top of page

OpenAI o3 vs Gemini 2.5 Pro:基准战争、真实世界使用以及重要事项

6月5日
讀畢需時 2 分鐘

OpenAI 于 2026 年 5 月下旬发布了 o3。Gemini 2.5 Pro 在几天后紧随其后。两者都声称在多步推理方面达到了新高峰。实验室分数与日常文档工作之间的差距现在主导了大多数买家的决策。

基准测试结果

  • OpenAI o3:在 GPQA diamond 上达到 92%,在 AIME 2025 集合上达到 88%

  • Gemini 2.5 Pro:在 GPQA diamond 上达到 89%,在 AIME 2025 集合上达到 91%

OpenAI o3 在研究生级别的科学问题上领先。Gemini 2.5 Pro 在数学竞赛问题上略胜一筹。原始分数仍未解决实际问题。

知识工作者很少解决竞赛问题。他们阅读合同、合并研究笔记,并将会议记录转化为行动清单。为这些流程构建的测试显示出更激烈的竞争。

文档合成

  • OpenAI o3:维护 14 页上下文线程,丢失的引用更少

  • Gemini 2.5 Pro:生成更紧凑的摘要,但偶尔会重新排序因果链接

当源文档集少于八个时,两个模型的分数彼此相差在十分之内。一旦用户在会话中添加外部文件,差异就会显现。

指令遵循显示出更清晰的区别。OpenAI o3 在 78% 的测试案例中遵循明确的格式规则。Gemini 2.5 Pro 达到 71%。当任务需要嵌套约束(如“仅使用项目符号列表并引用页码”)时,差距会扩大。

许多团队仍在同一提示集上运行两个模型。他们将长合成工作路由到 OpenAI o3,将快速数学检查路由到 Gemini 2.5 Pro。工作流模式现在与面对面试验中的排名相匹配。

真正的不确定性在于每令牌成本和上下文定价。OpenAI 尚未发布 o3 预览层之外的最终费率。Google 将 Gemini 2.5 Pro 的价格列为当前 Gemini 1.5 水平,适用于下一季度。预算团队等待第一批发票来决定批量承诺。

三个信号将决定下一季度。首先,o3 完整定价的公开发布。其次,任何将上下文窗口扩大到超过一百万令牌的 Gemini 2.5 Pro 更新。第三,发布内部文档集每月错误率的公司独立日志。每个数字都会比另一个基准发布更快地改变路由选择。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page