top of page

Gemini 3 Deep Think 在 Humanity's Last Exam 上取得 48.4% 的成绩,并获得 3455 Codeforces Elo

已更新:6月17日

Gemini 3 Deep Think Achieves 48.4% on Humanity's Last Exam and 3455 Codeforces Elo

Google 于 2026 年 2 月 12 日发布了 Gemini 3 Deep Think,这标志着大型语言模型处理复杂推理的方式发生了实质性转变。此次更新超越了标准的聊天机器人功能,旨在解决物理、数学和软件工程领域中经过验证的问题。

此次发布中最重要的数据点是该模型在“Humanity's Last Exam”上的表现。Gemini 3 Deep Think 在无工具辅助的情况下得分为 48.4%。作为对比,OpenAI 的 Deep Research 工具(基于 o3 模型)在大约一年前的得分为 26.6%,而 DeepSeek R1 为 9.4%。这一性能差距表明,“Deep Think”架构已成功将思维链推理置于简单的模式匹配之上。

本文分析了 Gemini 3 Deep Think 的技术规格、即时用户访问方法,以及其与 GPT-5.2 Pro 等当前市场替代方案的对比性能数据。

如何在 Google AI Ultra 中启用 Gemini 3 Deep Think

How to Enable Gemini 3 Deep Think in Google AI Ultra

对于拥有 Google AI Ultra 订阅的用户,访问新的推理功能需要操作特定的 UI 流程。Google 未将“Deep Think”设为默认设置,这可能是由于与深度推理模型相关的高推理成本和延迟。

要激活该模型:

  1. 打开标准的 Gemini 界面(gemini.google.com或该应用)。

  2. 导航至模型选择菜单(通常由 + 或模型版本下拉菜单指示)。

  3. 选择“Thinking”模型选项。

  4. 寻找标有“Deep Think”的二级开关并将其打开。

来自 Reddit 的早期用户报告显示,该界面引起了一些困惑。“Thinking”模式是一个类别,而“Deep Think”是特定的高算力功能。寻求基准测试性能的用户必须确保二级开关已激活。如果没有它,系统将默认使用较轻量的推理模型,这与 48.4% 的基准测试声明不符。

开发者和企业研究人员访问该模型的方式有所不同。目前不是通过直接开关,而是通过 Gemini API 的“Express Interest”表单进行访问,这表明 Google 正在为高容量商业用途谨慎管理算力分配。

基准测试分析:Humanity’s Last Exam 与 ARC-AGI-2

Benchmark Analysis: Humanity’s Last Exam and ARC-AGI-2

remio 的技术公信力Gemini 3 Deep Think建立在那些旨在让前代 AI 无法解决的测试评分之上。

Humanity's Last Exam 表现

“Humanity's Last Exam”由高级学术问题组成,通常需要深厚的领域专业知识才能解决。该测试旨在防止“benchmaxxing”——即专门为了在标准化测试中取得高分而优化模型的做法。

  • Gemini 3 Deep Think:48.4%

  • OpenAI Deep Research (o3): 26.6%

  • DeepSeek R1: 9.4%

48.4% 的得分非常引人注目,因为这是在没有外部工具的情况下实现的。该模型完全依赖于内部推理链。AI 社区的批评者认为,在这样一个利基数据集上获得如此高的分数可能暗示存在一定程度的训练数据污染(记忆),但其在其他指标上的广泛表现表明了真正的泛化能力。

科学与编程指标

Google 通过第三方机构验证了该模型,以反击内部偏见的指控。

  • ARC-AGI-2: 该模型得分为 84.6%,已由 ARC Prize Foundation 验证。这项测试衡量的是即时学习新逻辑规则的能力,而非回忆记忆中的知识。

  • Codeforces:它的 Elo 评分高达 3455 分,使其处于竞技编程的顶尖水平。

  • 国际奥林匹克竞赛:该模型在 2025 年国际数学、物理和化学奥林匹克竞赛中达到了金牌标准。

Gemini 3 Deep Think 的实际应用场景

Real-World Applications for Gemini 3 Deep Think

高基准测试分数往往难以转化为实际可用性。然而,由 Google 提供并经合作大学验证的早期案例研究显示,它在学术工作流中具有特定的实用价值。

纠正罗格斯大学(Rutgers)的物理研究

在与罗格斯大学的合作中,Gemini 3 Deep Think 分析了一篇关于高能物理的预印本论文。该论文已通过初步的人工评审。模型识别出了人类评审员忽略的一个数学证明中的逻辑不一致。这使得应用场景从“生成文本”转向了“审计逻辑”,而这一职能此前通常仅由资深博士候选人承担。

杜克大学(Duke)的材料科学工程

杜克大学的研究人员利用该模型解决了一个制造难题。挑战涉及生长一种厚度目标大于 100 μm 的特定薄膜,此前的配方均无法保持结构完整性。该模型提出了一种新的化学合成配方,成功达到了预期的厚度。

这些示例区分了 Gemini 3 Deep Think 与 GPT-5.2 Pro。虽然 GPT-5.2 仍然是一个强大的通用模型,但 Gemini 的调优侧重于广泛的分支可能性,在这些场景中,单个错误就会导致整个结果失效。

用户体验与市场对比

Gemini 3 Deep Think 在科技爱好者群体中的反响褒贬不一,揭示了普通用户与技术专家之间的分歧。

与 OpenAI 和 DeepSeek 的对比

熟悉 OpenAI 生态系统的用户注意到,从 Gemini 之前的 Pro 版本到 Deep Think 的跨越,比近期升级到 GPT-5.2 的感觉更为显著。

  • GPT-5.2 Pro: 用户将其描述为在 GPT-4 基础上的小幅改进,侧重于速度和对话流畅度。

  • Gemini 3 Deep Think: 被视为一种专业化工具。它的运行速度较慢,且思考过程更为审慎。

一位 Reddit 用户指出,对于通用查询,由于速度原因,他们仍然首选 Claude 或 ChatGPT。然而,对于“研究和数学证明”,Gemini 已成为首选引擎。这种分化表明,市场正在从“一个模型统治一切”转向针对特定认知任务的专业化引擎。

在编程和智能体(Agents)方面的弱点

尽管 Codeforces Elo 评分很高,但实际的编程体验各不相同。用户反馈称,虽然该模型可以解决算法难题(LeetCode 风格),但与 Claude 3.7 或最新的 GPT 版本相比,它在处理大规模软件工程任务时显得力不从心。据报道,其“智能体”能力——即模型自主执行多步任务的能力——也不如 Anthropic 的产品可靠。

关于“脑叶切除”的担忧

用户反馈中一个反复出现的主题是担心安全对齐会降低性能。评论中描述了一种对模型的“心理健康”担忧,即激进的人类反馈强化学习(RLHF)会迫使模型拒绝复杂查询或提供过度过滤的答案。虽然 Gemini 3 Deep Think 目前在其推理模式下不受限制,但用户担心未来的更新可能会为了符合安全协议而限制其创造性的问题解决能力。

Gemini 3 Deep Think 的定价与可用性

Gemini 3 Deep Think Pricing and Accessibility

Google 已将此模型捆绑到现有的 Google AI Ultra 订阅。这种激进的定价策略试图削弱那些对高推理模型收取基于使用量费用的企业级竞争对手。

对于开发者而言,API 的可用性仍然有限。“表达兴趣”的门槛意味着 Google 仍在扩展支持这些模型所需的大规模推理计算硬件基础设施。在 API 全面开放之前,Gemini 3 Deep Think 仍将主要是个人高级用户和特定学术合作伙伴的工具。

Gemini 3 Deep Think 的发布为重推理 AI 确立了新的基准。通过专注于在“Humanity's Last Exam”等验证性考试中的非工具辅助表现,Google 已将目标从聊天能力转向了自主研究验证。行业焦点现在转向了 OpenAI 将如何快速推出其 o3-heavy 模型的广泛可用版本作为回应。

常见问题解答

问:如何开启 Gemini 3 Deep Think 模式?

答:在 Gemini 网页或移动界面中,从下拉菜单中选择“Thinking”模型。选择后,切换出现的特定“Deep Think”开关。此功能目前仅限于 Google AI Ultra 订阅者。

问:Gemini 3 Deep Think 比 OpenAI o3 更好吗?

答:在“Humanity's Last Exam”基准测试中,Gemini 3 Deep Think 的得分为 48.4%,而基于 o3 的 Deep Research 工具得分为 26.6%。这表明在不使用外部工具的情况下,它在处理复杂的、新颖的学术问题方面具有更优越的性能。

问:Gemini 3 Deep Think 会写代码吗?

答:是的,该模型的 Codeforces Elo 评分为 3455,这使其在处理算法问题时能力极强。然而,一些用户反映它在管理大型、多文件软件工程项目方面的效率不如 Claude 或 GPT-5.2。

问:Gemini Pro 和 Deep Think 有什么区别?

答:Gemini Pro 针对速度和通用任务进行了优化,而 Deep Think 是一款推理模型,旨在回答前先暂停并进行“思考”。Deep Think 的速度明显较慢,但更适合数学、科学和逻辑谜题。

问:Gemini 3 Deep Think 是免费使用的吗?

答:不,访问 Deep Think 模型需要付费订阅 Google AI Ultra。希望获得 API 访问权限的开发者和研究人员目前必须通过意向表进行申请。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page