top of page

DeepMind 首席执行官驳斥 OpenAI 称 GPT-5 在各方面都达到博士水平的说法

已更新:6月18日

DeepMind CEO Rejects OpenAI’s Claim That GPT-5 Is PhD-Level Across the Board

引言

为什么 OpenAI 与 DeepMind 之间的交流在当下至关重要

OpenAI 公开发布 GPT-5伴随着异常戏剧性的信息传递:其 CEO Sam Altman 在描述该模型的速度和能力时,措辞中既透露出兴奋也带有警示。事实上,OpenAI 的 CEO 在公开言论中将 GPT-5 的速度描述为“令人恐惧”。这种高调的语言有助于推销产品,并吸引政策制定者、客户和竞争对手的关注。相比之下,DeepMind 的 CEO Demis Hassabis 反驳了关于 GPT-5 在各学科均达到“博士级水平”的笼统说法,他认为流畅的文本生成并不等同于深厚的领域专业知识,并呼吁在 AI 能力的公开评估中采用更严格的评估标准。参见 Demis Hassabis 的采访背景及其批评

这场争论之所以重要,是因为供应商的信息传递与专家的质疑性评估共同影响着采用决策、采购合同和监管压力。当供应商强调戏剧性的能力提升时,采购团队可能会加速购买周期;而当研究人员强调特定任务的缺陷时,买家更有可能要求更严格的测试和合同保障。最终结果将影响 GPT-5 进入企业的速度、交付时随附的 SLA,以及监管机构对风险的思考方式。

本文涵盖的内容

本文将深入探讨关于 GPT-5 的具体主张,通过独立评估和专家评论对这些主张进行交叉验证,并将技术性能说明转化为针对开发者和采购者的实用建议。你将获得:

  • 针对 GPT-5 在日常工作流中“能做”与“不能做”的功能性分析;

  • 对实测性能、基准测试背景的审视,以及为什么“博士级”是一个具有误导性的简称;

  • 企业应预期的发布计划、资格获取和定价模式;

  • 与 GPT-4 及竞争系统的直接对比;以及

  • 一份实用的常见问题解答(FAQ)和总结,强调组织机构应如何审慎地采用 GPT-5。

在全文中,我依靠厂商指南、市场报告和学术评估工作,将营销辞令与可验证的主张区分开来。

GPT-5 的功能与实际能力

GPT-5 features and practical capabilities

厂商强调的核心能力

厂商将 GPT-5 描述为大语言模型的下一步演进,重点关注三项关联的改进:多模态输入、更快的推理与更高的吞吐量,以及扩展的上下文处理能力。这里的“多模态”意味着模型可以接受并跨多种输入类型(文本、图像,以及在某些演示中的结构化数据)进行推理,而不仅仅是纯文本。对于企业用户,产品指南强调了更大的上下文窗口(以便模型在单次调用中访问更多文档内容)、针对批处理任务的优先 API 吞吐量,以及与常用业务工具的预构建连接器。有关这些营销能力的概述,请参阅此 面向专业人士的 GPT-5 产品导向指南以及一份强调使用场景和工具集成的实用功能报告由 Leanware 发布

供应商还推销了改进后的 API 易用性:SDK、用于营销和销售工作流的模板,以及更高层级的工具调用编排——例如在单个多步提示词中调用检索数据库或代码执行引擎。这些功能可供团队立即在营销自动化、内容个性化和快速原型设计中进行演示。

专业工作流的可用性改进

产品文档显示出向业务就绪模式的明显转变:预构建模板(例如,用于 A/B 测试友好的标题生成或产品简报合成)、带有 SLA 的企业级端点,以及在公司防火墙后部署模型的指南。该架构通常被呈现为一个平台,由基础模型提供生成原语,而开发人员则缝合进领域数据、合规性过滤器和人工审核。如需代表性的技术导向说明,请参考这份简明的GPT-5 功能技术概览

如果你是营销人员或分析师,最直接的收益是速度和规模——更快地生成更多草案、对更长文档进行摘要,以及针对图文并茂的产品页面改进多模态摘要。

已知局限性与建议的防护措施

厂商并未对风险保持沉默。面向公众的指南列出了常见的故障模式:幻觉(自信但错误的陈述)、脆弱的长程规划能力、对提示词表述的敏感性,以及偶尔对视觉输入的误解。产品指南通常建议对任何高风险输出进行人工干预验证(human-in-the-loop verification),进行日志记录以实现可追溯性,并针对准确性优先的用例进行特定领域的微调。在面向消费者的摘要中,有一份综合的局限性讨论,其中汇总了厂商警告和早期用户报告,例如 Android Authority 托管的局限性摘要

洞察:更高的吞吐量和更大的上下文窗口减少了一些摩擦,但当输出影响法律、财务或安全关键型决策时,它们并不能消除对领域验证的需求。

定位:速度、生产力与护栏

总体而言,厂商将 GPT-5 推销为生产力倍增器 —— 更快、更广、更集成 —— 同时发布操作指南以避免滥用。这一信息是经过深思熟虑的:承诺价值,但通过护栏来缓和,以帮助缩小企业买家的信任差距。

核心结论: GPT-5 为专业工作流带来了切实的易用性和集成改进,但厂商自身建议进行受控的人工监督部署,而不是在没有检查的情况下取代专家判断。

基准测试和测试实际显示的内容

What benchmarks and tests actually show

报告的指标和厂商声明

厂商资料和市场报告强调了更高的吞吐量(在相同硬件预算下每秒输出更多 token)、在许多标准 NLP 基准测试中得分的提高,以及不同订阅层级之间的功能差异。定价报告总结了性能和功能限制如何对应到付费层级。有关全面的产品和定价摘要,请参阅此Datastudios 市场报告

这些厂商引用的基准测试虽然有用,但往往具有选择性:它们可能会强调在语言建模、摘要和某些推理测试方面的改进,而淡化了专用模型或人类仍然优于 GPT-5 的领域。

独立评估及其发现

独立的审查在这里至关重要。最近在 arXiv 上发表的一项独立评估在广泛的学术和专业任务中对 GPT-5 进行了检查,结论是虽然 GPT-5 在吞吐量和某些基准测试分数上显示出可衡量的进步,但它在各领域尚未达到全面的“博士级”熟练程度。该研究提供了一项逐项任务的分析,识别了特定的弱点——特别是在领域深度、针对新问题的鲁棒思维链推理以及在对抗性提示下的可靠性方面。详情请参阅arXiv 评估.

要理解为什么像“博士级”这样单一的短语具有误导性,请回顾基础性的评估工作。这些工作表明,不同的基准测试评估的是不同的能力——推理、事实召回、领域专业化或长上下文规划——而将它们聚合成一个单一的标签会掩盖模型行为的细微差别。关于基准测试设计和局限性的实用入门读物可以在早期的 AI 评估研究中找到,该研究解释了为什么单项测试的主张是有问题的

更快的吞吐量在实践中意味着什么,不意味着什么

更快的推理和更高的吞吐量实现了新的工作流:大规模实时客户支持、更快的营销活动批量生成以及更低延迟的开发者体验。但是,速度并不代表正确性。在许多专业场景中,你需要领域特定的微调或外部验证流水线,才能将原始模型输出转化为值得信赖的结果——特别是对于需要证据支持的任务(法律备忘录、科学文献综述或受监管的财务建议)。

实际意义:针对你关心的特定任务同时衡量速度和准确性,并在采购过程中坚持要求供应商提供任务级的性能指标。

核心结论:独立研究显示了显著的改进,但也存在明显的特定任务差距;避免将速度和基准测试的领先解释为全能的专业能力。

企业采用的推出时间表、资格和定价

Rollout timeline, eligibility, and pricing for enterprise adoption

谁能获得访问权限以及可用性如何分阶段进行

记录在案的 GPT-5 推出模式遵循一条现已常见的路线:企业和 API 优先可用、优先合作伙伴,以及分阶段、基于订阅的向更广泛专业层级的扩展。供应商通常在开放公共订阅层级之前,先向战略合作伙伴、云提供商和选定的企业客户提供早期 API 访问。如果您需要企业入驻详情或专业模板,请参考产品指南,如 GPT-5 专业人士指南,其中概述了企业优先模式和集成选项。

对于买家而言,这意味着访问窗口是可预测的:预计会有一排优先客户,随后是付费专业层级,然后是标准消费者层级。如果您的组织需要数据驻留或严格的 SLA,您很可能处于企业波次中。

定价模型和功能门槛

市场研究总结了主流的定价模式:订阅层级(专业用户的月度席位)和针对 API 客户的基于使用量的定价(按 token 或按调用次数)的组合。企业计划通常包括 SLA 承诺、数据驻留选项以及针对受监管行业的合规性附加组件——这些元素通常被限制在更高级别的合同之后。有关深入的市场和定价细分,请参阅 Datastudios 关于功能、性能和定价的报告.

采购团队应预见功能差异化——更高吞吐量的端点、定制化的微调选项以及更高价位的先进监控工具。谈判筹码包括模型更新频率、事故响应承诺,以及对基于您数据集的模型行为进行审计的权利。

受监管行业的合规性与准入考量

企业指南强调了关于数据隐私、模型行为保证(例如,关于幻觉缓解测试的承诺)以及针对受监管工作的“人工在环”政策的合同条款。在许多情况下,供应商会提供围绕数据删除、模型训练排除和红队测试报告的合同语言。如果您在金融、医疗或政府部门运营,在正式上线前,请坚持要求提供可证明的数据驻留支持和合规性附加组件。

实用采购清单:索取独立基准测试报告,要求提供示例日志和测试数据集,并确认与模型更新和事故管理相关的合同权利。

核心要点:GPT-5 的推出将优先考虑企业客户和高接触服务计划;应争取可衡量的保护措施和性能证明文件,而非仅仅依赖营销宣传。

与早期模型及其他 AI 系统的对比

供应商主张与专家质疑的博弈

OpenAI 的公开表态强调了能力的巨大提升和进步的飞速;据报道,Sam Altman 表示 GPT-5 的速度令他感到“恐惧”。这些言论既传达了产品叙事,也发出了规范性警告。但更广泛的研究界和直接竞争对手则敦促保持谨慎。在一次广为流传的 Time 采访中,Demis Hassabis 认为,流畅的文本生成不应与深度理解混为一谈,且财经媒体的分析强调,头条新闻中的主张往往掩盖了任务级性能的可变性。请参阅 Financial Times 的专家分析,以审慎地看待这些主张对现实世界能力的真实影响 Financial Times 报道

核心矛盾很简单:厂商强调头条指标(吞吐量、综合基准增益),而领域专家则指出,在复杂推理、专业知识和对抗性语境中,关键错误依然存在。在技术媒体之外的公开报道中,记者也捕捉到了 Altman 本人的认知,即该模型的极速是一把双刃剑 Android Headlines 总结了他的反应

GPT-5 与 GPT-4 及替代方案的对比

公开分析表明,GPT-5 在语言建模、吞吐量以及部分基准测试得分方面较 GPT-4 及其早期版本有所提升,但在高度专业化的领域中,它并不能完全达到经审核的人类专家水平。独立基准测试显示其在速度和某些推理指标上有所改进,但在需要最新事实知识或严格领域约束的特定领域,持续性的失败依然明显。如需了解对比背景,请参阅汇总了厂商和第三方关于模型进展数据的报告:Datastudios 能力与性能报告是一份非常有用的市场级综合分析。

竞争对手和专业供应商正在通过专注于安全和领域专精的架构做出回应——有些为了更稳健的验证流水线,或为了针对代码、法律或医学推理专门微调的模型,而牺牲了通用吞吐量。

“博士级”意味着什么,以及为什么这个说法存在问题

“博士级”是一个极具启发性的简称,但它融合了多重含义:知识的广度、方法的深度、对新颖研究的推理能力,以及用证据和可重复方法为论点辩护的能力。受过博士训练的专家不仅能产出正确的陈述,还能理解方法的局限性,保持对文献的审慎怀疑,并能设计和评估实验。这一系列能力是典型的语言模型基准测试无法捕捉到的。arXiv 评估通过划定 GPT-5 综合得分提升的领域以及模型未能达到专业预期的领域,对这一点进行了精确说明 阅读 arXiv 评估

核心结论:GPT-5 在吞吐量和通用语言任务方面取得了显著进展,但“博士级”这一标签抹平了重要的任务特定差异;买家应坚持针对其关注的任务进行定向、可复现的评估。

实际应用场景与开发者影响力

早期采用模式与集成案例

早期采用者往往是市场、销售和产品团队,他们利用 GPT-5 进行内容生成、个性化定制和面向客户的自动化。分析和商业智能(BI)团队正在谨慎地开展摘要生成和代码生成的试点项目。供应商指南强调了 API 以及与 CRM 和营销平台的预构建连接器,这加速了初始集成工作;请参阅专业指南以获取实用模板和集成模式。面向专业人士的 GPT-5

开发者对改进后的 SDK、用于批量推理的高吞吐量端点以及更灵活的链式调用编排原语表示赞赏——这些都减少了从原型到生产过程中的阻碍。但成功的部署通常会将模型与搜索、检索增强生成 (RAG) 以及人工审核环节相结合,以提高事实准确性。

常见运营风险及缓解策略

早期部署中报告的风险包括数据泄露(在输出中暴露敏感数据)、幻觉(虚假但看似合理的事实)以及受监管行业的合规性差距。供应商手册和第三方报告建议将日志记录、红队测试和限缩范围的发布作为标准应对措施。技术概览展示了如何对模型进行可观测性检测,以及如何在 API 层实施护栏;请参阅技术入门指南以获取实现要点。Cirra 技术概览.

对于工程团队而言,实际的做法很明确:运行特定领域的基准测试,针对高风险输出保持人工审核机制,并要求在模型更新和事件响应方面具备明确的合同条款。这些措施在保留生产力优势的同时,也控制了下游责任风险。

洞察:生产力的提升是实实在在的,但必须与运营的严谨性保持平衡。

开发者启示:团队应如何准备

工程团队应构建包含以下内容的测试框架:

  • 模拟生产环境提示词的特定领域评估套件;

  • 针对每一个生成输出的日志记录和可追溯性;

  • 从非关键用例开始的分阶段推广计划;以及

  • 围绕数据使用和模型更新的合同保障。

这些步骤将供应商的商业化激励与企业的风险管理结合起来,在保持创新速度的同时实现受控的采用。

常见问题解答 — 关于 GPT-5 和 DeepMind 反驳的实际问题

FAQ — Practical questions about GPT-5 and the DeepMind rebuttal
  • 问:DeepMind 是否正式表示 GPT-5 不具备博士级水平? 答:是的 — Demis Hassabis 公开警告不要将流畅的文本生成与深厚的领域专业知识等同起来,并敦促建立更强大的评估标准,正如他在 时代周刊采访 中所讨论的那样。

  • 问:为什么 OpenAI 的 CEO 说 GPT-5 让他“感到害怕”? 答:Sam Altman 当时是在评论能力的快速提升和进步的速度——他将模型的速度描述为既是令人印象深刻的技术进步,也是社会关注的根源,正如 Tom’s Guide 等媒体所报道以及在其他报道中所总结的那样。

  • 问:是否有独立测试证明 GPT-5 是否达到博士级水平? 答:独立评估(包括一项详细的 arXiv 研究)显示了任务层面的优势和劣势,并警告不要贴上笼统的“博士级”标签;它们记录了在处理高风险工作时至关重要的特定领域缺陷。

  • Q: 企业现在应该采用 GPT-5 吗? A: 许多供应商将 GPT-5 定位为提升业务生产力的工具,但建议采取谨慎的分阶段采用方式,并进行严格的测试、人工监督和合同保护;请参阅专业的部署指南,例如 PanelsAI guide 和市场报告 Datastudios pricing analysis

  • Q: 在实际任务中,GPT-5 与 GPT-4 相比表现如何? A: 根据相关报道和专家评论(如 Financial Times analysis),公开分析显示,与早期的 GPT 版本相比,GPT-5 在吞吐量和某些基准测试分数上有所提高,但在特定领域的准确性和稳健的推理能力方面,仍然落后于经过审查的人类专家。

  • 问:在生产环境中需要注意的首要风险有哪些? 答:幻觉、数据隐私/泄露以及过度依赖未经验证的输出是主要的实际风险;应按照供应商和技术指南(如 LeanwareCirra’s technical overview)的建议,通过日志记录、红队测试、法律审查和人工参与流程来降低这些风险。

  • 问:监管机构会因为公众辩论而区别对待 GPT-5 吗? 答:高调的公众辩论增加了监管审查。预计在受监管行业中,透明度、第三方审计和更严格的采购要求将增加;随着记者和立法者寻求独立评估,公众的分歧本身也加剧了这些预期。

DeepMind 的反驳对 GPT-5 的采用及 AI 生态系统意味着什么

对未来选择的反思性观点

供应商大胆的宣传与专家怀疑的批评之间的公众博弈是一种有益的纠偏。当供应商领导者用戏剧性的语言描述新模型时,它会加速关注、投资和实验。而当像 Demis Hassabis 这样的领域专家提出反驳时,他们是在提醒买家和监管机构,能力声明必须拆解为任务级、可复现的证据。这种博弈创造了更健康的市场动态:它激励供应商交付可衡量的结果,同时促使企业要求问责制。

在未来的几个月和几年里,我们应该预见到几种趋势的成型。首先,独立且可复现的评估将变得更加重要:采购团队将越来越多地要求能够复制生产提示词和数据集的测试框架,而不仅仅是供应商选定的基准测试。其次,功能竞争将转向运营保障——如 SLA、数据驻留、补丁策略——而不仅仅是原始速度。最后,监管机构和大买家将要求模型训练数据、更新频率以及记录在案的红队测试结果具有透明度。

买家与开发者的机遇

对于组织而言,审慎的态度应当是务实与乐观并存。将 GPT-5 视为特定、中低风险工作流中的生产力加速器,并为更广泛的应用制定严谨的路径。这条路径包括在限定领域进行试点、为输出结果配置可审计的监测手段,以及构建能够捕捉模型必然错误的流程。对于开发者和建设者来说,这是一个将企业愿意付费的“护栏”产品化的机会:例如具有溯源能力的检索器、稳健的验证层以及特定领域的微调工具。

权衡与不确定性并存。创新的步伐预示着我们将看到更多的能力飞跃,每一次发布都会重新定义实践中的“州级水平(state-of-the-art)”。然而,进步是不均衡的:速度和流畅度在提升,而严谨推理和领域关键准确性方面的改进则相对缓慢。正确的应对方式不是恐慌性地过度采用或冻结采购,而是投资于评估、监督和以人为本的工作流,在最大限度发挥模型优势的同时最小化风险。

结语

DeepMind 对“博士级”这一简略说法的公开反驳提醒了我们,语言模型仍然是具有特定优势和可预测失效模式的人造产物。随着 GPT-5 及其竞争对手进入更多办公场所,成功将不仅取决于原始的模型能力,还取决于严谨的衡量和人类的判断。对于计划试点或采购的读者来说,机遇在于兼具雄心与纪律:在模型能证明其有效性的地方采用它,要求透明度和测试,并在结果至关重要的环节保持人工参与。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page