Elon Musk 称 Grok 落后于 Anthropic:Grok 4.7 与 Claude 的较量才是真正考验
Elon Musk 承认,Grok 4.7 落后于 Anthropic 的最新模型,尽管他宣称 Grok Bot 每月增长约 100%。这一反差使 Grok 4.7 与 Claude 的较量,比又一场基准测试之争更具揭示性。
Musk 在 9 月 25 日于 Tesla 全球工程总部接受中国中央广播电视总台采访时发表了这两项言论。他称 Grok 4.7 是一款可靠的模型,但表示其能力不及 Claude Opus 5.5。
这一承认意义重大,因为 Musk 通常将 SpaceXAI 描述为一个正在快速缩小差距的挑战者。这一次,他承认 Anthropic 占据优势,同时认为快速的产品采用和专业工程数据可能改变局势。
这一增长数据需要谨慎看待。Musk 并未公布支持月度翻倍说法的用户数量、统计周期、地域构成或独立审计结果。
这使两场不同的竞争浮现出来。Anthropic 拥有得到承认的模型优势,而 SpaceXAI 表示,作为个人数字助理的 Grok Bot 正在迅速获得用户。
Musk 对 Grok 4.7 与 Anthropic 实际说了什么
Musk 承认目前存在能力差距,但他并未表示 Grok 的技术确实比 Claude 落后数年。
在这场 9 月 25 日的采访中,Musk 表示 SpaceXAI 大约每一到两个月发布一个新模型。他将 Grok 4.7 称为一款“扎实的主力模型”,但认为它低于 Opus 5.5。
随后,Musk 对比了两家组织的发展年限。他表示,其公司从事 AI 工作约三年,而 Anthropic 约有六年。
这一区别很重要。“落后数年”的表述指的是组织经验,而非对模型能力或开发时间的量化估计。
Musk 在比较后又作出另一项预测。他表示,SpaceXAI 很可能会在明年某个时候追上前沿水平,但没有给出界定这一结果的基准门槛。
他的下一项表述将讨论从模型质量转向产品采用。Musk 将 Grok Bot 描述为个人数字助理,并称其每月增长约 100%。
每月翻倍将意味着非同寻常的扩张。若一款产品维持这一增速,六个月后规模将增长至 64 倍,一年后将增长至 4,096 倍。
这些计算说明了基数的重要性。小型产品比服务成熟全球用户群的产品更容易连续实现数次翻倍。
Musk 没有说明该数据衡量的是注册账户、活跃用户、完成任务数、已连接工作区还是营收。他也没有说明起始月份。
因此,这一表述确立的是企业主张,而非经独立验证的采用结果。它仍然具有意义,因为 Musk 选择以增长来回应能力上的劣势。
SpaceXAI 于 9 月 21 日推出 Grok 4.7,也就是 Anthropic 发布 Opus 5.5 的前一天。这一时点让两款面向编程和知识工作的模型形成了异常直接的比较。
根据 Grok 4.7 公告,该模型采用了比 Grok 4.6 更大的基础模型。它还在为需要长时间工作而设计的任务上接受了更长时间的强化学习。
强化学习是一种训练过程,会奖励与预期行为相关的输出。SpaceXAI 表示,在这里它重点强调了验证、长上下文以及持续数小时的任务。
该公司还训练 Grok 4.7 理解 Grok Bot 环境。这一关联表明,SpaceXAI 正在同步优化模型及其智能体产品。
Grok Bot 并非只是另一个聊天界面。该产品旨在借助软件、上下文和持久化计算资源完成更长周期的任务。
这一产品重点解释了 Musk 为何迅速从模型质量转向月度增长。他的观点是,在模型达到绝对前沿之前,实用性和分发能力同样重要。
然而,这一承认仍然重置了市场预期。SpaceXAI 自己的领导人接受了 Anthropic 目前提供更强旗舰模型这一事实。
这是此次事件最核心的反转。挑战者在声称其智能体产品已拥有非凡势头的同时,也承认了对手在技术上的领先地位。
为什么 Grok 4.7 与 Claude 的较量揭示了 SpaceXAI 的真正差距
Grok 4.7 与 Claude 的竞争,较量的并非聊天机器人的回答,而是可靠完成漫长、昂贵且多步骤工作的能力。
Anthropic 多年来一直围绕软件工程和受控工具使用构建 Claude。Claude Code 将这一重点转化为开发者可在真实代码仓库和终端中使用的产品。
Musk 明确肯定了 Anthropic 在让 AI 具备高度软件工程能力方面的成果。这一认可指出了 SpaceXAI 必须弥补的领域,其差距不止于基准测试。
智能体 AI 指的是能够规划步骤、使用工具,并在有限监督下朝目标行动的系统。随着任务持续时间变长,可靠性也会变得更难保证。
一个模型可能正确回答单独的编程问题,却在两小时的迁移任务中失败。它可能丢失上下文、重复操作、引入回归问题,或在验证结果前停止。
Anthropic 表示,Opus 5.5 改进了长周期编程、专业工作、工具协调和计算机使用能力。其 Opus 5.5 发布说明还强调了更少的步骤和更低的总体计算需求。
这些均为企业主张,个体结果会有所不同。不过,它们表明 Anthropic 正在优化完整工作流,而非令人印象深刻的单次回答。
SpaceXAI 也在瞄准同样的转变。其 Grok 4.7 资料强调高难度任务、自我检查、长上下文,以及与编程 harness 的集成。
Harness 是为模型提供工具、文件、指令和反馈的软件环境。Harness 的质量可以决定模型智能是否能转化为有用的工作成果。
SpaceXAI 报告称,Grok 4.7 在其选定评估中相较 Grok 4.6 有显著提升。它在一项电气工程基准测试和部分专业任务中也表现良好。
不过,该公司公布的结果是有高有低,而非全面领先。Grok 4.7 在若干长周期终端和知识工作评估中,仍落后于对比模型。
这一模式支持了 Musk 对该模型“主力模型”的描述。它可以具备商业实用价值,而不必在每个类别中领先。
Anthropic 的优势不止于一次模型发布。它已从 Claude Code、企业集成,以及开发者在大型代码库中委托工作的过程中积累了产品反馈。
Anthropic 对 2025 年 10 月至 2026 年 4 月期间约 235,000 人参与的约 400,000 次 Claude Code 会话进行了研究。其 使用研究发现,人们通常掌控规划,而 Claude 则处理更多执行层面的决策。
该研究还发现,领域专业知识依然重要。理解底层问题的用户能够取得更好的结果,也能更有效地从错误中恢复。
这些发现挑战了智能体采用只是简单替代的观点。更好的智能体会提升执行能力,但不会消除对专业监督的需求。
这些数据也为 Anthropic 提供了反馈闭环。真实会话揭示了智能体在哪些环节失败、用户委托哪些任务,以及随着模型改进,行为如何变化。
SpaceXAI 必须通过 Grok Bot、Grok Build、Cursor 及其 API 建立可比的闭环。如果 Grok Bot 的快速增长能够产生多样化、高质量的任务反馈,将会有所帮助。
规模本身并不能保证这一结果。消费者助理请求带来的经验,可能不同于企业编程、财务分析或受控工程工作。
这就是为什么 Grok 与 Anthropic 的比较不能止于月度用户数。更重要的问题在于,是否能成功、可重复地完成有价值的任务。
吸引好奇心的模型可以快速增长。要获得代码仓库、通信、日历和内部文件的访问权限,智能体还必须赢得信任。
Anthropic 目前在这场信任竞争中拥有更强的公开优势。Musk 的承认表明 SpaceXAI 理解这项任务的规模。
Grok Bot 每月 100% 的增长主张改变了竞争格局
如果 Grok Bot 的增长具有持续性,SpaceXAI 可以在匹配 Claude 最强模型之前,先通过分发能力挑战 Anthropic。
智能体产品的竞争不只依赖原始智能。它们还取决于引导流程、集成能力、响应速度、工作流设计,以及用户可访问它们的入口数量。
Grok 已受益于 SpaceXAI 与 X、Tesla、Cursor 及其他由 Musk 控制或关联产品之间的联系。每一个入口都能降低用户尝试该助理所需的成本。
Grok Bot 将这一策略从对话扩展到任务委派。用户可以描述一项任务、授予工具访问权限,并让系统跨多个步骤开展工作。
SpaceXAI 还推出了定时 Grok 自动化功能。该公司表示,用户可以配置周期性任务,或在符合条件的电子邮件到达时启动任务。
这一自动化系统可以总结收件箱活动、准备研究、标记邮件,并通过电子邮件或应用通知进行报告。每次运行都会保留为一段对话。
这些功能代表了 AI 产品设计中更广泛的转变。系统等待工作并基于触发条件行动,而不是每次都需要新的提示。
对于知识工作者而言,这既创造了价值,也带来了责任。拥有持续访问权限的智能体可以节省时间,但错误操作也可能被自动重复执行。
月度增长主张表明用户愿意尝试这种权衡。但它并不能证明用户会在首次任务后继续保持活跃。
留存至关重要,因为智能体产品往往会产生最初的新奇感高峰。当配置变得困难、结果不再稳定,或使用限制打断持续工作时,用户可能会流失。
任务频率同样重要。每天用于运营工作的助理,比每月仅为偶尔研究而打开一次的产品拥有更强的市场位置。
SpaceXAI 尚未披露评估这些差异所需的数据。没有公开的群组分析展示重复使用情况、成功完成的任务,或无需干预完成的工作。
缺乏细节并不意味着该主张不实。这意味着该主张目前尚不能与独立可观察的采用数据具有同等分量。
Anthropic 的位置说明了持续工作流使用为何重要。即使存在更便宜的替代方案,生产流量仍可能偏向某一模型。
Vercel 的 AI Gateway 报告了通过其基础设施路由的模型的匿名汇总活动。其生产指数说明了它如何衡量 token 使用量和标准化支出。
该数据集仅覆盖 Vercel 的 gateway,因此并不代表整个市场。不过,它为开发者在已部署应用中使用哪些模型提供了一个外部观察窗口。
Anthropic 在这一环境中表现强劲。这一模式表明,当模型能够可靠完成高要求工作时,客户愿意接受更高的资源成本。
SpaceXAI 正在尝试从不同的切入点进入市场。它可以提供快速的 agent 体验,将其连接到用户熟悉的产品,并在推广过程中改进底层模型。
这种做法让人想起早期的软件竞争:分发能力曾帮助技术暂时落后的产品缩小差距。只有当产品反馈能够转化为更好的结果时,这种比较才成立。
Musk 还将专业数据视为潜在优势。他告诉中国中央广播电视总台,SpaceX 和 Tesla 可以提供与现实世界工程相关的数据。
他将这一机会与 Anthropic 在软件工程领域的实力作了对比。在他看来,目前还没有任何公司打造出一款能够广泛胜任实体工程工作的 AI。
这一类别可能涵盖解读技术图纸、诊断设备、规划测试,或推理制造约束。Musk 并未宣布任何经验证可执行这些任务的产品。
他还表示,SpaceX 数据目前的贡献仍然很小。这一保留条件意味着,该采访不足以支持 Grok 4.7 曾接受大量专有工程记录训练的说法。
专业工程数据可能变得很有价值,因为高质量样本难以收集。然而,敏感的企业信息需要严格的权限、安全控制和评估机制。
在内部资料上训练的模型,并不会自动理解物理系统。现实世界中的工程工作还依赖测量、仿真、安全裕度,以及可追责的人工审查。
这一机会可信,但路径仍未得到验证。SpaceXAI 必须证明,专有数据能够在公司自行挑选的演示之外带来可量化的提升。
Grok Bot 的增长为该公司争取了时间和反馈,以追求这一目标。但这并不能抹去 Claude 当前的优势。
这些数字无法证明什么
无论是月度增长,还是供应商自行选择的基准测试,都无法证明哪一种 agent 能为真实组织提供最可靠的最佳价值。
最明显的不确定性涉及 Musk 所说的 100% 数字。没有绝对基线,这一百分比只能说明加速增长,无法说明规模。
一款产品从 10,000 名用户增长到 20,000 名,翻了一番。一款产品从 1,000 万增长到 2,000 万同样翻了一番,但其运营含义截然不同。
“增长”一词同样含糊不清。它可能指用户数、任务数、收入、已连接账户,或其他内部指标。
因此,报道应保留归因。根据 Musk 的说法,Grok Bot 每月增长约 100%,而非根据经审计的披露数据。
第二项不确定性涉及基准测试的选择。SpaceXAI 和 Anthropic 都会选择反映各自产品预期优势的评估方式。
基准测试可以帮助比较受控任务,但 agent 运行在不断变化的环境中。工具故障、权限错误、不完整指令和隐藏依赖,往往决定真实结果。
不同推理设置下的分数也可能难以比较。模型可能获得不同的推理预算、执行时间、工具,或重试机会。
SpaceXAI 按推理投入标注了部分 Grok 4.7 结果。买家应确认,受测配置是否与其所选产品中可用的版本一致。
第三项不确定性涉及组织成熟度。Musk 对三年与六年的比较提供了背景,但公司成立时间并不能保证未来趋同。
在 SpaceXAI 试图追赶的同时,Anthropic 也会继续改进。目标在不断移动,两家公司都可以招聘研究人员、收购产品并扩展计算能力。
Musk 此前曾给出激进的时间表。他预测 SpaceXAI 将在明年达到前沿水平,这仍是一项预测,而非已排定的发布承诺。
该公司已经展示出快速的发布节奏。频繁推出模型可以加速学习,但也可能为客户带来兼容性、评估和迁移工作。
基于 Grok 构建产品的团队需要模型版本之间的稳定性。他们必须了解,在更新后,提示词、工具调用、防护措施和输出格式是否仍能保持一致。
安全性是原始采用数据无法解决的另一维度。agent 获得的访问权限比普通聊天机器人更广,错误或遭操纵的行动后果也随之增加。
SpaceXAI 表示,Grok 4.7 使用了一套新的防护系统,并且在抵御越狱攻击方面表现更好。这些结果来自该公司自己的发布材料。
Anthropic 也发布模型评估和系统卡。两家供应商的内部评估都不应取代在客户实际环境中的测试。
竞争历史又增添了一层谨慎的理由。在 4 月的一次出庭中,Musk 承认 xAI 在训练期间曾部分使用 OpenAI 模型的输出。
这份庭审报道还称,Musk 将 Anthropic 排在 OpenAI、Google、中国开源模型和 xAI 之前。这使他最新的评论置于一个更长期的脉络中:他一直承认 Anthropic 的领先地位。
所涉的蒸馏做法,是利用一个模型的输出帮助训练另一个系统。其合法性和合同边界取决于这些输出的获取和使用方式。
这一事件表明,追赶不只涉及原创研究。它还涉及数据访问、计算能力、产品反馈、人才,以及从竞争系统中获得的知识。
客户应评估结果,而非创始人的叙事。结构化试点可以测试完成率、修正工作量、安全行为和总任务耗时。
这类试点应使用具有代表性的工作,而非经过精心打磨的演示。实用案例包括调试陌生代码库、审阅一组文档,或准备一份可追溯的研究简报。
团队还应保留对关键行动的人工审批。访问生产系统、对外沟通、财务和敏感记录时,需要明确的限制。
一套有记录的 AI 工作流可以帮助区分有用的自动化与缺乏监督的风险。目标是让工作可重复,并有可见证据支撑。
这一实用标准不会自动偏向任何一家供应商。Claude 可能在高要求任务上领先,而 Grok 对某些集成、响应特征或专业任务而言可能更合适。
在客户能够衡量这些差异在持续使用中的表现前,Grok 与 Anthropic 的比较仍不完整。
决定 SpaceXAI 能否追上的三个信号
下一阶段将由经验证的留存率、独立任务结果,以及工程数据能够创造独特优势的证据决定。
第一个信号是可衡量的 Grok Bot 采用情况。SpaceXAI 应披露活跃用户数、重复任务率、成功完成数,以及可比月度群组的留存情况。
这些数据将强化或削弱 Musk 的增长叙事。如果在强劲留存的基础上持续翻倍,将表明 Grok Bot 正在成为一款持久的工作产品。
快速注册后重复使用率下降,则会讲述另一个故事。这将表明分发和好奇心正超越可靠的实用价值。
最具信息量的指标或许是每位留存用户完成的任务数。这一指标将产品增长与实际委派联系起来,而不只是账户创建。
第二个信号是对 Grok 4.7 及其后续版本的独立评估。测试应在竞争模型之间采用相同的工具、预算、提示词和停止条件。
长时间运行的任务尤其值得关注,因为失败会随时间累积。评审者应记录人工修正、未完成工作、回归问题和验证成本。
可信的追赶应体现在多项评估和客户试点中。一张有利的图表无法决定 Grok 4.7 与 Claude 的竞争。
模型发布时间同样重要。Musk 预计 SpaceXAI 将在明年达到前沿水平,而 Anthropic 会继续更新 Claude。
如果后续 Grok 模型缩小了在长期终端任务和专业工作流上的差距,Musk 的预测将获得支持。如果 Claude 进步更快,目标仍会遥远。
第三个信号是来自现实世界工程的证据。SpaceXAI 必须证明,经授权的 SpaceX 或 Tesla 数据能够创造竞争对手难以轻易复制的能力。
有力的演示应涉及可由外部核查的工作。例如诊断已有记录的硬件故障、改进仿真,或产出通过既定验证的设计。
关于火箭或汽车的宣传性回答不符合这一标准。结果必须经得起理解该系统及其安全约束的工程师审查。
成功将为 SpaceXAI 提供一条绕过 Anthropic 软件优势的差异化路径。失败则会让专有工程数据停留在一个吸引人但未经验证的叙事层面。
这些信号的重要性不止于两家公司。开发者和企业买家正在判断,agent 平台能否成为知识工作中可靠的运营层。
模型领先地位可能在数月内消失。工作流信任、留存用户和积累的集成通常移动得更慢。
Musk 的采访之所以值得关注,是因为它区分了这些层次。他承认 Anthropic 目前拥有更强的模型,同时认为 Grok 的 agent 产品正在快速扩张。
这一立场比宣称全面领先更可信。它也为评判 SpaceXAI 设定了清晰标准。
目前,在 Musk 所指出的能力竞争中,Anthropic 处于领先。Grok Bot 的增长为 SpaceXAI 提供了可能的分发优势,但支撑数据仍未公开。
读者应关注 SpaceXAI 衡量什么,而不仅是它发布什么。Grok Bot 能否留住用户、完成更困难的工作,并将专业数据转化为经验证的结果?
这些答案将决定 Musk 的让步究竟标志着暂时的差距,还是 Grok 与 Claude 之间持久的分野。



