top of page

Claude Opus 4.7 已发布。这才是构建 Claude Agent 的实际变化。

已更新:6月17日

Anthropic 于 4 月 16 日发布了 Claude Opus 4.7,配备 100 万 token 上下文窗口,新增 xhigh 思考层级,专门的 Claude Code 审查命令,并声称在减少 token 消耗的同时,将长运行代理工作流的性能提升了 14%。

挂牌价格没有变动。但运行 claude 代理的实际账单变了,因为一个新的分词器悄然改变了相同提示词所消耗的 token 数量。Anthropic 还比往常更明确地承认,4.7 并不是其内部拥有的最前沿模型。那个模型仍被称为 Mythos,目前尚未发布。

如果你正在构建生产级代理,SWE-bench 的分值跃升是本次发布中最乏味的部分。真正重要的是三个重新定义了在 Anthropic 技术栈上开发代理的 API 层面变化,以及大多数发布报道都忽略的一项未公开的成本变动。

4 月 16 日发布内容

Opus 4.7 并非新一代模型。这是 Anthropic 首次发布代理应用层面比模型权重更重要的版本。

Claude Opus 4.7 announcement 中列出了核心数据:API model ID claude-opus-4-7,1M 输入 / 128K 输出上下文,价格维持在每百万输入 token $5 和每百万输出 token $25,与 Opus 4.6 相同。GA 版同日在 AWS Bedrock、Google Cloud Vertex AI 和 Microsoft Foundry 同步推出。Cursor 在首日将其设为默认模型。GitHub Copilot CLI 在几小时内便完成了接入。

有趣的更新不在模型卡片中,而是在开发者层面。

第一个是 xhigh,这是一个介于 highmax 之间的新算力层级。它已经是 Claude Code 中 Pro、Max、Teams 和 Enterprise 订阅用户的默认选项。开发者在未更改任何标志的情况下进行升级,其运行的计算层级已比一周前更高。

第二项是任务预算(task budgets),目前以公开测试版发布。你可以为智能体循环设置总 Token 目标,涵盖思考、工具调用和输出,模型在运行时会感知倒计时。它会据此调整优先级,而不是在探索过程中耗尽预算。通过 task-budgets-2026-03-13 beta 请求头开启。

第三项是 /ultrareview,这是 Claude Code 中的一个斜杠命令,可触发专用的多阶段代码审查,并在每次审查时使用全新的上下文。Pro 和 Max 用户每周期可获得三次免费运行机会,之后将按量计费。

视觉能力也得到了提升。支持的图像分辨率现在长边可达 2,576 像素,约 375 万像素,约为之前 Claude 上限的三倍。根据 Anthropic 自身的数据,在复杂的多步工作流中,长期运行的智能体可靠性提升了 14%,且使用的 Token 更少,工具调用错误率约为 Opus 4.6 的三分之一。这些数据来自与发布合作伙伴的内部测试,而非独立基准测试。

对于智能体构建者来说,实际的解读是 Anthropic 在开发者层面发布了三个新的原语(primitives),并在模型中发布了一个能力增量。原语改变的是你的代码,而模型增量改变的是你的营销话术。

Claude 智能体构建者真正关心的三件事

任务预算、xhigh effort 和 `/ultrareview` 才是真正的产品。模型权重只是入场券。

从任务预算(task budgets)开始,因为它们悄然重塑了 agent 的定价方式。典型的 agent 循环过去有两个成本维度:输入 token 和输出 token。4.7 版本增加了第三个维度,即循环本身的长度。通过任务预算,你可以设置上限,模型在运行时能感知到这一点,这意味着它会分配动作,而不是在探索上挥霍预算。一个过去需要消耗 140K token 才能得出结论的研究型 agent,现在可以被告知在 80K 预算内完成,它会自我截断,选择保留哪些工具调用以及跳过哪些。

这是 Anthropic 首次将预算视为一种带内信号(in-band signal),而非仅仅是计费产物。在长期运行 agent 的经济学深度探讨中对此有很好的界定:对于长期运行的 agent,任务预算加上新的分词器(tokenizer)从实质上改变了成本模型,即使官方价格没有变动。那些一直在循环中编写临时“N 轮后停止”逻辑的开发者,现在拥有了一个处理该想法的一等原语(first-class primitive)。

xhigh effort 是一个被悄悄默认的变更。Claude Code 发布时将 xhigh 作为新的基准,这意味着每个运行在 Claude Code 上的现有 agent 现在都在更高的计算层级上运行。相应的质量提升伴随着 token 消耗量的成比例增加。如果你不显式传递 effort=high,那么你今天的生产运行成本会比上周更高。对于任何具有一定规模运行 Claude Code 的团队来说,这是一个值得审计而非忽视的配置变更。

/ultrareview 是 Anthropic 首个专门的 Claude Code 审查界面。每次运行都带有全新的上下文,因此对一个文件的反馈不会被长会话早期的题外话所污染。Pro 和 Max 用户在每个周期内获得三次免费运行机会;之后将按量计费。这之所以重要,不在于审查质量(这需要独立测试),而在于它标志着 Anthropic 正在将特定的 agent 模式开辟为独立的计费产品,而不是将其仅仅视为通用模型的应用。

大多数 agent 开发者真正想要验证的能力声明来自 Cognition 的 Scott Wu,他的团队已将 Opus 4.7 作为 Agent Preview 在 Devin 中上线。Wu 在一次Devin Agent Preview在帖子中表示,Anthropic “显然针对长程自主性优化了 Claude Opus 4.7,解锁了一类我们以前无法可靠运行的深度调查工作”。换句话说,它可以连续协同工作数小时。这是一个具体的落地能力声明,作为衡量 4.7 在真实智能体中能做什么和不能做什么的信号,它比 SWE-bench 的分数更有价值。

Cursor 是一个切实的采用数据点。其内部基准测试 CursorBench 从 Opus 4.6 的 58% 提升到了 4.7 的 70%,整整跳升了 12 个百分点,Cursor 团队在将该模型设为首日默认模型时引用了这一数据。如果你的开发环境使用 Cursor,那么你已经在使用这一升级版本了。

Replit 同样出现在 Anthropic 的发布公告中,他们给出了一个平淡但昂贵的评价:在日志分析、漏洞搜寻和修复建议方面,以更低的成本实现了同样的质量。这种表述是推动企业客户内部逐项迁移的关键,因为企业关心的问题不是“这个模型是否更聪明”,而是“我能否向签署账单的副总裁证明这笔开支的合理性”。Notion 在其自身的智能体工作流中报告了同样的 +14% 提升和三分之一的工具错误减少,这很重要,因为 Notion 是少数几个智能体用例并非明显属于编程范畴的发布合作伙伴之一。如果这种可靠性的提升在编程之外也能保持,那么这就是未来一个月值得关注的信号。

无人谈论的隐性涨价

Opus 4.7 的价目表价格与 4.6 相同。但单次任务的价格并非如此。新的分词器(tokenizer)完成了价格表上没有体现的工作。

Anthropic 没有提高每百万输入 5 美元 / 输出 25 美元的价格。他们没必要这么做。4.7 中的分词器不同,它对相同字符串的分词率大约是之前的 1.0 到 1.35 倍。典型的编程提示词(prompt)由于包含密集的标点符号和重复的标识符,往往处于该范围的高端。

计算过程很简单。在 Opus 4.6 上花费 10,000 个 token 的提示词,在 4.7 上可能需要 12,000 到 13,500 个 token。同样的文字,同样的单价,更高的账单。再加上 xhigh 成为 Claude Code 的新默认设置,典型的开发者在第一天即使不更改任何代码,也会看到明显的成本增加。

社区的反应比以往发布后的喧嚣更为激烈。一篇社区文章将其称为最差的发布版本列举了三大槽点:分词器膨胀(tokenizer bloat)、默认成本转嫁,以及在创意写作方面可感知的退化。Reddit 上的一篇热门帖子“Claude Opus 4.7 是严重的退化,而非升级”获得了约 2,300 个点赞,并记录了幻觉问题(臭名昭著的“strawberry”拼写错误再次出现)、简历改写中捏造学校,以及更多只消耗 token 却不增加有效信息的确认循环。

并非所有指责都公平。很大一部分投诉与 Anthropic 每次发布新版本时收到的反应重叠,即习惯了旧模型的用户在调整提示词之前,会将新的默认设置视为退化。然而,关于分词器膨胀的具体说法是可以独立复现的,这也是罕见的开发者质疑文章与 Anthropic 官方文档在技术上达成一致的发布版本。分词器是新的。新的分词器分词方式不同。账单反映了这一点。

发布说明的诚实版本应该是:每个 token 的价格不变,但每个任务消耗的 token 更多,因此即使你的 agent 代码没变,月度账单也会上涨。官方的口径是“价格无变化”。两者都是事实。但对开发者来说,有意义的是后者。如果你发布了一个大规模运行的 agent,你会希望在决定质量提升是否值得 token 通胀之前,先获得一周的生产数据;并且你希望在 Claude Code 中 4 月 30 日到期的 7.5 倍促销乘数结束前拿到这些数据,因为真实的成本状况要到那个日期之后才会显现。

4.7 对阵 GPT-5.4 和 Gemini 3.1 Pro 的现状

Opus 4.7 在编程和工具使用方面勉强夺回领先地位。但在终端操作和网页浏览方面,它仍然落后。

基准测试的情况喜忧参半,这才是准确的解读。在 SWE-bench Verified 上,Opus 4.7 得分为 87.6%,高于 4.6 的 80.8%,领先于 GPT-5.3-Codex 的 85.0% 和 Gemini 3.1 Pro 的约 80.6%。在工具使用基准测试 MCP-Atlas 上,4.7 以 77.3% 领先,高于 Gemini 3.1 Pro 的 73.9% 和 GPT-5.4 的 68.1%。这是 claude opus 4 系列在本次发布中最强有力的竞争优势。

Terminal-Bench 2.0 则呈现了不同的局面。Opus 4.7 得分为 69.4%,落后于 GPT-5.4 的 75.1%。BrowseComp 的表现更糟:4.7 得分为 79.3%,较 4.6 的 83.7% 下降了 4.4 个百分点,远落后于 Gemini 3.1 Pro 的 85.9% 和 GPT-5.4 Pro 的 89.3%。在推理基准测试 GPQA Diamond 上,这三者实际上打成平手,均在 94% 左右。

勉强夺回领先地位”这一措辞抓住了核心:这并非代际跨越。这是一个在某些基准测试中胜出、在另一些中落败,且交付了比竞争对手更好的开发者原语的版本。

对于智能体构建者的实际翻译:如果你的设置是以编码为中心且重度依赖工具,4.7 是默认选择。如果它是重度终端操作或重度浏览,你可能希望将 GPT-5.4-Codex 或 Gemini 3.1 Pro 保留在轮换中,无论是作为主模型还是作为参考意见。

更具揭示性的背景是 Mythos 让步,Anthropic 在其中公开承认 Opus 4.7 并不是其前沿模型。该公司内部的 Mythos 模型在 Anthropic 自己的评估中表现优于 4.7,且尚未发布。一家主流实验室明确告诉市场,它今天发布的东西并不是它拥有的最好的东西,这是很不寻常的。带着这种框架去阅读发布公告:Opus 4.7 是一个中转站,而不是巅峰。

这对智能体工具层意味着什么

4.7 的发布验证了 Cursor、Devin 和 Replit 在一年前的赌注:模型是商品;智能体外壳(agent shell)才是产品。

在 Cursor、GitHub Copilot CLI 和 Devin 的 Agent Preview 中首日默认采用就是一个信号。IDE 和智能体供应商不再等待开发者需求才切换到新模型。他们立即切换,因为他们销售的差异化不再是“我们封装了哪个模型”,而是“哪个外壳能让模型用于实际工作”。

Anthropic 在发布文章中引用的 Replit 的表述很直白:在日志分析、漏洞寻找和修复建议方面,以更低的成本提供相同的质量。这是一个模型能得到的平淡评价,但也是能开启企业客户内部预算迁移的评价。文中同样提到的 Notion 报告称,其内部智能体工作流改进了 +14%,工具调用错误减少了约三分之一。

任务预算和 /ultrareview这种组合是 Anthropic 对终端用户不再直接使用原始 API 构建应用这一现实的回应。用户现在通过 Claude Code、Cursor 或合作伙伴的代理外壳(agent shell)进行构建。通过将功能移入外壳而非仅仅停留在模型层面,Anthropic 正在客户真正活跃的领域展开竞争。

竞争影响:OpenAI 的 Codex 和 Google 的 Gemini 代理也基于同样的假设。竞赛已经从“谁拥有最聪明的基座模型”转向“谁拥有构建代理的界面”。对于任何基于 Anthropic 技术栈构建的人来说,决策树不再是“调用哪个模型”,而是“在哪个外壳上构建,以及该外壳是否将任务预算、努力程度控制和代码审查作为一等原语(first-class primitives)开放”。像结构良好的 AI 原生第二大脑 这样的工具,看起来不再像是研究好奇心,而更像是代理外壳用来落地运行所需的上下文层。

下一步计划

预计 Mythos 将在夏季前发布,并预计 Anthropic 将继续推动代理界面领先于模型权重的发展。

短期内,Claude Code 中 7.5 倍的促销请求乘数将持续到 4 月 30 日。基于新分词器(tokenizer)和新默认努力程度的真实成本数据将在 5 月初揭晓。预计社区将利用促销后的干净数据重新基准测试分词器膨胀的说法,并预计 Anthropic 会通过更新文档或悄悄调整 Claude Code 默认设置来做出回应。

中期来看(三到六个月),Mythos 是一个不容忽视的存在。Anthropic 已明确承认内部存在一个更大的模型。从 Opus 4.6 到 4.7 的发布节奏来看,Mythos 级别的发布窗口可能在夏季。更有趣的信号是 Anthropic 已经透露了产品方向:下一个模型的衡量标准将不仅是其基准测试分数,还包括与其一同发布的代理界面。

长期来看,任务预算(task budgets)可能会从 Beta 版转为正式版(GA),并成为代理循环在开发者工具中定价、计费和呈现的默认方式。/ultrareview 是专用智能体模式的模板;预计同样的设计模式将出现在数据分析、研究和运维中,作为独立的计费产品,而非同一模型的不同应用。

对于开发者来说,悬而未决的问题是:随着 GPT-5.4 和 Gemini 3.1 Pro 加入类似的基元,Anthropic 这种在模型提升有限的情况下发布新智能体界面的策略能否维持。模型权重的领先地位比产品界面更难防守,而产品界面又比生态系统更难防守。无论谁最终掌控了 claude 智能体层,或是竞争对手 Codex 和 Gemini 层,都将是通过构建外壳而非赢得基准测试来实现的。

4.7 版本今天值得升级吗?

如果你在 Claude Code 上运行重度编码的 claude 智能体,那么 xhigh 默认设置和 /ultrareview 是值得升级的,即使考虑到隐形的分词器(tokenizer)通胀。如果你运行的是重度浏览的智能体,你可能仍希望将 GPT-5.4-Codex 或 Gemini 3.1 Pro 纳入组合。无论如何,需要预算的不是升级本身,而是持续的审计:你的智能体现在每个任务的成本是多少,一周前又是多少?一旦你有了答案,你如何在智能体对话间 召回工作记忆 就变得与底层模型同样重要。Opus 4.7 是一个路标,而非终点。为路标而构建,但不要将其与目的地混淆。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page