top of page

Anthropic 发布 Claude 4 Opus,扩展上下文与代理模式

Anthropic 推出了 Claude 4 Opus,其具有 100 万 token 的上下文窗口和专为链式任务设计的代理模式。此举对仍依赖较短窗口和手动提示链的提供商施加了压力。

该公司将此次发布定位为对用户需求的回应,即无需频繁重置即可处理整个代码库或研究库。这一变化正值多个团队已在测试需要跨数十步保持持久记忆的代理系统之际。

发布详情与上下文扩展

Anthropic 将 Claude 4 Opus 的新上下文限制设定为 100 万 token。该规模可在单次会话中覆盖约 75 万字的文本。用户现在可以加载完整的年度报告、多份会议记录和相关代码文件,而无需将其拆分为单独的调用。

该更新提升了窗口远端的召回准确性。此前模型在超过 10 万 token 后往往会丢失细节。内部基准测试显示,Claude 4 Opus 在检索测试中能保持对完整长度的正确引用,Anthropic's official announcement

代理模式让模型能够以更少的人工干预来规划、执行和修订多步序列。该系统可以调用工具、检查中间结果,并根据发现调整下一步操作。早期测试者报告称,与之前版本相比,步骤遗漏的情况减少,包括一个法律团队使用该模式在单一线程中协调了 12 份合同中的 200 个条款,详见The Verge's early access review

代理模式如何改变日常工作

处理产品需求文档的团队可以将数月的笔记和客户通话内容一次性输入提示。模型随后会返回围绕已讨论决策构建的草稿,而非通用模板。用户仍需审查和修正,但初始框架更贴近内部用语。

进行文献综述的研究团队可一次性加载数十篇论文。代理模式能识别相互矛盾的发现、标记空白,并建议后续搜索。整个过程保持在单一对话线程中,而非在多个独立聊天间跳转。一家生物科技初创公司的早期测试者借助代理模式,从 85 篇论文中综合发现,并生成了三个后来在实验室验证的针对性实验假设,详见coverage in Reuters

同一模式也出现在代码迁移项目中。开发者将模型指向旧代码库和当前文档。它会生成迁移步骤、在沙箱环境中测试,并在提交任何代码前显示冲突。

对竞争上下文策略的压力

OpenAI 和 Google 在此前版本中已扩展上下文,但两者仍强调对大多数代理任务采用较短的聚焦会话。这种方法可降低每次调用的计算成本。Anthropic 则押注用户更偏好减少重置,即使单次调用消耗更多资源。

提供代理编排层的较小实验室面临不同问题。他们的产品依赖将多个短上下文调用拼接在一起。一旦基础模型能可靠处理更长跨度,拼接层就会失去部分价值。

限制与遗留问题

100 万 token 的窗口仍需要仔细的提示设计。当输入噪声数据时,Claude 4 Opus 可能会提取无关部分。用户必须继续对源材料应用清晰结构,否则可能导致答案稀释。

代理模式性能随任务复杂度而变化。简单序列在早期测试中表现出较高一致性。需要跨变化数据源进行外部工具调用的任务则显示出更多差异和偶尔的循环。Anthropic 尚未发布这些情况的失败率统计数据。

成本仍是一个变量。更长的上下文调用平均会使用更多 token。团队必须权衡会话重启的减少与每次调用更高支出的利弊。公开定价细节尚未发布。

下季度值得关注的信号

采用数据将首先出现在 API 使用图表中。超过 20 万 token 的调用持续增长将表明对扩展窗口的真实需求。增长持平则表明大多数用户仍在对其工作进行分段。

竞争对手的回应至关重要。如果 OpenAI 或 Google 在 90 天内宣布匹配的上下文增加或新的代理工具,市场将检验 Claude 4 Opus 的优势是否持久。任一公司的延迟都可能让 Anthropic 在长上下文代理实验中获得暂时领先。

企业反馈将通过案例研究浮现。法律和金融团队的早期报告将揭示大规模召回准确性是否与实验室基准相符。这些报告将影响其他公司决定是微调较短模型还是转向更长窗口。

对于已在构建个人上下文层的知识工作者而言,此次发布强化了跨工具持久记忆的价值。类似 remio 的系统会持续积累会议笔记、文档和先前的 AI 交流,以便任何代理调用都能从已有历史开始。这种设置减少了即使新模型到来时重新提供上下文的需求。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page