top of page

Anthropic 与 Google 在 AI 上下文窗口上的冲突

6月15日
讀畢需時 9 分鐘

Anthropic 上周宣布 Claude 4 的上下文窗口达到 100 万 tokens。Google 随即发布更新版 Gemini,也达到了相同的长度。

两家公司如今在同一维度上展开竞赛,而非仅靠模型智能。两次更新相隔不到四天。

原始上下文长度已不再是可有可无的功能。它如今成为双方宣称技术领先的最清晰方式。

Anthropic 的公告强调了一次专门的训练运行,该运行针对长序列优化了 transformer 架构,使 Claude 4 能够一次性处理整个代码仓库、数百页的法律合同,或多天的对话历史。Google 的反击发布不仅强调在 100 万 tokens 上的平权,还增加了一个辅助检索层,可动态索引超过 50 万 tokens 的片段,减少手动分块的需求。这种快速的来回较量标志着与以往年份的背离,当时 OpenAI 的 GPT-4 系列曾以 128,000 tokens 暂时领先,而其他模型则滞后于 32,000 或 200,000 tokens。

Anthropic 的举措也表明了对开发者工作流的战略押注,这些工作流需要对代码库的整体理解,而非零碎分析。通过支持全仓库摄入,该公司将 Claude 4 定位为可用于此前需要多个专用代理的架构审查的工具。Anthropic 的早期内部测试显示,与 200,000-token 的前代产品相比,大规模重构任务的时间减少了 34%。

设定新标准的举措

Anthropic 让 Claude 4 能够一次性阅读约 75 万字的内容。公司表示,这一变化是通过一次专注于长序列的新训练运行实现的。根据 The Verge 的报道,此次更新迅速改变了行业对单个提示可合理包含内容的预期。

Google 以 Gemini 更新回应,匹配了 token 数量,并为超过 50 万 tokens 的文档添加了新的检索层。两次发布均来自公司博客上公布的官方模型卡。Google 的官方博客文章 详细介绍了混合注意力机制及其对企业文档处理的影响。

测试新限制的用户报告称,全代码库或多小时会议记录的摘要现在可以放入单个提示中,而无需拆分为更小的块。NYTimes 分析 指出,早期企业实验已显示多阶段审查周期的显著压缩。

Anthropic 的工程博客文章详细说明了训练课程如何在数周内将序列长度从 32,000 逐步增加到 1,000,000 tokens,采用了课程学习和专门的位置嵌入调整。工程师插入了带学习温度参数的旋转位置嵌入,以在极端距离上稳定注意力分数。所得模型在合成基准测试中表现出稳定性能,而早期的 200,000-token 版本在中上下文召回上曾出现崩溃。

Google 的方法结合了规模与架构增强。更新后的 Gemini 版本纳入了混合注意力机制,通过稀疏检索索引路由长程依赖,同时保留最近 128,000 tokens 的密集注意力。公告中引用的内部基准显示,当检索层在 750,000-token 法律证词上激活时,事实依据性提高了 18%。两家公司均开源了小型评估套件,可在不同深度复制“针在 haystack 中”测试,使社区无需访问完整模型即可验证声明。

早期企业采用者立即开始对扩展窗口进行压力测试。一家金融科技公司将三个月的监管文件和收益记录加载到 Claude 4 中,提示模型找出此前需要单独检索增强生成管道的文档间不一致之处。另一家软件咨询公司的团队上传了包含 420,000 行代码的整个单体仓库;Claude 生成了依赖图,并标记出静态分析工具遗漏的已弃用 API 使用模式。这些真实世界的探测显示,只有当底层注意力质量在整个跨度内保持高水平时,原始 token 容量才能转化为工作流压缩。一家媒体公司的额外测试显示,摄入 18 个月的编辑指南与故事档案,使 Claude 能够在无需显式检索步骤的情况下强制执行风格一致性,将修订周期缩短近一半。

Google 的企业客户同时在超过 100 万 tokens 的监管合规文档上试验双检索设置,结合即时索引与核心上下文窗口。一家物流提供商在单次会话中处理了 14 年的运输合同,识别出触发自动重新谈判警报的重叠条款。混合系统在保持事实依据性方面表现出特别的优势,即使相关段落相隔超过 700,000 tokens,而纯密集注意力模型在此领域仍继续挣扎。

为什么上下文长度突然变得重要

曾经依赖重复摘要步骤的团队现在可以一次性输入整个项目历史。这一转变消除了长研究任务中常见的错误来源。

企业内部的产品团队已经在重写内部工具,以假设新窗口大小保持稳定。一位早期采用者用包含三个月设计文档的单个提示替换了多步骤检索管道。这一演变与 personal knowledge management 的更广泛讨论相符,长上下文模型减少了维护第二大脑系统的摩擦。

这一变化也提高了犯错的成本。当模型在百万 tokens 上产生幻觉时,错误输出的量级会同步增长。

生产力影响远不止简单的摘要。药物发现领域的研究人员现在将完整专利组合与实验笔记本嵌入在一起,期望模型交叉引用不同格式描述的分子结构。法律部门将数十年的判例法输入提示,要求合成狭窄主题上先例演变的综合。在这两种情况下,消除中间摘要层可减少累积的事实漂移。以前在多个分块阶段幸存的单个遗漏条款或错误描述的研究,现在会直接浮现,因为完整源材料对模型可见。

几家大型组织正在进行工作流重新设计。一家汽车制造商将需求可追溯性矩阵生成从五阶段管道(文档摄入、每节摘要、交叉引用、验证和格式化)压缩为两阶段流程。新流程直接输入原始需求语料库,并请求矩阵及随附的风险评估。早期测量显示,每个发布周期的工程小时数减少了 47%,尽管验证阶段仍需要人工监督安全关键项目。类似模式出现在制药研究中,团队现在加载整个临床试验历史和监管通信,以生成统一的安全信号报告,而这些报告曾经需要单独的专家审查。

长度与可靠性之间的核心张力

更长的上下文并不自动意味着更好的答案。Anthropic 和 Google 都面临同样的问题:当序列拉伸到上限时,注意力机制仍会退化。

Anthropic 研究人员在发布说明中指出,一旦提示超过 600,000 tokens,中上下文事实的准确性会下降约 12%。Google 发布了类似的内部基准,显示了类似的下降。

因此,竞赛的中心在于谁能在窗口增长的同时保持答案质量平稳。两家公司尚未公布关于这一确切点的正面交锋数据。

注意力退化根据内容类型表现不同。在代码任务中,提示早期引入的变量定义可能在模型到达引用它们的后续函数时被忽略。在叙事或分析任务中,文档中间三分之一的细微论点往往比开头和结尾部分获得更少的权重。两家公司通过持续的预训练(使用位置插值数据)和后训练强化学习来缓解这一问题,后者奖励对所有上下文区域的一致使用。然而,此类训练的成本随序列长度超线性增长,形成了有利于最大云提供商的经济壁垒。最近与企业合作伙伴私下分享的消融研究表明,温度缩放的旋转嵌入可恢复约 7% 的中上下文保真度损失,但与较短窗口的完全平权仍需要额外的推理时技术,如上下文重新排序。

行业内的比较方法

虽然 Anthropic 和 Google 主导了最近的头条,其他实验室也采取了平行策略。OpenAI 将 GPT-4o 扩展到 128,000 tokens,并提供可选的 100 万 token 预览,仅限特定企业客户在严格速率限制下使用。Meta 的 Llama 3 衍生版本通过修改 RoPE 缩放的社区补丁达到 256,000 tokens,但这些模型在超过 100,000 tokens 后的质量退化比前沿产品更陡峭。Mistral 和 Cohere 分别发布了 128,000 和 256,000 token 变体,将自己定位为不需要完整百万 token 容量的成本高效替代方案。Bloomberg 的行业简报 强调了这些层级如何影响供应商选择。

技术差异现在在于辅助系统,而非标题 token 数量。Google 的检索层、Anthropic 对稳定中上下文准确性的强调,以及 OpenAI 的分层访问模型,各自代表了对用户实际如何消费长上下文的不同押注。因此,评估供应商的组织不仅比较原始长度,还比较不同上下文大小下的延迟概况、每额外 100,000 tokens 的定价,以及保留扩展上下文的微调 API 的可用性。行业论坛上分享的越来越多内部基准显示,除非工作负载涉及跨文档合成而非简单检索,否则从 256,000 增加到 1,000,000 tokens 的边际价值会趋于平稳。

企业工作流的实际影响

围绕新窗口大小重新设计流程的企业报告了工具预算的可衡量变化。以前需要多次向量数据库调用的检索增强生成堆栈,对于低于一百万令牌的工作负载,可以简化或退役。这种简化减少了嵌入模型和向量存储的基础设施支出,但增加了每令牌推理成本,因为完整上下文必须由大型语言模型处理。

团队还面临新的治理问题。当整个项目历史都存在于单个提示中时,访问控制变得更加细粒度。组织必须决定对话中的每位参与者是否继承对敏感历史线程的可见性,或者模型提供商是否提供提示范围的编辑。一些早期采用者已经实施了中间件,在组装上下文之前自动剥离个人身份信息,这增加了工程开销,抵消了部分承诺的工作流收益。例如,一家全球银行开发了一个预处理层,在保留交易模式的同时编辑客户端标识符,使合规团队能够查询完整的审计跟踪,而不会触发数据驻留违规。

限制与风险

尽管营销重点放在长度上,但仍存在一些硬性约束。在当前硬件上,推理延迟大致与上下文大小呈线性增长,因此即使在优化集群上,一百万令牌的提示也可能需要 8–12 秒的首令牌时间。内存消耗也类似地扩展,迫使提供商实施激进的 KV-cache 压缩,这本身可能引入质量差异。监管审查正在增加;欧洲 AI 法案草案文本将“系统性风险”标记为上下文窗口允许在没有明确保障措施的情况下处理大规模个人或受版权保护材料的模型。

另一个风险涉及知识产权泄露。当用户粘贴整个专有代码库或机密战略文档时,除非提供商保持严格的数据隔离保证,否则未来模型的训练数据可能会无意中包含该内容。Anthropic 和 Google 都发布了更新的数据处理政策,但对这些声明的独立审计仍然有限。

数字仍未明确之处

迄今为止的独立测试依赖于合成的大海捞针任务。这些测试容易被操纵,不能反映典型的企业文档组合。

真实用户报告仍然分散在论坛和私人 Slack 频道中。很少有组织运行受控比较,以衡量整个窗口中的检索准确性和最终输出质量。

在没有第三方基准的情况下,领先地位的声明仅基于公司声明。

接下来要关注什么

两家公司下一季度的模型发布将显示当前的 100 万令牌上限是否会再次移动,或者重点是否转向在新大小下保持质量稳定。

9 月到期的企业使用报告将揭示团队是否真的围绕全上下文提示改变工作流,或者是否出于可靠性原因恢复到分块。

监管机构已经要求两家公司提供数据,说明长上下文如何影响受监管行业的输出一致性。这些文件定于 7 月发布。

常见问题

团队应如何在长上下文工作负载上决定使用 Anthropic 还是 Google?

在代表性内部文档上评估中间上下文准确性,而不是仅依赖最大令牌数。运行并行试点,在 600,000 令牌操作点同时测量延迟和事实一致性。

上下文窗口会无限期继续扩展吗?

硬件约束和二次注意力成本表明,超过两百万令牌的有意义增益将需要新架构,例如状态空间模型或分层注意力。在接下来的一年内,增量增长到 150 万–200 万令牌仍然可能。

长提示中存在哪些防止数据泄露的保障措施?

两家提供商都表示,除非明确选择加入,否则客户提示不会用于训练。组织仍应应用数据最小化,并在加载敏感材料之前审查每个提供商的 SOC-2 和 ISO-27001 认证。

密切跟踪模型变化的用户将首先在定价页面中注意到下一个信号。两家公司都暗示了与上下文长度相关的新速率限制,但确切阈值仍未公布。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page