top of page

Anthropic 和 Google 争夺 AI 上下文窗口

Anthropic 上周在 Claude 4 上发布了 200 万 token 的上下文窗口。Google 几天后在 Gemini 2.5 Pro 上进行了匹配。这些举措标志着竞争重点从模型准确性转向内存规模。

两家公司现在都提供超出大多数企业文档集的上下文长度。这迫使竞争对手决定是追赶相同长度,还是在较短窗口上优化更低成本。

发布设定新的长度基准

Anthropic 于 6 月 3 日首次宣布 200 万 token 窗口。Google 于 6 月 5 日在 Gemini 2.5 Pro 中响应了相同的限制。两项更新仅适用于付费 API 层级。Google Blog 在其官方博客上确认了企业用户的扩展上下文。

该长度允许模型在单次会话中容纳大约 1500 页文本。此前两家提供商的限制接近 20 万 token。这一飞跃影响了团队构建检索系统的方式,而这些系统曾经依赖分块。

Anthropic 分享的内部测试显示,更长的窗口将法律合同的摘要步骤减少了一半。Google 在跨越多个代码库的代码库上报告了类似的收益。

处理历史档案的团队现在将整个集合视为一个提示,而不是多个交错调用。Anthropic 的 Claude 4 可以在一次通过中处理一家公司完整的 10 年财务历史。Google 的 Gemini 2.5 Pro 可以摄取一个开源项目五年内的所有提交消息和拉取请求,而无需中间摘要。

工程师以前将大型输入拆分为 5 万 token 的块,并维护单独的向量存储。新的限制简化了该管道。一家物流公司用一次调用替换了六个检索代理,该调用引用了自 2019 年以来的每条发货记录。

进一步的技术细节揭示了提供商如何达到这些长度。Anthropic 使用环形注意力和优化内存分配的组合训练 Claude 4,以允许逐步扩展而无需完全重新训练。Google 将其自己的混合专家路由应用于 Gemini 2.5 Pro,仅选择性地激活最相关长上下文部分的参数。这两种方法都需要在 GPU 内存管理和自定义内核优化方面进行大量工程投入。

企业团队现在尝试全新的数据格式。法律公司上传包含电子邮件、证词记录和法庭文件的多年诉讼历史。单个 200 万 token 窗口可以包含 180 万 token 的主要文档加上 20 万 token 的先例判例法,使模型能够在一个前向传递中跨越数十年的记录建立联系。

其他示例说明了采用的广度。出版商正在加载完整的期刊回溯目录,以进行跨几十年的主题分析。学术研究联盟现在在撰写新提案时加载整个资助历史,使模型能够识别可能需要数周手动交叉检查的重叠资助模式。

对于围绕长文档构建个人或团队知识系统的专业人士,remio 的 AI 原生第二大脑 等工具提供了集成扩展上下文功能的互补工作流。

管理大型记录的团队面临更高风险

知识工作者和工程团队现在面临直接压力。他们必须在为更长会话付费或重构检索管道之间做出选择。较短的窗口会强制重复上下文刷新,从而增加延迟。

中型公司的产品团队报告称,正在测试额外 token 是否足以降低错误率以证明更高的支出是合理的。早期数据仍然喜忧参半。一些文档集在 token 计数超过 80 万后仍会产生幻觉。

曾经维护数十个索引合同文件夹的法律部门现在上传整个交易历史。400 页的合并协议加上所有先前修订版都适合窗口。模型可以跨版本交叉引用条款,而无需外部查找。

工程组织也经历了类似影响。一家中型金融科技公司将其整个单体仓库文档(约 140 万 token)移入单个 Gemini 会话。开发人员提出的架构问题同时引用了当前代码和 2021 年的存档设计决策。响应质量有所提高,但团队仍支付之前每次查询成本的三倍。

医疗保健研究团队已开始加载跨越多个地点和多年的完整患者试验记录。一个肿瘤学团队将八年的纵向数据、影像报告和基因测序笔记合并到单个 Claude 4 上下文中。该模型发现了治疗时机和生物标志物变化之间以前未注意到的相关性,尽管肿瘤学家仍会根据源扫描验证每个标记模式。

供应链运营商正在测试类似模式。一家全球制造商将五年的供应商合同、质量报告和运输日志摄取到一个提示中,以建模中断风险。该练习揭示了某些原材料供应商与两个司法管辖区的监管变化之间的隐藏依赖关系。

能力声明掩盖了不断上升的计算成本

更长的上下文并不会自动改善推理。两家公司都承认,注意力层会稀释对 distant passages 的关注。因此,Anthropic 应用了一个新的路由层,优先考虑最近的 token。

Google 在完全注意力之前使用分层压缩步骤。该技术防止成本随长度线性扩展。独立基准显示,压缩在多跳问题上增加了小的准确性下降,如 The Verge 的报道所述。

Claude 4 中的路由层将上下文拆分为相关性带。最后 10 万个位置的 token 获得完全注意力;较旧的带获得逐渐较轻的加权。这种设计减少了内存带宽,同时保留了最近材料的连贯性。

Google 的分层方法首先将每 3.2 万 token 块总结为一个紧凑向量,然后对向量进行注意力处理。最终传递仅重新扩展排名靠前的块。根据与更新一起发布的 Google 内部论文,与未压缩注意力相比,长文档问答的准确性下降了大约 3–4%。

其他内部测量表明,即使在效率层到位的情况下,当从 20 万 token 增加到 200 万 token 时,每次查询的功耗大约上升 2.7 倍。这对于每天运行数千次查询的组织很重要,因为数据中心级别的电力和冷却成本变得重要。

生产使用中出现的实际限制

企业试点揭示了两个一致的约束。首先,当源材料超过 120 万 token 且没有额外结构时,输出质量会下降。其次,一旦发生缓存未命中,每次查询的价格上涨速度超过宣传。

测试 10-K 文件的财务团队发现,模型仍然需要手动部分提示来定位特定条款。法律部门在合同比较任务上看到了类似结果。仅靠原始长度并不能取代有针对性的检索。

一家资产管理公司将八年的收益记录加载到 Claude 4 中。该模型正确识别了收入趋势,但偶尔将 2022 年的利润率扩张归因于错误的运营部门。分析师仍然导出相关的 50 页摘录并反馈进行验证。

缓存行为增加了另一个变量。当相同的 200 万 token 上下文跨多个问题重用时,两家提供商都会缓存键值存储。一次缓存命中可将延迟减少 60%。但是,对提示的任何更改都会使缓存失效,使用户返回到完整价格。因此,迭代优化问题的团队会看到成本急剧波动。

第二家资产管理公司发现,跨项目轮换分析师会导致重复的缓存失效,使每个洞察的有效成本接近未压缩率。该团队现在为每个大型数据集指定一个“上下文所有者”,以最小化提示更改。

对检索增强生成系统的影响

依赖嵌入块和向量相似性搜索的传统 RAG 管道面临根本性的重新设计压力。有了 200 万 token 窗口可用,对于许多以前需要复杂分块策略的语料库,可以完全绕过中间检索步骤。例如,LangChain 的最新抽象引入了“全上下文检索器”,当 token 预算允许时直接传递整个文档集合,消除了嵌入模型调用和向量数据库维护开销。

团队报告说,生产代码有了可衡量的简化。一家保险分析团队在迁移到 Claude 4 的长窗口后,删除了三个单独的嵌入模型及其相关基础设施。查询延迟下降了 40%,而监管问题的召回率上升,因为模型现在交叉引用每个条款,而无需相似性阈值过滤。但是,当模型必须在密集文本中挖掘低显著性但关键的细节时,这种方法引入了新的失败模式。

实施的实际影响

采用这些窗口的企业必须重新设计摄取管道。团队不再将文档分块为 4000 token 的段,而是加载完整文件并添加模型可以引用的轻量级元数据头。提示模板从“检索最相关的段落”转变为“扫描整个记录并提取条款 X 的每个实例”。

LangChain 和 LlamaIndex 等工作流工具已经公开了新的抽象。最新版本支持“全上下文”检索器,当 token 计数允许时直接将整个语料库传递给模型。早期采用者报告说,代码库更简单,因为中间嵌入步骤消失了。

成本建模也发生了变化。每 token 定价仍然是标题费率,但实际支出取决于缓存命中率和输出长度。一个针对相同缓存上下文提出十个后续问题的团队实际上只支付一次摄取费用加上十个小的输出费用。因此,预算预测必须纳入使用模式,而不是原始 token 计数。

在采用新限制的公司中,变更管理研讨会已变得普遍。工程主管正在培训提示工程师如何编写“导航提示”,以指导模型通过海量语料库而不丢失线程。这些研讨会通常包括动手实验室,参与者练习构建在 200 万 token 会话中存活的元数据头。

限制和风险

几个技术上限仍然可见。在复杂推理任务上,注意力稀释仍然发生在大约 120 万 token 之外。因此,两家提供商都建议用户尽可能将核心问题保持在最近的 80 万 token 内。

数据隐私法规使全上下文使用变得复杂。当整个客户数据库放入一个提示中时,每个下游查询在技术上都会处理完整的数据集。因此,受 GDPR 约束的公司必须为这些会话实施更严格的日志记录和保留政策。

供应商锁定风险也会上升。围绕 200 万 token 窗口构建了大量提示库的组织,如果竞争对手无法达到该限制或更改定价,将面临迁移成本。一些团队故意维护并行的较短窗口管道,以保持灵活性。

最后,评估仍然困难。标准基准的上限为 20 万 token。团队必须创建自己的长上下文测试套件,这会引入测量噪声并减慢迭代周期。

与其他提供商的比较

OpenAI 目前在 GPT-4o 上提供 100 万 token 窗口。该公司尚未宣布计划达到 200 万 token 的水平。Microsoft 的 Azure OpenAI 服务提供相同的 100 万 token 限制,并附加企业合规控制。Mistral 和 Cohere 等较小的实验室仍将上下文限制在 12.8 万 token,专注于降低延迟和更便宜的推理。NYTimes 上周报道。

在价格上,竞争差距缩小。Anthropic 在 200 万 token 限制下每百万输入 token 收费 15 美元,而 Google 在类似条件下收费 12.50 美元。OpenAI 的 100 万 token 服务定价为每百万 10 美元。很少超过 50 万 token 的组织通常会选择 OpenAI,以避免与更长窗口相关的高价。

行业分析师指出,即使在较短的上下文长度下,Microsoft 的企业控制也为 Azure 在受监管行业提供了优势,因为 Anthropic 和 Google 在完整的 200 万 token 层级上的合规认证和专用网络选项仍不可用或不够成熟。

接下来值得关注的事项

关注 Anthropic 7 月的财报电话会议,了解更新的上下文定价层级。关注 Google Cloud 关于 Gemini 在窗口增加后的采用情况报告。跟踪 OpenAI 是否会扩展其 100 万 token 服务,或维持当前限制。

任何将定价降至当前每 token 费率以下的公告,都将决定 200 万 token 是成为标准还是仍为高级功能。稀疏注意力研究的持续进展也可能改变经济学,允许更长的窗口而不会导致成本成比例增长。

评估框架的持续进展将决定采用速度。一些学术团体正在发布新的长上下文基准,达到 50 万和 100 万 token;一旦这些基准标准化,采购团队将获得更清晰的信号,了解哪家提供商在规模上能提供最佳的每美元准确性。

上下文窗口增长的演变历程

在过去三年中,上下文长度大幅增长。2022 年,大多数前沿模型处理 4000–8000 token。到 2023 年底,上限达到 12.8 万–20 万 token。因此,2025 年跃升至 200 万 token,代表着仅在 18 个月内增长了十倍以上。每一步都需要新的注意力机制和硬件感知训练机制,但也暴露了召回保真度与推理经济学之间的相同根本权衡。

早期采用者围绕 3.2 万 token 限制构建的系统现在面临过时决策。一些组织选择保留传统管道用于成本敏感的工作负载,而仅将高价值查询路由到最新的长上下文端点。其他组织则重写整个摄取层以利用扩展的容量。

常见问题

更长的上下文是否总是能减少幻觉?

不会。质量仍然取决于材料对查询的新近度和相关性。许多团队仍会对较旧的区间应用轻量级摘要,以保持准确性稳定。

我可以在同一项目中混合使用长上下文调用和传统 RAG 吗?

可以。混合设置很常见:模型接收完整的近期语料库,加上针对很少更改的旧材料的少量向量检索补充。

是否每个提供商最终都会提供 200 万 token 窗口?

分析师预计 OpenAI 和 Meta 将在 12 个月内宣布类似的长度,这由企业需求驱动,尽管定价和效率层可能会有所不同。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page