top of page

Anthropic 上下文窗口扩展,Google 设置新限制

Anthropic 上周将其上下文窗口限制提高到两百万 tokens。Google 则在部分 Gemini 模型上测试新的 128 千 tokens 上限。这些举措将竞争从原始模型能力转向每个系统能保留多少先前材料。

开发者现在面临直接选择。一方提供对代码库和文档的广泛回忆。另一方则强制缩短内存以控制成本和延迟。两种方法都存在影响真实项目的权衡,从企业软件到研究管道。

Anthropic 上下文窗口无硬性停止地增长

Anthropic 表示,两百万 token 窗口适用于其最新 Claude 版本。该公司对完整代码仓库和多小时对话历史进行了限制测试。早期报告显示,当要求跨整个输入进行总结或编辑时,系统保持连贯性。

处理大规模代码库的团队已经开始迁移工作流。一个工程组将包含 140 万行代码、跨越多种语言的仓库加载到单个提示中。该模型识别出已弃用的函数,并建议重构引用相隔数十万 tokens 的文件。这消除了之前需要自定义编排层的分块检索管道。金融行业的另一家公司摄入了五年的监管文件和内部备忘录,使模型能够标记跨越多个财政季度的合规差距,而无需任何外部索引步骤。

Anthropic 通过内存分配和注意力机制的架构改进实现了扩展。该公司没有简单增加原始容量,而是优化了位置编码如何在扩展序列中扩展。早期采用者注意到,对于许多文档分析任务,检索增强生成层现在可以简化或完全移除。即使总体序列超过一百万 tokens,注意力机制现在也能通过优先考虑语义相关段落来更有效地分配计算。公司内部研究人员证明,该模型仍能跨长于大多数小说的文档执行准确的共指消解,这是一种以前需要多个分阶段提示的能力。

这些改进也改变了产品团队构建数据摄取管道的方式。一些组织现在直接将原始档案发送给模型,而不是将文档预处理为摘要或向量嵌入。这种方法减少了工程开销,并降低了在分块操作中丢失细微上下文的风险。团队报告说,提示迭代周期缩短了,因为模型可以引用早期指令或示例,而无需明确提醒。在一家物流初创公司中,工程师用单个 180 万 token 的提示替换了六个月前的管道,该提示将集装箱运动追溯到三大洲和四种监管制度,之前该管道将运输清单分成重叠块。这一变化将部署时间从数周缩短到数天,并减少了必须监控嵌入漂移的微服务数量。

Google 引入选择性上下文上限

Google 的举措则相反。工程师添加了一个切换开关,用于限制某些 Gemini 端点上的可见上下文。既定目标是降低交互会话期间的延迟。引用的内部基准显示,当模型忽略较旧 tokens 时,错误率更低。

运行面向客户聊天界面的产品团队欢迎此选项。一家支持平台报告,在启用 128 千 token 限制后,中位响应时间减少了 34%。同一团队观察到,对偶尔在完整历史可见时出现的过时政策文档的幻觉引用减少了。另一家运行高容量内部知识库的企业客户注意到,一旦窗口被限制,响应变得更加集中,减少了早期对话轮次中切题信息的包含。

该切换开关在 API 级别运行,允许开发者为每个请求设置最大上下文。Google 尚未表明未来模型是否会默认强制执行上限或保持可选。该决定似乎由基础设施成本建模驱动,而非能力限制。通过动态控制上下文长度,Google 可以更可预测地在其机群中分配 GPU 资源。这种可预测性转化为选择较短窗口的客户更稳定的定价。几家金融服务客户已经配置了切换开关,以便在低于 20,000 tokens 的查询时自动激活,同时将合规审查路由到更长、不受限制的会话。

使用切换开关的开发者已开始尝试混合策略。他们为关键事实维护单独的长期内存存储,同时允许模型在实时会话期间在严格的 128 千 token 边界内运行。这种模式保留了扩展上下文的一些好处,而无需在每次请求上支付全部延迟惩罚。一家媒体公司构建了一个后台作业,将每周编辑笔记压缩为结构化摘要,并仅重新注入最近的 80,000 tokens 加上压缩档案;结果将平均响应时间减半,同时在明确请求时仍能显示十年前的活动数据。

上下文窗口大小背后的技术机制

上下文窗口定义了模型在单次前向传递中可以处理的最大 tokens 数。Tokens 代表大约相当于英语中四个字符的文本块。因此,两百万 token 窗口可以容纳大约 150 万字或整本小说加上大量支持文档。

更大的窗口改变了模型执行多步推理的方式。当合同的每个条款或代码库中的每个文件都保持可访问时,模型无需依赖外部向量数据库即可交叉引用约束。这减少了检索错误,但增加了每次调用的计算需求。位置编码方案现在必须处理远超典型训练分布的距离,Anthropic 通过引入学习缩放因子解决了这个问题,这些因子在极端长度下保持相对位置保真度。早期内部测试显示,即使代词与其先行词之间的距离超过 120 万 tokens,这些缩放因子仍能保留超过 92% 的共指准确性。

较短的窗口迫使定期进行显式摘要步骤。开发者必须决定哪些信息值得保留,哪些可以丢弃。这会产生额外的提示工程开销,但通常会导致更可预测、成本更低的推理运行。团队经常实施分层内存系统,最近的交换保持在活动窗口中,而较旧的交换则压缩为结构化笔记,仅在相关时重新注入。例如,一家医疗保健分析公司运行夜间作业,将 200,000 token 的每周患者查房记录转为 8,000 token 的问题列表;活动窗口随后仅接收最新的 120,000 tokens 加上压缩列表。

窗口大小的差异也影响训练动态。用更长序列训练的模型需要更复杂的梯度检查点和内存高效注意力实现。这些工程投资解释了为什么只有部分前沿实验室目前宣传多百万 token 能力。试图复制结果的较小研究组报告说,如果没有相应的注意力优化,简单增加序列长度会导致大约 400,000 tokens 后训练不稳定。

推动上下文窗口需求的行业用例

法律技术平台是扩展窗口最明显的受益者之一。合同审查工具现在可以在单次会话中摄入完整的交易历史,包括先前修订和电子邮件谈判。律师收到考虑每个引用条款的综合风险评估。一家律所报告,在切换到两百万 token 模型后,复杂合并协议的审查时间从三天缩短到六小时。

分析纵向研究的科学团队也同样受益。一个基因组学组最近将五年的实验室笔记和实验元数据加载到 Claude 中。该模型发现了以前未注意到的、记录在单独笔记本中的实验条件之间的相关性。跨多年增量更新保持叙事连续性的能力加速了几家学术实验室的假设生成。在另一个案例中,气候建模研究人员输入了 170 万 tokens 的原始传感器读数和模型输出;该系统识别出北极冰厚度异常中的一种新兴模式,这种模式被传统统计管道遗漏。

相比之下,客户支持自动化更倾向于受限窗口。对话记录很快因重复问候和澄清而变得嘈杂。保持上下文简短可防止模型过度重视不再反映当前问题状态的早期回合。因此,几家大型零售商已为其聊天机器人舰队采用 Google 的上限端点,报告称代理停止引用过时促销细节后,回复更快且客户满意度得分更高。

提供商策略的比较分析

Anthropic 和 Google 方法之间的分歧说明了两种不同的理念。Anthropic 押注硬件和算法进步将继续使长上下文推理对不断扩大的工作负载经济实惠。Google 似乎将上下文长度视为可调参数,应与每个应用的统计特性匹配。两种方法都不是普遍优越的;最佳选择取决于查询复杂性、数据敏感性和所需响应时间。运行并行试点的团队一致报告,在具有密集交叉引用的任务上,纯长上下文使用获胜,而在高频、低复杂度交互上,上限窗口获胜。

成本结构和定价影响

Anthropic 按完整窗口的 tokens 收费。因此,两百万 token 请求产生的费用远高于竞争平台上等效的 10 万 token 查询。组织必须权衡这些成本与减少检索基础设施带来的节省。几家中型初创公司发现,直到每月复杂查询量超过五万次,基础设施节省才完全抵消推理账单。

Google 的分层方法允许团队选择与预期查询复杂度相匹配的上下文长度。128-thousand-token 设置具有较低的每 token 定价,使其对高容量、低复杂度的负载具有吸引力。采购团队现在运行内部基准测试,同时考虑推理成本和维护检索系统的工程时间。多家初创公司报告称,在根据各供应商的定价模型重新计算总拥有成本后,调整了整个产品路线图。一家 Series-B 公司将其 tier-1 支持机器人切换到受限的 Gemini 端点,并将最复杂的诊断查询重定向到 Anthropic,从而使每月 AI 支出净减少 27%,同时提高了首次联系解决率。

开发团队的实际影响

采用更长上下文窗口的团队可以拆除部分检索增强生成堆栈。这减少了维护负担,并消除了与嵌入漂移或分块边界错误相关的故障模式。工程速度得到提升,因为需要调试的自定义编排组件更少。新工程师的入职时间也会缩短,因为理解单个大型提示所需的思维模型比追踪多个向量存储和重排序器中的数据更简单。

选择较短窗口的团队必须投入到健壮的摘要和内存管理层。这些系统通常需要计划的后台作业,将最近的活动压缩为紧凑的状态表示。当响应时间和成本可预测性是主要用户体验指标时,这种额外复杂性是合理的。项目经理在两种方法之间选择时应建立明确的决策标准。影响因素包括平均文档长度、可接受的延迟阈值以及典型用户查询所需的交叉引用频率。实用的第一步是记录生产提示代表性样本中最早和最新引用之间的 token 距离;距离持续超过 200,000 token 表明长上下文模型可能带来净价值。

扩展上下文窗口的局限性与风险

极端上下文长度下的准确性仍研究不足。尽管 Anthropic 报告了稳定的内部结果,但缺乏超过一百万 token 的标准化基准,导致对细微推理任务退化的疑问仍未解决。分散在遥远部分的细微矛盾仍可能被当前评估套件遗漏。增加的 token 消耗也提高了数据暴露风险。处理敏感材料的组织必须验证大型上下文请求中发送的每个 token 都符合保留和访问策略。数据驻留要求可能迫使某些负载无论技术能力如何都留在较短窗口提供商上。最后,更长的窗口可能掩盖提示质量问题。当模型在指令模糊的情况下似乎仍能成功时,团队可能会延迟制定更清晰的提示标准,而这些标准对生产可靠性仍然至关重要。

未来几个月需要跟踪的信号

关注 Anthropic 的下一个模型发布及其每 token 定价的任何变化。关注 Google 在更多 Gemini 端点上公开 128-thousand-token 切换的结果。检查其他实验室是否发布超过一百万 token 的准确性数据。

这三个数据点将显示行业是选择更长的窗口还是回归更严格的限制。每次发布都将为团队提供新的数据,以重新运行自己的成本和准确性测试。

FAQ

上下文窗口与 AI 系统中的传统内存有何不同?

上下文窗口代表在一次推理步骤中处理的活动 token,而传统内存通常涉及通过单独系统检索的外部存储。

所有提供商最终会收敛到相似的窗口大小吗?

当前信号表明,分化将持续存在,因为供应商针对不同的负载配置文件进行优化,而非仅在最大容量上竞争。

团队今天可以采取什么实际步骤来测试这些限制?

在代表性文档集上使用两个供应商运行受控实验,并根据现有检索基线衡量准确性、延迟和总成本。

更多行业分析见 The VergeGoogle Blog 的官方报道。有关模型扩展的更多背景信息可通过 Reuters 获取。

下载 remio 以在工具间组织您自己的工作上下文,而不会遇到外部窗口限制。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page