Cloudflare Auto Router 降低 AI 支出,但质量决定其边界
Cloudflare 在其内部编程工作流中报告,相较于仅使用前沿模型,最高可节省 30% 的成本;随后该公司推出了处于公开测试阶段的 Cloudflare Auto Router。该功能位于 AI Gateway 内部,可为每个请求选择模型。用户不再需要判断一项任务是否值得使用昂贵的前沿模型。
这一转变将模型选择从用户偏好变为基础设施决策。Cloudflare 会评估每个请求,估算哪些模型能够处理该请求,并在预期质量与 token 成本之间权衡。简单工作可转交给更小的模型,而困难或影响重大的请求则会获得能力更强的选项。
矛盾的核心是成本与性能,而不是 Cloudflare 与某一家模型提供商之间的竞争。企业希望降低推理账单,同时避免在编程、研究、客服及其他知识工作中引入不易察觉的失误。Cloudflare 现在认为,其网关能比员工手动选择模型更稳定地管理这种平衡。
Cloudflare Auto Router 将模型选择移入网关
Cloudflare 正将一项重要的 AI 决策从个人用户手中移交给处理其请求的共享控制层。
Cloudflare 于 2026 年 9 月 30 日在 AI Gateway 中发布了处于公开测试阶段的 Auto Router。根据该公司的 Auto Router 公告,开发者只需将请求的模型设为 cloudflare/auto 即可启用该功能。
这项细微的配置变更改变了应用程序访问 AI 模型的方式。应用程序不再指定单一模型,而是要求 Cloudflare 为每个请求选择一个符合条件的选项。网关会在将请求发送至上游之前评估任务。
路由器首先会排除无法处理该请求的模型。兼容性取决于请求格式、执行模式、可用凭据、计费配置、访问策略和支出限制。Cloudflare 还会暂时将状态不健康的提供商排除在外,直至其恢复正常。
这些筛选条件之所以重要,是因为模型选择涉及的不只是智能水平和 token 成本。如果模型无法处理请求格式,即使理论上适合也毫无用处。同样,当企业尚未授权该提供商,或要求其满足无法实现的策略时,情况也是如此。
随后,Cloudflare 会分析对话的紧凑表征。它重点关注最近的消息,而不是将完整会话传入路由分类器。该分类器通过部署在 Cloudflare 边缘网络 GPU 上的 Workers AI 运行。
分类器会对 14 个任务类别分配概率。Cloudflare 列举的示例包括编程、规划、研究和数据分析。它还会从一到五评估复杂度、模糊性、任务重要性以及对早期上下文的依赖程度。
这些信号会进入一个独立的评分矩阵,其中包含每个候选模型基于基准测试得出的权重。因此,Cloudflare 可以通过添加性能权重来纳入新模型。该公司表示,随着可用模型池发生变化,它不需要每次都重新训练分类器。
这一架构不同于 Cloudflare 现有的基于规则的路由。其动态路由工具允许团队创建条件、配额、预算、回退路径和渐进式发布。但这些路由仍依赖管理员编写的规则。
Auto Router 则会做出预测性选择。管理员定义边界,而分类器决定哪一个符合条件的模型最适合某一具体请求。网关不再只是可观测性和策略层,而成为主动的决策者。
这一区别解释了为何这项测试版如此重要。仪表盘可以显示资金流向,预算规则可以阻止继续支出。但两者都无法判断更小的模型是否本可成功完成请求。
Auto Router 试图在昂贵的工作开始前做出这一判断。它先应用组织控制,再从剩余模型中进行选择。该系统在同一条推理路径中结合了治理与模型选择。
Cloudflare 最初瞄准的是混合型知识工作环境。其示例包括电子邮件、日历、工作场所消息、文件、差旅工作流、金融任务、编程和调试。这些环境的变化足够多,使路由具备实际作用。
一家将所有请求都发送给单一前沿模型的公司获得了一致性,但也会为未被使用的能力付费。一家强制让所有任务都通过更小模型处理的公司,则承担另一种风险。困难任务可能失败、需要重试,或消耗超出预期的更多输出 token。
Cloudflare Auto Router 在这两个极端之间插入了一个分类器。它的价值取决于该分类器能否在底层模型开始工作前识别出其中的差异。
手动选择模型如今成了成本问题
最直接的压力落在仅使用前沿模型的策略上:每位员工和每个智能体默认都获得能力最强的模型。
大多数 AI 界面都将模型选择呈现给用户。编程助手、智能体框架和聊天工具通常会提供包含多个选项的菜单。用户必须将模糊的模型名称转化为有关质量、速度和成本的决策。
这种安排看似灵活,却把基础设施优化工作转移给了正在完成其他任务的人。调查安全漏洞的工程师,与总结消息讨论串的员工有不同需求。但两者仍可能选择自己最熟悉、能力最强的模型。
这种行为可以理解。用户会立刻通过错误、修改和时间损失感受到较弱答案的成本。选择模型时,他们很少能看到企业完整的推理账单。
管理员可以通过限制来应对,但固定限制难以适应多变的工作。禁止使用前沿模型可以减少常规请求的支出,也可能在困难的编程、规划或安全任务真正需要它时,移除最佳选项。
模型路由提供了第三条路径。分类器会估算哪些请求需要更强的模型,同时让成本更低的模型处理常规工作。关于基于偏好的路由的学术研究已经表明,学习型路由器可以在不自动牺牲测量质量的情况下降低成本。
Cloudflare 的优势在于其所处的位置。AI Gateway 已位于应用程序与多个模型提供商之间。它可以观察请求元数据、执行访问控制、跟踪提供商健康状况,并核算组织可用的凭据。
这一位置也给独立路由供应商和提供商专属工具带来压力。企业可能更倾向于使用一个控制层来统一处理策略、可靠性、可观测性和模型选择。不过,Cloudflare 仍需证明这种整合能够带来更好的路由决策。
更大的变化将影响 AI 采购。买家过去通常通过单项基准分数和公开 token 价格比较模型。自动路由使模型组合而非单一模型成为可部署单元。
在困难编程任务中表现出色的模型,可以留在模型池中,而不必处理每一封电子邮件摘要。更小的模型可以赢得常规请求,而无需成为企业的通用默认选项。采购团队可以评估不同工作负载的覆盖范围,而非寻找一个永久赢家。
这种方法也改变了与模型提供商的谈判方式。使用量取决于路由器选择某提供商模型的频率。在某个特定任务类别中表现优异的模型,可以获得流量,而无需取代所有竞争模型。
因此,路由层获得了对需求的影响力。它决定哪些提供商获得请求、哪些能力足以证明更高成本的合理性,以及哪些模型弱点会在生产环境中造成影响。这个角色类似流量管理,但其决策还包含对预期回答质量的判断。
开发者也面临自身的调整。固定模型为测试和调试提供了相对稳定的目标。自动路由器则可能在不同请求、会话或模型池变化时产生不同的行为。
这种可变性要求更完善的评估记录。团队需要知道由哪个模型处理了请求、为何选择它,以及结果是否满足应用程序要求。Cloudflare 表示,其两阶段设计使分类结果和模型选择保持可检查性。
可检查性很重要,但并不能消除运营工作。团队仍需要能够代表其用户的评估集,也需要一种方式,将事故、路由决策和模型特定发现保存在可搜索的工程知识中。
因此,主要压力并不只是落在昂贵模型上,而是落在“人工选择模型能够在组织规模上提供有效控制”这一假设上。Cloudflare 押注于受策略约束的自动化将带来更好的平均决策。
Cloudflare Auto Router 如何平衡质量与成本
Cloudflare Auto Router 并非只选择 token 单价最低的模型;它会估算完成整个任务轨迹的成本。
评分过程始于预期质量。Cloudflare 将分类器的任务概率和四个难度维度与基于基准测试的模型权重相结合。该计算会估算每个符合条件的模型与当前请求的匹配程度。
路由器随后会考虑输入和输出 token 成本。对于简单请求,成本获得更高权重,因为多个模型都可能足够胜任。随着难度上升,成本惩罚会下降,为更强模型留出更多胜出的空间。
Cloudflare 将这一决策概括为预期质量减去自适应成本惩罚。公式很简单,但实现必须估算两个不确定量:既要预测模型可能产生的结果,也要预测达到这一结果所需的资源。
第二项预测使任务轨迹成本区别于公开 token 价格。成本更低的模型可能生成很长的回答、调用更多工具、重复失败步骤,或需要再次尝试。因此,其完成任务所消耗的资源可能多于单位成本更高的模型。
智能体工作流让问题更加复杂。一个用户请求可能触发规划、检索、工具调用、代码修改、验证和最终回复。只根据开场提示选择模型,可能会错过后续出现的需求。
Cloudflare 当前的路由器通过近期消息和依赖评分来考虑对话上下文。它还处理提示缓存,即提供商会保留已经处理过的上下文以供复用。缓存会话可能使继续使用同一模型比切换模型更便宜。
切换并非没有成本。新模型可能需要将完整上下文写入其缓存。它也可能无法读取前一模型生成的推理 token,从而被迫重复先前工作。
Auto Router 会应用一项随活跃上下文增长而增加的切换惩罚。在同一用户轮次内,它通常倾向于保留拥有预热缓存的模型。在不同轮次之间,另一个模型必须提供足够高的预期价值,才能证明重写上下文的合理性。
这种机制对长时间编码会话尤为重要。浅层比较可能会将每个简单步骤路由到成本最低的模型。但频繁切换可能会因缓存写入、重复推理和前提假设不一致而抵消这些节省。
Cloudflare 表示,其路由器会按当前模型的缓存读取成本对其定价。其他候选模型则需承担重建上下文的成本。会话越深入,继续使用当前模型的理由就越充分。
这比将提示词视为彼此孤立的消息,更符合现实的模型路由方式。它承认,智能体的状态具有经济价值。某个提供商已处理过的上下文,会形成一种暂时性的锁定效应。
这一设计仍有局限。Cloudflare 表示,大多数模型无法消费由其他模型生成的推理令牌。该公司计划在切换时考虑模型家族,但这一偏好尚未被描述为已发布系统的一部分。
路由器还会对候选项排序,而不是毫无替代方案地选定一个模型。AI Gateway 会先尝试排名最高的选项。如果提供商无法处理请求,它可以继续使用另一个符合条件的模型。
这种回退行为将质量与可靠性结合起来。某个模型在正常情况下可能是首选,但在提供商发生事故时无法使用。移除不健康的候选项,可防止路由器反复将流量发送到失效端点。
Cloudflare 的做法顺应了更广泛的技术趋势。模型路由器追求的不是普遍意义上最便宜的选项,而是成本最低且能力足够的选项。关键区别在于如何针对每项请求定义能力,以及如何衡量失误。
分类器本身也会增加工作量,尽管 Cloudflare 尚未公布这一测试版的详细延迟测量结果。在边缘运行它应能缩短网络距离,但部署位置并不能说明总路由延迟。
团队应将路由开销与完整任务时长进行衡量。在长时间运行的研究型智能体任务中,少量分类延迟可能微不足道。而在响应较短的高流量交互功能中,同样的延迟可能很重要。
他们还应比较已完成任务的成本,而不是原始令牌费率。失败任务、重试、工具循环和缓存重建都应纳入计算。Cloudflare 自身的表述正确地将整个执行轨迹视为经济单位。
这是理解 Cloudflare Auto Router 运作方式最重要的一点。路由器寻找的不是最便宜的模型,而是在组织与技术约束下预期效用最高的模型。
Cloudflare 的基准测试显示节省,而非确定性
Cloudflare 的结果支持路由理念,但并未证明它在所有工作负载或组织中都能实现同等质量。
Cloudflare 在一项包含 97 项任务的内部通用知识工作基准上评估了该路由器。每个模型针对每项任务进行了三次试验,因此每个被评估选项均产生了 291 次试验。
该基准测试使用了覆盖电子邮件、日历、工作场所消息、文件、旅行和金融的模拟工作区工具。任务要求模型返回可验证的答案或完成操作。这种设计比一组彼此孤立的知识问答,更贴近智能体部署场景。
Cloudflare Auto Router 成功完成了 252 次试验,成功率为 86.6%。GPT-6 Sol 完成了 245 次,即 84.2%。Claude Opus 5.5 完成了 281 次,即 96.6%。
这些结果划定了一个重要边界。路由器的实测成功率略高于 Sol,而在整个基准中成本仅为后者的 80%。但尽管其成本仅为 Opus 的 35%,它并未达到 Opus 的表现。
Cloudflare 还报告了通过 10,000 个任务级自助抽样生成的 95% 置信区间。路由器与 Sol 的区间存在显著重叠。读者不应将二者的差异视为自动路由能带来更高质量的证据。
Opus 的结果呈现出更清晰的权衡。在同样的 291 次尝试中,它比 Auto Router 多成功了 29 次。各组织必须判断,对自身工作负载而言,额外的成功结果是否值得投入更多资源。
正确答案取决于任务本身。遗漏日历细节与存在缺陷的安全分析,后果并不相同。Cloudflare 的分类器包含风险等级评分,但该公司尚未公布按类别划分的错误分析。
这种缺失的细分信息比总体平均值更重要。买家需要知道路由器在哪些方面表现较差、它选择了哪些模型,以及错误是否集中在困难或影响重大的任务中。
该评估也来自 Cloudflare,而不是独立机构。Cloudflare 设计了基准、配置了路由器、选择了模型池,并报告了结果。其结果是有用的证据,但仍属于供应商评估。
该基准代表了混合型企业知识工作。节省幅度将取决于客户的流量分布。以常规摘要为主的组织,比专注于复杂研究或安全分析的组织,更可能为小型模型提供机会。
Cloudflare 明确说明了这种依赖关系。该公司表示,非前沿任务的占比越高,节省就越多。因此,报告中的结果应被理解为特定工作负载下的表现,而非普遍适用的折扣。
模型池引入了另一个变量。路由质量取决于是否有真正存在差异的模型可供选择。能力重叠、经济性相近的模型池,能给路由器带来的有效选择更少。
模型变化也可能改变结果。Cloudflare 可以在不重新训练分类器的情况下更新从基准推导出的权重,这让引入新模型更容易。但这也意味着,当这些权重或候选模型发生变化时,客户必须监控系统行为。
路由器可能在两个方向上失效。过度路由会将常规任务交给昂贵模型,从而减少节省。路由不足则会将困难工作交给能力不足的模型,并带来不良结果的风险。
第二类失败通常更难发现。应用可以立即衡量成本,但输出质量可能需要人工审查或任务专用评估器。流畅的回复可能掩盖事实缺失、推理薄弱或行动不完整等问题。
安全性还引入了另一项担忧。关于路由器操纵的研究表明,对抗性令牌序列可以影响学习型路由器,使其选择更强大的模型。攻击者可能利用这种行为提高应用成本。
这项研究并未证明 Cloudflare Auto Router 存在漏洞。该论文评估的是其他开源和商业路由器,而 Cloudflare 尚未公布足够的实现细节,无法进行直接比较。
但它表明,路由分类器应被纳入应用的威胁模型。分类器会处理潜在的恶意输入,并控制对更昂贵资源的访问。即使自动选择表现良好,速率限制和预算政策仍然必不可少。
隐私政策带来了另一个尚未解决的问题。Cloudflare 表示,未来的筛选将考虑零数据保留要求。这一路线图意味着,公开测试版尚未将这些要求作为完整的模型选择约束。
这一缺口可能会影响受监管或敏感工作负载。当模型的数据保留条款与组织政策冲突时,即便其技术上适合,也不应接收请求。买家应在启用广泛模型池前核实提供商的数据处理规则。
Cloudflare 的基准测试所支持的结论,比其标题承诺更为有限。自动路由在 Cloudflare 的测试中降低了测得成本,同时维持了接近某一前沿模型的表现。它并未消除根本的质量权衡。
对生产环境买家而言,这项基准测试应是评估的起点,而非终点。有价值的问题不是模型路由在总体上是否省钱,而是该路由器能否在他们的流量上节省成本,同时不将失败转移到不可接受的类别中。
AI Gateway 正在成为决策引擎
竞争重心正从通过固定规则路由流量,转向预测哪种模型应处理每项请求。
AI Gateway 最初主要专注于 API 规范化、日志记录、缓存、速率限制和提供商回退。由于这些功能能让碎片化的模型市场更易于运营,它们仍然很有价值。
预测性模型选择则赋予了更具野心的角色。Gateway 现在会在推理之前理解任务、估计质量并做出经济决策。这使它更接近应用本身的推理过程。
Cloudflare 并非这一理念的首创者。RouteLLM 等学术项目已探索过在更强与更弱模型之间进行学习型选择。Martian 和 Not Diamond 等商业服务也一直在推广智能模型路由。
基于规则的 Gateway 解决的是不同问题。它们可以将某类客户分配给某个模型、执行预算,或在故障后进行切换。这些决策明确且可预测,但管理员必须预先判断各种条件。
预测性路由器试图跨越管理员未逐项分类的请求进行泛化。它们承诺降低维护负担并提供更细粒度的选择。作为交换,团队接受了另一个需要观察和纠正其失误的学习型系统。
Cloudflare 结合了这两种方式。团队可以使用 Gateway 策略定义允许的提供商、凭据、支出边界和访问规则。随后,Auto Router 会在形成的模型池内进行优化。
这种组合具有战略重要性。缺乏 Gateway 上下文的路由供应商或许能理解提示词,却可能缺少组织身份、政策或提供商健康状况信号。没有预测性选择的 Gateway 可以执行规则,却无法优化个别任务。
Cloudflare 还具备边缘计算方面的论据。其分类器通过遍布网络的 Workers AI 运行。这种架构可将路由步骤置于接近用户和应用的位置,但生产环境延迟仍需独立测量。
该公司公布的路线图表明了竞争的发展方向。Cloudflare 计划扩大模型池、纳入提供商容量,并为个别请求选择推理级别。它还计划提供更广泛的 Responses API 和 WebSocket 支持。
推理级别选择可能会实质性改变经济性。一些模型允许应用选择使用多少推理力度。与此同时路由模型及其推理设置,为避免支付不必要的计算成本创造了另一种方式。
提供商容量感知会将可靠性和延迟纳入效用计算。名义上最好的模型在拥堵期间未必是最佳选择。能够感知提供商状态的路由器,可以在失败发生前重定向工作。
Cloudflare 还计划推出 cloudflare/auto-best,这一配置文件将选择预期质量最高的选项,而不施加相同的成本惩罚。该选项会将自动化能力匹配与成本优化区分开来。
这种区别很重要,因为不同组织有不同目标。客服文案工具可能更强调效率。安全调查或法律审查可能更重视预期质量,同时仍能从自动模型选择中获益。
多个路由配置文件将让团队无需指定某个特定模型,也能表达这些目标。期望的结果将成为配置。路由器决定哪个提供商和模型最能实现它。
这会冲击模型忠诚度应当塑造应用架构的观念。如果应用调用抽象的路由配置文件,提供商便会在请求层面争夺流量。切换将成为基础设施功能,而非产品迁移。
然而,抽象化也会带来后果。不同模型在语气、工具行为、结构化输出可靠性、安全响应和指令处理方面各不相同。针对某一模型测试过的应用,在网关选择另一模型时可能表现不同。
因此,开发者不应将模型可互换性视为既定事实。他们需要针对结构化输出、工具调用、安全规则和任务完成情况进行契约测试。统一的 API 格式并不保证一致的行为。
胜出的网关需要的不只是一个聪明的分类器。它必须让决策可解释、保留政策边界、控制差异性,并帮助客户评估结果。Cloudflare 已阐述这些目标,但公开测试版如今必须在客户流量下证明它们。
公开测试版后值得关注的事项
三个信号将表明 Cloudflare Auto Router 会成为可靠的基础设施,还是仅仅停留在颇具前景的成本实验。
第一个信号是独立的工作负载数据。Cloudflare 的基准测试提供了可信的起点,但客户需要来自自身应用的结果。有价值的报告应包括已完成任务的成本、成功率、延迟以及模型选择分布。
按类别划分的发现将比单一的节省百分比更重要。团队应分别审视常规摘要、代码修改、研究任务、工具调用和高风险请求。在这些类别中保持稳定表现,将增强 Cloudflare 的说法。
无声的质量损失证据则会削弱这一说法。这包括任务虽被标记为成功、但实际操作未完成,路由错误集中于特定类别,或节省主要来自接受更低的完成率。
第二个信号是具备政策意识的路由。Cloudflare 计划将零数据保留要求和提供商容量纳入候选模型筛选。若能推出这些控制措施,Auto Router 将更适合敏感的企业部署。
买方应关注清晰的记录:为何某个模型符合资格、适用了哪些政策,以及最终选择为何胜出。他们还应期待,当配置或模型更新改变行为时能够立即回滚。
对更多请求格式的支持同样重要。Responses API 和 WebSocket 兼容性将扩大可通过同一路由器处理的工作负载范围。格式覆盖有限会让许多智能体部署继续依赖固定模型或自定义路由代码。
第三个信号是竞争对手如何回应。其他网关和模型提供商可以增加分类器、路由配置文件或具备任务感知能力的模型系列。竞争反应将检验 Cloudflare 的网络地位是否能形成持久优势。
某家提供商可能在自身模型系列内提供更好的路由。独立网关可能在跨供应商方面提供更广泛的中立性。开源路由器则可能吸引那些需要在提示词和评分逻辑上拥有本地控制权的组织。
Cloudflare 近期的模型扩展将暴露这种张力。更大的模型池为路由器带来更多能力和成本选择,但也会增加评估复杂性,并使路由行为更难预测。
客户应从影子评估或有限流量开始。他们可以在不立即改变所有生产请求的前提下,将 Auto Router 与固定模型基线进行比较。高风险类别应保留更严格的模型和审查政策。
团队应基于完整任务而非孤立调用来衡量结果。他们应纳入重试、缓存重建、工具循环、延迟和人工修正。这些成本决定了更便宜的路径是否真的更高效。
Cloudflare Auto Router 有力地证明了用户不应为每个请求都自行选择模型。公开测试版也让网关必须为每一次糟糕的选择负责。这种问责才是真正的考验。
如果你的组织使用多种模型,请选择一个混合但可衡量的工作流程,并将自动路由与当前基线进行比较。同时跟踪质量和已完成任务成本。所得证据将揭示 Cloudflare AI Gateway 路由究竟是在减少浪费,还是只是将权衡取舍移出视野。



