top of page

AT&T 通过模型路由和开放模型将 AI 成本降低 90%

8月21日
讀畢需時 14 分鐘

AT&T 表示,尽管其平均每日处理 450 亿个 token,部分人工智能成本已降低多达 90%。这一说法对 Google News 读者而言颇为醒目,但其实现机制比这一 headline 百分比更重要。

该公司并未找到一种可以替代所有高端系统的低成本模型。它构建了一个网关,根据每项请求预期的难度、速度、质量和成本选择不同模型。

这种做法挑战了企业应统一采用 OpenAI、Anthropic、Google 或其他大型供应商某一种前沿模型的假设。AT&T 则将商用系统与面向电信工作训练的较小型开放模型相结合。

这一策略带来了明确的权衡。模型选择可以降低推理支出,并减少对单一供应商的依赖;但也会形成复杂的运营层,必须跨多个系统评估质量、安全性、延迟和故障情况。

AT&T 的结果仍为公司自行报告,公开证据并未提供完整的独立审计。尽管如此,其规模使这不只是又一次企业 AI 实验。

AT&T 将模型路由器投入生产环境

AT&T 的关键变化并不只是采用了开放模型,而是将模型选择置于员工、应用程序与响应请求的模型之间。

AT&T 首席数据与 AI 官 Andy Markus 在 7 月 23 日一篇介绍公司 AI 经济学的博文中阐述了这一策略。根据这份 AI cost update,该公司平均每日处理 450 亿个 token。

Token 是模型处理的一小段文本或数据单位。Token 数量是一个有用的运营指标,因为大多数托管 AI 服务都按输入和输出消耗量收费。

将每个 token 都发送给能力最强的模型很简单,但也会把昂贵的推理能力浪费在常规提取、分类、摘要和数据准备任务上。

AT&T 的专有 AI Gateway 试图避免这种浪费。该网关采用缓存感知路由,在选择模型前会考虑是否已有可复用的信息。

在每一轮交互中,系统会权衡预期回答质量、速度和成本。它还可以在多轮对话过程中切换模型,而非让整个会话始终使用同一家供应商。

这种会话中途切换能力很重要。一段对话可能从基础查询开始,转向专业网络分析,最后以复杂建议收尾。

静态分配会将这些步骤视为同一类工作负载。动态路由则可根据各自需求,将它们发送至不同系统。

AT&T 表示,这一流程已将相关 AI 成本降低多达 90%,并且已节省数百万美元。这些说法描述的是生产环境中的使用情况,而非实验室基准测试。

不过,AT&T 尚未公开 90% 这一数字背后的基准值。它也未披露获得最大降幅的流量占比,或详细的质量对比结果。

因此,这一说法应被视为公司报告的上限结果,而不应被理解为适用于每个应用或企业的保证节省额。

即便存在这一局限,公开的处理规模仍使结果具有分量。当企业每天处理数百亿个 token 时,微小的路由改进也会累积放大。

该系统也反映了 AT&T 早期的架构选择。Ask AT&T 最初依赖 OpenAI 技术,但这家运营商将其设计为支持其他公司的算法。

这一灵活性在 Ask AT&T launched 于 2023 年推出时就已显现。该内部助手支持编程、客户服务、翻译、文档搜索、网络优化和遗留软件工作。

AT&T 当前的网关将这种可选性转化为运营策略。应用程序不再需要各自独立做出所有模型决策。

该网关成为路由、缓存、度量和治理的控制点。即使供应商发布新模型或改变服务条款,它也能应用一致的规则。

这正是 Google News 上的故事为何不止是一则降本公告。AT&T 正将模型选择视为企业基础设施,而非应用程序设置。

为什么模型路由会改变企业 AI 的经济模式

路由器将竞争从寻找一种普遍更强的模型,转向寻找满足每项任务要求的最低成本模型。

企业采用 AI 通常始于一种直接模式:团队选择领先的托管模型,接入公司信息,并在试点成功后扩大使用范围。

当使用不再局限于员工偶尔提问时,成本就更难预测。自动化工作流可能产生重复提示词、长上下文、工具调用、重试和中间输出。

Agent 会加剧这种压力,因为一次用户请求可能触发多次模型调用。一个工作流可能检索记录、分类文档、制定计划、调用软件工具、检查结果并修改答案。

用户只看到一个完成的任务,而企业需要为完成它所需的每一步付费。

AT&T 的路由器在消耗发生前处理这一问题。它试图在每一轮选择合适模型,而非在账单到来后才分析超支。

这类似于在混合团队中分配工作。常规请求并不总需要最专业的专家,而困难决策仍值得升级处理。

这一类比存在局限,因为路由器必须自动做出判断。错误的决定可能在任何人意识到需要更强模型前,就产生质量较差的回答。

AT&T 表示,其网关会在成本和速度之外估计预期输出质量。尽管节省比例更吸引注意力,但这一质量门槛才是核心组成部分。

仅按成本路由会持续偏向可用的最小模型。生产环境中的路由则必须识别在特定任务中仍可接受的最低成本选项。

由此产生的系统可以赋予企业更大的谈判筹码。能够在多个供应商之间转移工作负载的公司,较少会被迫接受单一供应商的技术限制或商业条款。

该策略也改变了应用程序的构建方式。开发者可以请求某种能力或服务水平,而无需永久将每项功能绑定到一种模型。

这种抽象可以缩短未来迁移时间,也让团队能够先针对真实工作负载类别评估新模型,再授予其更广泛的访问权限。

AT&T 的做法让前沿模型承担更聚焦的角色。它们成为推理密集型请求的升级目标,而不再是每次交互的默认引擎。

这并不意味着前沿系统失去价值,而是意味着其价值应匹配较小模型无法可靠完成的工作。

独立观察人士认为,这一做法是更广泛企业趋势的一部分。AvidThink 首席分析师 Roy Chua 向 Mobile World Live 表示,领先企业使用路由网关来实现成本、安全、缓存和审计控制。

Futuriom 创始人 Scott Raynovich 认为,开放模型能够支持专有企业数据,同时避免企业持续依赖最昂贵的前沿系统。

这些评论支持这一架构,但并未独立验证 AT&T 报告的节省额。这一区别很重要,因为架构和可量化的业务结果是两个不同问题。

路由器也集中了一部分权力。谁控制网关,谁就决定哪些模型获得流量、适用何种质量门槛,以及如何处理故障。

这一位置正变得具有战略价值。模型供应商围绕智能能力竞争,而路由层则观察跨应用和供应商的需求。

路由器可以学习哪种模型在编程、客户支持、电信标准、欺诈分析或文档提取方面表现良好。这些性能历史会成为有用的运营数据。

对企业采购方而言,启示很实际:仅靠模型基准无法解释生产级 AI 项目的经济性。

工作负载构成同样重要。组织需要了解哪些任务最常见、哪些成本最高,以及哪些确实需要前沿级推理能力。

团队还需要可追溯的评估标准。否则,路由可能成为一种不透明机制,悄然以更低消耗换取回答质量。

可检索的 AI workflow 可以帮助团队保留决策、证据和输出。当多个模型参与同一流程时,这类记录会变得更加重要。

Google News 的报道可能让 90% 这一数字看起来像单一技术突破。AT&T 的实际方法则是一项涉及分类、评估、缓存和工作负载测量的持续性实践。

开放电信模型为 AT&T 提供另一项成本杠杆

路由可降低不必要的消耗,而面向领域的开放模型则为路由器提供了更低成本、且理解电信术语和运营的选项。

AT&T 将其网关与 OTel 2.0 搭配使用,后者是一个适配电信领域的开放模型系列。该公司利用行业数据和多种计算平台开发了这些模型。

面向领域的模型是针对有限领域训练或适配的模型,而非面向通用对话。其更窄的聚焦范围可以提升在专业词汇、文档和运营问题上的表现。

电信领域提供了严苛测试。模型可能需要解读技术标准、网络拓扑、设备遥测、无线电配置和多供应商系统。

通用模型可以从宏观层面讨论这些主题,但它可能仍缺乏网络运营所需的精确性;在此类场景中,看似合理却错误的答案可能带来严重后果。

GSMA Intelligence 认为,面向领域适配的模型可以更小,同时在电信任务上保持竞争力。其 OTel analysis 将 AT&T 的策略描述为另一种选择,而非将每项请求都经由通用前沿模型路由。

AT&T 表示,它使用 AMD GPU 对 OTel 2.0 进行了超过 4000 亿个 token 的后训练。更广泛的开发工作流则处理了约一万亿个 token。

Microsoft 表示,AT&T 通过 Foundry Managed Compute 使用了约 530 块 GPU,其中包括 430 块 AMD Instinct MI300X GPU,以及多种硬件架构。

模型开发管线还将工作分配给了多个开放模型。Microsoft 的 Phi-4 负责数据准备和合成数据生成,每月处理超过 7000 亿个 token。

其他模型则支持推理和开发任务。这与生产网关的理念相呼应:无需由一种模型主导每一个阶段。

Microsoft 表示,与在相同开发工作中使用前沿模型相比,开放模型的数据生成节省了数千万美元。这是合作伙伴报告的比较,并非中立的财务审计。

不过,Microsoft 的说明提供的技术细节多于 AT&T 的简短公告。它表明,模型选择与硬件选择被视为相互关联的决策。

开放模型可以部署在专用基础设施上运行,而不必只能通过由供应商控制的应用程序编程接口使用。因此,企业可以评估模型、加速器、云和本地系统的不同组合。

这种灵活性支持了 AT&T 所强调的主权诉求。在此背景下,主权意味着对数据流、部署选择和供应商依赖关系拥有控制权。

这并不意味着 AT&T 已摆脱外部技术。该项目采用了 Microsoft 基础设施、AMD 硬件、GSMA 数据,以及由其他机构开发的底层模型。

将这一战略理解为“多元化依赖”更为恰当。AT&T 正试图避免任何单一模型、芯片供应商、云服务或开发环境变得不可替代。

这种立场可以增强议价能力。如果公司能够证明多个平台的结果相当,那么在采购谈判中,切换供应商就会更具可信度。

开放模型也支持更深入的领域适配。AT&T 可以使用获批的电信资料进行训练,并围绕网络专属任务调整评估方式。

GSMA 表示,初始源材料包括标准和行业文件。贡献方包括覆盖无线网络、接口、API 和电信运营的机构与项目。

该模型家族也面向更广泛的行业应用。向其他人开放成果,能够推动共享测试、扩展和专用应用的发展。

不过,在 AI 领域,“开源”需要谨慎解读。一次发布可能提供模型权重和使用权,但不会公开每一条训练记录、过滤决策或开发方法。

评估 OTel 2.0 的组织必须审查其实际许可证、文档、数据披露和部署要求。仅凭这一标签无法回答治理问题。

训练工作流的规模也说明,开放并不等于免费。专用 GPU、工程人力、安全控制、评估和持续推理都会产生成本。

AT&T 能够为这些投入找到合理依据,是因为它的运营规模不同寻常。规模较小的公司在构建和管理模型组合上的支出,可能超过通过路由节省的成本。

这种规模差异限制了直接模仿。可迁移的理念并不是每家公司都应该训练一个电信模型。

更广泛的启示是,将模型选择与特定工作负载的证据结合起来。企业应仅在领域性能、控制力和运营经济性足以证明额外责任合理时,才使用开放模型。

90% 的节省仍需接受质量审计

AT&T 已披露可信的实现机制和可观的运营规模,但尚未发布足够证据,以独立验证这一核心结果。

首个不确定性在于范围。“最高可达 90%”描述的是已报告的最大降幅,并不一定代表 AT&T 整个 AI 体系的平均水平。

公开披露并未说明基准模型组合。它们也没有显示有多少流量转向了较小模型、路由器多久会进行升级处理,或节省幅度如何因应用而异。

第二个不确定性在于质量。AT&T 表示路由不会损害质量,但读者无法查看任务级验收阈值或评估结果。

这一缺失很重要,因为质量并非单一指标。客户服务摘要、网络建议、软件补丁和欺诈警报,各自需要不同标准。

路由器可以通过将更多流量发送给较小模型来降低平均支出。只有当这些模型在分配给它们的工作中仍然可靠时,这种结果才有价值。

评估还必须识别罕见故障。平均分数可能掩盖网络运营或受监管工作流中少量但代价高昂的错误。

人工审查依然重要。Ask AT&T 推出时,Markus 表示,领域专家仍需要核实生成的代码和其他具有重要影响的输出。

路由并未消除这一要求。它增加了团队必须监控的另一项决策,因为当所选模型发生变化时,应用程序的行为可能也会不同。

面向缓存的运营模式带来了相关问题。复用先前计算可以降低消耗,但缓存信息必须保持最新、得到恰当的范围控制并受到保护。

适用于一名员工或客户的响应,不能自动复用于另一名员工或客户。身份、权限、地理位置和数据保留政策必须随请求一并执行。

安全团队还必须评估每个接入的供应商和模型。多模型系统会带来更多集成、凭证、日志、政策边界和潜在故障模式。

网关能够集中管理这些控制措施,这是其优势。但集中化也使网关成为高价值目标和关键依赖项。

如果其分类逻辑失效,敏感任务可能会被发送至未经批准的模型。如果服务不可用,许多下游应用可能会同时失效。

延迟带来另一项权衡。路由器必须检查足够的信息才能选择模型,而复杂的评估可能会延迟响应。

缓存可以抵消部分延迟,而较小模型的响应速度可能更快。最终结果取决于路由开销、应用设计和所选模型。

供应商多样性同样会增加运营工作。不同供应商采用不同接口、上下文限制、工具调用格式、安全控制和更新节奏。

网关可以将其中一部分差异标准化,但无法保证两个模型会以完全相同的方式理解每一项指令或结构化输出格式。

模型更新使这一问题持续存在。某条上月表现良好的路由,可能会在供应商改变行为或发布替代产品后变得不再理想。

因此,AT&T 必须持续维护评估,而非仅对每条路由认证一次。生产追踪数据应按工作负载揭示故障率、升级处理、延迟和人工修正情况。

开放模型部署还会引入供应链考量。团队需要在服务栈中追踪模型权重、库、许可证、模型来源和漏洞。

数据质量是另一项约束。基于标准和合成材料训练的电信模型,仍可能继承缺口、过时假设,或对少见设备覆盖不足的问题。

排行榜结果提供了有用证据,但无法复现每一种真实网络条件。生产评估必须反映 AT&T 自身的数据、工具和运营后果。

最后一个不确定性来自组织层面。技术上可靠的路由器无法修复不清晰的工作流,也无法弥补缺少明确责任人的应用。

AT&T 高管强调端到端工作流,而非孤立的 AI 任务。这一区别很重要,因为当员工之后必须修复薄弱输出时,局部节省可能会消失。

考虑类似系统的公司应计算整个流程的成本。核算应包括模型消耗、基础设施、评估、工程、安全、审查和故障恢复。

它们还应比较已完成的成果,而不仅是 token。一份更便宜的答案如果导致再次来电、再次运行模型或人工返工,就并不经济。

这些风险没有推翻 AT&T 的结果。它们解释了为何这一报告中的百分比应当开启尽职调查流程,而非终结它。

对于 Google News 读者而言,负责任的解读应保持审慎。AT&T 表示其网关实现了最高 90% 的降幅,但其更广泛的适用性仍未经验证。

AT&T 的 AI 成本主张之后应关注什么

三个信号将表明,AT&T 是构建了可重复的企业架构,还是记录了一组异常有利的工作负载。

第一个信号是更详细的生产环境评分卡。AT&T 应披露各类工作负载的平均节省,而非只披露最大降幅。

有价值的报告应区分客户服务、编码、文档检索、网络分析、欺诈检测和自主工作流。每一类都有不同的质量阈值和模型特征。

一份有说服力的评分卡应包括升级率、延迟、错误率和人工修正情况。它还应显示,在单位成本下降后,消耗量是否仍在增长。

如果平均成本在业务量扩张时仍受控,AT&T 的模型路由案例就更有说服力。如果节省集中于一小组简单任务,这一主张的可迁移性就会降低。

第二个信号是对 OTel 2.0 的独立评估。行业排行榜提供了起点,但运营商需要与真实网络决策相关的测试。

评估者应将该模型与更大的通用系统进行比较,测试其在标准解读、拓扑分析、遥测推理、故障排除和工具使用方面的表现。

他们还应记录较小模型的失效场景。一个可信赖的领域模型需要清晰的升级边界,而不只是较高的总体分数。

OTel 2.0 在 AT&T 之外的采用,将提供另一种形式的证据。其他运营商可以测试其所报告的优势能否经受不同网络、供应商、语言和监管环境的考验。

有意义的外部部署将支持 AT&T 的观点,即专用开放模型能够服务于一个行业。有限的采用则可能表明,其经济性高度依赖 AT&T 的规模和内部数据。

第三个信号是前沿模型和基础设施供应商如何回应。AT&T 的战略迫使它们为每一种工作负载的高价消耗提供合理依据。

供应商可以通过更小的模型、更低延迟的系统、更强的缓存、自动路由或更可预测的企业合同来应对。它们也可以改进领域适配和私有部署选项。

路由层的竞争尤其值得关注。云公司、模型提供商、独立网关和企业软件供应商都希望影响模型选择。

如果路由实现标准化,企业就能更自由地迁移工作负载。如果每个平台都开发专有路由器,供应商依赖可能只是转移到了更高层。

硬件多样性同样重要。AT&T 对 AMD 及其他架构的使用,测试了企业能否避免将 AI 经济性绑定在单一加速器路线图上。

跨硬件的一致性能将强化主权论点。困难的迁移或不均衡的软件支持,则会暴露维持这种灵活性的成本。

AT&T 的经验也为企业采购方提供了一份实用清单。它们可以先按照任务、风险、延迟、质量和已完成业务成果来衡量请求。

接下来,它们可以测试较小模型是否能满足定义明确的工作负载。只有到那时,才应在获批选项之间引入自动路由。

治理必须先于大规模流量。团队需要为每条生产路由建立访问控制、日志、评估关卡、回退规则、事件处置流程和指定负责人。

目标不是最大化被低成本处理的请求比例,而是最小化可接受、已完成工作的成本。

这一区别能让路由器与业务成果保持一致。它也能防止成本目标悄然削弱客户服务、网络可靠性或员工信任。

AT&T 展示了这一架构最清晰的大型企业案例之一。450 亿日均 token、动态路由与领域专属模型的组合值得关注。

该公司尚未证明每个组织都能复现 90% 的降幅。但它已表明,在生产规模下,让一个模型处理所有任务为何会变得难以维系。

下一阶段将取决于证据,而非又一个标题。应关注平均节省幅度、外部对 OTel 2.0 的验证,以及供应商对多模型采购的回应。

这些信号将决定 Google News 的主张会成为行业行动手册,还是仅仅是一个受 AT&T 特殊规模影响的亮眼成果。企业团队应从现在开始衡量自身的工作负载组合,再决定选择路由器还是训练另一个模型。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page