OpenAI 小模型降低成本,但提高更大期望
- Olivia Johnson

- 6月14日
- 讀畢需時 10 分鐘
已更新:6月18日
OpenAI 在 2026 年 6 月初发布的小型模型使推理成本比前几代降低了 80% 以上。此次发布立即改变了用户的预期,因为曾经仅限于高级付费层级的质量标准,现在似乎在免费或低成本方案中也触手可及。
这种效率提升直接迫使 OpenAI 在不增加计算开支的情况下,大规模提供接近高级水平的准确度。
OpenAI 发布更小模型,大幅削减成本
OpenAI 推出了一个新的紧凑型模型系列,其推理价格约为之前旗舰版本的一分之五。该系列模型在内部代号为 “Nano”,针对的是目前占据 API 流量主导地位的高并发聊天补全和检索增强生成(RAG)工作负载。与早期合作伙伴分享的内部基准测试显示,8 k 上下文变体的每 token 价格降低了 4.8 倍,32 k 上下文变体降低了 6.2 倍,使典型的 2,000 token 交互成本降至 0.0004 美元以下。
测试这些模型的开发者报告称,在标准 API 调用中延迟降低了 40%,同时在标准基准测试中保持了之前 92% 的准确度。在 AWS us-east-1 和 Azure North Europe 区域进行的实际延迟测量显示,小型模型的首个 token 中值响应时间(TTFT)从 820 毫秒降至 490 毫秒。推理端的内存占用也大幅缩小;以前只能服务 14 个并发大模型会话的单个 A100-80 GB 实例,现在在相同的 batch-size 设置下可以处理 72 个并发 Nano 会话。
这一时机至关重要,因为在几家大型云供应商提高 GPU 费率后,企业对 AI 工作负载的预算在 2026 年上半年有所收紧。NVIDIA 的 H100 现货价格同比上涨了 22%,而 Google Cloud 搭载 H100 的 A3 实例在 1 月至 5 月期间两次上调挂牌价。在这种背景下,OpenAI 发布激进蒸馏模型的决定,看起来更像是为了留住市场份额的深思熟虑之举,而非纯粹的研究里程碑。
OpenAI 将这些较小的模型定位为聊天和检索任务的直接替代品,而非新的研究发布。文档明确将 “chat completion”、“function calling” 和 “simple RAG” 列为主要支持模式。该公司不鼓励在繁重的数学推理或长文档摘要工作负载中使用这些模型,但营销语言仍强调在日常开发任务中具有 “接近旗舰级的质量”。
早期内部测试显示,当 batch size 达到 64 时,Nano 8 k 变体在单个 H100 GPU 上每秒可处理 420 个 token,而之前的旗舰模型在相同硬件限制下每秒仅处理 95 个 token。这种吞吐量优势在客户支持自动化部署中被证明特别有价值,因为此类场景通常会有数千个短查询并发到达。
用户现在期望无需额外费用即可获得高级结果
企业团队迅速将内部试点项目迁移到较小的模型上,以减少每月账单。一家拥有 1,200 人的金融科技公司此前每月在 GPT-4 级别的调用上花费 87,000 美元,在切换所有非关键聊天端点后,支出立即降至 19,000 美元。该公司的 CFO 将这一变化描述为 “自我们开始使用大语言模型以来,看到的单位经济效益的首次实质性下降。”
在几天之内,支持工单量便开始上升,因为部分输出在法律和财务摘要中失去了细微差别,而这些任务此前需要更大的模型。一个合规团队发现,Nano 变体在 14% 的合同起草提示中遗漏了特定司法管辖区的条款,迫使这些工作流回退到旧版模型。OpenAI 的客户成功经理记录显示,在正式发布的头两周内,“模型降级”工单增加了 3.4 倍。
分析人士指出,成本压缩制造了一个“预期陷阱”,用户会将较低的价格视为永久性的,而非暂时的权衡结果。历史先例确实存在:当 OpenAI 在 2023 年底将 GPT-3.5-turbo 的价格削减 75% 时,随后要求其质量与 GPT-4 持平的呼声稳步增长,直到公司推出新的中层模型来管理需求。同样的模式似乎正在以更短的时间周期重复出现。
OpenAI 正面临着与此前 API 调整相同的模式,即初期的成本节省导致了用量激增,而其增速超过了收入增长。在一次私人合作伙伴网络研讨会上发布的遥测数据显示,Nano 系列处理的总 token 数在发布后的前 18 天内增长了 9.1 倍,而来自这些端点的收入仅增长了 1.8 倍。业务量与收入之间的差距现在是 OpenAI 产品部门内部的核心关注点。
一个拥有 3000 人的医疗保健 SaaS 供应商也出现了类似的情况,该供应商将其 78% 的患者接诊聊天流迁移到了 Nano。每月推理支出从 142,000 美元降至 31,000 美元,但临床医生指出,不完整的症状摘要增加了 9%,导致需要进行后续电话跟进。该机构最终引入了一个分层路由层,仍需消耗原始预算的 18% 以维持临床安全标准。
效率与准确性之间的核心张力
较小的模型通过剪枝参数并依赖于从较大“兄弟”模型中提取的蒸馏来实现。据报道,该蒸馏流水线结合了对 1.2 万亿精选 token 的监督微调,以及从 GPT-4o 输出中获取的 AI 反馈强化学习 (RLAIF) 信号。这种方法在处理简短、常见的模式时具有很强的指令遵循能力,但在模型必须综合多个检索段落的信息时,则会暴露弱点。
这种方法对于简单的提示效果良好,但当上下文窗口超过 32,000 个 token 时,会出现明显的差距。在一家独立实验室进行的对比测试中,在 48k token 的法律语料库上,事实召回准确率从之前旗舰模型的 89% 下降到 Nano 32k 变体的 71%。多跳推理准确率下降更为剧烈,从 84% 降至 61%。
这里的对手是先前的假设,即更便宜的推理会自动在所有工作负载中保持旗舰级的质量。业界在其他蒸馏模型上也看到了类似的结果:一旦任务复杂度超过了蒸馏过程中使用的数据分布,性能就会出现断崖式下跌。OpenAI 自己的系统卡也承认,“在专业领域的幻觉率增加”是一个已知的局限性。
发布后发布的几项独立基准测试显示,新模型在多步推理任务上落后于 Claude 4 Haiku 和 Gemini 2.5 Flash。Artificial Analysis 在 2026 年 6 月的测试套件中给 OpenAI Nano 32 k 模型的综合质量指数为 81.4,而 Claude 4 Haiku 为 87.2,Gemini 2.5 Flash 为 84.9。这一差距在代码编写和数学推理子任务中具有统计学显著性,但在简单对话和分类子任务中则不显著。
针对法律取证工作负载的进一步压力测试显示,当同时提供 6 份或更多文档时,Nano 在交叉引用证词笔录时的错误率上升至 17%,而之前的旗舰模型仅为 7%。即使经过提示词工程(prompt engineering)优化,这些差距依然存在。根据 The Verge 对模型基准测试的报道,类似的压缩权衡已多次迫使团队保留备用模型。
开发者测试极限并报告参差不齐的结果
产品团队的早期采用者使用这些模型从会议记录中生成每周状态报告。一家处于 C 轮融资的 SaaS 公司的 45 人产品团队将 Nano 模型集成到其内部知识库中,取代了之前的 GPT-4 工作流。三周后,自动化评估脚本标记出,在超过 12 000 个 token 的会议记录上,事实不一致的情况增加了 6%。
当源材料保持在 10 页以下时,这些团队看到了可以接受的输出,但在更长的笔录中却遇到了反复出现的事实漂移。这种漂移表现为虚构行动项负责人和错误归属决策——这些错误导致人类审核员平均每份报告需要花费 11 分钟进行修正。因此,一旦计入审核开销,净生产力增益从预期的 70% 缩减至约 35%。
质量差异直接挑战了 OpenAI 关于小型模型可以作为通用替代方案的说法。两家 B 轮初创公司的工程负责人证实,他们仍将复杂的代码审查路由给大型模型,而将较轻的任务保留在新层级上。其中一家初创公司维护着一个简单的路由器,根据预估的 token 数量和任务类型对传入的工单进行分类,将任何超过 8 000 个 token 或标记为“架构审查”的任务发送给旧版模型。
另一家构建了自动化财报电话会议摘要生成器的金融科技初创公司报告称,Nano 从 20 分钟的笔录中正确提取了 94% 的数字指标,但仅提取了 68% 的前瞻性定性陈述,这促使团队增加了一个后处理验证步骤,平均每次通话额外消耗 0.8 秒。正在探索的团队remio已采用类似的路由层来平衡成本和准确性。
竞争压力来自对手
Anthropic 和 Google 已经运营类似的轻量级模型系列,以平衡成本和能力。Anthropic 在 2026 年 4 月发布的 Claude 4 Haiku 与 Claude 4 Opus 相比,价格降低了 5 倍,同时保留了比 OpenAI 的 Nano 系列更强的多步推理评分。Google 的 Gemini 2.5 Flash 在匹配 OpenAI 价位的同时,还增加了当前 Nano 版本所缺乏的原生多模态支持。
OpenAI 的新发布缩小了价格差距,但在并排评估中性能差异依然明显。Artificial Analysis 于 2026 年 6 月 12 日发布的一份公开对比表显示,在创意写作任务中,Claude 4 Haiku 在与 Nano 32 k 的两两人类偏好投票中胜出率为 68%,在编程任务中胜出率为 74%。当产品团队决定是否维持多供应商策略时,这些差距至关重要。
当 OpenAI 用户必须维持双模型工作流以覆盖边缘案例时,竞争对手将从中受益。2026 年 5 月的市场数据显示,Anthropic 在宣布降价后,在开发者细分市场的份额有所增加。两家大型分销商共享的内部估算表明,Anthropic 在以开发者为中心的账户中的新 API 注册份额从 3 月份的 19% 上升到 5 月份的 27%,这与 Haiku 的降价时间吻合。彭博社报道了公告发布后类似的竞争格局转变。
对开发团队的实际影响
成功采用较小模型的团队在提示模板上实现了标准化,这些模板明确限制输出长度并要求从源材料中明确引用。一家企业创建了一个包含 27 个提示的库,并通过人工评分的基准进行验证,在不增加 token 消耗的情况下,事实准确性提升了 4.2 个百分点。同样的库在应用于开放式研究任务时失效,这强化了仅靠提示工程无法完全弥补容量限制的观点。
采用混合路由策略的组织报告称需要新的可观测性工具。仪表盘现在跟踪每任务模型选择率、回退频率和人工修正时间。这些指标会输入季度预算模型,将模型选择视为一级成本杠杆,而非事后优化。
一家每天处理 180,000 个发货状态查询的物流公司实施了一个轻量级分类器,将 71% 的流量路由到 Nano,其余路由到旗舰模型,在将整体支出降低 63% 的同时,将错误率控制在 2% 的合同 SLA 阈值以下。
小模型依赖的局限与风险
蒸馏会继承教师模型中存在的偏见,同时在学生模型从未明确见过的边缘案例上放大这些偏见。多家组织报告称,在切换到 Nano 后,简历筛选提示中的性别刻板印象泄露有所增加,这促使他们额外进行了安全评估周期,耗时两到三周工程时间。
最低价层级的用量上限在初始文档之外仍未披露。合作伙伴报告称,即使远低于公布的限制,在高峰时段仍会收到 429 限流响应,这表明存在未公开的节流,可能影响流量不可预测的面向客户的应用。
监管审查增加了另一层不确定性。欧盟委员会数字服务部门已要求提供关于如何跨欧盟语言执行输出一致性测试的文档,理由是较小模型对低资源语言可能表现出更高的错误率。Reuters coverage of EU AI oversight凸显了要求提供商披露此类指标的压力日益增大。
未来一个季度需关注的信号
第一个指标将是 OpenAI 将于 7 月底发布的季度使用报告。每 token 收入趋势将揭示量增是否转化为持久的利润率扩张,还是仅带来更高的运营强度。
第二个信号是 Anthropic 或 Google 是否会在 9 月前进一步降价或提出新的能力主张。任何一种举措都将扩大当前迫使部分用户维持双模型栈的性能差距。
第三个指标是企业合同续约中是否出现任何明显转变,将较小模型作为支出减少的理由。采购团队已在插入条款,允许在有新低成本模型可用时进行中期降价,从而改变长期承诺的经济性。
技术架构与蒸馏流程
Nano 系列依赖两阶段压缩流程,首先根据从 4000 亿校准 token 中得出的重要性分数修剪注意力头和前馈层。随后的知识蒸馏阶段训练紧凑的学生模型,以匹配教师模型在额外 1.2 万亿 token 上的输出分布,使用温度缩放交叉熵损失。该流程将参数量从先前旗舰模型的约 1.7 万亿减少到最大 Nano 变体的约 2800 亿,同时保留了大部分指令遵循行为。
行业特定采用模式
客户支持平台最积极地采用了 Nano,因为大多数工单涉及简短、重复的查询,准确性差距在统计上不显著。相比之下,法律科技供应商报告仅将 35% 的工作负载路由到新层级,将复杂的合同分析保留给更大模型。测试文章摘要的媒体公司指出, Nano 在单源浓缩方面表现尚可,但在将三个或更多源文章合成为连贯叙述时则表现不佳。
FAQ
新模型在多语言任务上的表现如何?
并排评估显示,Nano系列在高资源语言上达到旗舰模型的83%水平,但在斯瓦希里语和巴斯克语等低资源语言上仅达到71%水平。
我可以将小模型用于生产环境的 RAG 流程吗?
对于语料库小于 25000 token 且检索模式简单的场景可以;当前指南建议在超过该长度或需要多跳合成的段落时,保留一个更大模型待命。
OpenAI 是否会在采用稳定后再次提高价格?
该公司尚未对未来定价发表评论;因此合作伙伴正在 2027 年预算预测中同时模拟持平和温和上调情景。
OpenAI 小模型证明,激进的尺寸缩减可以一夜之间重置价格预期。未来三个月将显示这些预期是否能在不重蹈此前限制较小产品发布的质量妥协的情况下实现。


