top of page

GPT-Live-1 语音基准测试以 0.2 分领先 Grok,OpenAI 登顶

9月16日
讀畢需時 14 分鐘

Artificial Analysis 在其最新 GPT-Live-1 语音基准测试中将 OpenAI 排在首位,为采用 Astra 支持的配置给出了 81.5 的指数得分。这一成绩略高于 Grok Voice Think Fast 2.0 High 的 81.3 分。

差距仅为 0.2 分,但其背后的配置让这一结果更具意义。GPT-Live-1 负责实时音频交互,而 GPT-6 Astra 则以中等推理强度提供更深入的推理。据报道,使用 Sol 的 GPT-Live-1 配置得分为 80.1,位列第三。

因此,这并非一场独立语音模型之间的简单较量,而是对完整语音代理系统的比较,包括实时模型、后端智能、工具访问和编排选择。

这一排名也扭转了 Grok Voice Think Fast 2.0 在 7 月发布后呈现的局面。当时,xAI 引用了较早版本的 Artificial Analysis 指数,其中 Grok 领先于 OpenAI 和 Google 的知名系统。

此后,Artificial Analysis 修订了指数方法论。OpenAI 也发布了一种将对话控制与深度推理分离的语音架构。这些变化重塑了竞争格局,也让孤立解读头部得分变得更加困难。

GPT-Live-1 语音基准测试迎来新领跑者

Artificial Analysis 目前报告称,搭配 Astra 的 GPT-Live-1 位居榜首,但该排行榜衡量的是一个组装完成的系统,而非单独运行的某一个模型。

这一结果出现在 GPT-Live-1 接入 OpenAI API 后发布的一篇 Artificial Analysis 帖文中。该帖列出了三个领先配置:

  • GPT-Live-1 搭配 Astra,中等推理强度:81.5

  • Grok Voice Think Fast 2.0 High:81.3

  • GPT-Live-1 搭配 Sol:80.1

第一名与第三名之间相差 1.4 分。OpenAI 的领先配置与 Grok 之间仅差 0.2 分,因此现在就对技术主导地位作出大范围断言仍为时过早。

不过,这一排名仍然重要,因为 Artificial Analysis 评估的不仅是语音质量。其当前的语音排行榜将该指数定义为四项不同组成部分的等权重组合。

语音推理测试系统能否理解口头推理问题,并给出正确的口头答案。代理性能考察系统能否通过工具和政策指令完成客服任务。

竞技场偏好通过实时、盲测对比来捕捉人类偏好。任务成功率则评估系统是否真正完成被分配的工作,而不只是听起来流畅。

模型必须在全部四项组成部分中获得有效结果,才能取得指数得分。这项要求避免了某个快速或悦耳的声音仅因擅长单一维度而登顶。

该指数的推理部分使用 Big Bench Audio——一个包含 1,000 道口头问题的题库。这些问题涵盖形式逻辑、导航、物体计数,以及以文字题形式表达的布尔推理。

代理性能采用 τ-Voice 框架。它向系统提供模拟客服问题,涉及航空、零售和电信等领域。

代理必须理解来电者、遵循政策、调用正确工具,并让底层数据库达到所需状态。如果请求的操作仍未完成,即使语音回答再令人信服也不算成功。

这种设计使 GPT-Live-1 语音基准测试与构建运营型代理的公司密切相关。它评估语音系统能否将对话行为与推理和执行结合起来。

不过,这一结果不应被理解为对所有可能部署方案的普遍判断。它反映的是经测试的配置、选定的工作负载,以及发布时可用的基准测试版本。

Artificial Analysis 表示,其结果会随着模型和提供商的变化而更新。这使该排行榜适合作为当前快照,但不太适合作为永久性的层级排序。

这一微弱领先也为正常的单次运行差异、实现差异和未来基准测试修订留下了相当大的空间。Artificial Analysis 并未将 0.2 分的差距视为每个 GPT-Live-1 应用都会优于 Grok 的证据。

更可靠的结论更为具体:在已发布的评估框架下,采用 Astra 支持的 OpenAI 语音系统目前取得了最高综合成绩。

OpenAI 改变了语音模型的定义

GPT-Live-1 作为可委派复杂工作的实时对话层参与竞争,改变了开发者需要评估的对象。

OpenAI 于 2026 年 7 月 8 日在 ChatGPT 中发布 GPT-Live-1,并于 9 月 10 日将该模型引入 API——距离更新后的 Artificial Analysis 结果仅数日之隔。

GPT-Live-1 使用全双工架构,这意味着它可以同时聆听和说话。传统语音系统通常会通过相互独立的语音识别、语言处理和语音生成组件来处理一轮交互。

这种链式设计可以很好地发挥作用,但每一次交接都会增加协调成本。它也可能丢失有关停顿、打断、犹豫、背景语音以及用户意图变化的信息。

OpenAI 的 GPT-Live-1 发布公告称,该模型会在单一对话层内针对传入和传出的音频进行推理。它能够在维持交互的同时回应确认和打断。

该模型无需自行完成每一项困难任务。它可以将更深层的推理和工具调用委派给开发者选择的后端模型。

这一区别解释了为什么 Artificial Analysis 的标签中包含 Astra 和 Sol。受测系统将 GPT-Live-1 的音频行为与执行更高要求推理的独立模型结合在一起。

OpenAI 将委派描述为一种在后台持续处理工作的同时延续对话的方式。在后端完成搜索、推理或工具使用之前,语音层就可以先确认用户请求。

这种架构将问题拆分为两项相关工作。实时模型负责时机把控、聆听、说话和处理打断;后端则负责需要更多算力或外部系统的任务。

OpenAI 自己的评估说明了其预期优势。该公司称,GPT-Live-1 在 Full Duplex Bench 上的表现比 GPT-Realtime-2.1 提高了 30 个百分点。

该公司还报告称,采用中等强度 Astra 的 GPT-Live-1 在其 Tau3 评估中排名第一。Tau3 衡量的是跨航空、零售和电信场景的端到端客服表现。

这些是公司自行报告的结果,并不能独立证明其在每一种生产环境中的表现。Artificial Analysis 提供了单独评估,但其指数仍取决于所选提示词、工具、模拟器和评分方法。

这一架构也改变了买方应如何比较产品。当实时体验依赖于独立选择的后端时,传统模型卡已不再足够。

81.5 和 80.1 的得分展示了实际影响。两种配置中的语音层都是 GPT-Live-1,但更换后端便产生了可衡量的 1.4 分差异。

这一差异表明,后端并非实现细节。它直接影响系统在推理、使用工具和完成任务方面所测得的能力。

对开发者而言,这既带来了灵活性,也带来了责任。团队可以选择适合自身工作负载的后端,但必须验证组合后的系统,而不能仅凭语音模型的名称判断。

预订助手可能优先考虑快速、可预测的操作。医疗预约系统则可能需要更严格的指令、检索控制和升级路径。

技术支持代理可能需要访问文档、账户历史和诊断工具。在每种情况下,接入不同推理系统时,同一个实时界面都可能产生不同结果。

这种模块化设计正是 OpenAI 新领先地位背后的机制。GPT-Live-1 并不只是说得更自然;它为可配置的代理技术栈提供了一个对话外壳。

GPT-Live-1 与 Grok Voice 如今是一场系统之争

主要竞争已不再是 OpenAI 语音质量与 Grok 语音质量的对决,而是委派式编排与紧密集成的并行推理之争。

xAI 于 7 月下旬推出 Grok Voice Think Fast 2.0。该公司将其描述为一款在推理、转录、对话和工具可靠性方面有所提升的语音到语音模型。

Grok Voice 公告引用了较早的 Artificial Analysis 对比结果。该版本中,Grok 的综合得分为 82.9,高于 GPT-Realtime-2.1 High 的 79.1。

这些数字不应与新的 81.5 和 81.3 结果直接比较。Artificial Analysis 在 8 月期间改变了指数,因此这些分数代表的是不同的综合框架。

当前方法论将指数中的对话动态替换为任务成功率,同时将人类偏好和代理性能与语音推理一并纳入评估。

在新版本下,Grok Voice Think Fast 2.0 High 仍然极其接近第一名。其 81.3 分仅落后领先的 OpenAI 配置 0.2 分。

Grok 也保有明确的速度优势。Artificial Analysis 目前列出的其首段音频输出时间为 0.70 秒,在这一指标上仅落后于两个系统。

首段音频输出时间衡量系统在接收输入后多快开始产生声音。它会影响用户感知到的响应速度,但不能反映完整的对话体验。

一个系统可以很快开始说话,却仍可能打断用户、误解更正,或调用错误的工具。另一个系统可能稍等片刻,却能更准确地完成更多任务。

xAI 表示,Grok Voice 会在说话时同步推理。该公司认为,这一并行过程使系统能够准备工具操作,而不会增加对话延迟。

OpenAI 的方法强调委派。GPT-Live-1 管理交互,然后将高要求工作发送给 Astra、Sol、其他模型或外部代理框架。

这些方法带来了不同的工程权衡。Grok 提供了更统一的产品叙事,而 GPT-Live-1 则将后端作为一项部署选择暴露给开发者。

OpenAI 的路线让团队能够针对不同用例调整推理能力,但也增加了可能影响延迟、可靠性、隐私和调试的组件数量。

Grok 的设计可以减少一些显性的编排选择。不过,买方仍需要围绕该模型测试提示词、工具、政策、网络条件和故障处理。

两种架构都无法消除周边应用的必要性。生产级语音代理仍需要身份验证、数据访问、可观测性、升级机制,以及防范非预期操作的保障措施。

它们也需要最新的组织知识。如果政策、记录或产品文档不完整,一个表达流畅的代理也无法解决请求。

这正是为什么语音部署仍与维护 AI knowledge base 这类不那么显眼的工作相连。口语流畅度无法弥补缺失或相互矛盾的源材料。

因此,这场竞争促使 OpenAI 和 xAI 都提升完整任务的表现。自然语音正从唯一的竞争边界,变成一项预期中的能力。

OpenAI 必须证明,委派机制能够在不同后端模型和工具环境中保持可靠。xAI 则必须证明,随着工作流变得更长、限制更多,并行推理仍能持续带来强劲成果。

新排名让 OpenAI 占据了头条领先位置。0.2 分的差距意味着 Grok 足够接近,只需一次模型更新、配置调整,或在某个组成部分取得更强结果,就可能实现反超。

后端差距比 0.2 分的胜出更重要

最值得关注的数字,是两种 GPT-Live-1 配置之间 1.4 分的差异,而不是 OpenAI 与 Grok 之间的微弱差距。

采用 Astra、设置为中等推理强度的 GPT-Live-1 得分为 81.5。采用 Sol 后端的配置得分为 80.1。

这一内部差距是采用 Astra 后端的 GPT-Live-1 与 Grok Voice Think Fast 2.0 High 报告分差的七倍。

这并不能自动证明 Astra 是所有语音任务中更优秀的后端。它表明,后端选择对这项综合基准测试产生了实质性影响。

这一结果也让产品命名变得更加复杂。两款应用都可以宣传使用 GPT-Live-1,却呈现出明显不同的推理和任务完成表现。

它们之间的差异可能来自后端模型、推理强度、系统提示词、可用工具、检索质量或编排逻辑。网络状况还会进一步改变用户体验。

OpenAI 明确给予开发者对这些选择的控制权。其 API 架构允许团队将实时层与不同模型和智能体框架搭配使用。

这种灵活性可以帮助组织仅在必要时分配更强的推理能力。常规状态查询不需要与存在争议的账户交易同样的后端行为。

不过,动态路由也带来了新的问题。应用必须识别何时请求需要委派,选择合适后端,保留上下文,并自然地返回结果。

它还必须处理后端耗时过长、发生故障,或生成与实时对话相冲突答案的情况。这些过渡在真实电话通话中至关重要。

OpenAI 的语音工程说明解释了为何对话时机如此困难。早期系统依赖轮次检测器,猜测说话者何时结束发言。

猜得太早会打断用户。猜得太晚则会留下令人不适的沉默。全双工处理为系统提供了更多信息,但并未消除所有时机判断。

OpenAI 表示,GPT-Live 已从音频路径中移除了独立的轮次检测器。该模型可以持续理解传入语音,同时生成自己的回应。

这种架构可以让打断感受起来不那么机械。但基准分数无法显示,这种体验能否在不同口音、嘈杂房间、不稳定网络或长时间通话中保持可靠。

后端委派又增加了一层时机挑战。实时模型必须在更深层系统完成工作时,决定该对用户说什么。

有用的确认回应能够维持对话流畅。重复的填充语或不准确的阶段性陈述,则会让同样的延迟更加令人沮丧。

任务设计也会影响哪个后端看起来最强。以推理为重点的评估,与简短的日程安排工作流,会奖励不同的行为。

该指数结合多个维度,以减少对单一测试的依赖。但等权重本身仍体现了一种编辑判断:哪些能力应当具有同等重要性。

联络中心可能比起竞技场偏好,更重视任务成功。语言辅导产品可能更关注打断处理和对话节奏。

无障碍产品可能优先考虑对不同语音模式和环境下语音的识别。销售应用可能聚焦于准确的工具使用、合规性和交接质量。

因此,开发者应将排行榜视为生成候选名单的工具。它可以识别有前景的配置,但无法为特定部署选出最佳系统。

实用的评估应使用实际工具和政策重放具有代表性的对话。它应衡量已完成结果、纠正率、升级处理情况和用户打断。

团队还应记录每项委派请求由哪个后端处理。没有这一追踪记录,故障可能难以归因或复现。

GPT-Live-1 语音基准指向了一个可配置的未来。它也表明,配置选择所决定的,可能远不只是产品页面上标注的模型品牌。

Artificial Analysis 指数尚未解决的问题

81.5 的综合得分无法证明生产环境可靠性,而该基准近期的方法论调整也限制了与旧结果的比较。

Artificial Analysis 于 2026 年 6 月推出 Speech to Speech Index 的首个版本。该版本结合了语音推理、对话动态和智能体表现。

该机构在 8 月通过加入 Speech Agent Arena 修订了该指数。同月晚些时候,2.0 版又在综合得分中以任务成功率取代了对话动态。

当前的基准方法论对语音推理、智能体表现、竞技场偏好和任务成功率赋予相同权重。

对话动态仍作为一项独立基准提供。它衡量停顿、轮次交替、打断、背景语音,以及“yeah”或“mm-hmm”等简短确认回应。

这段历史很重要,因为 7 月的分数和 9 月的分数不一定衡量的是同样的能力组合。排名变化可能同时反映模型进步和方法论变化。

此前被引用的 Grok 82.9 分来自更早版本的指数。其更新后的 81.3 分并不意味着模型变差了。

同样,GPT-Live-1 的 81.5 分也不意味着它在完全相同的测试中击败了此前的 Grok 得分。当前排名才是有效的直接比较。

另一个不确定性涉及基准方差。报告中的领先优势很小,但公开摘要没有为综合排名附上置信区间。

随着更多比较结果到来,人类偏好分数可能发生变化。智能体模拟在重复试验、提示词或工具实现之间也可能表现不同。

Artificial Analysis 会在模型首次具备进入指数资格时冻结其竞技场评分。这避免了分数持续变动,但也只捕捉了特定阶段的偏好。

该基准还要求模型在每个组成部分都有结果。这提高了纳入系统之间的可比性,但排除了数据不完整的产品。

因此,排行榜可以描述符合资格的竞争格局,却不能代表所有可用的语音系统。专用模型可能在延迟、转录或狭窄工作流中表现出色,却不会出现在综合排名中。

生产环境会引入更多不确定性。真实来电者可能转换话题、提供不完整信息、与他人同时说话,或请求执行超出政策范围的操作。

长时间会话也可能暴露短测试未能发现的上下文故障。工具权限、过期的检索结果和后端中断,都会削弱原本强大的语音层。

OpenAI 报告了令人鼓舞的早期客户评估。据称,Speak 观察到,与早期基于轮次的系统相比,在思考停顿期间的打断减少了近 80%。

OpenAI 引述的一项医疗部署称,GPT-Live-1 将其级联式代码库减少了 80%,并移除了 23,000 行代码。这些是客户和公司的说法,而非标准化的独立结果。

这些案例仍指出了有用的评估目标。团队可以衡量打断频率、代码复杂度、成功处理的通话数量,以及人工升级的次数。

他们不应假定这些结果会自动迁移。架构、流量、语言组合、政策和集成质量都可能改变结果。

自然语音智能体还存在更广泛的安全问题。高度流畅的系统可能在其事实或操作可靠性得到验证前,就促使用户信任它。

全双工行为可以让智能体显得具备社交层面的专注力。这种印象并不保证它理解了账户规则,或选择了正确的后端操作。

企业需要为重要操作设置明确的确认步骤。当系统缺乏权限、上下文或信心时,也需要提供清晰可见的升级机制。

因此,恰当的审慎解读应当是有限的。Artificial Analysis 已识别出一个领先的受测配置,而不是一个普遍更优秀的语音智能体。

三项信号将显示 OpenAI 能否保持领先

下一阶段将由可重复的任务完成能力、后端一致性和竞争性更新决定,而不是单一综合得分。

第一个信号是,随着 Artificial Analysis 增加结果并刷新模型配置,GPT-Live-1 是否能维持其位置。

排行榜仍在动态变化,该指数自推出以来已两次调整方法论。另一次更新可能会改变接近系统的名次,而无需改变其底层产品。

若能在多个快照中持续领先,将增强 OpenAI 结果具备可重复性的论据。若迅速逆转,则会显示前沿系统之间的差距有多小。

组成部分得分将比单独排名更重要。开发者应关注 GPT-Live-1 是否在任务成功方面领先,还是依靠其他优势抵消较弱维度。

Astra 和 Sol 的结果也应分别监测。如果两者的差距持续存在,买家就需要将后端选择视为核心性能决策。

第二个信号是使用委派机制的应用所提供的生产证据。OpenAI 已将客户支持、预约、教育、医疗和软件开发确定为初始场景。

这些部署最终应产出比宽泛偏好主张更有用的衡量指标。完成率、纠正频率、打断和人工转接可以揭示这一架构在哪些方面有效。

开发者还应关注实时确认回应与委派答案之间的延迟。这一间隔将决定后台推理让人感觉自然,还是像在回避问题。

一致的上下文传递是另一项关键测试。后端必须接收足够的对话细节,同时不会混淆阶段性评论、纠正信息或重叠语音。

强劲结果将表明,GPT-Live-1 可以在不丢失用户意图的情况下完成更长的工作流。频繁重启或相互矛盾的回答将削弱基准测试所支撑的论据。

第三个信号是 xAI 的回应。Grok Voice Think Fast 2.0 High 仅落后 0.2 分,因此小幅改进就可能改变排名。

xAI 已强调语音推理、转录、对话行为、工具可靠性和响应速度。它还宣称其模型能够边说话边推理。

未来更新应通过当前指数来判断,而不是旧的综合得分。直接比较需要相同的方法论和同样完整的配置。

Grok 的低首段音频响应时间为 xAI 提供了另一条竞争路径。如果响应能力对某个特定工作流更重要,略低的综合结果仍可能颇具吸引力。

OpenAI 面临相反的挑战。它必须证明,更强的委派推理不会带来不可预测的延迟、复杂性或依赖后端的故障。

因此,这场竞争可能在不同应用中产生多个赢家。银行、语言辅导产品、餐厅和编程助手并不存在唯一的最优评分公式。

Artificial Analysis 通过评估多个维度,让这种复杂性变得更加直观。其最新结果将 OpenAI 置于综合排名首位,但这一组件化框架也提醒我们,不应将排名视为命运。

对开发者而言,下一步很明确:在计划部署所使用的确切后端、工具、策略、语言和网络条件下测试 GPT-Live-1。

应根据已完成的任务,而非经过精心打磨的演示效果,将其与 Grok Voice 进行比较。测试应涵盖打断、纠正、嘈杂音频、工具响应缓慢,以及需要人工批准的请求。

当前的 GPT-Live-1 语音基准测试使 OpenAI 以 0.2 分的优势领先。下一轮结果将揭示,这一差距究竟代表了持久的系统工程能力,还是暂时的排行榜优势。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page