top of page

自主拳击基准测试让 AI 延迟走上擂台

据一名在自主拳击模拟中测试 Gemini Flash Live 的开发者称,Google 本周进入了一个不同寻常的基准测试。该项目用必须感知攻击、选择应对方式,并在模拟拳击命中前采取行动的拳手,取代了静态问题。

这一前提使得这项实验比其暴力主题所暗示的更有趣。拟议中的 Google 能力边界以几分之一秒衡量,而不是数小时的编程工作或数千道学术题目。一个推理能力出色却反应迟缓的模型,依然会挨打。

开发者表示,Gemini Flash Live 可以利用视觉信息闪避并反击。报道称,在配备 8GB 显存的 Nvidia GeForce RTX 5060 Ti 上运行的本地模型,需要更长时间才能作出决策。不过,最初的 Reddit 描述并未附带公开排行榜、可复现实验代码、完整结果或独立验证。

这让该项目介于创意演示与具有说服力的基准测试之间。但其核心问题仍然很有价值:当 AI 智能体在不断变化的环境中运行时,响应时间是否应被视为智能的一部分?

拳击模拟将延迟转化为伤害

该实验通过将模型的缓慢响应转化为即时的竞技劣势,让延迟变得可见。

创建者将这场由 AI 控制的拳击比赛描述为一项用于测试决策速度、适应能力和策略的实验。每个模型都会获得当前比赛的信息。支持视觉的模型还可以接收额外的视觉数据,但具体格式和采样频率并未披露。

该模拟采用刻意宽松的“街头规则”。一切皆可发生,拳手不会仅因被击倒就输掉比赛。裁判必须数到 10,或者对手必须在击倒后造成相当于该拳手生命值 50% 的伤害。

这些规则带来了持续压力。模型无法将每次交锋视为孤立的提示词,因为它的状态、位置、对手和可用时间都在不断变化。它必须在环境持续运转的同时选择行动。

开发者表示,目标是创造一种比又一套固定答案题集更具娱乐性的测试。拳击的呈现方式也为失败提供了直观解释。延迟的回答不会表现为抽象的延迟数字,而会表现为一次漏挡或未能回应的连击。

这种清晰性很有用,但也可能造成误导。动画拳手会让人觉得模型持续看见、理解并控制整个场景。底层系统实际上可能只是将游戏状态转换为文本、定期发送图像,或将模型限制在一个小型动作菜单中。

这些实现选择决定了系统实际测量的内容。在“闪避”“格挡”和“反击”之间做选择的模型,面对的问题不同于能够独立控制移动、时机、方向和攻击选择的智能体。

原始帖子未披露动作空间、提示词格式、更新间隔、网络条件、随机种子或比赛数量,也没有提供完整的得分分布。因此,关于 Gemini 能够闪避和反击的说法,应被视为创建者的观察,而非已确立的模型排名。

即便如此,这一概念仍揭示了静态评估经常掩盖的问题。许多基准测试题目实际上让世界在模型思考时暂停。真实界面、机器人、游戏和实时助手并不提供这种特权。

Google 的 Live API 专为利用连续音频、图像和文本流进行低延迟交互而设计。拳击环境将这一设计推向可衡量的后果:反应太晚,下一个状态会在前一个决策失去意义前到来。

为什么 Google 的能力边界以毫秒衡量

相关的 Google 能力边界并非 Gemini 能追求一项任务多久,而是其感知与行动循环能多快地保持有效。

AI 研究人员已经使用“时间跨度”来讨论智能体能力。METR 将任务完成时间跨度定义为:智能体达到特定成功概率时,相应任务所需的人类完成时长。其当前测量主要聚焦软件工程、机器学习和网络安全工作。

这一框架关注的是,智能体能否可靠完成需要更长时间人类劳动的任务。拳击项目提出的是不同的问题:决策是否能在仍可改变结果、且不断缩短的窗口内到达。

两种思路都很重要,但不应在缺乏解释的情况下共用一个分数。编程智能体可以花数分钟修改计划,因为代码仓库通常会等待。面对来拳的拳手,可能只有一个真正有用的反应时刻。

这至少会产生四类延迟。

首先,模拟必须收集当前状态。如果涉及视觉,它必须捕获并编码图像或视频帧。陈旧的帧可能在推理开始前就让一个原本不错的决策失效。

其次,应用必须传输该输入。本地部署避免了互联网传输,但仍要承担序列化、调度和内存成本。托管系统则增加了网络波动性。

第三,模型必须推断出一个动作。更大的推理预算可以改善规划,但也会消耗时间。在实时环境中,额外的思考反而可能降低实际表现。

第四,应用必须解析并执行响应。如果游戏需要的是紧凑指令,冗长解释便毫无用处。输出约束、工具调用和格式错误的响应都会影响最终动作时间。

Google 此前曾将其 Multimodal Live API 描述为支持双向流的有状态 WebSocket 服务。在 2024 年的一篇开发者文章中,该公司称该代服务的首个 token 输出时间为 600 毫秒。这个数字是在未说明条件下的平台主张,并非拳击系统测得的端到端反应时间。

这一区别至关重要。首个 token 延迟不等于完成动作延迟。一个有用的评估应从威胁变得可观察的时刻开始,测量到模拟器接受有效防御动作的时刻。

它还应报告分布,而不只是平均值。一个拳手在九次交锋中反应迅速、却在第十次卡住,仍可能输掉比赛。尾部延迟,例如最慢 5% 响应的延迟,可能比平均值更能预测生存能力。

创建者对本地模型的比较让这一问题变得具体。帖子称,在 8GB RTX 5060 Ti 上运行的模型需要一段时间才能推理,这引出了时间缩放的可能性。放慢模拟速度会让这些模型得以参与,但也会改变比赛本身。

时间缩放可以回答:在获得同等思考机会时,本地模型能否选择好的动作。实时对战则可以回答:在相同环境压力下,整个部署是否能产生有用动作。这是两项不同的测试,应该产生不同的排行榜。

快速多模态模型对较慢的推理模型形成压力

主要竞争是快速感知—行动系统与较慢审慎推理模型之间的较量,而不是 Google 与某一个具名对手之间的较量。

Gemini Flash Live 看起来很适合这项实验,因为 Google 为流式交互构建了 Live API。其文档称,该服务处理连续音频、图像和文本,以提供即时响应。客户端到服务器的连接还可以减少经由应用后端的额外跳转。

这种架构为 Gemini 带来了重要的系统层面优势。它并不能证明其拳击策略、通用推理能力或适应能力更强。它意味着该模型和交付层是为这类工作负载设计的:传入媒体无需等待完整的提示词—响应周期结束。

创建者的本地模型位于比较的另一侧。在消费级硬件上运行模型可提供隐私、控制、可重复性,以及不受远程服务可用性限制的自由。然而,内存限制可能约束模型规模、上下文、图像处理或量化选择。

公平的比较必须明确哪种约束在发挥作用。如果本地模型接收文本,而 Gemini 接收图像,那么该基准测试混合了模态与部署因素。如果两者都看到相同帧,但其中一个通过远程流式 API 运行,那么结果就混合了模型能力与基础设施因素。

这两类比较都并非无用。它们只是回答不同的问题。

为实时教练或交互式角色选择技术的产品开发者,关心的是集成后的结果。模型架构、网络、推理硬件和界面设计都会影响用户体验。比较推理能力的研究人员则需要更严格的控制。

OpenAI 的 realtime model 展示了另一条可用路径。其文档所述模型接受文本、音频和图像输入,但未列出视频输入。因此,拳击实现必须决定提交图像的频率,以及如何让图像与游戏事件对齐。

Google DeepMind 的 SIMA 研究提供了一个更直接的历史参照。SIMA 使用屏幕图像和自然语言指令,随后在 3D 游戏中生成键盘和鼠标操作。DeepMind 报告称,其评估覆盖 600 项基础技能,初始任务被设计为大约需要 10 秒完成。

这项 SIMA research 也表明了交互式环境为何吸引研究人员。它们在可控软件中结合了感知、语言、记忆、行动和后果。环境可以记录每一次观察与指令。

拳击模拟将这一循环进一步压缩。10 秒的导航任务允许智能体从犹豫中恢复,而一次闪避几乎会立即失效。

这正是较慢推理模型面临压力的地方。基准测试通常奖励模型在困难问题上投入额外计算。拳击则可能惩罚同样的行为,因为边际改进抵达时,行动窗口已经关闭。

这种压力并不限于模型提供商。构建自主界面的开发者必须决定是否将每个选择都交由大型模型处理。实用系统可能会使用快速控制器执行即时防御,然后在交锋间隙咨询较慢的模型制定策略。

这种混合方案可能优于两种极端做法。但它也会使归因更复杂,因为基准测试衡量的是经过工程设计的智能体,而不是单一模型。这种张力已存在于各种智能体评估中:脚手架和工具设计会强烈影响结果。

有趣的演示尚不是可靠的 AI 基准测试

如果没有受控输入、重复试验和完整的时间数据,这场拳击比赛无法将策略与系统工程区分开来。

基准测试需要的不只是一个环境和一名获胜者。它还需要一个明确的构念,也就是分数声称代表的能力。“拳击智能”可能指反应速度、战术选择、长期适应、视觉理解,或整体比赛成功率。

这些结果可能彼此冲突。反应式模型或许能频繁闪避,却始终无法创造进攻机会。战略型模型可能接受有限伤害,以便在后续利用对手的模式。视觉模型则可能显得更具适应性,因为它获得的信息比纯文本参与者更丰富。

规则又增加了一个混杂因素。允许在击倒后继续攻击,并要求造成额外伤害,会产生不同寻常的激励机制。基于传统拳击知识训练的模型,可能会选择符合正式规则的动作,却在模拟器的自定义条件下表现不佳。

这并不意味着该环境没有价值。新颖的规则可以测试指令遵循和适应能力。不过,提示词必须始终一致地说明这些规则,评估者也必须验证模型是否理解了它们。

随机性同样构成问题。格斗游戏通常会让命中判定、移动、伤害和时机产生变化。一场比赛的胜负可能取决于一连串幸运事件。可靠的排名需要重复对局、镜像起始位置、受控随机种子和置信区间。

模型身份也需要更严谨地处理。“Gemini Flash Live”描述的是一个模型家族及其交付模式,不一定对应某个固定快照。预览服务可能发生变化。可复现的结果应记录准确的模型标识符、API 版本、日期、地区、系统提示词、生成设置和工具架构。

硬件对比同样需要谨慎。“在 RTX 5060 Ti 上运行的本地模型”并不能说明具体模型、参数量、量化方式、推理引擎、上下文长度或图像编码器。每一项都可能显著改变响应时间。

一项可信的发布至少应公布三类评分。

决策质量

  • 造成和承受的伤害

  • 成功格挡、闪避和反击次数

  • 无效或战略上不连贯的动作

  • 对抗多种对手风格时的表现

时序表现

  • 状态捕获延迟

  • 网络和队列延迟

  • 首次可用动作所需时间

  • 端到端延迟的中位数和尾部延迟

适应表现

  • 各回合之间的改进

  • 对重复出现的对手模式的反应

  • 战术失效后的恢复能力

  • 对未见规则或拳手的泛化能力

评估还应纳入简单的基线。一套手写的反应式策略可以在攻击超过某个阈值时立即闪避。随机策略能够建立性能下限。脚本化的战术策略则可用于判断,语言模型是否在可预测规则之外提供额外价值。

如果 AI 无法稳定击败这些基线,炫目的表现也不应挽救这一结论。反之,若它能在未见条件下战胜它们,该项目就不只是一个视觉演示。

与人类对比或许会有帮助,但需要经过周密设计。人类反应时间、对界面的熟悉程度以及对游戏的了解都会影响结果。人类应获得与模型相同的可观测信息和动作限制。

因此,创作者对于时间缩放的不确定性其实富有建设性。它指出了该基准最重要、尚未解决的选择:相同的现实时间评估可部署的响应能力,而归一化时间则评估在调整计算资源后的决策质量。

最好的答案是同时发布两种结果。一个组别可保持模拟时钟固定。另一个组别则可在追踪分配给每个智能体的计算资源时暂停或缩放事件。这样,读者便能区分聪明但缓慢的策略与快速却浅薄的策略。

METR 的时间跨度方法论展示了:针对明确的任务度量定义成功概率具有重要价值。其软件任务与此大不相同,但其中的核心经验可以迁移:评分必须准确说明“时长”的含义,以及如何估计可靠性。

该拳击项目目前缺少这一方法论层面。在此之前,“Gemini 能够闪避拳击”之类的表述,只是在描述一次被观察到的运行结果,并不能证明其具备可比较的能力。

交互式基准揭示静态分数遗漏的问题

受控的拳击竞技场能够暴露单次问答测试中不易察觉的感知滞后、动作延迟和恢复能力不足。

传统语言模型基准通常提供固定输入,然后等待答案。这种设计支持可重复性和低成本评分,但也消除了犹豫的代价。

交互式环境重新引入了这种代价。下一次观察取决于上一次动作,而对手或世界仍在持续变化。错误会不断累积,而不是以一个错误答案结束。

这使拳击成为测试智能体行为的合理试验场,即便它的呈现方式颇具娱乐性。模型必须维持状态、选择动作、观察后果并调整方法。这些要求也与机器人、屏幕控制智能体、实时助手和自主游戏角色息息相关。

该环境还可以揭示最终成功率所掩盖的失败模式。模型可能因为尚未整合最新画面而发出相互矛盾的指令;它可能因为记忆中缺少有用摘要而重复失败战术;它也可能规划正确,却错过每一个执行窗口。

Google 的实时技术栈尤其相关,因为它支持持续的多模态输入。然而,能够访问实时流并不保证具备准确的时间推理能力。模型必须判断发生了什么变化,区分运动与噪声,并将近期观察关联到正确动作。

帧率在这里很重要。发送更多图像可以改善时间覆盖度,但会增加带宽和处理负载。发送更少图像可以降低延迟,却可能掩盖一次攻击的开始。最优速率取决于模型和环境两者。

因此,评估设计者必须将观测管线视为智能体的一部分。只报告模型名称,会抹去那些甚至在推理开始前就可能决定胜负的设计选择。

拳击形式也能比静态测试套件更清晰地检验适应能力。评估者可以为对手设定不同风格,包括激进压迫、防守反击、重复连招或欺骗性移动。模型可以先面对熟悉的风格,再面对未见过的混合风格。

真正的适应评分应衡量证据积累后行为发生的变化。它不应仅因模型随机选择了不同动作而给予奖励。模型后续的决策必须利用开始时尚无法获得的模式。

这一设计将使项目与游戏作为 AI 实验室的更广泛历史相连接。DeepMind 指出,游戏提供了目标不断变化、可实时响应的环境;它们还提供了实体实验往往缺乏的仪器化能力。

不过,拳击基准应避免沦为又一场封闭的展示。没有可下载的环境、固定协议和机器可读日志,观众就无法审查拳手为何获胜。娱乐价值能够吸引关注,但透明度才能创造科学价值。

同样的经验也适用于企业智能体测试。一个最终能够完成工作流的屏幕智能体,若会不可预测地停顿或基于过时信息行动,依然会令用户受挫。团队需要能够展示观察、决策、时序和恢复过程的轨迹。

视觉竞技场让这些轨迹更容易理解。观看智能体未能格挡,比阅读百分位图表更直观。机会在于保留这种易理解性,同时加入有意义比较所需的控制条件。

什么能让结果值得信赖

三个信号将决定该项目会成为有用的评估,还是仍只是一场富有创意的社交媒体演示。

第一个信号是可复现的发布。创作者应公布环境、规则、提示词、动作架构、时序逻辑和固定的模型配置。回放应包含带时间戳的观察和被接受的动作。

如果独立用户复现出相近的排名,这一发布将加强该结论;如果微小的提示词或网络变动就能逆转结果,它则会削弱该结论。

第二个信号是双轨排行榜。一条轨道应执行完全一致的实时条件;另一条则应对计算资源进行归一化或披露,以便评估者将动作质量与速度分开比较。

这将解决时间缩放问题,而不会假装公平只存在一种定义。两条轨道上稳定的排名将支持广泛的能力结论;出现分歧的排名则说明,延迟与推理质量仍然是不同维度。

第三个信号是覆盖更广的模型和基线。Gemini Flash Live 应与其他托管服务提供商的固定快照、披露细节的本地模型、手写控制器和随机策略进行对比。除非一个单独的多模态组别被明确标注,否则每个系统都应获得可比的观察信息。

如果 Gemini 能在重复随机种子、未见对手和透明的延迟测量下保持竞争力,Google 的前景就会变得有意义。如果它只凭借更丰富的视觉信息或有利的时机获胜,那么该基准记录的将是集成优势。

目前没有经过验证的结果能够确立上述任一结论。来源是一名开发者对进行中工作的描述,核心性能主张尚未得到独立核查。这种不确定性应推动更好的测量,而非导致轻率否定。

下一步很简单:保留乐趣,然后展示机制。公布日志,将速度与策略拆分,让其他开发者运行同样的对局。那个在暂停比赛中占据统治地位的模型,在时钟持续推进时还能存活吗?这个问题超越了模拟拳击。它检验的是,实时 AI 能否在世界再次变化之前将感知转化为行动。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page