Moonshot AI PerceptionBench 揭示多模态模型评分背后的视觉鸿沟
- Aisha Washington

- 7月17日
- 讀畢需時 17 分鐘
已更新:7月20日
Moonshot AI 发布了包含 3,000 道问题的 PerceptionBench,所有受测多模态模型的得分均低于 60%。Moonshot AI PerceptionBench 视觉感知基准测试聚焦于一个隐藏在综合排行榜之下的基本问题:模型真的看见图像了吗?
这一区别至关重要,因为许多多模态评测将感知、知识、语言和推理合并为一个分数。模型可以通过识别熟悉的问题或推断可能的答案来弥补视觉输入的不足。即使无法可靠地定位、计数或读取图像中出现的内容,它仍然可以给出听起来令人信服的回答。
PerceptionBench 试图消除这些逃避途径。Moonshot AI 表示,其团队追踪了 40 多个现有基准测试中的错误,一直追溯到最早发生的视觉错误。最终形成的测试将这些错误划分为 10 项原子能力,涵盖计数、定位、OCR 和幻觉等方面。
此次发布为 OpenAI、Google、Anthropic、Moonshot AI 及其他模型开发商带来了令人不安的比较。它们的系统越来越多地用于操作浏览器、解读文档、检查界面,并根据视觉信息采取行动。PerceptionBench 表明,表达流畅的推理仍可能建立在不稳定的视觉基础之上。
Moonshot AI PerceptionBench 衡量模型实际看到了什么
该基准测试将评估单位从完成一项复杂任务,转变为正确感知一个可见事实。
Moonshot AI 将 PerceptionBench 描述为面向原子视觉感知的诊断性基准测试。原子能力是指一种定义明确、无需外部知识或冗长推理链的狭窄技能。每道问题都应当只有一个可直接从所提供图像中得出的答案。
官方的 PerceptionBench 发布说明包含横跨 10 个类别的 3,000 个经过验证的样本。这些类别分别为视觉关系、计数、属性、深度与 3D、定位、比较、细粒度识别、语境整合、OCR 和幻觉。
类别设计以错误为驱动。Moonshot AI 表示,研究人员首先收集前沿模型在 40 多个基准测试中出现的错误。随后,他们将每个错误归因于最早出现问题的视觉步骤,而不是在审查错误之前预先定义分类体系。
这种方法不同于围绕便于划分的学术主题构建测试。它关注的是视觉处理流程最先在哪个环节失效。一个错误的最终答案,可能始于漏看一个数字、混淆一种空间关系,或模型凭空虚构了一个物体。
有些问题在人类观察者看来几乎简单得微不足道。例如,询问现场有多少人、杯子的哪个部位与一条线相连,或方框中出现的是哪个数字。另一些问题则要求区分相同的轮廓、识别棋子,或判断某个物体是否不存在。
这种简单性是刻意设计的。复杂提示会增加错误归因的难度,因为感知、记忆和推理会相互作用。模型答错一道工程学问题,可能是因为误解了图示、不知道公式,或出现了算术错误。
PerceptionBench 消除了其中的大部分歧义。如果模型无法说出图像中的蓝色数字,额外的推理就不应挽救它。如果模型声称一辆空卡车里有人,那么问题出在视觉依据,而非专业知识。
Moonshot AI 还尝试在仅保留具有单一可验证答案的样本同时平衡难度。据该公司称,人工验证剔除了模棱两可的案例,以及主要因推理而产生难度的问题。
各类别的分布相对均衡。计数、视觉关系、属性、定位和深度各包含 330 个样本。细粒度识别包含 290 个,比较包含 279 个,幻觉包含 271 个,OCR 和语境整合则各包含 255 个。
这种均衡可以防止某一项常见技能主导总体结果。它还会生成能力画像,揭示两个排名相近的模型是否以不同方式出错。单一综合分数通常会掩盖这种操作层面的差异。
更广泛的基准测试格局解释了为什么这种区分如此重要。MMMU 通过 11,500 道问题,将感知与大学水平的知识和审慎推理相结合。其广度很有价值,但错误回答并不总能揭示究竟是哪个组成部分出了问题。
PerceptionBench 针对的是一个更狭窄的问题。它并不试图取代广泛的多模态评测,也不试图预测所有真实产品的表现。它测试的是,进入模型推理过程的视觉证据是否足够忠实、值得信赖。
这一更狭窄的范围形成了本文的核心矛盾。多模态系统以日益复杂的任务作为营销卖点,但其基础感知输入仍然不可靠。推理层可能会掩盖这一弱点,直到某个简单的视觉细节改变结果。
所有受测模型的准确率均未突破 60%
最值得关注的结果并非某家厂商获胜,而是整个受测领域在基础视觉任务上仍接近不及格。
Moonshot AI 报告称,所有受评模型的总体准确率均未超过 60%。其发布的排行榜显示,GPT-5.6-Sol 以 59.7% 位居第一,Kimi-K3 以 58.5% 紧随其后。Claude-Fable-5 达到 57.2%,Gemini-3.1-Pro 则达到 56.2%。
这些结果是由公司报告的基准测量数据,并非经过独立复现的发现。列出的若干模型名称也反映了 Moonshot AI 发布测试时的模型市场状况。在外部评估者复现该方法之前,读者应将具体排名视为暂定结果。
即便存在这一限制,各子类别的结果仍比排名包含更多信息。GPT-5.6-Sol 总体领先,定位得分达到 76.7%。然而,它在幻觉问题上的得分仅为 26.9%,是其已发布能力画像中表现最弱的类别。
Kimi-K3 呈现出不同的模式。其定位得分为 70.6%,视觉关系得分为 68.5%。它的幻觉得分为 42.1%,深度与 3D 得分则为 52.7%。
Claude-Fable-5 的 OCR 得分达到 64.3%,但幻觉得分仅为 45%。Gemini-3.1-Pro 的 OCR 得分同样为 64.3%,定位得分却降至 52.7%。因此,相近的总体得分掩盖了不同的操作性弱点。
这种差异对于模型选择十分重要。处理扫描表单的团队,与检查仓库图像的团队,对 OCR 和定位的关注方式截然不同。通用排行榜上的位置无法体现任何一种应用的错误成本。
这些结果也挑战了这样一种假设:更新的通用模型会自动继承全面提升的视觉能力。模型可以在语言生成、工具使用和推理方面有所改进,同时在不同视觉类别上的表现仍然参差不齐。更好的推理无法持续修复那些从未被正确感知的证据。
Moonshot AI 的基准测试并非首个质疑综合多模态评分的测试。MMMU-Pro 移除了无需图像即可回答的问题,增加了答案选项,并引入了纯视觉格式。与原始测试相比,受测模型的表现大幅下降。
MMStar 通过必须依赖视觉信息的样本探讨了类似问题。其研究人员发现,一些模型即使未接收到图像,回答基准问题的表现仍高于随机猜测。MMStar 基准测试旨在减少文本捷径和潜在的训练数据泄漏。
PerceptionBench 将这一趋势进一步推进到更小的感知单元。它先询问模型能否识别可见输入,然后再评估模型如何处理这些信息。这不如评估自主智能体那般引人注目,却具有基础性意义。
以一个通过视觉界面购买商品的浏览器智能体为例。它必须区分已选选项、注意禁用的控件、读取标签,并定位确认状态。任何一个属性识别错误,都可能让之后的所有正确推理步骤失去意义。
同样的问题也存在于文档工作流中。系统可能在误读一个标签后,仍流畅地总结图表。它的文字依然可以保持连贯,因为语言模型经过优化,擅长延续看似合理的模式,却不会自动暴露不确定的视觉输入。
医疗和工业场景的风险更高,尽管 PerceptionBench 并不能证明模型已为这两个领域做好准备。会混淆深度、数量或缺失状态的模型,在部署前需要接受针对具体应用的验证。仅凭基准测试表现无法完成这种验证。
因此,压力落在了每一家将视觉能力作为智能体系统组成部分出售的开发商身上。OpenAI、Google、Anthropic、Moonshot AI 和开放模型团队需要的不只是吸引人的演示。他们需要提供可重复验证的证据,证明模型能够感知关键的界面和文档细节。
PerceptionBench 同样给企业买家带来了压力。采购团队通常会比较少数几个综合分数,并进行小规模提示测试。新结果表明,他们应围绕可能损害自身工作流的具体感知错误来构建评测。
低于 60% 的得分并不意味着每个模型在大多数普通图像上都会失败。基准测试会刻意收集困难案例,而 PerceptionBench 正是根据已知的模型错误构建的。该分数衡量的是模型在这一精心筛选的数据分布上的表现,而非普遍意义上的视觉准确率。
这一限定并不会抹去该发现,而是对其作出了准确定义。当问题被专门挑选来揭示已知的视觉弱点时,没有一个受测系统能够持续解决这些问题,而且不同模型的能力画像存在显著差异。
真正的分界在于感知与看似合理的推断
PerceptionBench 揭示了一种反转:更强的语言能力可能让薄弱的视觉能力更难被察觉,而非更容易被修复。
多模态模型并非只是检查像素并报告一份中立的视觉记录。它们的视觉编码器会将图像转换为与语言模型交互的表征。随后,语言组件根据视觉信号和学习到的统计预期生成答案。
这种设计能够实现有用的推断。模型可以将部分视觉证据与有关可能存在的物体和关系的知识结合起来,从而识别陌生场景。但当视觉证据薄弱时,同样的机制也可能生成一个看似合理的答案。
PerceptionBench 旨在让这种替代现象显现出来。它的问题要求答案必须以图像为依据,几乎不需要外部知识。依赖一般概率的模型应当会失去其惯有优势。
幻觉样本进一步凸显了这一区别。它们会询问图像中并不存在的物体或人物,因此正确答案为零。这些案例测试模型能否尊重否定性的视觉证据,而不是用某种可能存在的内容来补全场景。
该基准测试中排名第一的模型在这一类别中的报告得分仅为 26.9%。一些排名较低的系统虽然总体表现落后,但在幻觉类别上的表现更好。这一对比表明,整体准确率与克制能力并不是同一种能力。
这一问题此前已在多模态研究中出现。HallusionBench 研究了视觉证据与语言先验相冲突或产生错觉的情况。它揭示了视觉错误和语言错误为何会相互纠缠。
PerceptionBench 的贡献在于,将这一问题与更广泛的基础错误分类体系联系起来。幻觉与计数、深度、OCR 和定位并列为其中一种类别。这一框架将虚构内容视为感知不可靠的一种显性症状。
重复提问提供了另一层诊断手段。Moonshot AI 表示,最初回答正确的问题中,有很大一部分在再次提出相同问题时无法得到同样的答案。该公司认为,这种不稳定性表明模型往往是在猜测,而非真正感知。
发布页面的可见摘要并未公布完整的各模型可重复性表格。这一缺失限制了对该说法的独立分析。在读者对特定系统得出明确结论之前,准确性和一致性应当一并报告。
尽管如此,这项基础测试仍然很有价值。视觉事实不会因为提示词被重复而改变。如果模型在两个计数结果之间来回变化,那么至少有一个答案缺乏稳定的视觉依据。
采样设置可能会影响生成的回答,因此可重复性测试必须使用受控参数。评估者应披露温度、图像处理方式、提示词措辞、模型版本和试验次数。否则,不一致性可能同时混合了感知错误与解码变化。
更完善的测试方案应同时衡量单次作答准确率和多次重复试验的一致程度。还可以允许模型在视觉证据不足时选择不作答。这将把不确定性感知能力与单纯的识别能力区分开来。
传统基准测试背后的激励结构可能并不利于模型选择不作答。准确率测试通常会奖励侥幸猜对的答案,同时将“我无法判断”与错误答案同等惩罚。因此,开发者可能会将模型优化为自信作答,而不是如实表达不确定性。
OpenAI 曾在纯语言评估中描述过类似问题。其对模型幻觉的分析指出,许多准确率基准会奖励猜测。PerceptionBench 表明,当答案依赖图像时,同样的激励问题也会出现。
这改变了用户理解流畅视觉解释的方式。详尽的思维链并不能证明最初的观察是正确的。它可能会将一个感知错误扩展成更冗长、更具说服力的错误。
因此,真正的对立并不是 Moonshot AI 与某家竞争公司之间的较量,而是忠实感知与貌似合理的推断之间的冲突。当用户将表达流畅的补全结果误认为可靠的视觉依据时,所有模型开发者都会从中受益。
这一冲突也解释了为什么仅凭模型排名无法体现更深层的启示。排行榜只会在某一测试分布中评出胜者,而诊断画像则表明,没有任何参与者解决了一致、通用的视觉感知问题。
该基准仍未证明什么
PerceptionBench 是一项有用的诊断方案,但其最有力的主张仍需独立复现和更完整的方法披露。
第一个局限来自数据集的构建方式。Moonshot AI 从 40 多个现有基准中筛选出失败案例,随后对其进行拆解和验证。这种方法产生了困难且具有相关性的问题,但也使样本集中在当前系统已经难以应对的案例上。
这种方法适合用于诊断,却不太适合估算日常场景中的失败率。某个模型在 PerceptionBench 上取得 55% 的成绩,并不一定意味着它会答错 45% 的普通图像问题。
基准的来源构成同样重要。Moonshot AI 报告称,来源基准之间错误分布的两两加权 Jaccard 重叠度均值为 0.20。这支持了其观点,即任何一小组基准都无法全面覆盖感知能力。
然而,低重叠度并不能自动证明最终分类体系是完整的。所选来源基准、标注规则和受测模型都会影响呈现出的错误类型。新的交互界面、视频任务、科学图像和不常见语言可能会揭示更多类别。
第二个局限涉及数据污染。从现有公开基准中抽取的问题可能已经出现在模型的训练数据中。PerceptionBench 专注于失败案例,这降低了记忆题目即可确保成功的可能性,但并未消除数据污染。
模型可能会认出一道熟悉的问题,却仍然给出不一致的回答。反过来,不熟悉的格式也可能压低模型表现,但这并不代表模型存在普遍的感知缺陷。采用私有或持续更新的测试集,将增强未来比较的可信度。
第三个问题是基准的归属。Moonshot AI 既开发 Kimi 模型,也制定这项评估。其自有的 Kimi-K3 在已发布结果中排名第二,仅比第一名低 1.2 个百分点。
这并不会使该基准失效,也不意味着存在操纵。它只是形成了一种常见的利益冲突,任何模型供应商发布比较评估时都会面临这一问题。外部研究人员应复现提示词、评分规则和模型设置。
第四个局限是答案格式。简答题可以减少评审歧义,但精确匹配评分可能会惩罚无关紧要的表达差异。当所要求的事实相同时,“八个人”这样的回答应当与“8”获得相同分数。
Moonshot AI 表示,这些样本都有唯一且可验证的答案。但发布页面并未完整说明规范化方式、评审处理、拒答评分或容差规则。当模型生成冗长回答时,这些选择可能会影响分数。
图像分辨率和预处理也值得关注。OCR、定位和细粒度识别取决于每个模型实际收到的像素。不同提供商采用不同的图像缩放、分块、压缩和标记化系统。
公平比较必须控制上传的文件,同时记录提供商不可避免的转换过程。如果缺少这些细节,测得的部分差异可能反映的是 API 处理方式,而非底层模型本身。
版本稳定性带来了另一项挑战。托管模型可能会在公开名称不变的情况下发生变化,基准结果也可能很快过时。可复现的排行榜需要提供评估日期、准确的模型标识符以及保存下来的输出。
所列模型的设计目标和部署设置也各不相同。有些强调速度,有些强调推理深度,还有些强调开放部署。单一请求配置可能无法代表每个系统所支持的最佳视觉模式。
可重复性主张尤其需要谨慎对待。Moonshot AI 表示,许多正确答案在再次提问时会发生变化,但发布页面的可见摘要并未提供总体一致性百分比。读者无法仅凭摘要比较不同模型的不稳定程度。
独立评估者应在确定性和随机性设置下,对每个样本重复运行多次。他们还应公布正确答案和错误答案各自的一致率。这将揭示模型究竟是稳定地出错、随机波动,还是对解码方式敏感。
人类基线可以补充背景信息。原子化问题看似简单,但微小物体、压缩图表和模糊边界也会给人类带来挑战。经验证的人类得分可以说明,有多少难度来自图像本身。
现实世界验证仍然属于另一个层面。PerceptionBench 不衡量延迟、成本、隐私、工具使用或错误恢复能力。它也无法说明智能体能否缩放、裁剪、请求澄清或使用专门的 OCR。
这些能力可以在不改变单次视觉准确率的情况下减少实际运行中的失败。智能体可能会察觉不确定性,并再次检查某个区域。这种行为值得评估,但不应与首次尝试时正确感知图像混为一谈。
正确的结论应比“多模态模型看不见”更为克制。当前系统能够完成许多视觉任务,有时甚至表现出色。PerceptionBench 表明,在经过精心隔离的失败案例中,它们的成功仍然不均衡且不可靠。
它还表明,总分无法告诉买家,他们的应用中会出现哪些视觉错误。即使每项排行榜结果尚未得到独立确认,这仍然是该基准最站得住脚的贡献。
视觉感知错误会转化为产品故障
当 AI 系统能够依据自身解读采取行动时,一个像素级事实的遗漏就会产生商业影响。
多模态模型正在从聊天窗口走向能够操作软件、审查文件和协调工作流的智能体。这一转变提高了视觉错误的代价。错误答案的影响不再止于屏幕上的文字。
浏览器智能体必须感知已选中的控件、错误消息、日期、数量和页面状态。如果它将未勾选的复选框误认为已勾选,其规划过程可能在内部仍然逻辑自洽,但操作却会失败。
定位错误与界面操作尤其相关。PerceptionBench 已发布结果中,定位类别的最高成绩达到 76.7%。即使是该类别的领先者,也答错了基准精心筛选的定位问题中的近四分之一。
将这一比例直接换算成浏览器操作失败率会产生误导。界面不同于基准图像,而且智能体可以使用结构化页面数据。尽管如此,这一结果仍表明,定位是产品团队应当直接测试的一项能力。
文档智能体面临另一组风险。OCR 错误可能会改变账号、日期、总额或标签。上下文整合错误可能会把某个数值关联到错误的行、图表或注释。
随后,模型可能会围绕这个错误数值撰写一份精致的摘要。由于叙述看起来前后一致,审阅者可能会忽略该错误。因此,在评估摘要质量之前,必须先验证视觉信息。
计数错误在合成谜题之外同样重要。库存审查、检查图像和研究图表通常需要精确数量。当最初的计数错误时,语言流畅性无法弥补这一缺陷。
虚构物体会带来另一种风险。助手可能会报告一个并不存在的签名,描述一个并未激活的指示灯,或根据上下文推断出一个警告符号。这些都属于未能尊重缺失证据的错误。
产品团队应采用针对具体任务的评估,而不是将 PerceptionBench 的总分直接作为采购标准。他们可以先将每种工作流映射到该基准的原子化类别。
表单处理系统可以优先关注 OCR、定位、属性和上下文整合。视觉购物智能体可以重点关注比较、细粒度识别和幻觉。界面智能体则需要定位、关系、OCR 和状态识别能力。
团队还应测试可重复性。在记录明确的设置下,应多次提交相同的图像和提示词。稳定的错误答案与不稳定的答案需要采用不同的缓解措施。
稳定错误有时可以通过规则、专用模型或针对性训练来发现。不稳定答案则需要置信度检查、重复采样或独立验证。要求模型给出更长的解释并不能解决任何一种问题。
该基准支持一种分层评估策略。首先测试独立的感知能力,然后使用经过验证的视觉输入测试推理能力,最后测试完整的智能体工作流。这一顺序有助于团队定位真正的错误来源。
它还能防止一种常见的调试错误。当智能体选择了错误的操作时,工程师往往会修改系统提示词或规划器。然而,根本原因可能是遗漏了某个图标或错误读取了标签。
人工监督必须关注证据,而不只是文字说明。审查界面应显示源图像、突出显示相关区域并呈现不确定性。如果视觉依据仍处于隐藏状态,审查者就无法高效验证某项主张。
知识工作者也可以在个人工作流中采取同样谨慎的做法。将源文档与生成的笔记存放在一起,保留引用,并在重复使用前核查从图像中提取的事实。可搜索的个人知识库有助于维持主张与证据之间的联系。
开发者还需要能够感知失败的用户体验。模型应该能够说明文本无法辨认或对象边界不清晰。产品应让澄清的成本低于自信猜测的成本。
PerceptionBench 并未提供这些产品机制。它提供了一套词汇,用于识别哪些地方需要这些机制。即使团队从未采用完整数据集,这套词汇也能改进评估计划。
其竞争层面的影响非常直接。模型提供商将面临压力,需要公布分类级别的视觉能力画像、可重复性指标和不确定性行为。对于智能体部署而言,单一的多模态评分已越来越不够用。
企业买家也应向供应商索取同样的证据。他们应该询问测试了哪些视觉任务、图像是否不可或缺,以及多次试验中答案发生变化的频率。他们还应该使用类似生产数据的私有样例进行测试。
PerceptionBench 让这些问题更难被回避。它将视觉可靠性定义为一套可衡量的能力体系,而不是与网页搜索或文件上传并列的一项二元功能。
三个信号将决定 PerceptionBench 是否真正重要
这项基准测试的长期价值将取决于复现情况、模型提供商的响应,以及 Moonshot AI 自身研究之外的采用程度。
第一个信号是独立复现。研究人员需要能够获取数据集、评估代码、提示词、评分逻辑和模型输出。他们应该测试已公布的排名能否在受控复跑中保持稳定。
即使具体分数发生变化,复现也可能强化 Moonshot AI 的核心主张。持续存在的子类别差距将证实,综合排行榜名次掩盖了不同的感知弱点。相反,大幅的排名变化则会暴露评估设置的敏感性。
最重要的复现结果是可重复性。外部团队应公布在多次完全相同的试验中,正确答案能够保持正确的频率。他们还应区分确定性解码与普通托管模型设置下的结果。
如果在受控条件下不稳定性仍然很高,那么“模型是在猜测,而不是真正看见”的解释将得到支持。如果经过标准化后答案变得稳定,Moonshot AI 的论述则需要修正。
第二个信号是模型提供商如何响应。OpenAI、Google、Anthropic、Alibaba、ByteDance、Zhipu AI、MiniMax 和 Moonshot AI 可以公布针对这 10 个类别的定向改进。
类别层面的提升比总体排名的小幅变化更重要。如果一个模型在不牺牲 OCR 或定位能力的情况下提升了抵抗幻觉的能力,就回应了这项基准测试的核心权衡。总体分数更高但不稳定性没有变化,则没有做到这一点。
提供商还可能加入经过校准的拒答机制或视觉自检功能。这些功能承认,可靠的感知也包括识别不确定性。智能体框架可以放大、裁剪、比较多次观察结果,或请求人工确认。
这类工具会使基准测试的设计更加复杂,因为它们超越了一次性感知。但它们对产品仍然很重要。实际目标并不是赢得一项静态测试,而是防止视觉不确定性转化为错误操作。
第三个信号是外部采用情况。PerceptionBench 必须对 Moonshot AI 之外的研究人员和应用团队有用。这需要透明的许可协议、稳定持久的托管、可复现的评估和定期更新。
静态公开数据集最终可能成为训练目标。持续维护的基准测试应加入新的私有样本,并报告数据污染控制措施。随着新的多模态界面出现,它还应扩大覆盖范围。
外部采用会体现在独立排行榜、技术报告、模型卡和企业测试框架中。更重要的是,团队将开始报告分类级别的可靠性,而不是一个笼统的视觉评分。
如果这种情况发生,Moonshot AI PerceptionBench 视觉感知基准测试将影响多模态模型的评估方式。它的价值将来自改变买家和开发者提出的问题,而不是维持某一次排名。
眼下的启示已经可以付诸行动。不要想当然地认为,流畅的视觉推理始于准确的视觉证据。测试工作流所依赖的具体感知能力,重复进行测试,并检查结果之间的分歧。
对于开发者,下一步是根据真实失败案例构建一个小型评估集。尽可能将计数、OCR、定位、比较和缺失检测分别测试。同时记录准确性和一致性。
对于企业买家,应要求供应商提供与你的图像和失败成本直接相关的证据。在学术基准测试中领先的模型,对于特定文档或界面工作流而言,仍可能是错误的选择。
对于普通用户,在从图像中提取的事实进入报告、数据库或自动化操作之前,应进行核实。自信的解释仍然只是生成的回答,并不能证明每个视觉细节都已被准确感知。
PerceptionBench 将这种谨慎态度转化为一项具体的研究议程。接下来的问题是,模型开发者会改进忠实的视觉对齐能力,还是仅仅优化另一个排行榜分数。


