CausalVLBench 将视觉 AI 推向识别之外,并揭示推理鸿沟
- Ethan Carter

- 8月3日
- 讀畢需時 14 分鐘
CausalVLBench 在三项因果任务中测试了八个视觉语言模型系列,其核心发现对当前机器学习的发展方向提出了挑战。能够识别物体并回答视觉问题的模型,在被问及场景由何而起、发生了什么变化,或在另一种条件下会发生什么时,仍可能表现失准。
该基准测试由阿肯色大学研究人员 Aneesh Komanduri、Karuna Bhaila 和 Xintao Wu 提出。他们的研究在早期预印本发布后,于 EMNLP 2025 发表。该研究在三个受控视觉数据集上评估了因果结构推断、干预目标预测和反事实预测。
这一区别至关重要,因为视觉识别并不等于因果理解。模型或许能识别灯、摆锤和阴影,却未必知道哪个变量控制另一个变量。CausalVLBench 将这种缺口转化为模式识别与机制推理之间可量化的较量。
CausalVLBench 测试视觉因果推理的三个层次
该基准要求模型从描述可见状态,迈向识别产生这些状态的机制。
研究人员围绕三项任务构建了 CausalVLBench。每项任务都以不同方式检验模型能否超越表层相关性进行推理。
第一项任务是因果结构推断。模型会接收图像以及有关变量间直接因果关系的问题。它必须判断改变一个变量是否会直接改变另一个变量。
其中一个示例涉及摆锤、光源和阴影。模型可能需要判断摆锤角度是否直接影响阴影长度。它必须区分直接效应与仅仅同时出现的关系。
论文包含该任务的标准版和交错版。标准版使用一张图像,并询问底层因果图相关问题。因果图将变量表示为节点,将因果关系表示为有向连接。
交错版引入成对的视觉状态。模型必须利用这些状态之间的差异来恢复底层结构。该设定检验多次观察是否能改善推理,还是只会增加视觉复杂性。
第二项任务是干预目标预测。干预会刻意改变一个变量,其余系统则随之响应。模型必须识别被操纵的是哪个变量。
以包含多个相连元素的水流系统为例。模型可能观察到两个状态,并识别出哪个阀门、容器或流量变量最先发生了变化。识别每个组件并不能保证答对。
第三项任务是反事实预测。模型先看到实际状态,随后接收一项假设性变化。它必须预测每个相关变量的结果值。
反事实问题询问的是:在一个未曾发生的条件下,本会发生什么。这不同于普通预测,因为模型必须在改变一个前提的同时,保留系统的因果规则。
这三项任务大致从因果映射逐步走向干预与反事实推理。这一递进遵循因果推断中熟悉的层级。仅凭观察无法回答干预或反事实所能处理的所有问题。
CausalVLBench 使用经过调整的 Pendulum、Water Flow 和 Causal Circuit 数据集来评估这些任务。基准测试论文将三者都描述为由明确因果变量控制的受控系统。
Pendulum 数据集连接了光源位置、摆锤角度、阴影位置和阴影长度等属性。Water Flow 数据集则呈现模拟流体系统中的因果关系。
Causal Circuit 描绘了机械臂与彩色灯光互动的情景。三组数据集在提供不同视觉外观的同时,仍保留了已知的真实机制。
这种受控设计很重要。对自然照片作出的因果主张通常仍存在歧义,因为研究人员无法观测到所有隐藏因素。合成系统则提供了已知答案,可用于评估模型预测。
该基准对生成答案采用精确匹配准确率。对于因果图,它还报告结构汉明距离,即将预测图转换为正确图所需的改动次数。
研究人员对大多数评估取三个随机种子的平均结果。由于速率限制,Gemini 2.0 Flash 仅评估了一次;在将其结果与开放模型比较时,这一限定条件不容忽视。
因此,CausalVLBench 不只是增加了一些困难的视觉问题。它定义了一种结构化评估,其中感知、因果推断和回答格式必须共同发挥作用。
机器学习的发展方向如今已超越物体识别
因果推理正成为部署要求,因为视觉智能体越来越需要预测后果,而不只是为场景贴标签。
视觉语言模型在图像描述、文档分析、视觉问答和物体识别方面已有进步。这些能力支撑了实用的助手,但并不能证明模型理解因果关系。
仓储模型可以识别掉落的包裹。具备因果能力的系统则应能区分,该结果究竟由不稳定堆叠、碰撞还是支撑失效造成。
制造助手可以识别有缺陷的组件。更强的系统应当能够推理出哪种上游条件造成了缺陷,以及另一项干预将如何改变生产过程。
机器人技术进一步提高了风险。具身智能体必须预判某项行动改变环境后会发生什么。它不能完全依赖于与此前观察场景的视觉相似性。
这正是 CausalVLBench 对构建多模态智能体的开发者施加压力的原因。该基准区分了能够描述世界的系统,以及能够推理如何改变世界的系统。
作者评估了 LLaVA-OneVision、Qwen-VL-Chat、Qwen2.5-VL-Instruct、IDEFICS2、DeepSeek-VL2、OpenFlamingo、Otter-Llama 和 Gemini 2.0 Flash。模型规模涵盖多个参数量级。
大多数测试模型均为开源模型。研究人员表示,这一选择有助于支持透明性和可复现性。Gemini 被用作专有模型的参考点,不过其仅运行一次的评估限制了强有力的比较。
模型名单也使论文比单一系统的失败报告更具启发性。较弱的结果不能只归因于某一种架构或训练方案。
相反,研究结果指向一种更广泛的不匹配。当前视觉语言训练奖励视觉对齐、识别、描述文本生成和指令遵循。形式化因果推理则需要另一种内部结构。
模型可以通过将熟悉的视觉模式与可能的文本关联起来回答问题。因果任务要求它分离变量、推断有向关系,并通过这些关系传播一项假设性变化。
这一过程会产生多个失效点。视觉编码器可能遗漏相关细节。语言模型可能推断出错误关系。生成的答案也可能不符合要求的格式。
精确匹配评估将这些错误合并计算。这使基准测试颇具挑战性,但也带来了解读难题:错误答案并不总能揭示究竟是哪个组件失效。
尽管如此,该基准仍构成了一项有用的压力测试。产品团队经常用结合识别、知识和语言流畅度的综合分数来评估多模态系统。
这类分数可能掩盖较弱的因果能力。模型即使无法推断视觉状态为何发生,也可能因识别物体或检索熟悉事实而表现良好。
这种差异在高后果环境中变得至关重要。医疗影像、工业检测、自主系统和科学分析都涉及无法被安全简化为视觉共现的关系。
CausalVLBench 并未表明现有模型已准备好用于这些场景。它表明研究人员如今拥有了更清晰的方法,来测试其中一项前提条件。
该基准也将机器学习的发展方向,从更大的图文数据集转向结构化监督。更多示例可以提升识别能力,却未必能教会模型干预如何改变一个系统。
因此,评估视觉智能体的团队应提出一个更聚焦的问题:当图像、提示词或假设性干预发生变化时,模型是否仍能保留正确的因果关系?
这个问题比模型能否生成看似合理的解释更难。看似可信的语言可能掩盖错误的因果图。
更多示例往往未能带来更好的推理
CausalVLBench 的核心反转在于,尽管上下文学习被视为通用推理助力,额外示例却经常未能带来帮助。
上下文学习会在提示词中向模型提供已解答的示例。模型的权重不会更新,但它可以利用这些示例推断预期任务和回答模式。
这种方法在许多语言任务中效果良好。它可以澄清标签、确立输出格式,并展示预期的推理类型。
CausalVLBench 测试了零样本和少样本设置,以观察视觉示例是否能带来同样的好处。论文报告称,提升通常很有限,有时甚至为负。
对大多数开源模型而言,随着示例数量增加,性能反而下降。这一结果挑战了“更长的提示词自然会提供更多有用推理上下文”的假设。
Qwen2.5-VL-Instruct 是一个重要例外。该大型模型在反事实预测中随示例增加而改善,不过这一模式并未在所有基准任务中持续出现。
Gemini 2.0 Flash 在反事实任务上也呈现上升趋势。不过,研究人员仅评估了 Gemini 一次,因此该结果缺乏其他评估中采用的多随机种子平均。
这种不均衡的结果表明,示例会带来相互竞争的要求。模型必须解析多张图像,将每张图像与其答案绑定,推断机制,并将该机制迁移到新问题中。
额外示例增加了可用证据,也增加了上下文长度、视觉密度,以及在不同示例之间混淆变量的风险。
这解释了为何少样本提示可能有助于格式,却无法修正因果推理。模型可以模仿回答模式,同时仍依赖于对系统错误的内部理解。
研究人员还测试了示例选择。平衡示例旨在提供更好的覆盖范围,而非呈现任意收集的一组案例。
选择有时会改变性能,但并未消除更广泛的弱点。因此,该基准质疑仅靠提示工程能否补足缺失的因果机制。
团队还单独检验了省略因果关系的提示词。移除这些信息有助于判断模型是通过视觉推断关系,还是复述文本中提供的结构。
这种消融实验是该基准价值的核心。若提示词已经说明了回答所需的因果图,系统就不应因视觉因果推理而获得认可。
该论文还评估了零样本思维链提示。思维链要求模型在给出最终答案前生成中间推理过程。
这种方法并未形成通用解决方案。冗长的推理可以暴露模型的过程,但额外文本并不能保证其底层因果表征是正确的。
模型可以围绕一个错误前提写出连贯的推理序列。当因果图中最先推断出的边是错误的,后续推理仍可能保持流畅,同时不断传播这一错误。
这些发现让基于提示的优化面临压力。开发者常通过优化指令、加入示例或要求明确推理来提升基准测试结果。
CausalVLBench 表明,视觉因果任务可能会抵抗这些方法。缺失的关键要素或许存在于模型训练或架构中,而非提示词本身。
这一结论的范围仍比“上下文学习无效”更窄。该基准涵盖三个合成数据集及一组明确界定的任务。
但它确实表明,团队不能假定视觉因果推理会随着示例增多而自动涌现。这一假设如今需要任务特定的证据支持。
开放仓库提供了数据生成、推理和评估代码,进一步强化了这一挑战。研究人员可以在可比条件下测试更新的模型。
可复现性在此尤为重要,因为提示词敏感性可能造成误导性的胜利。共享实现使区分稳定改进与有利提示配置变得更容易。
模式识别与因果机制仍是主要对手
该基准真正的较量并非一个模型对抗另一个模型,而是视觉模式匹配与显式因果表征之间的竞争。
现代视觉语言模型通常将视觉编码器与语言模型连接起来。编码器将图像转换为表征,而对齐层使这些表征能够在文本生成过程中发挥作用。
这种架构支持强大的识别与问答能力。然而,其训练目标未必要求模型形成关于变量如何相互影响的稳定模型。
模型可以学到长阴影通常伴随特定光源位置。它仍可能无法判断光源位置是否会直接改变阴影长度。
因果推理要求方向性。相关性只表明变量共同变化,而因果关系则识别出哪一种变化产生了另一种变化。
它还要求模块性。如果对某个变量进行干预,模型应更新下游影响,同时保留无关机制不变。
反事实推理增加了另一项要求。系统必须保留已观察到的世界,修改一个特定前提,并计算出连贯的替代结果。
这些操作更接近结构化执行,而非普通的相似性匹配。它们要求模型在多张图像和多个提示之间维持变量身份与有向依赖关系。
早期以语言为中心的基准测试发现了类似弱点。CausalBench 研究评估了 19 个语言模型,并报告它们在更大型因果网络和特定图结构上存在困难。
CausalVLBench 将这一担忧延伸至多模态系统。图像引入了高维信号,必须先将其转换为正确的因果变量。
这带来了绑定问题。模型必须识别出某个视觉属性在多个状态中对应同一变量,即使它的外观发生变化。
随后,它还必须区分干预与普通变化。两张图像可能不同,但并非每一种差异都能识别出被刻意改变的变量。
该基准的合成环境减少了歧义,但当前系统仍然举步维艰。真实场景还会增加遮挡、测量噪声、隐藏原因以及不确定的对象边界。
这一差距解释了为何强劲的基准表现并不能自动证明真实世界中的可靠性。它代表的是受控推理方面的进展,而非完整的因果理解。
不过,受控测试的价值恰恰在于它们排除了许多借口。当因果变量和机制已知时,失败更容易被比较。
后续研究方向已将提示视为不足。2026 年 6 月的 BridgeVLM 论文提出将归纳出的因果图转换为内部因果 token。
这些 token 由语言模型解码器内的专用层处理。该方法旨在让因果结构成为模型执行的一部分,而非仅停留在文本指令中。
BridgeVLM 的作者报告称,其在 CausalVLBench 上的干预准确率为 54.4%,而提示层监督为 33.2%。他们还报告因果结构 F1 从 33.4% 提升至 75.1%。
这些数据是作者在 2026 年预印本中报告的结果。它们提供了一个颇具前景的后续方向,但仍有必要进行独立复现,并在更多架构间加以比较。
更大的要点在于架构。如果因果信息只出现在提示中,模型可以将其视为更多文本。内部机制能够约束因果信号如何在生成过程中传播。
这并不意味着每个视觉语言模型都需要专门的因果模块。训练目标、中间表征、外部工具或神经符号方法都可能提供其他路径。
该基准为比较这些路径建立了共同目标。成功应意味着在结构推断、干预识别和反事实预测上持续取得提升。
仅在一项任务上取得改进,则意味着能力范围更窄。系统可能更擅长读取图结构,却未能提升假设性预测能力。
这正是该基准三部分设计的重要性所在。当模型的改进并不均衡时,它使单一的总体性主张更难成立。
对开发者而言,实际教训很直接。流畅的解释不应被视为视觉智能体已经推断出正确机制的证据。
作出重要建议的系统需要在正确因果结构已知的情况下接受测试。它们还需要能够区分感知、推理和输出失败的错误分析。
管理技术实验的团队可以将提示词、观察结果和基准结果保存在可搜索知识库中。这些记录有助于揭示性能提升能否经受模型和提示词变更的考验。
CausalVLBench 尚未证明什么
CausalVLBench 揭示了一个真实弱点,但其受控设计无法证明模型在开放式物理环境中会如何表现。
第一个局限与合成数据有关。摆锤、水系统和因果电路提供了已知机制,但它们仅代表视觉现实中的一小部分。
自然场景包含隐藏变量。一个可见结果可能有多个合理原因,而图像未必包含区分它们所需的证据。
该基准避免了大部分这种歧义。这有利于进行清晰测量,但也限制了对实际部署的直接结论。
第二个局限与模型覆盖范围有关。论文评估了若干重要开源模型和一个专有参考模型,但该领域变化迅速。
新的多模态推理模型可能采用不同的训练数据、工具调用、更长上下文或内部推理过程。它们的表现需要重新评估,而不能从旧系统中推断得出。
让该论文重新受到关注的 Reddit 帖子本身并未提供新的实验证据。其背后的事件,是一个已确立的 EMNLP 2025 基准重新获得关注。
这一时间点很重要,因为后续研究如今已将 CausalVLBench 用作评估目标。随着研究人员提出专为视觉因果性设计的机制,该基准正变得更加相关。
第三个局限来自精确匹配评分。严格答案简化了比较,但也可能将格式错误与真正的推理失败一并惩罚。
论文通过结构汉明距离部分处理了因果图质量问题。不过,完整的诊断应识别每次失败从何处开始。
模型是否误读了图像?是否绑定了错误变量?是否推断出错误的边?是否错误地计算了反事实?
若缺少这种分解,两个系统可能因不同原因获得相同分数。一个可能感知正确但推理不佳,另一个则在视觉提取阶段失败。
第四个问题是可能存在基准污染。公开数据集、提示词和论文可能在发布后进入未来训练语料库。
在基准样例上训练过的模型可能有所提升,却并未获得通用因果能力。研究人员将需要保留机制和新生成系统来测试迁移能力。
第五个问题涉及规模。论文观察到,部分更大模型表现更强,尤其是在特定反事实设置中。
然而,仅凭参数数量无法确定原因。更大模型在训练数据、视觉编码器、对齐方法和指令微调方面也存在差异。
现在就得出规模会自动解决视觉因果性问题的结论还为时过早。该基准反而表明,在测试条件下,较小的开源模型更持续地陷入困境。
该评估也未在相同信息和评分规则下比较模型与人类。人类基线将有助于区分任务本身极其困难与模型特有弱点。
同样,该基准不能证明正确答案反映了类似人类的因果模型。系统可能利用合成场景中的规律,而没有学到可迁移的机制。
这些不确定性并不会削弱对该基准的需求。它们界定了该基准的恰当用途。
CausalVLBench 应作为更广泛评估计划中的受控测试,而不应成为自主运行的认证标签。
产品团队应将其与分布变化、未见机制、对抗样例和领域特定安全测试结合使用。他们还应检查校准情况,即置信度是否与正确性相符。
有用的视觉智能体必须知道何时证据不足。基于不完整图像作出的自信因果主张,可能比明确拒绝带来更大风险。
因此,该基准开启了一条评估路径,而非终结这个问题。它最重要的成果,是暴露了一个未来系统必须透明解决的可测量差距。
三个信号将表明视觉因果推理是否正在进步
当性能提升能够经受复现、迁移至未见机制,并体现在真实智能体行为中时,进展才会变得可信。
第一个信号是架构层面提升的独立复现。BridgeVLM 报告了显著改进,但其他团队必须使用共享协议和多个随机种子测试这些结果。
复现应涵盖 CausalVLBench 的全部三项任务。若增益仅限于一个数据集或一种提示配置,就会削弱有关通用视觉因果推理的主张。
第二个信号是在未见因果系统上的表现。研究人员应在一组机制上训练或调优,然后在新生成的环境中进行评估。
学会因果抽象的模型,应比记住对象组合的模型有更好的迁移能力。这项测试也将减少公众对公开基准污染的担忧。
第三个信号是以部署为导向的评估。机器人、工业检测和科学助手需要能够衡量错误干预后果的测试。
研究人员不应只报告答案准确率,还应跟踪校准情况、错误严重程度、纠正后的恢复能力,以及视觉证据不完整时的表现。
开放的评估基础设施将有所帮助。CausalVLBench 已提供代码和数据集生成步骤,使创建可控扩展成为可能。
未来的排行榜应保留任务层面的结果,而不是将所有内容压缩为单一分数。结构推断、干预检测和反事实预测代表着不同的能力。
它们还应公布提示词模板和解码设置。当图像顺序、响应格式或示例选择发生变化时,多模态结果可能随之改变。
下一代基准测试应引入更大的因果图、隐藏变量、带噪观测以及新颖机制。每项新增内容都应保留足够的可控性,以支持可信的真实标签。
开发者应关注通用模型是否能在没有针对基准进行特定修改的情况下取得进步。这类提升将表明,更广泛的多模态训练正在产生可迁移的因果表征。
他们也应关注专用架构。如果内部因果模块持续优于仅依赖提示词的方法,模型设计将成为未来发展的核心路径。
CausalVLBench 已经将机器学习的视野推进到“模型是否能看懂和表达”之外。更严苛的考验在于,它是否理解什么会改变什么。
对于任何评估视觉 AI 系统的人而言,下一步很务实:测试干预,而不只是描述。让模型预测后果,然后改变场景并验证其回答。跨模型更新、提示词和领域追踪这些失败案例。这些证据将揭示,新版本究竟学会了一种机制,还是仅仅给出了更好的解释。


