top of page

ERNIE-4.5-VL:百度“思考”MoE模型分析

已更新:6月17日

ERNIE-4.5-VL: An Analysis of Baidu's 'Thinking' MoE Model

在构建更强大 AI 的竞赛中,模型对资源的渴求已众所周知。参数量越大,性能通常越好——但代价是高昂的计算能力需求和较低的可访问性。Baidu 最近发布的 ERNIE-4.5-VL,带着一个极具吸引力的主张进入了这一领域:如果你能在仅使用一小部分资源的情况下获得旗舰级性能,会怎样?这个模型不仅仅是一个增量更新;它直接挑战了“越大越好”的观念,其核心在于专为效率而构建的架构,以及一种被称为“以图促思”(Thinking with Images)的独特能力。

这不仅仅是又一个模型的发布。它代表了对一种特定架构的战略性押注——Mixture of Experts (MoE)——旨在解决困扰许多大规模 AI 项目的部署瓶颈。虽然它拥有总计 280 亿个参数,但其巧妙的设计意味着对于任何给定任务,它仅激活约 30 亿个参数。这种极高的效率使其运行速度更快、成本更低,为以前不切实际的现实应用打开了大门。但真正的热点在于它主动审视图像的能力,这种技能使其超越了简单的识别,进入了真正推理的领域。

解构 ERNIE-4.5-VL 架构

Deconstructing the ERNIE-4.5-VL Architecture

ERNIE-4.5-VL 的核心是一个多模态 AI 模型,专为复杂的视觉语言理解而设计。其性能取决于混合专家 (MoE) 结构。该模型并非采用所有 280 亿参数都参与每个查询的单一整体网络,而是由多个专门的“专家”模块组成。当面临任务时,门控机制会智能地将输入路由到最相关的专家。这意味着每个 token 仅激活总参数的一小部分(约 30 亿)。其结果是与同等规模的传统模型相比,计算开销减少了 50%,从而使推理速度提高了两到三倍。

训练室内部:GSPO 与 IcePop 强化学习

Baidu 不仅仅依赖于高效的架构。该模型的推理能力通过先进的训练技术得到了磨炼。文档指出集成了 GSPO 和 IcePop,这是两种尖端的强化学习策略。这些方法与动态难度采样相结合,本质上创建了一个训练课程,在具有可验证结果的任务上不断挑战模型。通过在关键的中期训练阶段专注于优质的视觉语言推理数据集,Baidu深化了模型所见内容与其用于描述和分析的语言之间的语义对齐。这种在“可验证任务”上的强化学习,是其在科学问题求解等答案可被客观证明的领域中展现强大实力的关键。

ERNIE-4.5-VL 的核心能力

该模型的先进训练体现在几项关键技能中。它展示了强大的视觉推理能力,能够对复杂场景进行多步分析,从解读统计图表到识别图像中的因果关系。它在 STEM 任务 上的表现尤为出色。例如,它可以查看物理电路图,正确运用欧姆定律(Ohm's Law)和基尔霍夫电流定律(Kirchhoff's Current Law),列出必要的方程并推导出正确答案。这远远超出了简单的物体标注。

它还支持精确的视觉定位(visual grounding),使其能够以坐标级的精度检测物体。你可以给它一个复杂的指令,比如“识别所有穿西装的人并以 JSON 格式输出他们的边界框坐标”,这使其在 工业自动化 或机器人领域具有即时实用性。这种能力还扩展到了视频理解,它可以提取屏幕字幕并将其映射到时间戳,从而实现可搜索的视频存档。

争议与社区疑问:ERNIE-4.5-VL 是否在“用图像思考”?

Controversy & Community Questions: Is ERNIE-4.5-VL "Thinking with Images"?

最引人注目的特性,也是引发最多讨论的一点,正是 百度称之为“以图促思”(Thinking with Images)。该系统允许模型动态缩放图像的局部,以检查细粒度的细节。如果遇到模糊的文本部分或微小、模糊的对象,它可以触发图像缩放工具,分析新清晰化的细节,并将该发现整合到最终答案中。营销文案将其描述为模仿人类的视觉探索过程。

然而,技术社区正在进行更深入的挖掘。正如在在线讨论中所见,主流理论认为这并不是某种全新的、神奇的原生模型技能。相反,它很可能是一种“代理特性(agentic feature)”。这表明 ERNIE-4.5-VL 模型与外部工具(如用于图像裁剪和调整大小的 Python 脚本)配对。模型本身学习何时调用这些工具。当面临歧义时,其强化学习训练会发挥作用,促使其对特定区域执行“缩放”命令,然后重新处理新的、更高分辨率的裁剪图。这是一个智能的多步工作流——更像是针对图像块的上下文内 RAG,而不是视觉模型本身的根本性改变。正如一位评论者所说,“我们终于拥有了‘缩放并增强’功能!”

这场讨论还提出了一个关于性能的关键问题。如果模型通过这些缩放和裁剪循环多次分析一张图像,推理时间是否会根据图像的复杂程度而增加?在进行更广泛、独立的测试之前,这仍然是一个悬而未决的问题。社区正热切期待该模型的 GGUF 版本,以便在本地硬件上运行并亲自测试这些边界。

对更清晰基准测试的需求

另一个争论点是缺乏详细的基准测试。虽然 Baidu 声称 ERNIE-4.5-VL 与 Qwen-2.5-VL 等旗舰模型 相比具有竞争力甚至更胜一筹,但模型卡中提供的图表非常简略。这让用户希望获得更多信息。在标准化基准测试上进行直接的正面比较,对于开发者和企业做出明智决策至关重要。社区正在将其与其他模型的使用体验进行对比,并指出某些纯文本版 ERNIE 变体与 Qwen 并驾齐驱,但速度更快,且不易陷入“思考循环”。需要更清晰的数据来验证 ERNIE-4.5-VL 在使用显著更少的激活参数的情况下,是否真的达到了其 性能声明 的水平。

展望:ERNIE-4.5-VL 的部署与实用性

Outlook: Deployment and the Practicality of the ERNIE-4.5-VL

也许 ERNIE-4.5-VL 最显著的方面是其易用性。它授权于 Apache 2.0,它允许不受限制的商业使用,消除了企业采用的主要障碍。它已在 Hugging Face 等平台上架,随时可以集成。

Baidu 还通过提供强大的量化支持优先考虑了灵活部署。量化是降低模型权重精度的过程,这可以缩小模型体积并加快推理速度,且通常精度损失极小。ERNIE-4.5-VL 支持多个级别:

  • 全精度 (FP16): 需要约 56GB 显存。

  • 4-bit 量化: 将显存需求降低至更易于管理的 ~14GB。

  • 2-bit 量化:进一步突破了界限,仅需约 7GB 显存。

这种激进的量化意味着该模型可以在更广泛的硬件上运行,从企业级服务器到高端消费级 GPU。支持多种推理框架如 Transformers、vLLM,而 FastDeploy 进一步简化了与现有流水线的集成。该模型显然针对数据锁定在视觉格式中的企业级用例:工程图纸、工厂视频流、医学扫描或物流仪表板。其执行详细分析和定位的能力使其适用于工厂车间质量检测, 医学影像解读,以及自动驾驶场景分析。

ERNIE-4.5-VL 的真正差异化优势不仅在于单一功能,而是在于其高效的 MoE 架构与主动工具使用能力的结合。这是一种务实的方法。通过仅激活 10% 的参数,它使接近旗舰级的性能在资源受限的环境中变得切实可行。“以图促思”(Thinking with Images)功能,即便它是一种智能体工作流,也从根本上改变了交互模式。它将 AI 从被动的感知者(“这是什么?”)转变为主动的问题解决者(“这里出了什么问题,让我仔细看看”)。这为真正的自主智能体 能够识别问题、放大细节、在需要时搜索外部上下文,并最终建议采取行动。

常见问题解答 (FAQ)

1. ERNIE-4.5-VL 中的混合专家 (MoE) 架构是什么?

ERNIE-4.5-VL 中的 MoE 架构使用了一个由被称为“专家”的专门子网络组成的系统。路由机制不会为每个任务激活全部 280 亿个参数,而是将输入引导至最相关的专家,每次仅激活 30 亿个参数,从而实现更高的效率。

2. “Thinking with Images” 功能是如何工作的?

社区分析表明,“Thinking with Images” 是一种模型使用外部工具的智能体 (agentic) 功能。当遇到不清晰的细节时,模型可能会触发图像工具来裁剪或放大特定区域,然后重新分析高分辨率片段以提高理解能力。

3. 运行 ERNIE-4.5-VL 模型对 VRAM 有什么要求?

VRAM 要求随量化程度而变化。在全 FP16 精度下,它需要约 56GB。使用 4-bit 量化时,需求降至约 14GB;使用 2-bit 量化时,它可以在低至约 7GB 的 VRAM 上运行。

4. ERNIE-4.5-VL 与 Qwen 等其他模型相比如何?

Baidu声称其性能与 Qwen-2.5-VL 等模型相当甚至更高,同时使用的激活参数更少。熟悉早期 ERNIE 文本模型的用户注意到,它们通常比同类 Qwen 模型更快速、更稳定,尽管针对 VL 变体的详细独立基准测试仍有待观察。

5. ERNIE-4.5-VL 模型开源吗?

是的,ERNIE-4.5-VL 是在 Apache 2.0 许可证下发布的。该许可证允许不受限制的商业使用,使其可免费用于学术和企业应用。

6. 在该模型的训练背景下,GSPO 和 IcePop 是什么?

GSPO (Generalized Self-Play Optimization) 和 IcePop 是进阶的强化学习技术,Baidu 用于训练 ERNIE-4.5-VL。这些方法通过在可验证的任务上进行训练,使模型的答案可以根据正确性进行客观评分,从而帮助提高模型的视觉推理能力。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page