NVIDIA Alpamayo 2 Super 面向商业开放,但 Robotaxi 安全性仍待检验
- Martin Chen

- 8月6日
- 讀畢需時 15 分鐘
NVIDIA 已发布 Alpamayo 2 Super,这是一款拥有 340 亿参数的驾驶模型;商业开发者从其首次公开发布起即可对其进行修改、微调和再分发。此次 NVIDIA Alpamayo 更新之所以重要,在于它消除了许可障碍,同时将模型能力从视觉理解扩展至推理、规划和行动。
这一组合提高了自动驾驶团队面临的要求。他们现在可以研究大型模型,利用私有车队数据进行适配,并将其行为蒸馏至更小的系统中。不过,可下载的权重和强劲的基准测试结果,并不能证明车辆已经能够在没有驾驶员的情况下搭载乘客。
因此,主要竞争并非 NVIDIA 与某一家 robotaxi 运营商之间的较量,而是 NVIDIA 的开放教师模型策略,与领先自动驾驶项目采用的封闭式垂直整合开发路线之间的竞争。Waymo 及其他运营商围绕专有车队数据、内部仿真、安全流程以及严格控制的部署进行建设。NVIDIA 押注于共享基础模型能够缩短其中一部分路径,但不会取代这些控制机制。
NVIDIA Alpamayo 2 Super 实际带来了哪些改变
此次发布将此前公布的研究平台转变为自动驾驶团队可检查并适配、可用于商业用途的基础能力。
NVIDIA 首次在 2026 年 5 月 31 日的 GTC Taipei 上介绍 Alpamayo 2 Super。当时,该公司表示其推理代码和模型权重将在夏季推出。此次公开发布完成了从发布公告到可下载工件的承诺性过渡。
模型权重采用 Linux Foundation 的 OpenMDW-1.1 许可证。NVIDIA 则以 Apache 2.0 发布相关推理代码。这些条款共同允许商业开发,无需让每家公司在测试模型前都先协商单独的仅限研究例外许可。
这种区别很重要。被称作“开放”的模型,仍可能对商业使用、再分发或衍生产品施加限制。更明确的授权,使 robotaxi 开发商、汽车制造商、供应商或研究实验室能够在已知条款下评估同一基础能力。
340 亿参数总量由一个 320 亿参数的视觉语言骨干网络,以及一个用于驾驶输出的行动组件构成。NVIDIA 早期材料有时会按其 320 亿参数骨干网络来描述该模型。其更新后的发布摘要则将完整系统描述为 340 亿参数。
Alpamayo 2 Super 是一款视觉语言行动模型,即 VLA,它将视觉观察和类似语言的推理连接到预测行动。它可接收多摄像头驾驶环境信息,并生成未来轨迹,而非止步于文字描述。
该系统还会生成因果链路追踪,这是 NVIDIA 对将观察结果与驾驶决策相连的结构化解释的称谓。它可以识别相关对象、解释冲突、选择高层级行动,并预测车辆的移动方式。
这种输出不止于识别行人、交通信号灯或车道标线。该模型旨在表达为何某一对象重要,以及车辆应如何响应。这一定位使 Alpamayo 成为离线教师模型和开发工具,而非简单的感知模型。
NVIDIA 还将输入从以前聚焦前方的摄像头扩展到六摄像头、360 度覆盖。每个摄像头的四个历史帧为模型提供时间上下文。它可以在并线、变道和路口通行时考虑车辆侧方和后方的活动。
其轨迹输出覆盖 6.4 秒,包含 64 个以 0.1 秒为间隔的航点。每个点表示车辆坐标系中预测的位置和朝向。这些输出可用于评估工具、标注工作流或下游规划系统。
元行动增加了另一层能力。模型可以在表达详细路径之前,先给出停车、让行或变道等高层级决策。开发者可以将这一声明意图与最终轨迹和推理追踪进行对比。
因此,眼前的改变远不止参数增加。NVIDIA 发布了一款多输出教师模型,其权重、代码和许可条款均支持商业实验。这会给封闭式开发项目带来压力,但并不会消除它们在运营上的优势。
为什么开放的 Robotaxi 模型会给封闭技术栈带来压力
NVIDIA 正在向缺乏 Waymo 级别数据与基础设施运营能力的团队,提供自动驾驶研究中成本高昂的一层能力。
垂直整合的 robotaxi 公司掌控着几乎所有相关投入。它收集车队数据、标注困难场景、训练专有模型、运行仿真系统、验证发布版本,并管理公共道路上的车辆。这种控制有助于保持一致性,但也需要大量资本和专业人员。
Alpamayo 2 Super 提供了不同的起点。团队可以利用该模型检查场景、提出轨迹、创建推理标签,并监督更小的模型。它不再需要从随机初始化组件或通用视觉模型开始每一项推理实验。
此次发布尤其适合拥有有用驾驶数据、但缺少成熟基础模型的公司。汽车制造商可能拥有来自量产车辆的视频;供应商可能了解特定传感器配置;大学可能拥有强大的评估方法,但训练能力有限。
开放权重让这些组织能够将本地专业知识与共同基础相结合。他们可以针对区域交通模式、不同摄像头布局或内部驾驶策略对模型进行微调。他们也可以检查失败案例,而无需将敏感车队视频发送给封闭的外部 API。
NVIDIA 表示,早期 Alpamayo 模型的下载量已接近 40 万次。该数据衡量的是兴趣,而非生产环境采用情况。但它仍表明,研究人员希望获得介于通用视觉推理系统和完整专有自动驾驶技术栈之间的、面向驾驶的模型。
更广泛的平台增强了这一主张。Alpamayo 与 Physical AI Autonomous Vehicles 数据集、AlpaSim 仿真、AlpaGym 训练,以及 NVIDIA 的 NuRec 重建技术相连接。每个组件都覆盖从记录数据到经测试驾驶策略之间的不同阶段。
开放驾驶数据集包含来自 25 个国家、超过 2,500 个城市的 1,727 小时驾驶数据。NVIDIA 报告称,该数据集包含 310,895 个片段,涵盖多摄像头和 lidar 覆盖。163,850 个片段中包含 radar。
这些数字无法与大型商业车队积累的数据规模相匹配。不过,公开访问为小型团队提供了一套一致的实验与比较基础。他们可以在加入自身受限数据之前,复现工作流的部分环节。
NVIDIA 还提供后训练方案。这些方案帮助开发者通过监督微调或强化学习来适配预训练模型。方案能够减少搭建工作,但并不能免除谨慎选择数据、设计奖励和验证的需求。
这正是封闭技术栈所承受压力变得具体的地方。NVIDIA 并非提供一项与 Waymo 逐单竞争的公共 robotaxi 服务。它是在将部分底层开发基础设施转化为可复用的产品层。
这种方法与 NVIDIA 在其他 AI 市场的策略相似。该公司提供算力、软件库、参考模型和部署工具,客户则构建最终应用。在自动驾驶领域,这一策略将 NVIDIA 的角色从车载硬件扩展至训练数据、仿真、推理和模型开发。
共享基础也可能提高人力效率。Alpamayo 2 Super 支持推理自动标注,可从原始片段生成结构化标签。NVIDIA 表示,这一过程可将标注周期从数月缩短至数天,不过独立团队仍需在自身工作流中验证这一说法。
经济层面的关键问题并不是一个模型能否取代整个自动驾驶部门。它不能。问题在于,开放教师模型是否能消除足够多的重复性工作,让更多公司训练专门的驾驶系统。
如果能做到,封闭项目就将面临更广泛开发者群体的竞争。它们的专有数据和部署经验仍然很有价值,但对复杂驾驶模型的独占获取将更难以辩护。
其机制是教师模型,而非每辆车中都运行一台 340 亿参数计算机
Alpamayo 2 Super 的设计目的是教导更小的驾驶模型,因为其完整规模并不适合直接进行实时车辆控制。
一款 340 亿参数模型需要大量内存和计算能力。自动驾驶车辆还需要可预测的响应时间、受控的功耗以及冗余安全行为。这些约束使完整模型直接部署不太可能成为默认选择。
NVIDIA 转而将 Alpamayo 2 Super 定位为离线教师模型。教师模型会生成标签、解释、轨迹或中间特征,供较小的学生模型学习模仿。学生模型随后可在车载硬件上以更低延迟运行。
蒸馏,即将大型模型的行为转移到较小模型中的过程,是该计划的核心。开发者可以在为 NVIDIA DRIVE AGX Thor 或其他目标平台训练紧凑策略时,将 Alpamayo 的输出作为监督信号。
该模型可通过多种方式协助这一过程。首先,它能够使用对象和空间参照标注原始驾驶视频。其次,它可以生成描述交互的因果链路追踪。第三,它可以提出元行动和详细轨迹。
设想一辆车接近路口时,一名骑行者部分被停靠的厢式货车遮挡。传统标签可能会识别骑行者的位置。Alpamayo 还可以将遮挡与不确定性联系起来,建议让行,并生成更慢的轨迹。
这种更丰富的输出可帮助开发者发现意图与运动之间的不一致。追踪信息可能建议让行,但轨迹仍显得过于激进。这类不一致可成为有价值的测试案例,尽管文本本身绝不应被视为安全内部推理的证据。
该模型还支持带二维定位的视觉问答。开发者可以询问哪个对象影响了决策,然后将回答与摄像头图像中的区域关联起来。这可能有助于数据团队审查标注或定位异常场景。
全环视输入扩展了这些使用场景。变道取决于车辆侧方和后方的交通,而不仅是前方视野。六摄像头输入为教师模型提供更多上下文,以便围绕整辆车生成标签和轨迹。
NVIDIA 报告称,其训练使用了约 115,000 小时的多摄像头驾驶视频,以及约 370 万条因果链路追踪。这些由公司提供的数字描述的是训练规模,而非每个示例的多样性或质量。此次公开发布并未披露全部底层语料。
这一限制至关重要,因为罕见事件并不能互相替代。模型可能接触过许多不寻常的场景,却仍然遗漏导致部署失败的特定区域、行为或环境条件。总时长无法显示困难案例是否集中在某个特定服务区域。
AlpaGym 解决了机制的另一部分。传统的开环评估会将预测结果与记录下来的人类轨迹进行比较。模型的动作不会改变后续发生的事情,因为该场景已经发生过。
闭环评估允许预测动作改变模拟环境。一个轻微的转向误差会改变下一帧摄像头画面。其他模拟道路使用者也可能作出反应。错误会随时间累积,而非在每个记录帧上被重置。
NVIDIA 的闭环工作流程将 AlpaGym 与 AlpaSim 连接起来。随后,强化学习会根据策略在模拟中的决策后果进行调整。
这种反馈对驾驶至关重要。系统可能会在记录视频片段中预测出合理的下一步轨迹,却在连续作出多次决策后逐渐偏移、犹豫不决,或造成不安全的交互。闭环测试能够揭示单步准确率可能掩盖的失败情况。
NVIDIA 的路线结合了大型教师模型、自动化标注、紧凑型学生模型以及反复模拟。这一机制解释了为何此次发布比普通的检查点上传更具意义。它提供的是一个开发闭环,而不只是一个视觉模型。
这种开放策略仍内置了一层依赖关系。最一体化的路径使用 NVIDIA 的训练硬件、仿真软件、重建工具和车载计算平台。开发者获得了可复用的技术栈,而 NVIDIA 则获得了进入汽车工程流程的另一条路径。
强劲的基准成绩仍不能衡量 Robotaxi 就绪程度
Alpamayo 2 Super 在 NVIDIA 报告的测试中领先,但其分数衡量的是驾驶智能的组成能力,而非公共道路安全。
根据已发布的技术分析,Alpamayo 2 Super 在采用 Lingo-Judge 指标的 LingoQA 测试中得分为 79.2。LingoQA 通过问答来评估模型对驾驶视频的推理能力。
NVIDIA 的结果显示,该模型比 Qwen2.5-VL 72B 高出 17 分,比 Gemini 2.5 Pro 高出 15.1 分,比 GPT-4o 高出 23.2 分。在近 40 个受评估模型中,它排名第一。
这些比较表明,面向驾驶的专用模型可以在驾驶推理基准上超越通用视觉语言系统。但这并不能证明它相对于运营商业自动驾驶车队的专有系统也具有同等优势。
GPT-4o 这类通用模型并不承担 Waymo 的驾驶策略。在 LingoQA 上击败它,对于视觉推理而言具有参考价值,但并非 Robotaxi 的正面对比结果。相关的专有系统无法接受同样的公开评估。
NVIDIA 还报告称,在 910 个重建的 NuRec 场景中,AlpaSim 的闭环得分为 1.50,裕度为 0.13。由于决策会改变后续状态,闭环测试更接近实际部署。然而,模拟器质量和场景选择仍然界定了测试边界。
另一项报告结果衡量了 937 个高难度样本上的开环轨迹准确率。在考虑六条候选轨迹时,Alpamayo 2 Super 在 6.4 秒处记录的最小平均位移误差为 0.911 米。
最小位移误差会奖励多个输出中最接近的候选轨迹。这有助于衡量模型是否表征了一个合理的未来。但这并不意味着部署后的控制器会始终选择最安全的候选方案。
每项指标都孤立地衡量一种能力。LingoQA 测试对驾驶场景的回答;开环位移测试轨迹相似度;AlpaSim 测试重建模拟中的行为。没有任何一项指标涵盖无人驾驶服务的全部运营负担。
公共道路就绪程度还取决于传感器校准、定位、制图、车辆控制、天气应对、远程协助、维护、网络安全、故障降级行为和事件响应。基础模型只能覆盖整个系统的一部分。
推理轨迹带来了另一项评估挑战。即使模型的底层决策依赖于错误信号,它仍可能生成听起来连贯的解释。语言模型经过训练会生成看似合理的文本,因此流畅性无法证明因果忠实性。
“因果链”一词意味着不止是普通的理由说明。它暗示该轨迹识别出了真正促成该动作的观测信息。独立测试必须确定,改变这些观测是否会同时改变所陈述的理由和规划轨迹。
例如,评估人员可以从场景中移除相关行人,同时保留其他细节。一个忠实的模型应当更新其解释和动作。如果解释改变而轨迹未变,或反之亦然,那么该轨迹可能只是描述性的,而非因果性的。
基准污染同样值得关注。即使具体测试标签仍受保护,公开评估集也会影响研究选择。针对同一类任务反复优化,可能带来更高分数,却无法在陌生交通环境中带来成比例的改进。
地理差异进一步增加了不确定性。不同城市、国家和道路设计中的驾驶规范各不相同。能够处理北美四向停车路口的系统,可能会在无标记的欧洲路口或密集的亚洲踏板车穿行场景中面对不同预期。
报告结果仍然有用。它们让开发者在投入微调或仿真之前拥有可参考的基准点,也使该模型更容易与未来的开放发布进行比较。
然而,最重要的基准将来自独立团队。他们需要复现结果、测试反事实场景、衡量人工干预率,并记录其目标运营域内的失败案例。
NVIDIA 发布了一种强大的研究工具。它尚未发布证据证明,一个 340 亿参数模型能够独立满足商业 Robotaxi 的安全论证要求。
开放许可扩大的是访问权,而非问责范围
商业使用许可让 Alpamayo 更容易被采用,但每个部署方仍须负责验证其衍生系统。
OpenMDW-1.1 是为模型分发而非仅为普通软件创建的。该框架在同一许可结构下涵盖权重、参数、架构、脚本、文档及相关模型材料。
Linux Foundation 许可证授予对涵盖模型进行训练、修改、再分发和部署的权利。这比模糊的“开放模型”标签为开发者提供了更清晰的界定。
Apache 2.0 为推理代码承担着熟悉的角色。团队可以审查实现、将其整合到内部工具中,并在成熟的软件条款下进行修改。模型许可证则单独处理软件许可证原本并非为之设计的模型制品。
对于正从实验室评估走向实际应用的组织而言,商业可用性最为重要。供应商可以构建衍生模型,汽车制造商可以利用车队数据进行微调,初创公司可以将适配后的输出纳入付费开发产品。
不过,宽松的许可证并非安全认证。它不保证适用于特定车辆、传感器阵列、城市或监管环境,也不会将故障责任从部署方转移给 NVIDIA。
开发者必须审查模型卡、可接受使用条件、训练披露和局限性。他们还应确定哪些制品使用 OpenMDW-1.1,哪些代码仓库使用 Apache 2.0。“开放”并不意味着所有关联数据集都采用相同条款。
车队数据会带来独立义务。摄像头视频可能包含人脸、车牌、家庭地址以及敏感的移动轨迹。使用私人驾驶记录对公开模型进行微调,需要基础许可证无法提供的治理机制。
生成的标签也是如此。自动化标注可以减少人工工作量,但错误可能会大规模传播到学生模型中。一个存在偏差的教师模型,可能将一次遗漏的边缘案例转化为数千个看似自信的训练样本。
因此,团队需要建立评审体系,将自动标签与人工判断及可量化结果进行比较。仅抽样简单场景会造成误导性的信心。评审应集中于模糊且后果严重的事件。
当通用模型成为共享依赖时,安全风险也会增加。研究人员可以检查并改进开放检查点,但攻击者同样可以研究它。车辆开发者必须评估对抗性输入、遭篡改的摄像头数据、供应链变更以及不安全的微调。
教师模型架构为部署车辆提供了一定程度的隔离。团队无需将完整的公开检查点置于量产车辆中。他们可以将选定能力蒸馏到受控的学生模型中,并以确定性的安全防护机制加以包围。
这种隔离很有价值,但也使问责更加复杂。一次失败可能源于教师模型、私有微调数据、蒸馏过程、控制器或集成层。每次转换都需要可追溯的评估。
推理文本可能帮助工程师记录这些转换。它可以揭示教师模型在标注期间考虑了什么,并使某些分歧更容易被发现。然而,监管机构仍需要将这些解释与可靠行为联系起来的实证证据。
开放发布可让多个实验室测试同一模型,从而改善这一证据基础。独立研究人员可以设计反例、比较评估方法,并发布失败案例,而无需依赖 API 访问权限。
最理想的结果应是围绕该模型形成共享测试文化,而非盲目采用。公开权重使审查成为可能,但并不保证审查会在商业期限到来前发生。
三个信号将显示 NVIDIA Alpamayo 是否重要
下一阶段取决于独立复现、成功蒸馏,以及开放工具能改善真实驾驶项目的证据。
第一个信号是在 NVIDIA 之外进行可复现的评估。研究人员应在 LingoQA、AlpaSim 以及无关数据集上运行已发布的检查点,并公开其配置。若结果在独立设置中仍保持强劲,将强化 NVIDIA 的性能主张。
反事实测试将尤其具有价值。评估人员可以改变交通信号灯、移除障碍物、变更导航指令,或调整周围车辆。随后,他们可以比较模型的推理轨迹、元动作和轨迹。
这些输出之间的一致性将支持 Alpamayo 能够追踪相关原因这一观点。矛盾则会削弱文本解释能够改善验证的主张。无论结果如何,都将比单一排行榜排名提供更多洞见。
第二个信号是团队能否在不失去其长尾优势的情况下,将教师模型蒸馏为更小的模型。如果一个大型离线模型的行为无法迁移到满足车辆延迟和可靠性约束的系统中,那么它的商业价值就有限。
开发者应在蒸馏后披露学生模型的规模、硬件配置、响应时间、功耗和性能表现,并比较压缩前后在罕见事件中的行为。平均准确率可能掩盖 Alpamayo 旨在解决的关键失效问题。
若有证据表明紧凑模型能在 DRIVE AGX Thor 上稳定运行,将强化 NVIDIA 的全栈主张。若推理或轨迹质量大幅下降,则说明这款拥有 340 亿参数的教师模型更适合用于标注,而非直接开发策略。
第三个信号是其在真实自动驾驶项目中的采用情况。下载量和 GitHub 活跃度能够反映兴趣,但无法说明组织是否改变了生产工作流。具体集成案例、已发表的安全研究或供应商合作关系更具分量。
最可信的报告应明确指出其有限而具体的贡献。例如,一家公司可能展示自动推理标注如何减少路口场景的审核时间;另一家公司可能证明 AlpaGym 发现了开放环测试遗漏的失效问题。
如果没有运营细节,声称 Alpamayo 为整套 robotaxi “提供动力”并没有太多信息价值。自动驾驶汽车结合了多种模型、规则、传感器和降级系统,基础模型的确切角色必须保持清晰可见。
竞争对手的回应也将影响其采用情况。其他芯片厂商、汽车制造商和研究团队可以在类似宽松的条款下发布面向驾驶的基础模型。这将使开放自动驾驶成为真正的模型市场,而非单一厂商的项目。
封闭式 robotaxi 领域的领先者面临不同选择:他们可以忽略此次发布,因为自有系统更成熟;也可以将开放组件用于标注和评估等辅助任务。即便只是有限使用,也将验证 NVIDIA 的基础设施战略。
NVIDIA Alpamayo 的发布并未决定开放式或封闭式自动驾驶哪一种会造就更安全的车辆。它改变的是谁能够参与这场技术竞争,以及他们能够审视哪些内容。
开发者应从聚焦的评估开始,而不是承诺部署。应使用本地场景测试模型,核验其许可是否覆盖每一项工件,并用反事实输入检验其解释。随后,再通过闭环测试衡量其标注和轨迹是否能改进更小型的策略模型。
对企业采购方而言,核心问题同样务实:Alpamayo 是否能减少经过验证的工程工作,还是只会生成更多需要审核的工件?未来几个月应会带来首批可信答案。在此之前,NVIDIA 已打开 robotaxi 技术栈中的一个重要层面,而最艰难的证据仍必须来自道路。


