Xenon Hunmin VLM 397B 已开源,但 Qwen-CUA 仍在更难的测试中胜出
Xenon 已将 Hunmin VLM 397B 开源。这款拥有 3970 亿参数的模型在八张 Nvidia B200 GPU 上完成训练后,获得了新的计算机控制能力。此次发布以 Apache 2.0 许可证开放了屏幕识别、点击、输入以及多步骤桌面操作能力。不过,Xenon 自己的结果也揭示了一个重要分野:识别界面元素与完成较长任务之间仍有差距。
Xenon Hunmin VLM 397B 在衡量模型能否定位专业应用中界面目标的基准测试 ScreenSpot-Pro 上取得了 75.6 分。该公司表示,这一成绩使其在模型发布时位列该基准 Hugging Face 排行榜第二。它还在五项公布的界面定位评估中击败了其 Qwen3.5 基座模型和 Qwen-CUA。
当测试从定位一个按钮转向完成整个工作流时,排名发生了变化。Xenon 报告称,在其包含 360 项任务的 OSWorld 评估中,该模型得分为 70.5;在相同复现设置下,Qwen-CUA 得分为 77.1。这一差距让此次发布的意义超出了普通排行榜公告。
Hunmin 证明,一家公司可以借助相对较小的训练集群,将专业能力迁移至超大规模开源模型中。但这并不证明仅凭视觉准确度就能造出最可靠的计算机智能体。对开发者和企业采购方而言,这一区别比模型醒目的参数量更重要。
Xenon Hunmin VLM 397B 为 Qwen3.5 加入计算机控制能力
此次发布在无需重新训练整个 3970 亿参数基础模型的情况下,将通用多模态模型转变为开放的计算机使用模型。
Xenon(国际上亦称 GenON)于 2026 年 9 月 18 日发布了这款模型。该公司通过 Hugging Face 上的 mncai 组织发布其模型。新仓库包含全精度模型、FP8 版本、评估结果及实现指南。
Hunmin 以阿里巴巴 Qwen 团队的开源权重混合专家模型 Qwen3.5-397B-A17B 为基础。它共有 3970 亿参数,但每次前向传播仅激活约 170 亿参数。这一设计提供了超大模型的知识容量,同时无需在每个 token 上调用所有参数。
原始的 Qwen3.5 release 为文本、图像和视频引入了原生多模态处理能力。Xenon 保留了这一基础,同时加入计算机使用能力。这些能力使模型能够理解截图、生成坐标,并决定下一步应执行哪项界面操作。
该模型完整的公开名称为 Hunmin-397B-A17B-CUA。CUA 指计算机使用智能体,即通过人类使用的图形界面执行任务的系统。这类模型不只依赖网站 API,还可以通过可见控件操作浏览器、办公应用和桌面软件。
这一方案扩展了 Xenon 早期的 Hunmin 工作。该公司于 2025 年发布 Hunmin 32B,并在 2026 年初推出 Hunmin VLM 235B。其 company timeline 还将 Hunmin 系列与面向行动的企业 AI 产品 OneAgent 联系起来。
Xenon 表示,新模型保留了 Qwen3.5 大部分韩语能力。在八项公布的韩语基准测试中,其得分与基座模型相比大致维持在两分以内。部分单项结果略有上升,另一些则有所下降。
这种平衡对 Xenon 而言具有战略意义。若计算机使用模型损失过多语言能力,可能难以处理指令、文档和本地化界面。保持韩语表现,让该公司相较于仅针对英语网页任务优化的模型,拥有更明确的企业市场定位。
公开的 model card 比发布标题提供了更多细节。它列出了训练数据、软件栈、硬件配置、比较设置以及已知评估限制。同时,它将基线结果标注为作者复现分数,而非供应商报告的分数。
这种披露提高了此次发布的实用性。开发者可以了解哪些比较采用相同设置,而不是混合来自无关排行榜的不可比数字。它也揭示了定义 Hunmin 当前定位的取舍。
八张 B200 GPU 承担了后训练工作
Xenon 最具影响力的主张关乎训练效率,而不是模型总参数量。
从头训练一个 3970 亿参数的基础模型,所需的远不止八张 GPU。Xenon 并未尝试这样做。它将现有的计算机使用能力迁移到 Qwen3.5 中,再通过监督学习和强化学习优化所得模型。
第一步以 Qwen-CUA 作为计算机控制行为的来源。Xenon 计算了 Qwen-CUA 与其对应 Qwen3.5 基础检查点之间的参数差异,随后通过截断奇异值分解近似这些差异。截断奇异值分解是一种将大型矩阵压缩为低秩组件的数学方法。
这些压缩后的差异成为 LoRA 风格适配器。LoRA,即低秩适应,通过更小的可训练矩阵表示模型更新,而不是独立修改每个原始权重。Xenon 将这些适配器合并进更大的 Qwen3.5-397B-A17B 检查点。
这一技术之所以重要,是因为随着模型规模增长,传统微调会变得困难。优化器状态、梯度、激活值和模型权重都会消耗 GPU 内存。更新有限的低秩表示可减少可训练数据量及相应的内存负担。
随后,Xenon 将迁移后的检查点量化为 FP8。FP8 使用八位存储许多数值,与 16 位格式相比可降低内存使用。团队接着通过 FP8 QLoRA、监督微调和智能体强化学习进行进一步后训练。
监督微调通过包含目标界面操作的示例来教授模型。智能体强化学习则对在计算机环境中成功的行为给予奖励。Xenon 指出,当前阶段采用的强化学习方法为 GRPO,即组相对策略优化。
训练栈包括 MS-Swift、Ray、Megatron-Core 和 vLLM。Xenon 将 OpenGVLab 的 ScaleCUA-Data 列为其监督数据集,也将 ScaleCUA 和 CUA-Gym 列为强化学习环境。
据 Xenon 称,完整的后训练过程运行在八张 Nvidia B200 GPU 上。这一说法并不意味着完整基座模型是在八个加速器上创建的,而是指在 Qwen 已构建基础模型后,能力迁移和后训练阶段使用了该集群。
这一区别避免将出色的工程成果变成误导性的算力比较。Xenon 受益于 Qwen 的原始模型、Qwen-CUA 的专业检查点、开放训练数据集和成熟的优化软件。其贡献在于高效整合这些组件,并针对目标能力进行适配。
这种方法为较小的 AI 厂商提供了潜在模板。企业无需为新的基础模型融资,而可从开源检查点起步并添加狭窄的操作技能。随后,它可以将有限算力投入任务数据、评估和强化学习,而非重复进行通用预训练。
这条路径也缩短了学术研究与可部署企业模型之间的距离。团队可以专注于应用、本地语言和受控环境,而所得模型仍可从其基础模型继承广泛的视觉与语言能力。
不过,该模型在推理时依然要求很高。混合专家架构仅激活部分参数集,但全部 3970 亿权重仍需存储。Xenon 的 FP8 版本大致将存储需求减半,但部署仍需要严肃的多 GPU 基础设施。
因此,八 GPU 训练的说法不应被理解为八 GPU 部署承诺。训练适配器与服务合并模型具有不同的资源需求。企业团队在选择这一架构前,必须评估内存容量、互连带宽、延迟、并发能力和能耗。
屏幕识别是 Hunmin 最明确的优势
Hunmin 最强的结果表明,它能够识别界面目标,尤其是在信息密集的专业界面中。
图形用户界面定位将文字指令关联到截图中的具体位置。如果用户要求智能体选择某个电子表格公式,模型必须找到相关单元格或工具栏控件。很小的坐标误差就可能让智能体进入错误菜单,或修改错误文件。
ScreenSpot-Pro 在高分辨率专业应用中测试这项能力。其任务涵盖的界面比典型消费级网站更密集、容错率更低。之所以设计 ScreenSpot-Pro benchmark,是因为早期定位测试未能充分代表专业桌面软件。
Xenon 报告称,该模型在单视图推理下得分 75.6,采用放大方法时得分 76.6。其复现的 Qwen3.5 基座分数分别为 72.7 和 75.1。在同一报告环境中,Qwen-CUA 未使用放大时得分 62.2,使用放大时得分 71.9。
Hunmin 在 ScreenSpot-v2 上也取得 96.2 分,高于其基座模型的 95.2 分和 Qwen-CUA 的 95.0 分。在侧重定位的 OSWorld-G 评估中,它达到 79.9 分;在经过优化的 OSWorld-G-R 版本中,则取得 86.8 分。
模型卡称,这些定位结果在 Xenon 按其复现设置评估的比较组中领先。这一表述很重要。它并不能证明该模型在所有模型、评估配置或后续提交中持续领先。
不过,公布的结果仍显示出一致模式。Hunmin 在多项测试中提升了界面感知能力,而非依赖单一有利数字。它相对 Qwen-CUA 的最大优势出现在 ScreenSpot-Pro 上,在 Xenon 的设置中差距达到 13.4 分。
这一优势对企业软件具有实际价值。信息密集的界面在会计系统、客户关系平台、开发环境和内部管理工具中仍很常见。许多此类产品提供的 API 并不完整,或需要跨越可见界面状态执行操作。
具备定位能力的模型也可处理从未为 AI 集成设计的旧应用。它可从像素和标签中识别控件,而不是依赖结构化网页元素。这带来了更广的覆盖范围,但也造成可靠性与安全挑战。
Xenon 指示用户提供原生分辨率截图,并将坐标归一化至零到 1,000 的范围。随后必须根据屏幕实际宽度和高度缩放所得坐标。这些细节会实质影响点击准确性。
该模型在所报告的计算机使用评估中还采用五张截图的视觉历史上限。Xenon 表示,接近 20 张图像的历史记录会增加内存使用和推理成本。较小的窗口不仅反映了基准测试选择,也反映了部署选择。
限制视觉历史可以让服务成本更易于控制。但这也可能让智能体对早期操作、对话框或页面状态掌握的证据更少。随着任务变得更长,这种张力会愈发重要。
一次准确点击不需要大量记忆。完成一个包含 30 个步骤的工作流则需要。正是这种差异解释了为何 Hunmin 出色的定位得分,并不会自动转化为其在完整计算机任务上的领先地位。
Qwen-CUA 仍在端到端计算机任务中领先
核心结论呈现分化:Hunmin 更擅长识别界面目标,而 Qwen-CUA 能完成更多长程任务。
OSWorld 在真实计算机应用中评估智能体,而非测试孤立的坐标。任务可能涉及浏览器、文件操作、邮件客户端、图像编辑器、文档工具以及多个应用程序。智能体必须观察状态、选择操作、应对变化,并持续执行直至完成。
官方的 OSWorld benchmark 最初汇集了 369 个具有可复现初始状态和基于执行结果评估的计算机任务。Xenon 在其模型卡的结果中使用了 360 项任务配置。其报告称,所有对比模型均采用相同的五张图像视觉历史限制。
Hunmin 在该评估中得分为 70.5。Qwen3.5 基础模型得分为 48.2,这意味着 Hunmin 提升了 22.3 分。这是一项显著改进,也支持 Xenon 关于其后训练加入了有意义的计算机控制行为的说法。
不过,在相同复现设置下,Qwen-CUA 得分为 77.1,领先 Hunmin 6.6 分。WindowsAgentArena 给出了相同的排序。Hunmin 得分为 50.9,比基础模型的 41.8 提高了 9.1 分,而 Qwen-CUA 达到 57.3。
这些结果并未否定 Hunmin 在定位方面的提升。它们表明,智能体需要的不只是精确的视觉目标定位。它还必须进行规划、跟踪进度、处理错误、理解应用状态,并避免会使工作流偏离轨道的操作。
设想一个智能体被要求更新电子表格中的数字并通过电子邮件发送结果。它可能能够准确找到每个菜单、单元格和按钮,但仍可能因编辑了错误的工作簿、将公式应用到错误范围,或附加了过期文件而失败。
更长的任务会累积微小错误。早期的错误会改变后续截图,并使原始计划失效。模型必须检测到这种偏离并进行恢复,而不是自信地沿着错误路径继续执行。
Hunmin 的训练结果揭示了一部分改进来源。Xenon 表示,其能力迁移检查点在后续训练前已在 OSWorld 上达到 66.2。监督微调和强化学习将这一得分提升至 70.5,进一步提高了 4.3 分。
这一进展支持 Xenon 方法的价值。能力迁移提供了大部分初始计算机使用能力,而特定任务的后训练进一步提升了表现。不过,Qwen-CUA 仍然领先,说明部分行为可能未能被完美压缩,或在整合过程中发生了变化。
韩语目标也可能塑造了这一权衡。在多项比较中,Hunmin 在八个韩语基准上的表现优于 Qwen-CUA。Xenon 并未只针对尽可能高的 OSWorld 分数进行优化。
例如,Hunmin 在 KMMLU-Pro 上得分为 76.1,而 Qwen-CUA 为 71.4。它在 K-MMStar 上也达到 80.3,而 Qwen-CUA 为 75.0。这些结果表明其多语言能力更为均衡,尽管这些评估仍由公司复现完成。
这种平衡对韩国企业可能很重要。模型必须理解本地指令、文档、术语和用户界面,其点击能力才会真正有用。更高的英语中心型智能体得分并不能决定每一项采购决策。
不过,Xenon 不应将定位能力领先表述为整体计算机使用能力领先。其模型卡通过公布不利的 OSWorld 对比避免了这一错误。若发布报道只强调其在 ScreenSpot-Pro 上获得第二名、却不解释端到端差距,其参考价值就会下降。
对买方而言,合适的比较取决于预期工作负载。以密集界面目标定位为主的工作流可能更适合 Hunmin 的特性。需要恢复能力和规划的更长操作序列,则可能暴露它目前相较 Qwen-CUA 的弱点。
模型的开放性为团队提供了另一种选择。开发者可以检查发布内容、进行适配,并在自己的软件上开展受控评估。这种灵活性很有价值,但并不能消除进行特定应用测试的必要性。
开放权重并不能消除部署风险
Apache 2.0 访问提升了可控性,但可下载的计算机使用模型距离安全的自主工作者仍相去甚远。
Xenon 以 Apache 2.0 发布了原始模型和 FP8 变体。该许可证通常允许商业使用、修改和再分发,但需遵守其相关条件。相比仅能通过托管界面使用的封闭智能体,它给予企业更大的部署自由。
开放访问也支持私有化评估。企业可以在不向第三方模型提供商发送截图的情况下,在内部应用中测试 Hunmin。团队可以衡量它在本地语言、专业表单和组织特定工作流中的表现。
不过,模型访问只是计算机使用系统的一个层面。生产级智能体仍需要运行时、操作控制器、权限模型、审计轨迹、凭据策略和恢复流程。它还需要防御嵌入网页或文档中的恶意指令。
计算机使用模型能够与操作账户可访问的任何内容交互。这可能包括电子邮件、客户记录、云存储、内部仪表板和金融应用。一次错误操作可能带来的后果,是错误的聊天机器人回答所无法比拟的。
屏幕定位基准几乎无法证明授权或意图方面的能力。即使按下“删除”按钮会违反政策,正确定位该按钮在技术上仍算成功。外围智能体必须判断该操作是否被允许,以及是否需要人工批准。
基准任务也都从受控状态开始。真实桌面会逐渐积累通知、软件更新、浏览器扩展、过期会话、自定义布局和不一致的窗口尺寸。这些变化既可能改变模型看到的内容,也可能改变一次操作产生的结果。
Xenon 承认了若干评估限制。它表示,结果取决于截图分辨率、推理设置、交互限制、服务软件和基准版本。它还警告,不应将其得分与使用更长截图历史得到的结果直接比较。
这一提醒应影响读者对发布中每个数字的解读。该公司在自身环境中复现了基线模型。这带来了更公平的内部比较,但独立团队尚未广泛复现这些结果。
排行榜位置也存在另一种不确定性。随着新模型和推理方法出现,ScreenSpot-Pro 排名可能发生变化。发布时的第二名只是一个有时效性的快照,而非永久地位。
参数规模也带来了运营风险。即使采用 FP8 量化和稀疏激活,组织仍需要合适的基础设施。更小的专用模型可能以更低延迟、更简单部署和更容易微调的方式,提供足够的准确性。
因此,团队应在工作流层面对系统进行比较。有用的指标包括完成率、人工干预频率、平均步骤数、恢复成功率、延迟以及失败操作的严重程度。单一汇总基准得分无法涵盖所有这些维度。
同样的原则也适用于围绕智能体运营的知识工作。团队需要可搜索的指令、输出、异常情况和人工决策记录。受控的 AI knowledge base 可以帮助审查人员还原自动化任务为何会产生某一特定结果。
这本身不会让智能体变得安全。它为审查、调试和政策改进提供了证据。当计算机使用系统的操作始终与授权它们的文档和决策相连时,治理会变得更容易。
Xenon 值得肯定的一点是,它在发布最强得分的同时,也公布了局限性和不利对比。这种透明度让开发者能够提出更好的问题。下一步需要独立测试,同时衡量能力与失败后果。
三项信号将显示 Hunmin 能否缩小差距
Hunmin 的意义如今取决于独立复现、更好的长程任务结果,以及超越模型仓库的实际采用。
第一个信号是独立的基准复现。外部研究人员需要在相同硬件、截图历史、推理设置和任务框架下运行 Hunmin、Qwen3.5 与 Qwen-CUA。相似的结果将强化 Xenon 关于低秩迁移保留了有用计算机控制能力的说法。
复现不应只覆盖 ScreenSpot-Pro。研究人员还应测试定位、完整任务完成情况、恢复能力、延迟和资源消耗,并公布失败类别,而非仅公布汇总得分。
如果独立运行复现出 75.6 的定位得分和 70.5 的 OSWorld 得分,人们对 Xenon 评估的信心将会上升。若出现较大偏差,则会削弱发布叙事,并表明结果对配置较为敏感。
第二个信号是 Xenon 是否能缩小与 Qwen-CUA 的长程任务差距。其当前模型已经能准确找到目标,因此下一阶段的提升必须来自规划和状态管理。更好的记忆能力、更强的强化学习环境或改进的错误恢复,都可能提高端到端完成率。
未来的检查点应在不牺牲韩语表现的前提下,缩小报告中 6.6 分的 OSWorld 差距。这一结果将支持 Xenon 的论点:高效后训练能够产出均衡、实用的计算机使用模型。仅提升定位能力将无法解决核心限制。
第三个信号是在 OneAgent 或其他企业产品中的部署。公开检查点证明了技术可访问性,但产品使用将揭示模型能否承受延迟限制和不可预测的界面。实际采用也将表明,企业是否足够重视本地语言控制,以接受该模型的基础设施要求。
Xenon 表示,计划利用这些新能力改进 OneAgent,并扩展 AI 可执行的工作。买方应关注具名部署、可重复的工作流、干预率,以及任务在基准环境外仍保持可靠的证据。
最有参考价值的案例研究应像描述成功一样清晰地描述边界。它们应说明智能体能够操作哪些应用、哪些操作需要批准,以及人工需要介入的频率。缺少这些细节,客户公告将提供很少的技术证据。
Xenon Hunmin VLM 397B 已是一项值得关注的工程发布。它表明,一个相对专注的团队可以使用八张高端 GPU,通过后训练向庞大的开放模型加入计算机控制行为。其自身数据也阻止了人们轻易构建胜利叙事。
评估该模型的开发者应从狭窄的工作流和可逆沙盒开始。衡量完整任务的成功率,而不仅是点击准确率,并记录每次干预或恢复。随后,在完全相同的条件下,将这些结果与 Qwen-CUA 和更小的替代方案进行比较。开放许可证使这项工作成为可能,但只有独立测试才能确定 Hunmin 的定位优势能否转化为可靠行动。



