top of page

Xenon Hunmin VLM 397Bはオープン化、ただしより難しいテストでは依然Qwen-CUAが優勢

6 分前
読了時間: 19分

XenonはHunmin VLM 397Bをオープンソースとして公開した。8基のNvidia B200 GPUで学習を行い、3970億パラメータのモデルに新たなコンピューター操作機能を加えたものだ。このリリースにより、画面認識、クリック、入力、複数ステップにまたがるデスクトップ作業がApache 2.0ライセンスで利用可能になる。しかしXenon自身の結果は、インターフェース要素を認識する能力と、より長いタスクを完遂する能力の間に重要な隔たりがあることも示している。

Xenon Hunmin VLM 397Bは、モデルが業務用アプリケーション内のインターフェース対象を特定できるかを測るベンチマーク、ScreenSpot-Proで75.6を記録した。同社によれば、この結果はモデル公開時点で同ベンチマークのHugging Faceリーダーボードで2位に相当したという。また、報告された5つのインターフェース・グラウンディング評価では、Qwen3.5ベースモデルとQwen-CUAの双方を上回った。

ただし、テストがボタンの位置特定からワークフロー全体の完遂へ移ると、序列は変わる。Xenonは、360タスクのOSWorld評価で70.5を報告しており、同一の再現セットアップにおけるQwen-CUAの77.1を下回った。この差が、このリリースを単なるリーダーボード発表以上に示唆的なものにしている。

Hunminは、比較的小規模な学習クラスターでも、企業が専門的な能力を巨大なオープンモデルへ移植できることの証拠だ。一方で、視覚的な精度だけで最も信頼性の高いコンピューターエージェントが実現するわけではない。開発者や企業の購入担当者にとって、この違いはモデルの目を引くパラメータ数より重要である。

Xenon Hunmin VLM 397B、Qwen3.5にコンピューター操作を追加

このリリースは、3970億パラメータの基盤全体を再学習することなく、汎用マルチモーダルモデルをオープンなコンピューター操作モデルへ変換する。

国際的にはGenONとしても知られるXenonは、2026年9月18日にモデルを公開した。同社はHugging Face上でmncai組織を通じてモデルを公開している。新しいリポジトリには、フル精度モデル、FP8版、評価結果、実装ガイダンスが含まれる。

Hunminは、AlibabaのQwenチームによるオープンウェイトのMixture-of-Expertsモデル、Qwen3.5-397B-A17Bを基盤としている。総パラメータ数は3970億だが、各フォワードパスで有効化されるのは約170億パラメータである。この設計により、すべてのトークンで全パラメータを使用することなく、非常に大規模なモデルの知識容量を活用できる。

オリジナルのQwen3.5 releaseでは、テキスト、画像、動画を対象とするネイティブなマルチモーダル処理が導入された。Xenonはこの基盤を維持しながら、コンピューター操作機能を追加した。これらの機能により、モデルはスクリーンショットを解釈し、座標を生成し、次に実行すべきインターフェース操作を判断できる。

モデルの正式な公開名称はHunmin-397B-A17B-CUAである。CUAはcomputer-use agentを意味し、人が使うグラフィカルインターフェースを通じてタスクを実行するシステムを指す。WebサイトのAPIだけに依存するのではなく、この種のモデルは可視の操作部を通じてブラウザ、オフィスアプリケーション、デスクトップソフトウェアを扱える。

このアプローチは、XenonによるこれまでのHunminの取り組みを拡張するものだ。同社は2025年にHunmin 32Bを公開し、2026年初頭にはHunmin VLM 235Bを続けて公開した。company timelineでは、Hunminシリーズをアクション志向の企業向けAI製品OneAgentとも結び付けている。

Xenonによれば、新モデルはQwen3.5の韓国語性能の大部分を維持している。報告された8つの韓国語ベンチマークでは、スコアはベースモデルからおおむね2ポイント以内に収まった。個別の結果にはわずかに向上したものもあれば、低下したものもある。

このバランスはXenonにとって戦略的に重要だ。言語能力を大きく失うコンピューター操作モデルは、指示、文書、ローカライズされたインターフェースの処理に苦戦する可能性がある。韓国語性能を維持することで、英語圏のWebタスクだけに最適化されたモデルよりも、同社は明確な企業向けポジションを得る。

公開されたmodel cardは、公開時の見出しよりも詳細な情報を提供している。学習データ、ソフトウェアスタック、ハードウェア構成、比較設定、既知の評価上の制約を明示している。また、ベースライン結果には提供元報告のスコアではなく、著者側で再現した結果であることを示すラベルが付されている。

この開示により、リリースの有用性は高まる。開発者は、無関係なリーダーボードの互換性のない数値を混在させるのではなく、同じセットアップを共有する比較を確認できる。また、Hunminの現時点での立ち位置を決定づけるトレードオフも明らかにする。

8基のB200 GPUがポストトレーニングを担った

Xenonの最も重要な主張は、モデルの総パラメータ数ではなく、学習効率に関するものだ。

3970億パラメータの基盤モデルをゼロから学習するには、8基を大きく上回るGPUが必要になる。Xenonはそれを試みていない。既存のコンピューター操作能力をQwen3.5へ移植し、その後、教師あり学習と強化学習で得られたモデルを洗練させた。

最初のステップでは、コンピューター制御の振る舞いの源としてQwen-CUAを用いた。Xenonは、Qwen-CUAと対応するQwen3.5ベースチェックポイントの間にあるパラメータ差分を計算した。続いて、大きな行列を低ランク成分へ圧縮する数学的手法である打ち切り特異値分解を通じて、その差分を近似した。

これらの圧縮差分はLoRA形式のアダプターとなった。LoRA、すなわちlow-rank adaptationは、元の重みをすべて個別に変更する代わりに、より小さな学習可能行列でモデル更新を表現する手法である。Xenonはこれらのアダプターを、より大きなQwen3.5-397B-A17Bチェックポイントへ統合した。

モデルが大きくなるほど、従来のファインチューニングは困難になるため、この手法は重要である。オプティマイザの状態、勾配、活性化値、モデルの重みは、いずれもGPUメモリを消費する。限定的な低ランク表現を更新することで、学習対象データの量と、それに伴うメモリ負荷を削減できる。

Xenonは次に、移植済みチェックポイントをFP8へ量子化した。FP8は多くの数値を8ビットで保存するため、16ビット形式と比べてメモリ使用量を減らせる。チームはFP8 QLoRA、教師ありファインチューニング、エージェント強化学習を通じて追加のポストトレーニングを行った。

教師ありファインチューニングでは、望ましいインターフェース操作を含む例からモデルを学習させた。その後のエージェント強化学習では、コンピューター環境内で成功した行動に報酬を与えた。Xenonは、この段階で使用した強化学習手法としてGRPO、すなわちGroup Relative Policy Optimizationを挙げている。

学習スタックにはMS-Swift、Ray、Megatron-Core、vLLMが含まれた。Xenonは、OpenGVLabのScaleCUA-Dataを教師ありデータセットとして挙げている。また、強化学習環境としてScaleCUAとCUA-Gymも列挙している。

Xenonによれば、ポストトレーニングの全工程は8基のNvidia B200 GPUで実行された。この説明は、完全なベースモデルが8基のアクセラレーターで作成されたことを意味しない。Qwenがすでに基盤モデルを構築した後、そのクラスターを能力移植とポストトレーニングの段階で用いたという意味である。

この区別により、印象的なエンジニアリング成果が誤解を招く計算資源の比較になることを防げる。Xenonは、Qwenのオリジナルモデル、Qwen-CUAの専門チェックポイント、公開学習データセット、確立された最適化ソフトウェアの恩恵を受けた。同社の貢献は、これらの要素を効率よく組み合わせ、目的とする能力向けに適応させた点にある。

この手法は、小規模なAIベンダーにとって一つのテンプレートになり得る。新たな基盤モデルへ資金を投じる代わりに、企業はオープンなチェックポイントから始め、限定的な運用スキルを追加できる。その後、一般的な事前学習を繰り返すのではなく、タスクデータ、評価、強化学習に限られた計算資源を投入できる。

この経路は、学術研究と導入可能な企業向けモデルの距離も縮める。チームはアプリケーション、地域言語、制御された環境に集中できる。結果として生まれるモデルは、基盤から幅広い視覚・言語能力を継承できる。

ただし、このモデルは推論時にも大きな要求を伴う。Mixture-of-Expertsアーキテクチャでは有効化されるパラメータの一部にとどまるが、3970億すべての重みを保存する必要がある。XenonのFP8リリースはストレージ要件をおよそ半減させるものの、導入には依然として本格的なマルチGPUインフラが必要だ。

したがって、8 GPUでの学習という主張を、8 GPUでのデプロイを約束するものと解釈すべきではない。アダプターの学習と統合済みモデルのサービングでは、必要なリソースが異なる。企業チームは、このアーキテクチャを選ぶ前に、メモリ容量、インターコネクト帯域幅、レイテンシー、同時実行性、エネルギー使用量を評価する必要がある。

画面認識はHunminの最も明確な強み

Hunminの最も強い結果は、とりわけ情報量の多い業務画面で、インターフェースの対象を識別できることを示している。

グラフィカルユーザーインターフェースのグラウンディングは、書かれた指示をスクリーンショット上の特定の位置に結び付ける。ユーザーがエージェントにスプレッドシートの数式を選択するよう求めた場合、モデルは該当するセルまたはツールバーの操作部を見つけなければならない。座標の小さな誤差でも、エージェントを誤ったメニューへ導いたり、誤ったファイルを変更させたりする可能性がある。

ScreenSpot-Proは、高解像度の業務用アプリケーションでこの能力をテストする。そのタスクには、一般的な消費者向けWebサイトよりも情報密度が高く、許容度の低いインターフェースが含まれる。ScreenSpot-Pro benchmarkは、従来のグラウンディングテストが専門的なデスクトップソフトウェアを十分に表現していなかったことを受けて設計された。

Xenonは、単一ビュー推論で75.6、ズームイン手法で76.6を報告している。同社が再現したQwen3.5ベースのスコアは、それぞれ72.7と75.1だった。同じ報告環境で、Qwen-CUAはズームなしで62.2、ズームありで71.9を記録した。

HunminはScreenSpot-v2でも96.2を記録し、ベースモデルの95.2とQwen-CUAの95.0を上回った。グラウンディングに焦点を当てたOSWorld-G評価では79.9に達し、改良版のOSWorld-G-Rでは86.8を記録した。

モデルカードによると、これらのグラウンディング結果は、Xenonが再現セットアップで評価した比較グループをリードした。この表現は重要である。あらゆるモデル、評価構成、その後の提出結果にわたる恒久的な優位性を示すものではない。

それでも、報告結果には一貫した傾向が見られる。Hunminは、単一の有利な数値に依存するのではなく、複数のテストでインターフェース認識を改善している。Qwen-CUAに対する最大の優位性はScreenSpot-Proで見られ、Xenonのセットアップでは差が13.4ポイントに達した。

企業向けソフトウェアにおいて、この強みは実用的な価値を持つ。会計システム、顧客関係管理プラットフォーム、開発環境、社内管理ツールでは、情報量の多いインターフェースが依然として一般的だ。これらの製品の多くはAPIが不完全であるか、可視のインターフェース状態をまたぐ操作を必要とする。

グラウンディング済みのモデルは、AI統合を前提に設計されていない旧来のアプリケーションでも動作できる。構造化されたWebページ要素に依存するのではなく、ピクセルとラベルから操作部を識別できる。これにより適用範囲は広がるが、同時に信頼性とセキュリティ上の課題も生じる。

Xenonは、ネイティブ解像度のスクリーンショットを提供し、座標を0から1,000の範囲に正規化するようユーザーに指示している。得られた座標は、その後、実際の画面の幅と高さに合わせてスケーリングしなければならない。こうした詳細はクリック精度に大きく影響し得る。

このモデルは、報告されたコンピューター操作評価で、視覚履歴を5枚のスクリーンショットに制限している。Xenonによれば、履歴を20枚程度に増やすと、メモリ使用量と推論コストが増加する可能性がある。この小さなウィンドウは、ベンチマーク上の選択であるだけでなく、デプロイ上の選択でもある。

視覚履歴を制限すれば、サービス提供コストをより管理しやすくできる。一方で、エージェントが過去の操作、ダイアログ、ページ状態に関する証拠を十分に持てなくなる可能性もある。タスクが長期化するほど、この緊張関係は重要になる。

正確なクリックを1回行うだけなら、膨大な記憶は必要ない。しかし、30ステップのワークフローを完了するには必要だ。この違いは、Hunminが高いグラウンディングスコアを示しても、完全なコンピュータータスクで自動的に首位になるわけではない理由を説明している。

Qwen-CUAは依然としてエンドツーエンドのコンピュータータスクで首位

中心的な結果は分かれている。Hunminはインターフェース上の対象をより正確に捉える一方、Qwen-CUAはより長期的なタスクを多く完了する。

OSWorldは、孤立した座標をテストするのではなく、実際のコンピューターアプリケーション内でエージェントを評価する。タスクにはブラウザー、ファイル操作、メールクライアント、画像エディター、文書ツール、複数のアプリケーションが関わる場合がある。エージェントは状態を観察し、操作を選び、変化から回復し、完了するまで継続しなければならない。

公式のOSWorld benchmarkは当初、再現可能な初期状態と実行ベースの評価を備えた369件のコンピュータータスクで構成されていた。Xenonはモデルカードの結果に360タスク構成を用いたとしている。同社は、比較対象の全モデルで視覚履歴の上限を5枚の画像に揃えたと報告している。

Hunminはこの評価で70.5を記録した。Qwen3.5のベースモデルは48.2であり、Hunminの改善幅は22.3ポイントとなる。これは大幅な改善であり、Xenonのポストトレーニングが意味のあるコンピューター制御能力を加えたという主張を支持する。

しかし、同じ再現設定ではQwen-CUAが77.1を記録し、Hunminを6.6ポイント上回った。WindowsAgentArenaでも順位は同じだ。Hunminは50.9で、ベースモデルの41.8から9.1ポイント改善した一方、Qwen-CUAは57.3に達した。

これらの結果はHunminのグラウンディング能力の向上を否定するものではない。エージェントには精密な視覚ターゲティング以上の能力が必要であることを示している。計画、進捗追跡、エラー管理、アプリケーション状態の理解、そしてワークフローを脱線させる操作の回避が求められる。

たとえば、スプレッドシートの数値を更新して結果をメールで送るよう求められたエージェントを考えてみよう。すべてのメニュー、セル、ボタンを正しく見つけられるかもしれない。それでも、誤ったブックを編集したり、間違った範囲に数式を適用したり、古いファイルを添付したりして失敗する可能性がある。

長いタスクでは、小さなミスが積み重なる。初期のエラーは後続のスクリーンショットを変え、当初の計画を無効にする。モデルはその乖離を検出し、誤った経路を自信を持って進み続けるのではなく、回復しなければならない。

Hunminのトレーニング結果は、改善の一部がどこから生まれたかを示している。Xenonによれば、能力転移を施したチェックポイントは、その後のトレーニング前にOSWorldで66.2に到達した。教師ありファインチューニングと強化学習により、このスコアは70.5へとさらに4.3ポイント上昇した。

この推移はXenonの手法の価値を裏付ける。能力転移によって初期段階のコンピューター利用能力の多くがもたらされ、タスク特化のポストトレーニングがそれを改善した。ただし、Qwen-CUAとの差が残っていることは、一部の挙動が不完全に圧縮されたか、統合の過程で変化した可能性を示唆する。

韓国語を重視した目標も、このトレードオフに影響している可能性がある。複数の比較において、Hunminは8つの韓国語ベンチマークでQwen-CUAより高い性能を維持している。XenonはOSWorldの最高スコアだけを最適化したわけではない。

たとえば、HunminはKMMLU-Proで76.1を記録し、Qwen-CUAの71.4を上回った。K-MMStarでも80.3に達し、Qwen-CUAの75.0を超えた。これらの結果は、よりバランスの取れた多言語プロファイルを示唆しているが、依然として企業側が再現した評価である。

このバランスは韓国企業にとって重要になり得る。モデルのクリック能力が役立つ前に、ローカルの指示、文書、用語、ユーザーインターフェースを理解する必要がある。英語中心のエージェントスコアが高いからといって、すべての調達判断が決まるわけではない。

それでもXenonは、グラウンディングにおける首位をコンピューター利用全般での首位と同一視すべきではない。モデルカードでは、不利なOSWorld比較も公開することでその誤りを避けている。ScreenSpot-Proでの2位を、エンドツーエンドの差を説明せずに強調するローンチ報道は、あまり有用ではない。

購入側にとって、適切な比較は想定するワークロードに左右される。密度の高いインターフェース上のターゲティングが中心のワークフローでは、Hunminのプロファイルが有利かもしれない。回復と計画を要する長い一連の作業では、Qwen-CUAに対する現時点の弱点が露呈する可能性がある。

モデルがオープンであることは、チームに別の選択肢も与える。開発者はリリースを検査し、適応させ、自社ソフトウェアで管理された評価を実行できる。この柔軟性は価値があるが、アプリケーション固有のテストが不要になるわけではない。

オープンウェイトはデプロイメントリスクをなくさない

Apache 2.0によるアクセスは制御性を高めるが、ダウンロード可能なコンピューター利用モデルは、安全な自律ワーカーとは依然として大きく隔たっている。

Xenonは、元のモデルとFP8版の両方をApache 2.0の下で公開した。このライセンスは一般に、その条件に従う限り商用利用、改変、再配布を認めている。ホスト型インターフェース経由でしか利用できないクローズドなエージェントより、企業に大きなデプロイメントの自由度を与える。

オープンアクセスは非公開の評価も可能にする。企業はスクリーンショットをサードパーティのモデルプロバイダーに送ることなく、社内アプリケーションに対してHunminをテストできる。チームはローカル言語、専門フォーム、組織固有のワークフローにおける挙動を測定できる。

しかし、モデルへのアクセスはコンピューター利用システムの一層にすぎない。本番のエージェントには、実行環境、アクションコントローラー、権限モデル、監査証跡、認証情報の戦略、回復プロセスがなお必要となる。また、ウェブページや文書に埋め込まれた悪意のある指示への防御も必要だ。

コンピューター利用モデルは、操作アカウントがアクセスできるものなら何にでも対話できる。そこにはメール、顧客記録、クラウドストレージ、社内ダッシュボード、金融アプリケーションが含まれる可能性がある。誤った操作が1回でも、誤答したチャットボットにはない結果を招き得る。

画面グラウンディングのベンチマークは、権限や意図に関する証拠をほとんど提供しない。正しい「Delete」ボタンを見つけることは、押せばポリシー違反となる場合でも技術的には成功である。周囲のエージェントは、その操作が許可されているか、人間の承認が必要かを判断しなければならない。

ベンチマークタスクも管理された状態から始まる。実際のデスクトップには、通知、ソフトウェア更新、ブラウザー拡張機能、期限切れのセッション、カスタムレイアウト、不揃いなウィンドウサイズが蓄積する。こうした変動は、モデルが見るものと操作が行うことの両方を変え得る。

Xenonはいくつかの評価上の限界を認めている。結果はスクリーンショットの解像度、推論設定、操作上限、提供ソフトウェア、ベンチマークのバージョンに依存するとしている。また、はるかに長いスクリーンショット履歴を用いて得られた結果と、自社スコアを直接比較しないよう警告している。

この注意は、読者がリリース内のすべての数値を解釈する際に反映されるべきだ。同社は自社環境内でベースラインモデルを再現した。これはより公正な社内比較を生むが、独立したチームによる結果の広範な再現はまだ行われていない。

リーダーボードの順位にも別の不確実性がある。ScreenSpot-Proのランキングは、新しいモデルや推論手法の登場により変化し得る。ローンチ時の2位は、恒久的な地位ではなく、時点に依存するスナップショットである。

パラメータ規模も運用リスクをもたらす。FP8量子化とスパース活性化を用いても、組織には適切なインフラが必要だ。より小さな特化モデルでも、低レイテンシー、簡素なデプロイメント、容易なファインチューニングで十分な精度を実現できる場合がある。

したがって、チームはワークフローレベルでシステムを比較すべきだ。有用な指標には、完了率、介入頻度、平均ステップ数、回復成功率、レイテンシー、失敗した操作の重大性が含まれる。単一の総合ベンチマークスコアでは、これらすべての側面を捉えられない。

同じ原則は、エージェント運用を取り巻くナレッジワークにも当てはまる。チームには、指示、出力、例外、人間による判断の検索可能な記録が必要だ。管理されたAI knowledge baseは、レビュー担当者が自動化タスクが特定の結果を生んだ理由を再構築する助けになる。

これだけでエージェントが安全になるわけではない。レビュー、デバッグ、ポリシー改善のための証拠を生み出す。操作がそれを認可した文書や判断に結び付いたままであれば、コンピューター利用システムはより管理しやすくなる。

Xenonのリリースは、最も強いスコアとともに制約や不利な比較も公表した点で評価に値する。この透明性により、開発者はより良い問いを立てられる。次の段階は、能力と失敗の結果の両方を測定する独立テストである。

Hunminが差を縮められるかを示す3つのシグナル

Hunminの重要性は今後、独立した再現、より良い長期タスクの結果、そしてモデルリポジトリーを超えた採用にかかっている。

第1のシグナルは、独立したベンチマーク再現である。外部研究者は、同一のハードウェア、スクリーンショット履歴、推論設定、タスクハーネスの下で、Hunmin、Qwen3.5、Qwen-CUAを実行する必要がある。同様の結果が得られれば、低ランク転移が有用なコンピューター制御能力を維持したというXenonの主張が強化される。

再現はScreenSpot-Proだけにとどまるべきではない。研究者はグラウンディング、完全なタスク完了、回復、レイテンシー、リソース消費をテストすべきだ。総合スコアだけでなく、失敗カテゴリも公表すべきである。

独立した実行で75.6のグラウンディング結果と70.5のOSWorldスコアが再現されれば、Xenonの評価に対する信頼は高まる。大きな乖離があれば、ローンチ時の説明は弱まり、設定への感度を示すことになる。

第2のシグナルは、XenonがQwen-CUAとの長期タスクの差を縮められるかどうかだ。現行モデルはすでにターゲットを正確に見つけているため、次の改善は計画と状態管理から生まれなければならない。より優れたメモリー、より強力な強化学習環境、または改善されたエラー回復は、エンドツーエンドの完了率を高める可能性がある。

将来のチェックポイントは、韓国語性能を犠牲にすることなく、報告されたOSWorldの6.6ポイント差を縮めるべきだ。その結果は、効率的なポストトレーニングによって、バランスが取れ実用的なコンピューター利用モデルを生み出せるというXenonの主張を支持する。グラウンディングのみの改善では、中心的な制約は解決されない。

第3のシグナルは、OneAgentまたは別のエンタープライズ製品への導入である。公開チェックポイントは技術的なアクセス可能性を示すが、製品での利用は、モデルがレイテンシー制約や予測不能なインターフェースに耐えられるかを明らかにする。実際の採用は、企業がモデルのインフラ要件を受け入れるほどローカル言語での制御を重視するかどうかも示すだろう。

Xenonは、新しい能力をOneAgentの改善とAIが実行できる業務の拡大に活用する計画だとしている。購入者は、明示された導入事例、再現可能なワークフロー、介入率、そしてタスクがベンチマーク環境の外でも信頼性を維持する証拠に注目すべきだ。

最も有用なケーススタディは、成功と同じくらい明確に境界を説明する。エージェントが操作できるアプリケーション、承認を必要とする操作、人間の介入が必要になる頻度を特定すべきである。こうした詳細がなければ、顧客向けの発表は技術的な証拠をほとんど提供しない。

Xenon Hunmin VLM 397Bは、すでに注目すべきエンジニアリング上のリリースである。比較的焦点を絞ったチームが、ポストトレーニングに8基の高性能GPUを用いて、巨大なオープンモデルへコンピューター制御の挙動を追加できることを示した。自社の数値も、単純な勝利物語を許してはいない。

モデルを評価する開発者は、範囲を絞ったワークフローと元に戻せるサンドボックスから始めるべきだ。クリック精度だけでなく、完全なタスク成功を測定し、すべての介入と回復を記録する。そのうえで、同一条件下でQwen-CUAおよびより小規模な代替モデルと結果を比較する。オープンライセンスはこの作業を可能にするが、Hunminのグラウンディング上の優位性が信頼できる行動へと変わるかどうかを確立できるのは、独立したテストだけである。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page