top of page

ERNIE-4.5-VL: Baiduの'Thinking' MoEモデルの分析

更新日:6月17日

ERNIE-4.5-VL: An Analysis of Baidu's 'Thinking' MoE Model

より強力なAIを構築する競争において、モデルは著しくリソースを消費するようになりました。パラメータ数が多いほど性能は向上しますが、計算能力とアクセシビリティには大きなコストがかかります。Baiduが最近リリースしたERNIE-4.5-VLは、リソースのほんの一部しか使用せずにフラッグシップレベルのパフォーマンスを得られるとしたらどうだろうか、という魅力的な提案とともにこの状況に参入します。このモデルは単なるマイナーアップデートではなく、効率のために構築されたアーキテクチャと「Thinking with Images」と呼ぶ独自の機能を中心に、大きいものが常に最良であるという考え方に直接挑戦するものです。

これは単なるモデルリリースではありません。それは特定の種類のアーキテクチャへの戦略的な賭けを表しています —Mixture of Experts (MoE)—大規模AIプロジェクトを悩ませてきたデプロイメントのボトルネックを解消するためです。合計280億のパラメータを誇りますが、その巧妙な設計により、特定のタスクでは約30億しかアクティブになりません。この抜本的な効率性により、実行がより高速かつ安価になり、これまで非現実的だった実世界での応用への道が開かれます。しかし、真の注目は、画像に積極的に質問できる能力であり、これは単純な認識を超えて、真の推論の領域へと移行するスキルです。

ERNIE-4.5-VLアーキテクチャの解体

Deconstructing the ERNIE-4.5-VL Architecture

ERNIE-4.5-VLの中核は、複雑なビジョン・言語理解のために設計されたマルチモーダルAIモデルです。そのパフォーマンスは、Mixture of Experts (MoE) 構造. 単一のモノリシックなネットワークで、すべての 280 億のパラメータがすべてのクエリに対してアクティブになるのではなく、モデルは複数の専門化された「エキスパート」モジュールで構成されています。タスクが提示されると、ゲーティングメカニズムが入力を知的に最も関連性の高いエキスパートにルーティングします。これは、合計パラメータのごく一部、約 30 億しかトークンごとにアクティブにならないことを意味します。その結果、同様のサイズの従来のモデルと比較して計算オーバーヘッドが 50% 削減され、推論速度が 2 ~ 3 倍高速になります。

トレーニングルーム内部:GSPO と IcePop 強化学習

Baidu は効率的なアーキテクチャだけに頼ったわけではありません. モデルの推論能力は、高度なトレーニング技術によって洗練されました。ドキュメントでは、GSPO および IcePop という 2 つの最先端の強化学習戦略の統合が指摘されています。これらの方法は、動的な難易度サンプリングと組み合わされ、実証可能な結果を持つタスクでモデルに常に挑戦するトレーニングカリキュラムを本質的に作成しました。トレーニング中盤の重要な段階でプレミアムなビジュアル言語推論データセットに焦点を当てることにより、Baiduモデルが見ているものと言語がそれを説明・分析するために使用されるものとの間の意味的な整合性を深めました。「検証可能なタスク」に対するこの強化学習は、科学の問題を解くような、答えが客観的に証明できる分野での強みにつながっています。

ERNIE-4.5-VL のコア機能

モデルの高度なトレーニングは、いくつかの主要なスキルとして現れています。統計グラフの解釈から画像内の因果関係の特定まで、複雑なシーンの多段階分析を実行できる強力な視覚的推論能力を示しています。特に注目すべきは、STEM タスクにおけるパフォーマンスです。例えば、物理回路図を見て、オームの法則やキルヒホッフの電流法則などの原理を正しく適用し、必要な方程式を立てて、正しい解を導き出すことができます。これは、単純なオブジェクトのラベリングをはるかに超えています。

また、座標レベルの精度でオブジェクトを検出できる、正確な視覚的グラウンディングもサポートしています。「スーツを着ている人をすべて特定し、そのバウンディングボックス座標を JSON 形式で出力してください」のような複雑な指示を与えることができ、産業オートメーションやロボット工学にすぐに役立ちます。これはビデオ理解にも拡張され、画面上の字幕を抽出し、タイムスタンプにマッピングすることで、検索可能なビデオアーカイブを可能にします。

論争とコミュニティからの質問:ERNIE-4.5-VL は「画像で考える」のか?

Controversy & Community Questions: Is ERNIE-4.5-VL "Thinking with Images"?

最も際立った機能であり、最も多くの議論を呼んでいるのは、Baiduは「Thinking with Images」と呼んでいます。このシステムにより、モデルは画像の特定の部分に動的にズームインして、細かい部分を調べることができます。テキストのぼやけた部分や小さくて不明瞭なオブジェクトに遭遇した場合、画像ズームツールをトリガーし、新しく明確になった詳細を分析し、その発見を最終的な回答に統合することができます。マーケティングでは、これを人間の視覚的探索の模倣として位置づけています。

しかし、技術コミュニティはさらに深く掘り下げています。オンラインディスカッションで見られるように、一般的な理論は、これが新しい魔法のようなネイティブモデルのスキルではなく、おそらく「エージェンティック機能」であるということです。これは、ERNIE-4.5-VLモデルが、画像クロッピングやリサイズ用のPythonスクリプトのような外部ツールとペアになっていることを示唆しています。モデル自体は、いつこれらのツールを呼び出すかを学習します。曖昧さに直面した場合、その強化学習トレーニングが機能し、特定の領域に「ズーム」コマンドを実行してから、新しく高解像度のクロップを再処理するように促します。これは、ビジョンモデル自体の根本的な変更というよりも、画像チャンクのためのインコンテキストRAGのような、インテリジェントなマルチステップワークフローです。あるコメント者が言ったように、「ついに『ズームと強化』を手に入れました!」

この議論は、パフォーマンスに関する重要な疑問も提起します。モデルがこれらのズームとクロップのサイクルを通じて画像を複数回分析する場合、推論時間は画像の複雑さに依存して増加するのでしょうか?これは、より広範で独立したテストが行われるまで、未解決の疑問のままです。コミュニティは、ローカルハードウェアで実行してこれらの境界を自分でテストするために、モデルのGGUFバージョンを熱心に待っています。

より明確なベンチマークへの需要

もう一つの論点は、詳細なベンチマークの欠如です。Baidu は、ERNIE-4.5-VL が Qwen-2.5-VL のような フラッグシップモデルと同等かそれ以上であると主張しています、モデルカードに記載されている提供されたチャートは最小限です。これにより、ユーザーはさらに多くの情報を求めています。標準化されたベンチマークでの直接的な比較は、開発者や企業が情報に基づいた意思決定を行う上で不可欠です。コミュニティは、他のモデルでの経験と比較しており、一部のテキスト専用ERNIEバリアントはQwenとほぼ同等でしたが、より高速で「思考ループ」に陥りにくいと指摘しています。ERNIE-4.5-VLがそのパフォーマンスの主張に真に応えているかどうかを検証するには、より明確なデータが必要です。

見通し:ERNIE-4.5-VLの展開と実用性

Outlook: Deployment and the Practicality of the ERNIE-4.5-VL

おそらくERNIE-4.5-VLの最も重要な側面は、そのアクセシビリティです。ライセンスはApache 2.0、商用利用の制限がなく、エンタープライズでの導入における大きな障壁を取り除いています。Hugging Faceなどのプラットフォームで利用可能で、統合の準備ができています。

Baiduはまた、堅牢な量子化サポートを提供することで、柔軟なデプロイメントを優先しています。量子化とは、モデルの重みの精度を下げるプロセスであり、サイズを縮小し、推論を高速化しますが、精度はわずかに低下することがよくあります。ERNIE-4.5-VLは、いくつかのレベルをサポートしています:

  • フル精度 (FP16):約56GBのVRAMが必要です。

  • 4ビット量子化:要件を、より管理しやすい約14GBのVRAMにまで引き下げます。

  • 2ビット量子化:VRAMを約7GBしか必要とせず、さらに性能の限界を押し広げます。

この積極的な量子化により、モデルはエンタープライズグレードのサーバーからハイエンドのコンシューマー向けGPUまで、はるかに幅広いハードウェアで実行できるようになります。複数のサポートTransformers、vLLMのような推論フレームワーク、FastDeployは既存のパイプラインへの統合をさらに簡素化します。このモデルは、エンジニアリング図面、工場のビデオフィード、医療スキャン、ロジスティクスダッシュボードなど、データが視覚形式でロックされているエンタープライズユースケースを明確にターゲットにしています。詳細な分析とグラウンディングを実行する能力により、工場での品質検査, 医療画像解釈、自動運転シーン分析。

ERNIE-4.5-VL の真の差別化要因は、単一の機能ではなく、効率的な MoE アーキテクチャとアクティブなツール使用能力の組み合わせにあります。これは実用的なアプローチです。パラメータの 10% のみをアクティブにすることで、リソースが制約された環境でもフラッグシップに近いパフォーマンスを実用的なものにします。「Thinking with Images」機能は、エージェンティックなワークフローであっても、根本的にインタラクションモデルを変更します。AI を受動的な知覚者(「これは何ですか?」)から能動的な知覚者へとシフトさせます。積極的な問題解決者「何が間違っているのだろう、もっと詳しく見てみよう」。これにより、真の自律エージェントへの道が開かれます問題を特定し、詳細をズームインし、必要に応じて外部コンテキストを検索し、最終的に行動方針を提案できます。

よくある質問 (FAQ)

1. ERNIE-4.5-VLにおけるMixture of Experts (MoE) アーキテクチャとは何ですか?

ERNIE-4.5-VLのMoEアーキテクチャは、「エキスパート」と呼ばれる専門化されたサブネットワークのシステムを使用しています。すべてのタスクで280億個のパラメータすべてをアクティブにするのではなく、ルーティングメカニズムが入力のみを最も関連性の高いエキスパートに誘導し、一度に30億個のパラメータのみをアクティブにして効率を高めます。

2. 「Thinking with Images」機能はどのように機能すると考えられますか?

コミュニティの分析によると、「Thinking with Images」は、モデルが外部ツールを使用するエージェンティックな機能です。不明瞭な詳細に遭遇した場合、モデルはおそらく画像ツールをトリガーして特定の領域をクロップまたはズームインし、その後、高解像度のセグメントを再分析して理解を深めます。

3. ERNIE-4.5-VLモデルを実行するためのVRAM要件は?

VRAM要件は量子化によって異なります。完全なFP16精度では約56GBが必要です。4ビット量子化では約14GBに低下し、2ビット量子化ではわずか約7GBのVRAMで実行できます。

4. ERNIE-4.5-VLはQwenのような他のモデルと比較してどうですか?

Baidu remio は、アクティブ化されるパラメータ数が少ないながらも、Qwen-2.5-VL のようなモデルに匹敵するか、それを超えるパフォーマンスを主張しています。以前の ERNIE テキストモデルに慣れているユーザーは、それらが同等の Qwen モデルよりも高速で安定していることが多かったと指摘していますが、VL バリアントに関する詳細な独立したベンチマークはまだ期待されています。

5. ERNIE-4.5-VL モデルはオープンソースですか?

はい、ERNIE-4.5-VL は Apache 2.0 ライセンスの下でリリースされています。このライセンスは無制限の商用利用を許可しており、学術およびエンタープライズアプリケーションの両方で自由に使用できます。

6. このモデルのトレーニングの文脈における GSPO と IcePop とは何ですか?

GSPO(Generalized Self-Play Optimization)と IcePop は、ERNIE-4.5-VL をトレーニングするために使用された高度な強化学習技術です。Baidu これらの手法は、モデルの回答の正しさを客観的に採点できる検証可能なタスクでトレーニングすることにより、モデルの視覚的推論を改善するのに役立ちました。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page