昆仑万维CEOの方漢氏、トークンではAIネイティブ組織は構築できず、モデルが依然として最重要と語る
昆仑万维CEOの方漢氏は、WAICのラウンドテーブルで、企業AIが好んで用いる指標の一つに異議を唱えた。トークン消費量が多くても、組織がAIネイティブになるわけではないという主張だ。この議論は、目に見えるAI活用と測定可能な生産価値との間にある直接的な矛盾を浮き彫りにする。企業は、モデルの出力を信頼できる業務へと変える仕組みを改善しないまま、より多くの推論処理を購入し、より多くのアシスタントを導入し、より多くのコードを生成できてしまう。
方氏の立場は、トークン増加を否定するという単純なものではない。彼はトークンを、その価値がモデル、エージェントフレームワーク、そしてそれを取り巻く組織に左右される入力要素として説明した。昆仑万维が初期にCopilotやCursorを利用した際も、トークン消費量は明確には増加しなかったとされる。より大きな変化が訪れたのは、コーディングエージェントがリポジトリを調査し、ツールを実行し、変更をテストし、複数のステップにわたって作業を継続できるようになってからだった。
この違いが重要なのは、企業がAIの利用を変革の証拠として扱う傾向を強めているためだ。トークン量は簡単に数えられる一方、意思決定の改善、より安全なリリース、有用な製品は測定が難しい。方氏が警告しているのは、組織が数えやすい数字を最大化しながら、実際の成果を見失う可能性があるということだ。
彼の回答は、昆仑万维の戦略的な賭けも明らかにしている。同社は基盤モデルの訓練を継続する一方、音楽、動画、ロボティクス、インタラクティブなワールドモデルを開発している。方氏は、エージェントやアプリケーションがより多くの注目を集めているとしても、モデルとコンピューティングインフラがAI企業の長期的な基盤であり続けると主張する。
昆仑万维の方漢氏、トークン量をAIネイティブ度の指標とする考えを否定
方氏の中心的な主張は、トークン消費量が示すのは活動量であり、組織の知性や事業価値ではないということだ。
ラウンドテーブルで方氏は、トークン使用量によって組織のAI変革を測定できるかと尋ねられた。同社のWAICでの議論によれば、彼は昆仑万维におけるコーディングアシスタントの利用経験を説明することで回答した。
同社はCopilotやCursorを含むツールを早期に導入したものの、トークン消費量は比較的横ばいのままだったとされる。従業員はモデルを利用できたが、それらは依然として従来のワークフロー内のアシスタントとして主に使われていた。ツールはコードを提案したり質問に答えたりできたが、タスクがアイデアからテスト済みの成果へ至る流れを自動的に再編成するものではなかった。
方氏は、その後の有用なAI業務の増加を、Claude Codeのようなコーディングエージェントの台頭と結び付けた。コーディングエージェントとは、コードベースを調査し、ファイルを編集し、コマンドを実行し、テストを行い、自らの作業を修正できるソフトウェアである。この運用フレームワークによって、モデルはより長いタスクに必要なフィードバックループへアクセスできる。
これが本記事の主要な逆転の発想だ。トークンが増えても、必ずしもより優れたAI組織が生まれるわけではない。より優れたモデルと強力な実行フレームワークは、各トークンの有用性を高められる一方、脆弱なシステムは信頼できる成果を生み出さないままトークンを消費し得る。
この違いは、ソフトウェアプロジェクトで明確になる。基本的なアシスタントは、プロンプトを受け取った後に関数を生成できるかもしれない。エージェントは、関連するサービスを特定し、その依存関係を調査し、複数のファイルを変更し、テストを実行し、失敗内容を読み取り、修正を試みることができる。
そのようなエージェントでさえ、単独では動作しない。リポジトリへのアクセス、テストインフラ、権限の境界、明確な仕様、そして望ましい成果を理解する人間が必要だ。トークン消費量は、こうしたステップ全体の計算活動を記録するが、結果がユーザーのニーズを満たしたかどうかは示さない。
したがって組織は、繰り返しの再試行、冗長なプロンプト、重複するエージェント、不適切に選択されたモデルによってトークン使用量を増やすことができる。こうしたパターンは、導入の進展ではなく無駄を示している可能性がある。逆に、適切なコンテキストと巧みに設計されたツールを備えた高性能なモデルなら、より少ないトークンで同じタスクを完了できるかもしれない。
方氏の捉え方は、トークンデータを無意味なものにするわけではない。この指標を成果に従属させるものだ。企業は引き続き、キャパシティプランニング、コスト管理、製品分析のために利用データを必要とする。ただし、その運用シグナルを、AIが組織を改善した証拠と混同すべきではない。
より信頼できるスコアカードなら、AIの活動をサイクルタイム、欠陥率、顧客成果、従業員の能力、回避できた手戻りと結び付けるだろう。これらの指標は収集が難しいが、モデルが何を消費したかではなく、組織が何を得たかを捉えられる。
Claude Codeのフレームワークが状況を変えた理由
モデルが推論を提供し、エージェントフレームワークがその推論を行動、フィードバック、完了した業務へと変える。
方氏がClaude Codeに言及したことは、AIソフトウェア開発におけるより広範な変化を浮き彫りにしている。従来のアシスタントは、主にエディター内でコードを補完していた。新しいエージェントは、リポジトリ全体を移動し、コマンドラインを通じて開発ツールを操作できる。
AnthropicはClaude Codeを、コードベースを読み取り、ファイルを変更し、テストを実行し、コミット済みのコードを提供するエージェント型コーディングシステムとして説明している。こうした機能は、基盤となるモデルを取り囲むハーネスを形成する。このハーネスが、利用可能なコンテキスト、エージェントが使用できるツール、変更が機能することを示す証拠の受け取り方を決定する。
このフレームワークは、同一のモデルでも製品によって異なる性能を示す理由を説明するのに役立つ。脆弱なループ内に置かれたモデルは、関連ファイルを参照できず、過去の決定を忘れ、テスト前に停止する可能性がある。同じモデルでも成熟したハーネス内なら、リポジトリを検索し、タスクの状態を維持し、チェックを実行し、失敗に対応できる。
それでもハーネスは、モデルに欠けている知性を生み出すことはできない。情報を提示し、フィードバックを提供することはできるが、モデルがその両方を正しく解釈しなければならない。方氏は、自身の比較では、競合システムが同じ基盤モデルを使用している場合でさえClaude Codeが優れていることが多かったと、そのテストを紹介した詳細なハーネス分析で述べている。
この見解は、AI生産性を二層で捉える解釈を裏付ける。モデルの能力が上限を定め、エンジニアリング設計が製品をその上限にどこまで近づけられるかを決める。どちらの層も、もう一方を代替することはできない。
約400,000件のClaude Codeセッションを対象としたAnthropicの2026年6月の分析は、このシステムにおける人間側の重要性を示す証拠を提供している。同社のエージェント型コーディング研究では、通常、計画に関する意思決定の大半を人間が行い、実行に関する意思決定の大半をClaudeが行っていた。ドメインの専門知識が豊富なユーザーほど、検証済みの成功に至る割合が高く、エラーからの回復も効果的だった。
また同研究では、専門家と評価されたセッションは、初心者と評価されたセッションに比べ、検証済みの成功に到達する割合が2倍以上だった。初心者は問題が発生したセッションを数倍高い頻度で放棄していた。これらの結果は、エージェントへの普遍的なアクセスによって誰もが自動的に同等の成果を得られるという考えに疑問を投げかける。
したがってAIネイティブ組織に必要なのは、ライセンスとプロンプトだけではない。価値ある問題を定義し、誤った出力を見抜き、信頼できる受け入れテストを設計できる人材が必要だ。また、不要なデータを露出させることなくエージェントが取得できる共有コンテキストも必要になる。
そこで、検索可能なエンジニアリングナレッジベースが重要になる。アーキテクチャ上の決定、インシデント履歴、運用上の制約を構造化されたコンテキストとして利用できれば、エージェントの性能は向上する。それでも組織は、エージェントがアクセスできる情報と実行できる操作を管理しなければならない。
Claude Codeが重要なのは、モデルがどのように実行システムの一部になり得るかを示しているからだ。モデルが付随的な存在になったことを示しているわけではない。フレームワークの価値は、その内部にある推論エンジンの品質に依存する。
トークンの山ではなく、モデルこそが昆仑万维の長期的な賭けであり続ける
昆仑万维はアプリケーションを流通手段として位置付けながら、モデルとコンピューティングを技術戦略の中心に据え続けている。
複数のAIアプリケーションを構築してきた企業の主張として、方氏の議論は異例に聞こえるかもしれない。昆仑万维は、リサーチ、文書、プレゼンテーション、その他の知識業務向けAIワークスペースとしてSkyworkを推進してきた。それでも方氏は、同社が外部プロバイダーに全面的に依存するのではなく、モデルの訓練を継続していると述べた。
この立場は、戦略的な依存に対する懸念を反映している。サードパーティ製モデルを基盤とするアプリケーション企業は迅速に製品を出荷できるが、そのコスト構造と能力の上限は他社のロードマップに左右され続ける。モデル開発企業は、訓練とインフラに関してはるかに大きな負担を抱えるものの、性能と製品の方向性をより強く制御できる。
昆仑万维は、このモデル戦略をテキスト以外にも拡大している。同社は、ユーザーの操作によって制御されるインタラクティブな環境を生成するMatrix-Gameシリーズを開発してきた。同社が公開するMatrix-Gameリポジトリでは、長期記憶を備えたリアルタイムのストリーミング型ワールドモデルとして説明されている。
ワールドモデルは、ある行動の後に環境がどのように変化するかを予測する。ゲームでは、キーボードやマウス入力後の次の視覚的状態を生成することを意味し得る。ロボティクスでは、関連するシステムが、行動を選択する前に物理的な結果を予測する助けとなり得る。
昆仑万维はまた、モデルのロードマップが音楽、動画、具身化環境、ゲーム世界を対象としていることも示している。これらの分野では、それぞれ異なる訓練データと評価方法が必要になる。環境がオブジェクトの一貫性を失ったり、数秒後に操作を無視したりするなら、説得力のある動画フレームだけでは不十分だ。
同社の初期の言語モデル開発も、これが最近の方針転換ではないことを示している。2023年の技術論文では、Skyworkがオープンなバイリンガル基盤モデルとして説明されていた。その後のモデルレポートでは、総パラメータ数1460億、16個のエキスパートを持つMixture-of-Experts言語モデルであるSkywork-MoEの詳細が示された。
これらの数字は技術的な規模を示すものだが、それ自体で製品価値を証明するものではない。パラメータ数も、トークン消費量と同じように、単なる活動指標になり得る。重要なのは、現実的な制約の下でモデルが実際のタスクを改善するかどうかだ。
昆仑万维の仮説は、激しい競争に直面している。Anthropic、OpenAI、Googleは、コーディング製品や企業向け製品を通じて汎用モデルを推進している。AlibabaのQwen、DeepSeek、MiniMaxを含む中国の開発企業やその他の研究機関も、能力、効率性、マルチモーダル性能、導入の柔軟性を競っている。
特化型ワールドモデルも、別の過密市場を生み出している。研究チームやスタートアップは、インタラクティブ動画、ロボティクスシミュレーション、自動運転、生成型ゲーム環境を追求している。各市場には固有の要件があり、一つのモデルファミリーがすべてを支配するのは困難だ。
したがって、方氏の戦略的主張は検証可能である。昆仑万维のモデルが同社のアプリケーション内で明確な優位性を生み出すなら、訓練の継続はその費用と組織的な注力に見合う可能性がある。外部モデルの進歩がより速ければ、垂直統合は持続的な基盤ではなく、コストの高いこだわりになり得る。
次のリリースでは、視覚的に印象的なデモンストレーション以上のものを示さなければならない。安定したインタラクション、制御可能性、実用的なレイテンシ、そして開発者や顧客がそれらを基盤に再現可能なワークフローを構築できるという証拠が必要だ。モデルの所有が重要なのは、アプリケーション層では容易に借りられない能力や経済的優位性を生み出す場合に限られる。
AIコーディングは成果と技術的負債を同時に増大させる
コーディングエージェントは、組織がそのソフトウェアをレビューし、テストし、責任を持って管理する能力を拡大するよりも速く、ソフトウェアの成果物を増やせる。
Fangは生産性に関する主張とともに、技術的負債、つまり近道、脆弱な設計、または十分に理解されていないコードによって将来発生する作業について警告した。彼の発言をまとめたAIHOTの要約によると、AIプログラミングによって本番環境のインシデントが数倍に増える可能性があると警告したという。この数値的主張は独立した検証を受けていないため、業界のベンチマークとして扱うべきではない。
その数値を受け入れなくても、根底にあるリスクには信憑性がある。エージェントは継続的にコードを生成できる一方、レビュー能力は人間の注意力とテスト品質によって制限されたままだ。生産速度が上がれば、隠れた前提、セキュリティ問題、保守負担を含み得るソフトウェアの量も増える。
Anthropicは、成果物の増加を示す印象的な社内事例を提供している。同社は、2026年5月までにコードベースへマージされたコードの80パーセント以上をClaudeが作成したと報告した。また、一般的なエンジニアが第2四半期に1日当たりマージしたコード量は、2024年の8倍だったという。
Anthropicは、コード行数は品質ではなく量しか測定しないため、生産性を過大評価すると明確に注意を促した。この但し書きはFangの主張を裏付けている。生成されたコードを数えることは、トークンを数えることと同じ理由で誤解を招き得る。
モデル企業以外から得られた証拠は一様ではない。METRによるランダム化試験では、使い慣れたリポジトリで2025年初頭のAIツールを使用した経験豊富なオープンソース開発者は、タスクの完了に19パーセント長い時間を要した。この開発者調査が対象としたのは古いツールであるため、2026年のエージェントの性能について結論を出すものではない。しかし、ベンチマークスコアやユーザーの期待が、実環境での測定に代わるものではない理由を示している。
AIが生成した変更は、責任の空白も生み出し得る。エンジニアは、その背後にある設計上の判断を理解しないまま、正しく見えるコードを承認する可能性がある。数週間後にシステムが障害を起こした場合、チームは一度も文書化されなかった判断過程を再構築しなければならない。
非エンジニアが社内アプリケーションを作成する場合、このリスクはさらに高まる。ドメインの専門家は開発者よりもビジネス上の問題を深く理解していることが多く、コーディングエージェントはそれを直接自動化する手段を提供する。しかし、そうしたユーザーは、認証の欠陥、安全でないデータ処理、競合状態、脆弱な依存関係を認識できない可能性がある。
これは、組織がエージェント型コーディングを阻止すべきだという意味ではない。それを取り巻く責任体制を整えるべきだという意味だ。本番環境へのすべての変更には、引き続き責任を負う所有者、適切なテスト、セキュリティ制御、ロールバック手段が必要である。
コードレビューも変わらなければならない。増大する機械生成パッチを一行ずつレビューすることは、不可能になり得る。チームには、より強力な自動チェック、より小さな変更単位、明確なアーキテクチャ規則、表面的な構文ではなく動作を評価するテストが必要だ。
組織は、デプロイ速度と運用品質の関係を監視すべきである。有用な指標には、流出した欠陥、ロールバック頻度、インシデントの深刻度、レビュー時間、リリース後に発生した保守作業などがある。トークン量は、これらの指標より上位ではなく、並列に置くべきだ。
Fangの最も重要な指摘は組織に関するものだ。AIは実装を安価にするが、安価な実装は価値の低いソフトウェアをさらに増やす可能性がある。希少な資源は判断力へと移る。つまり、適切な問題を選び、制約を定義し、生成された成果物が存在する価値を持つかどうかを決める力である。
真の競争はモデル能力と測定された成果の間にある
業界の中心的な論点はモデル対アプリケーションではなく、能力と規律ある実行対目に見える消費量である。
トークン量は、チーム間で共通の単位を提供するため、経営幹部にとって魅力的だ。従業員が承認済みのツールを試しているか、インフラの利用が拡大しているかを示すことはできる。しかし、ユーザーが適切なモデルを選んだか、有用なコンテキストを与えたか、欠陥のある出力を受け入れたかは明らかにできない。
同じ制約は、他の一般的なAI指標にも当てはまる。プロンプト数は断片化を評価してしまう。生成コード量は冗長性を評価してしまう。シートの有効化数はアクセスを測る。節約時間は、その後の手戻りを除外した自己申告の推定値に依存することが多い。
成果の測定は時間がかかり、組織内で政治的に難しい。失敗したデプロイには責任者がいる一方、上昇する利用状況ダッシュボードは進歩のように見える。Fangの批判は、テクノロジーリーダーにAIへの支出を運用上の証拠と結び付けるよう迫っている。
モデル開発者も同様の測定問題に直面している。標準ベンチマークは制御された条件下でシステムを比較するのに役立つが、実際の業務には非公開のコンテキスト、曖昧な目標、ツールの障害、変化する要件が伴う。モデルがベンチマークで首位に立っていても、組織のワークフロー内では十分に機能しない可能性がある。
これこそ、主たる対立がKunlun Tech対Anthropic、あるいは他の研究所ではない理由だ。より深い対立は、AI変革に関するインプット主導の理論と成果主導の理論の間にある。
インプット主導の理論では、モデルへのアクセスが増えれば利用が増え、利用が増えれば変革が起こる。成果主導の理論では、モデル、ツール、知識、ガバナンス、責任を負う人々が機能するシステムを形成した場合にのみ、AIは価値を生み出す。
成果主導の考え方は調達も変える。購入者は、リーダーボードから1つを選ぶのではなく、代表的なタスクで複数のモデルをテストすべきだ。完了した作業、修正率、レイテンシ、セキュリティ、人間の総作業量を評価すべきである。
人員計画も変わる。ドメインの専門家がエージェントを効果的に指揮できるなら、組織はドメイン知識を保持し、共有する必要がある。経験豊富なスタッフの判断を体系化する前に彼らを置き換えると、エージェントが必要とするまさにそのコンテキストが弱体化する可能性がある。
このプロセス全体を通じて、モデルは依然として重要だ。より優れた推論は、再試行を減らし、不足している情報を認識し、より長い依存関係の連鎖を追跡できる。優れたハーネスでも、タスクを誤解するモデルを完全には補えない。
同様に、強力なモデルでも、権限の不足、古いドキュメント、存在しないテストスイートを補うことはできない。Fangの立場は、これら両方の事実を結び付けている。モデルが長期的な能力を確立し、エンジニアリングシステムがその能力を本番環境での価値へ変換する。
この解釈は、構築か購入かという誤った二者択一も防ぐ。ほとんどの組織はフロンティアモデルを訓練すべきではない。それでも、評価、ルーティング、データアクセス、プロバイダーリスクを網羅する社内モデル戦略は必要だ。
Kunlun Techは、モデルとアプリケーションの両方を構築するという、より困難な道を選んだ。この選択により、スタック全体を最適化できる可能性が得られる。また、その投資が差別化された成果を生むかどうかについて、市場が評価できる点も増える。
3つのシグナルがFang HanのAIネイティブ論を検証する
次の証拠は、新たな見出しを飾るトークン数ではなく、製品の挙動、運用品質、顧客による採用から得られるべきだ。
最初のシグナルは、Kunlun Techによる次のモデルリリース群である。同社の音楽、動画、ロボティクス、ゲーム世界の各システムは、永続的な状態、制御可能な出力、実用的なレイテンシを示す必要がある。優れたデモンストレーションは、独自のモデル能力が永続的な基盤を生み出すというFangの主張を裏付けるだろう。
弱いデモンストレーションや、狭く演出されたデモンストレーションは、その主張を弱めるだろう。ワールドモデルは特に、持続的なインタラクションでは通用しない印象的な短いクリップに陥りやすい。独立したテストでは、長期的な一貫性、アクションへの応答、慎重に選ばれたプロンプト以外での性能を検証すべきだ。
第2のシグナルは、コーディングエージェントを大規模に導入する組織の品質実績である。デプロイ頻度はおそらく上昇するが、その増加が意味を持つのは、欠陥、ロールバック、インシデントのデータが併せて示される場合に限られる。信頼性を悪化させずにエージェントが作成したコードを増やせるという証拠は、Fangの技術的負債に関する懸念への回答になるだろう。
これらの指標が悪化すれば、組織がガバナンスよりも速く生成能力を拡大したことを示す。また、人間によるレビュー、自動検証、より明確な責任範囲の必要性を強く裏付けることになる。
第3のシグナルは、企業が利用状況ダッシュボードからタスクレベルの投資効果測定へ移行するかどうかである。購入者は、エージェントが完了時間、手戻り、顧客成果、運用に要する総労力をどう変化させるかを報告すべきだ。トークン消費量も分析の一部として残せるが、コストと処理能力の指標として機能させるべきである。
この移行は一様には進まないだろう。ベンダーは急速に増加する利用状況を報告することで利益を得る一方、顧客側にはナレッジワークの明確な基準値がない場合がある。それでも、調達圧力は、エンゲージメントだけでなく検証済みの成果を示せるシステムに有利に働くはずだ。
開発者にとって、Fangのメッセージは実践的である。エージェントを無条件に信頼するコード工場ではなく、実行のパートナーとして扱うことだ。テスト、制約、関連するコンテキストを与える。アーキテクチャ、セキュリティ、データ処理に影響する判断はレビューする。
企業の購入者にとって、そのメッセージはシステム全体を評価することだ。モデル品質、ツールへのアクセス、可観測性、知識検索、ガバナンスが、エージェントが永続的な価値を生み出すかどうかを決定する。トークン請求額が増えても、その問いには答えられない。
ナレッジワーカーにとって、この変化は明確な問題定義とドメイン理解を重視する。AIはより多くの実行を担えるが、どの成果が重要か、結果が信頼できるかは依然として人が判断する。体系化されたAIワークフローは、その判断を手放すことなく反復作業を減らせる。
トークンベースの変革に対するFang Hanの異議は、究極的にはより良い証拠を求めるものだ。今やKunlun Techも同じ立証責任を負っている。今後登場するモデルは、所有、訓練への投資、コンピューティングインフラが、ユーザーに選ばれ、組織が信頼できる製品へとつながることを証明しなければならない。
すべてのAIリーダーが問うべきことは、もはや企業が何トークン消費したかではない。そのトークンを費やしたことで何が変わったのか、誰が結果を検証したのか、そして組織がそれを安全に再現できるのかである。



