中国AIとPentagon業務をめぐり米国データベンダーに厳しい視線
Google Newsは、中国のAI研究所にサービスを提供する一方で、米国政府関連の業務を追求または受託していると報じられた米国のデータ企業4社をめぐる深刻な対立を取り上げた。
該当する企業はSurge AI、Mercor、AfterQuery、Turingである。Forbesの調査は、Tencent、Ant Group、Alibaba、ByteDanceを含む顧客との関係をこれらの企業に結び付けた。こうした関係の一部は、社内コミュニケーション、プロジェクト記録、業界関係者への取材によって裏付けられたとされる。
この報道は、ベンダーが機密情報、軍事データ、または米国のモデル開発企業に属する独自データセットを移転したことを示すものではない。提起しているのは別の問いだ。米国政府機関向けに専門的な学習データを構築する企業は、Washingtonが安全保障上のリスクと見なす組織にも専門知識を提供すべきなのか。
Texas州選出の共和党議員で、長年対中強硬派として知られるMichael McCaulは、政府へのアクセスには制限を伴わせるべきだと主張する。同氏はNew York Postに対し、米国契約を求めるベンダーが、Pentagon指定の中国軍関連企業によるAI改善を支援すべきではないと語った。
この立場は、目立たなかったサプライチェーン上の問題を調達をめぐる議論へと変える。Washingtonは長年にわたり、高度なチップ、製造装置、投資を制限してきた。一方で、専門的な学習データははるかに緩やかな監視の下で国境を越えて移動している。
したがって核心的な対立は、単純な米中対立ではない。世界規模のデータ市場が持つ商業的な可能性と、政府業務に伴う安全保障上の責務との対立である。
データベンダーが販売したと報じられたもの
問題となっているのは、Pentagonのファイルや秘密の米国モデル重みの移転ではなく、パッケージ化された人間の専門知識である。
現代のAIシステムには、ウェブサイトから収集した生のテキスト以上のものが必要だ。開発者は、難しいタスクの遂行方法をモデルに教えるため、綿密に設計された例、専門家による評価、採点指示、修正も購入する。
このプロセスはしばしばポストトレーニングと呼ばれる。幅広い初期学習の後に、より優れた回答を示し、誤りを特定し、望ましい振る舞いに報酬を与えることで、モデルを改善する。
データベンダーは、この作業のためにソフトウェアエンジニア、科学者、会計士、弁護士などの専門家を募る。そして専門家の成果を、AI研究所が繰り返し利用できるデータセットに整理する。
今回の調査は、カスタムプロジェクトと既製データセットの双方から成る市場を描いている。カスタムデータは、特定の顧客やモデル目標のために作成される。既製データは標準化され、複数の購入者に販売できる。
再利用可能なデータセットは、孤立した事実以上のものを広めうるため、この違いは重要だ。そこには、以前のプロジェクトで開発されたタスク設計、評価手法、品質管理、推論パターンが含まれる可能性がある。
元となる学習データ調査によると、中国の購入者は金融、サイバーセキュリティ、コーディング、モデルの自己改善といった分野を扱う素材を求めていた。同誌は複数のデータプラットフォームの購入者や作業者に関するコミュニケーションを確認した。
Forbesは、Tencentの幹部がデータ面でSurge AIに依存していると説明していたと報じた。また、MercorをTencent、AfterQueryをAnt GroupおよびAlibaba、TuringをByteDanceと結び付けた。
これらの調査結果には慎重な帰属が必要である。同誌は社内メッセージ、記録、プロジェクト文書を確認したとしているが、根拠となる記録の大半は全文公開されていない。読者は各商業関係を裏付けるすべての文書を独自に確認することはできない。
各社の公の回答も限られていた。Mercorはコメントを拒否し、AfterQueryとSurgeは顧客情報を開示していないと述べた。Turingは、独自モデルとオープンソースモデルの開発の双方にサービスを提供していると説明した。
報告書に名を連ねた中国企業は、この調査に対する回答を示さなかった。沈黙は、報じられた関係を確認するものでも、否定するものでもない。
規模の推計も、公開された財務資料ではなく業界関係者の情報に基づく。データ業界の起業家2人は、中国の主要AI研究所6社による米国のデータラベリング企業への年間支出を約5億ドルと見積もったとされる。
同じ報道は、AfterQueryについて少なくとも5,000万ドルの継続的な中国関連収益があるとした。また、事情に詳しい人物の話として、中国の研究所がMercorの第2四半期売上高の2%を占めたと報じた。
これらの数値が正確であれば、なぜこの取引がベンダーを引き付けるのかが分かる。市場は販売戦略に影響を与えるほど大きい一方で、非公開性が高く、顧客やプロジェクトの追跡は依然として困難だ。
4社は、既存の輸出規則に違反したとして報道で非難されているわけではない。専門的なデータセットは一般に、高度なプロセッサや半導体装置に適用されるものと同様の規制には直面していない。
この法的な隔たりが、この問題の中心にある。現行ルールの下で商業的に通常の取引であっても、国家安全保障政策を担う議員から精査を受ける可能性がある。
公に入手可能な証拠が支持する結論は限定的だ。米国のベンダーは、中国の商業組織に構造化されたAI学習素材を供給していると報じられている。それは、米軍の情報を引き渡した、または特定顧客のデータセットを複製したという主張を裏付けるものではない。
この境界は明確に保たれるべきだ。さもなければ、調達と輸出規制に関する正当な議論が、裏付けのないスパイ活動の疑惑へと変質しかねない。
Google NewsがPentagonの調達問題を増幅させる理由
政治的圧力の源はデータラベリング業務そのものではなく、ベンダーの顧客リストが重なっていることにある。
Surge AIには、小規模なDefense Department受注の記録がある。連邦のSmall Business Innovation Research記録には、AI支援型データラベリングプラットフォームに関する2023年のArmyプロジェクトが掲載されている。
そのArmyのデータ関連受注の総額は149,285ドルだった。公開記録では、Surge Labsが受託者、Edwin Chenが主任研究者として記載されている。
別のAir Forceプロジェクトでは、Surgeが2023年に73,194ドルを受注した。記載された目的には、情報報告書の検索と要約のための言語モデルが含まれていた。
これらの受注規模は、大型の防衛技術契約と比べれば小さい。しかし、データインフラと情報関連アプリケーションに関わる業務で、Surgeが防衛調達システムに参入したことを示している。
公開されている受注ページは、Surgeが機密データを受け取ったことを示していない。また、方法、素材、従業員のいずれかが米国向けと中国向けのプロジェクト間を移ったことも証明していない。
McCaulの主張は、むしろ組織としての整合性に焦点を置く。政府業務を任せられるベンダーは、Pentagonが指定した組織を同時に強化すべきではない、というのが同氏の論点だ。
Tencentが最も重要な例である。米国政府は以前、Tencentを中国軍と関係があると認定しており、同社はその評価に異議を唱えている。
この指定によって、Tencentとのすべての商取引が自動的に違法になるわけではない。しかし、防衛分野の顧客にサービスを提供する米国の請負企業にとって、評判面と政策面のリスクは生じる。
同じ問題は現在Alibabaにも及んでいる。2026年6月、PentagonはAlibaba、Baidu、BYDなどを、中国軍企業と見なす事業体の拡大リストに追加した。
公式の軍関連企業リストは、Alibabaが政府との関係を通じて中国の防衛産業基盤に寄与しているとしている。Alibabaはこの結論を否定し、指定に異議を申し立てている。
リストそのものは政府の判断であり、刑事上の有罪判決ではない。掲載されれば防衛契約が制限され、さらなる規制につながる可能性はあるが、掲載企業のすべての製品が軍事目的に使われていることを示すものではない。
AfterQueryとAnt Groupの関係が報じられた件では、このニュアンスが重要になる。Antは重要な企業上の側面でAlibabaとは独立して事業を行っているが、両社の事業と歴史にはつながりが残る。Antを含むとされるプロジェクトを、中国軍向けの直接業務と自動的に表現すべきではない。
それでもGoogle Newsの見出しは、政治的な問題を効果的に捉えている。Washingtonは技術供給企業に対し、政府業務が最低限の法令順守を超える義務を伴うかどうかの選択を迫っている。
連邦調達ではすでに、多くの請負企業に安全保障規則、利益相反の開示、サプライチェーン要件が課されている。Congressは、AI学習データや指定された外国事業体向けの業務を対象に、これらの規則を拡大する可能性がある。
このような変更は、規制当局が新たな輸出区分を定義する前にベンダーへ圧力をかけることになる。企業はデータセットを海外に販売する法的能力を維持していても、国内で連邦契約の適格性を失う可能性がある。
このアプローチは、輸出規制の代替として調達政策を用いるものだ。政府機関はすでに請負企業のリスクを評価する幅広い権限を持つため、迅速に進められる可能性がある。
同時に、複雑さも生む。AIデータベンダーは分散型の労働力、下請け企業、専門家マーケットプレイスを利用している。データセットの出所、設計費用を負担した顧客、手法が再利用されたかどうかを判断するのは難しい場合がある。
政府の購入者には、単なる顧客ブラックリスト以上のものが必要になる。チーム、データ、評価手法、再利用可能な素材を分離するための明確な規則が必要だ。
その詳細がなければ、制限は一貫性を欠く可能性がある。ある政府機関が争いのある顧客関係を理由にベンダーを拒否する一方、別の機関はそこから購入を続けるかもしれない。
したがって、当面の圧力はPentagonの調達担当者にかかる。請負企業の海外での商業活動が、運用上のリスク、政治上のリスク、あるいはどちらでもないのかを判断しなければならない。
真の輸出規制の隔たりは人間の専門知識にある
チップ規制は計算能力を対象とする一方、報じられたデータ取引は、その能力をより有用にする手法を移転する。
米国は、中国向け技術政策をプロセッサ、半導体製造装置、製造ノウハウに集中させてきた。これらの規制は、高度なAIシステムの学習が膨大な計算能力を必要とすることを反映している。
計算能力は投入要素の一つにすぎない。モデル開発企業には、弱点を狙い、性能を測定し、専門分野で信頼できる振る舞いを教えるデータも必要だ。
生のインターネットテキストだけでは、高度な会計分析の完了や研究室の手順のレビューをモデルに十分教えられない。こうしたタスクには、業務を理解する人々による例と判断が求められる。
ベンダーは、ある専門職に解決策を作成させ、別の専門家にそれを批評させ、さらに第三の専門家に競合する回答を採点させることがある。その結果生まれるパッケージは、優れた性能がどのようなものかをモデルに教える。
評価ルーブリックは特に価値が高い。ルーブリックは、回答に含まれるべき要素と、評価を下げるべき誤りを定義する。専門家の判断を、反復可能な学習シグナルへと変換する。
報じられた取引は、中国の研究所が、すべての専門家ネットワークと品質プロセスを社内で構築する代わりに、このインフラを購入できることを示唆している。それにより実験の負担を減らし、開発サイクルを短縮できる可能性がある。
ネイサン・ランバート氏(元Allen Institute for AIのリサーチサイエンティスト)はForbesに対し、モデルがより難度の高い領域へ進むにつれ、高品質なデータの重要性が特に高まると語った。この指摘は、データセットが大きな商業的価値を持つ理由を説明している。
しかし、国家安全保障上の論点が自動的に成立するわけではない。データベンダーはしばしば、公開知識と有償の専門家労働をもとに素材を作成する。こうしたサービスを制限することは、特殊なチップを制限する場合とは異なる法的・実務的な問題を伴う。
プロセッサは、型番、出荷記録、測定可能な性能を持つ物理的な製品である。一方、トレーニング用データセットは複製、変更、他の素材との結合が可能であり、サービス契約を通じて提供される場合もある。
同じベンダーでも、顧客ごとに異なるデータを制作することがある。あるプロジェクトでAnthropicにサービスを提供しているからといって、別の場所で販売される既製データセットにAnthropicの機密情報が含まれていることにはならない。
この区別は不可欠だ。報道によれば、この論争は共有された生産能力と専門性に関わるものである。米国の研究所が保有する独自の顧客データが無断で再販売されたことを示すものではない。
それでも戦略上の懸念は残る。ベンダーは、どの専門家ワークフローが有用な改善を生むか、弱い寄与をどう排除するか、評価システムを効率的にどう構築するかを学習する。
機密記録が一切移転しなくても、その運用上の知識は別の研究所が資源をより効果的に投入する助けになり得る。優位性の一部は生産手法にある。
ワシントンは、他の技術分野でも似た課題に直面してきた。輸出規制は、当局が規制対象を定義し、その仕向け先を特定できる場合に最も機能する。
知識集約型のサービスは切り分けが難しい。規制当局は、最終的なデータセット、主題、生産プロセス、購入者、あるいはそれらの組み合わせのどれを規制するのかを決めなければならない。
過度に広範な規則は米国ベンダーにも損害を与えかねない。海外販売は収益を支え、国際的な専門家を呼び込み、米国企業が業界標準への影響力を維持する助けとなる。
Forbesが引用したAIデータコンサルタントのショーン・カイ氏は、包括的な制限はオープンソース開発を弱め、少数のクローズドモデル提供者の地位を強化しかねないと警告した。同氏は安全保障上の懸念を退けたわけではないが、単純な制限には疑問を呈した。
この議論は、マッコール氏の提案に対する最も有力な反論を示している。強制的な商業分離は中国のアクセスを制限し得る一方で、研究市場を分断し、米国プロバイダー間の競争を弱める可能性もある。
オープンソースモデルは、さらに別の層を加える。その重みとトレーニング手法は広く流通し得る一方、改善に使われたデータセットは非公開のまま残る可能性がある。
米国のデータサービスを制限しても、中国の代替手段をなくすことにはならない。中国国内のデータ企業、大学、クラウドソーシングプラットフォームが米国の供給者を代替する動きを促すことになる。
したがって政策上の論点は、恒久的な遮断ではなく、遅延と交渉力にある。制限は特定の専門家ネットワークや評価手法へのアクセスを遅らせる可能性がある。しかし、根底にある知識そのものを消し去ることはできない。
読者は、データ品質とモデル能力も区別すべきだ。優れた事例を購入すれば性能を改善できるかもしれないが、競争力のあるフロンティアモデルが保証されるわけではない。
研究所には依然として、計算インフラ、研究者、アルゴリズム、展開システム、継続的なテストが必要だ。データは高価値な投入要素ではあるが、それらの能力を完全に代替するものではない。
Google Newsで注目を集めたことは、この繊細な仕組みを公の議論へ持ち込むという意味で重要である。チップ規制に馴染みのある読者は、人間が生成するトレーニング素材がなぜ同じ戦略的議論に属するのかを理解できるようになる。
証拠はまだ安全保障上の侵害を示していない
最も強く確認されている懸念は未開示の政策上の衝突であり、最も重大な疑惑は依然として立証されていない。
現時点で公開されている証拠は、Surge AI、Mercor、AfterQuery、またはTuringが米国の機密情報を中国の顧客へ移転したことを示していない。
また報道は、国防総省との契約に基づいて作成されたデータセットが海外で再販売されたことも示していない。Anthropic、Google、Meta、またはOpenAIの顧客素材が許可なく共有されたことも示していない。
これらははるかに重大な主張となる。それを裏付けるには、契約書、技術記録、または直接の証言が必要だが、そうしたものは公開されていない。
利用可能な証拠はむしろ、報じられた顧客関係、政府の発注記録、業界推計、議員の発言を組み合わせたものだ。
この一式は精査の根拠にはなる。しかし、これらの企業を軍事機密の流通経路と表現することを正当化するものではない。
政治的な注目が高まるにつれ、この区別を維持することは難しくなる可能性がある。見出しは複雑なサプライチェーンを、企業が対立する二陣営を「支えている」という単純なイメージへ圧縮する。
この表現は対立を伝えるが、顧客間で情報の共通プールが移動していることを示唆しかねない。データベンダーはプロジェクトをどう分離しているかについて公にほとんど語らないため、その示唆を検証するのは難しい。
企業は透明性を通じて、不確実性の大部分に対処できる。指定対象事業体に関する方針、顧客審査、データセットの来歴、政府チームと商業チームの分離について開示できる。
また、既製製品に機密プロジェクトで開発された技術が組み込まれているかどうかも説明できる。こうした説明には顧客データの開示は必要ない。
独立監査はより強い証拠を提供する。監査人は、機微な資料を公開せずに、アクセス制御、従業員の権限、データの系譜、契約上の制約を検証できる。
政府の調達担当者も同様の質問をすべきだ。外国顧客との関係は、リスク評価の一部にすぎない。
人員が重複しているか、ツールが同じストレージ環境を共有しているか、再利用可能なデータセットが機密仕様を保持しているかを調べるべきである。また、請負業者が下請け業者をどのように管理しているかも確認すべきだ。
ベンダーの限定的な回答により、こうした疑問は未解決のままである。守秘義務によって顧客名を明かせない場合でも、一般的な安全措置は公表できる。
中国側も、ワシントンによるより広範な指定に異議を唱えている。AlibabaとBaiduは自社が軍事企業であることを否定しており、中国政府は米国が国家安全保障の定義を拡張していると非難している。
Associated Pressは、国防総省のリストが2026年に188事業体へ拡大したと報じた。指定をめぐる争いは、政策立案者が公式な分類と独立して立証された軍事活動を区別すべき理由を示している。
この問題は単なる言葉の問題ではない。国防総省のリストに連動する規則は、そのリストに伴う異議、追加、削除、法廷での争いも引き継ぐことになる。
ある顧客が指定された場合、その商業プロジェクト自体が合法で防衛と無関係であっても、ベンダーは連邦契約の適格性を失う可能性がある。
議会は、制限を遡及適用するかどうかを決める必要がある。また、企業が問題のある関係を開示、段階的に終了、または争うための手続きも必要となる。
別の不確実性は、Mercorが報じられた連邦政府契約に関するものだ。公開報道によれば、同社は従業員に対して政府業務を獲得したと伝えたが、利用可能な詳細は限られている。
省庁名、範囲、発注記録、契約条件がなければ、Mercorの状況をSurgeの公表済み受注と同じ証拠水準で扱うのは時期尚早である。
AfterQueryとTuringは、また異なる事例である。報道は両社を中国の顧客と結びつけているが、これまでに示された公開証拠は、いずれの企業についても国防総省との契約を立証していない。
4社すべてのベンダーを同一視すれば、重要な違いが見えなくなる。それぞれの関係について個別の検証が必要だ。
マッコール氏の提案は政治的立場であり、既存の政府全体に適用される規則ではない。政府機関は、指定された中国企業にサービスを提供するすべてのデータベンダーを対象とする包括的な禁止措置を、公には発表していない。
ただし議会は、中国のAIシステムと米国技術への依存に対する注目を強めている。2026年7月の下院調査では、米国企業が中国のオープンウェイトモデルをどのように利用しているかが検討された。
この調査は、中国のモデルが米国のシステムへ入り込むという逆方向の流れに関するものだ。二つの議論を合わせると、議員たちがAIサプライチェーンを両方向から検討していることがわかる。
一方では、米国企業が中国のモデルを購入すべきかが問われる。もう一方では、米国企業が中国の研究所に、それらのモデルを改善するデータを販売すべきかが問われる。
どちらの問いも、国籍だけで解決することはできない。リスクは購入者、用途、データセット、アクセス制御、そして根底にある専門知識の機微性に左右される。
最も有効な政策は、こうした測定可能な要因に焦点を当てるものだろう。広範な政治的ラベルは伝えやすいが、執行の精度は低い。
次に何が起きるかを示す3つのシグナル
次の段階は、調達規則、企業の開示、データセット分離に関する証拠によって決まる。
第1のシグナルは、国防総省または議会による正式な措置である。マッコール氏は原則を示したが、それがベンダーの行動を変えるには、政府機関がその原則を契約文言へ落とし込まなければならない。
意味のある措置は、対象となる事業体と制限されるサービスを特定する。また、業務の終了、運用の分離、より強力な統制の導入によって、ベンダーが適格性を維持できるかどうかも説明する必要がある。
国防総省が指定した企業に限定する規則は、すべての中国AI顧客を対象とする禁止措置より狭い。その違いが商業的な影響を左右する。
政府全体に適用される調達条項は、ワシントンがトレーニングデータを戦略的資産と見なしているという主張を強める。個別案件ごとの扱いが続くなら、当局が実行可能な境界について依然として確信を持てていないことを示すだろう。
第2のシグナルは、名指しされたベンダーによる開示である。Surge AI、Mercor、AfterQuery、Turingは、機密の顧客記録を公開せずに自社の立場を明確にできる。
最も有用な開示は、審査基準、禁止用途、データ分離、既製製品の再利用方針を説明するものだ。
企業が、軍とつながりのある指定顧客を避けていると発表すれば、マッコール氏の圧力は立法なしに市場の反応を生んだことになる。
企業がグローバル販売を擁護し、既存の統制を強調するなら、議論はそれらの統制が政府の購入者を満足させるかどうかへ移る。
沈黙にもコストがある。特に請負業者が情報機関、防衛、または機微な運用情報を扱う場合、連邦政府の顧客は通常、サプライチェーンリスクに関する確信を求める。
第3のシグナルは、データの来歴に関する独立した証拠である。来歴記録は、トレーニング素材の出所、変更者、その利用を規律する制約を追跡する。
厳格なプロジェクト分離を示す信頼できる監査は、米国顧客の知識が中国の研究所へ直接流れているという示唆を弱めるだろう。ただし、専門知識を海外へ販売することをめぐるより広範な争いを解決するものではない。
再利用された機密仕様の証拠が出れば、はるかに重大な論争となる。調達政策を超えて、契約執行、訴訟、輸出規制措置を引き起こす可能性がある。
読者は、より強いレトリックだけでなく文書にも注目すべきだ。契約受注、政府機関のメモ、監査報告書、公表されたコンプライアンス方針は、匿名の市場推計より多くを明らかにする。
Google Newsを通じてこの話題を追う際にも、同じ姿勢が当てはまる。集約された見出しは新たな論争を見つける助けにはなるが、疑惑、確認済みの記録、政治的提案をしばしば一文にまとめてしまう。
検証済みの記録が示す範囲は、より限定的だ。Surgeは2023年に小規模な防衛研究案件を2件受注した。Forbesは、米国のデータベンダー4社と複数の中国テクノロジー組織との商業的関係を報じた。
米国防総省はTencentを含む複数の中国テクノロジー企業を軍関連企業に指定しているが、各社はこの見解に異議を唱えている。McCaulは、連邦政府の請負業者に対し、米政府の業務と特定の中国顧客のどちらかを選ぶよう求めている。
依然として不明な点も、同じくらい重要だ。公開記録からは、機密情報の移転、顧客間でのデータセットの再利用、あるいはこれらの販売を包括的に禁止する現行の措置は確認できない。
開発者にとって、この問題はデータの来歴が製品要件になりつつある理由を示している。学習データを購入するチームは、その出所、ライセンス、再利用条件、品質管理を理解する必要がある。
エンタープライズの購入者にも同様の責任がある。購入したサービスが優れた性能を発揮していても、ベンダーの顧客リストがコンプライアンス上の問題になり得る。
学習例を作成するナレッジワーカーも、自身の貢献がどのようにパッケージ化され、再販され得るのかを問うべきだ。彼らの仕事は、一般的な請負契約では明確にならない形で、モデル、市場、法域をまたいで流通する可能性がある。
仮にワシントンが4社を規制しても、この対立は消えない。専門分野でより良いフィードバックを必要とするモデルのため、専門家が生成するデータへの需要は拡大している。
政策は、その需要をどの供給者が取り込み、どれほど透明に事業を運営するかに影響を与えられる。しかし、専門的な判断が持つ経済的価値をなくすことはできない。
したがって、最も有益な次の一歩は、即断ではなく慎重な精査だ。調達文書の文言を追い、ベンダーの保護策を検証し、記録された取引と国家安全保障上の影響に関する主張を分けて考えるべきである。
ワシントンはAI学習データを管理対象の戦略的資源として定義するのか。それとも、個別契約を通じて市場を監視し続けるのか。その答えは、このGoogle Newsをめぐる論争が持続的な政策転換となるのか、あるいはAIの見えにくいサプライチェーンに関する未解決の警告にとどまるのかを決定する。



