OPMのAIツール展開、全職員に6つのアシスタントを提供も、アクセスはインパクトではない
OPMは全職員に6つの承認済みAIプラットフォームへのアクセスを提供し、連邦政府でも最も広範なマルチベンダー型の職場導入の一つを実現した。OPMのAIツール展開には、ChatGPT、Claude、Gemini、Microsoft Copilot、Grok、Perplexityが含まれる。同機関の職員の70%以上が、少なくとも1つのプラットフォームを積極的に利用している。
この導入状況は、OPMを政府のOneGov購買戦略にとって重要な試金石にしている。中央集約型の契約により、比較的小規模な機関でも、6社それぞれと個別のエンタープライズ契約を交渉することなく、競合する6ベンダーの製品を調達できた。
しかし、OPM自身のデータはより難しい現実を示している。アクセスと利用は増加した一方で、あらゆる種類の業務で測定可能な改善が同じ速度で進んだわけではない。自由度の高い文章作成や分析を担う職員ははるかに強い成果を報告しているのに対し、定型化された退職、法務、財務プロセスを扱うチームでは成果が限定的だ。
この隔たりこそが、本当の競争を規定している。OPMは単にChatGPTとClaude、あるいはGeminiとGrokを比較しているのではない。個々のツールが機関のワークフローに深く統合される前に、幅広いアクセスが業務を改善できるかを検証している。
OPMのAIツール展開、調達をプロダクト戦略へと転換
OPMは中央集約型調達を、単に取得業務を減らす手段ではなく、選択肢を維持する方法として扱っている。
OPMの最高情報責任者(CIO)であるAdam Starrは、9月15日にワシントンで開催されたGovExec Government and AI Summitでこの展開について説明した。その後の6ツール展開に関する報道では、プラットフォームの詳細と同機関の導入率が伝えられた。
承認済みの6製品は、Google、Microsoft、xAI、OpenAI、Anthropic、Perplexityから提供されている。職員は、汎用アシスタント、リサーチ重視のシステム、職場用ソフトウェアと統合されたツールから選択できる。
このアプローチは、従来型のエンタープライズ標準化プロジェクトとは異なる。多くの機関は1つのプラットフォームを選定し、職員をその製品に合わせて訓練し、結果として生じるベンダー依存を受け入れる。対してOPMは、複数のプラットフォームを同時に利用可能な状態に保つ内部市場を構築した。
Starrによれば、モデルの変化に伴い、ベンダーは頻繁に互いを追い越す。複数のツールを維持することで、職員はタスクに最適な製品へ移行できる。また、機能や商用条件の進展に応じて、OPMはベンダーを再評価できる。
OneGovは、この戦略を実行可能にした。米国一般調達局(GSA)は、対象機関が利用できる共通条件と購買ルートを交渉する。各機関は依然として必要な発注・承認業務を行うが、共通の商用フレームワークから始められる。
GSAの現在のAI購買ガイダンスには、Anthropic、Google、OpenAI、Perplexity、xAIによる政府向け提供が掲載されている。Microsoft製品も、より広範なOneGovの取り決めを通じて対象となっている。
調達フレームワークが重要なのは、さもなければ6製品の評価に大きな調達コストがかかるためだ。各契約では、個別のセキュリティ審査、ライセンス交渉、利用管理、更新判断が必要になる可能性がある。
OPMには、最大規模の連邦省庁ほどの購買力もない。Starrは、OneGovによって同機関が単独では確保困難だった条件を利用できたと述べた。
その結果、珍しい導入モデルが生まれた。OPMは購買レイヤーを標準化する一方で、利用者レイヤーでの標準化は避けた。職員には承認済みの選択肢が提供され、契約締結後もベンダー間の競争は続く。
これは、同機関とサプライヤーの関係を変える。契約を獲得しても、職員が日常業務でその製品を選ぶことは保証されない。モデルの改善、統合機能の拡張、あるいは信頼の低下に伴って利用は変化し得る。
6ツール体制は比較可能な証拠も生み出す。OPMは、どの製品が利用者を集め、どのタスクで反復利用が発生するかを観察できる。そのうえで、真の需要と、研修キャンペーンや経営層の注目によって促された導入とを区別できる。
ただし、利用可能であることだけでは適合性を証明しない。システムごとに、管理機能、インターフェース、モデルの挙動、データ取り扱いの境界は異なる。OPMは、職員を圧倒することなく、これらの違いを理解可能にしなければならない。
したがって、当面の成果は職場変革よりも限定的だ。OPMは調達上の障壁を取り除き、職員に主要プラットフォームを複数試すための適法な経路を与えた。
これは意味のある変化である。同時に、次の障壁もより明確になる。すなわち、実験を信頼できる業務改善へ転換することだ。
OneGovがマルチモデルAIを可能にする理由
OneGovは、連邦政府のAI購買を、孤立した機関別交渉から共通条件、共有された交渉力、より迅速なアクセスへと移行させる。
GSAは、従来は異なる条件で類似技術を購入していた各機関の購買を統合するためにOneGovを立ち上げた。この戦略は、ソフトウェア、クラウドサービス、セキュリティ製品、AIシステムを対象とする。
このモデルは、政府全体で単一のソフトウェア環境を構築するものではない。代わりにGSAが、参加機関が認定された契約手段と発注ルートを通じて利用できる契約を整備する。
この違いは重要だ。各機関は、ミッション適合性、セキュリティ、プライバシー、記録管理、内部承認について引き続き責任を負う。OneGovは商取引上の摩擦を軽減するが、運用上の説明責任を機関のリーダーから移すものではない。
GSAによると、クラウドプロバイダーは適切なFedRAMP認可を取得済み、または取得手続き中でなければならない。FedRAMPは、連邦機関が利用するクラウドサービスのセキュリティ管理策を評価するための標準化プロセスを提供する。
認可があっても、職員があらゆる政府情報をAIアシスタントに入力できることを意味するわけではない。各機関は、許容されるデータ種別、承認済みアカウント、保持ルール、禁止用途を定めなければならない。
OPMのAIコンプライアンス計画は、断片化された調達を導入の障壁の一つとして挙げている。また、安全な開発環境へのアクセスの不均一性と、AI活動の可視性不足も指摘している。
同計画は、プライベートエンドポイント、分離ネットワーク、ロールベースのアクセス制御を備えたクラウドベースの環境を説明している。また、サンドボックスでのテスト、開発、パイロット、運用、本格的な廃止に至る段階も示している。
これらの管理策は、調達契約が出発点にすぎない理由を示している。AI製品はOneGovを通じて商用利用可能であっても、特定のユースケースには追加審査が必要となる場合がある。
GSA自身も、明確に定義されたミッション上の課題から始めるよう各機関に助言している。同機関のガイダンスは、限定的なグループで製品を試験し、データフローを検討し、監督担当者間で調整し、利用状況を監視することを推奨している。
OPMは汎用アシスタントについて、より広範なアクセスモデルを選んだ。この決定により、各ワークフローに専用アプリケーションが整備される前から、職員は有用なタスクを見つける余地を得られる。
このボトムアップ型の探索には利点がある。プロセスに最も近い職員は、中央の技術チームが見落としがちな反復作業に気づくことが多い。カスタムシステムを待たずに、下書き作成、要約、調査、コーディング、文書分析を試すことができる。
このアプローチは、ガバナンス上の圧力も生む。6つのツールは、1つのツールよりも多くのポリシー上の疑問を生み出す。職員は、同じ文書をすべてのプラットフォームで扱ってよいのか、どの出力に追加審査が必要なのかを知る必要がある。
管理者には比較可能なテレメトリーも必要だ。製品間のアクティブユーザー数は、同じ定義を使っていない可能性がある。ログイン、プロンプト入力、継続的な週次利用は、それぞれ異なる導入レベルを表す。
更新に伴う経済性も複雑化する。導入初期の契約は幅広い実験を容易にする一方、後の従量課金条件では、利用量と価値の差異が明らかになる。
この移行はすでに始まっている。GSAの新しいChatGPT契約は、2026年10月1日に発効する予定だ。これは当初のアクセス提供を、割引された従量課金型利用とプラットフォームアクセス料金なしの形へ置き換える。
この契約は27か月間にわたり、有資格のChatGPTモデルを対象とする。これには、認可済みの連邦環境で提供されるサービスも含まれる。また、複数の政府レベルにわたって発注オプションも拡大する。
OPMにとって、これは直接的な試験となる。アクセスが導入期間を過ぎた後、利用が継続的な従量課金を正当化するかどうかを判断しなければならない。
6社のベンダーはいずれも同じ基本的課題に直面している。容易な調達は扉を開いたが、継続的な参加は職員の需要、ワークフローへの適合性、セキュリティ、そして実証可能なミッション成果に左右される。
6つのAIアシスタントが連邦業務で日常的な競争を生む
OPMのマルチモデル戦略は、競合するAIシステムを評価する実質的な審判を職員に委ねる。
承認済みの各プラットフォームは、それぞれ異なる製品上の位置付けで職場に導入される。Microsoft Copilotは、使い慣れた生産性アプリケーションに近接している利点を得られる。ChatGPTとClaudeは、幅広い文章作成、分析、コーディングのニーズに対応する。
GeminiはGoogleのモデルポートフォリオと政府向け提供に接続する。Perplexityは回答の発見とリサーチを重視する。Grokは、xAIのモデルと検索志向の機能を比較対象にもたらす。
こうした説明を固定的な境界とみなすべきではない。ベンダーは、リサーチモード、コネクター、コーディング機能、文書分析、エージェント的なアクションを継続的に追加している。製品間の重複はリリースごとに増している。
この重複は、複数の選択肢を維持するというStarrの主張を裏付ける。あるタスクで今日優れた性能を示すプラットフォームが、別のベンダーによるモデル更新後に優位性を失う可能性がある。
職員の選択は、単一ベンダー契約では調達チームが得にくいシグナルも提供する。自主的な反復利用は、製品が実際の業務に適合していることを示唆するが、業務が改善したことを証明するものではない。
選好と性能の違いは重要だ。職員は、インターフェースに親しみを感じるため、あるプラットフォームを好むかもしれない。また、ログイン要件やデータ制限が摩擦を生むため、別のプラットフォームを避ける場合もある。
利用は組織的な習慣にも左右される。Microsoft Copilotは職員がすでに作業している場所で現れる一方、別のブラウザベースのアシスタントでは意図的なコンテキスト切り替えが必要となる。
逆に、スタンドアロンのシステムは、組み込み型アシスタントにない機能を提供できる。一部の職員は複数のタブを開いたままにし、異なるタスクを異なる製品へ振り分けるかもしれない。
この行動は、従来の連邦ソフトウェア展開よりも、消費者向けAIの利用に近い。職員に柔軟性を与える一方で、プロンプト、保存済みの作業、組織知識をベンダー間で断片化させる可能性がある。
あるアシスタントで生成された有用な回答が、同僚には見えないままになることもある。補足コンテキストは、別の文書リポジトリ、メールスレッド、または職員のノートに置かれている場合がある。
この断片化により、ナレッジマネジメントも導入上の課題の一部となる。アシスタントが増えても、組織に共有された記憶が自動的に生まれるわけではない。
したがってOPMは、モデル品質以上のものを評価しなければならない。職員がどのようにソース資料を取得し、出力を検証し、判断を保存し、有用な結果を正式な記録システムに移しているかを理解する必要がある。
リサーチアシスタントは簡潔な回答を作成できるが、職員には依然として権威ある根拠が必要だ。文書作成アシスタントはメモを再構成できるが、最終記録は機関の要件に従わなければならない。
コーディングアシスタントは、また別の形態を示している。技術者による旧来システムの理解や、変更案の作成を支援できる。一方で、セキュリティ、テスト、デプロイに関する判断の責任は人間のレビュアーに残る。
競争圧力は6社のベンダーにとどまらない。他の連邦機関も、初期の購買インセンティブが終了した後に、OPMのマルチモデル型アプローチが引き続き管理可能かどうかを注視している。
好結果となれば、機関には単一の標準アシスタントが必要だという前提は弱まる。承認済みの製品がタスクと予算を巡って競争する、ポートフォリオ型モデルを支持する材料となる。
逆に、悪い結果となれば、集約を支持する論拠が強まる。機関は、重複するトレーニング、ガバナンス、統合、利用状況の監視にかかる負担が、職員に選択肢を与える利点を上回ると判断するかもしれない。
したがってベンダーが競っているのは、ベンチマークのスコアだけではない。管理業務を減らし、承認済みの環境に適合し、特定のワークフローを支援し、人間のレビューに耐える成果を生み出さなければならない。
6ツールの導入は、その競争を可視化する。ただし勝者を決めるものではなく、OPMはプラットフォーム別の利用状況や性能の結果を公表していない。
こうした数値がなければ、機関全体で利用可能であることが選好を意味するとは、どのベンダーも主張できない。入手可能な証拠が支持するのはポートフォリオ戦略であり、その内部にあるツールの順位付けではない。
高い導入率は、同等の効果を生んでいない
OPMの最も強力な証拠は、AIアシスタントが有用と感じられるかどうかを決めるのは一般的な熱意ではなく、職場の構造だということを示している。
OPMは6月に職員調査を実施し、回答率56%に当たる1,100件超の回答を得た。同機関の職員パルス調査結果は、導入率という見出し上の数字よりも詳しい情報を提供している。
回答者のうち81.4%は、承認済みAIツールを利用したと答えた。一方、テレメトリーでは実際の全体利用率は70%前後であり、自己申告による導入率だけでは不十分であることを示している。
報告された利用率は、職位が上がるほど高かった。調査では、非管理職の利用率は77.4%、管理職は93.5%、上級幹部は97.3%だった。
承認済みAIツールに対するOPM全体のネット・プロモーター・スコアは17.9で、プラスだった。ただし、組織単位ごとの差は大きかった。
長官室のスコアは95.7だった。OPMの技術組織は65を記録し、人材部門も強く肯定的な結果を報告した。
法務業務ではスコアがマイナスとなった。退職サービス部門はマイナス38.1に達し、回答者の10人にほぼ6人が批判者に分類された。
同機関のBoyers退職業務では、職員は「AIが自部門のパフォーマンスを改善した」という設問に対し、10点満点中4.6点を付けた。
この違いは、熱心なリーダーと抵抗する現場職員の単純な対立ではない。根底にある業務の形を反映している。
汎用アシスタントは、比較的非構造化された知識業務に適している。ドラフト作成、統合、ブレインストーミング、調査、初期分析は、通常のチャット画面で始められる。
構造化された業務は異なるパターンに従う。退職手続きは、確立されたケースフロー、記録、計算、方針、システムに依存しており、職員はそれらを独立した会話ウィンドウで置き換えることはできない。
OPMは、以前はフォーカスグループのフィードバックをスプレッドシートでコーディングするのに数時間から数日を費やしていた組織設計担当職員の例を紹介した。AI支援プロセスでは現在、初期カテゴリーとテーマを数分以内に作成できる。
職員の責任がなくなったわけではない。業務は、出力の検証と調査結果の活用へと移った。
別の例は退職業務からのものだ。ある職員は、年間およそ11,000回実施される保険料不足額の計算のためのツールを作成した。
従来、この手計算にはケースごとに5分から10分かかっていた。OPMによると、新しいプロセスでは監査可能なワークシートを数秒で作成できる。
この例は、一般的な利用統計よりも重みがある。明確に定義されたタスク、再現可能な出力、レビュー可能な成果物を結び付けているからだ。
また、6つの汎用アシスタントが戦略の一層にすぎない理由も示している。最大の業務改善を実現するには、従業員に仕事を別個のチャットへ移させるのではなく、AIを既存のワークフローに組み込む必要がある。
OPMが挙げた障壁も、この点を裏付けている。調査対象の職員のほぼ半数が、学習や試行に充てる時間が不足していると答えた。3分の1超は、正確性と信頼性への懸念を示した。
ほぼ4分の1が、セキュリティまたはデータの機密性への懸念を挙げた。AI利用を上司に止められたと答えたのは、わずか1.4%だった。
これらの結果は、よくある導入の物語を覆す。主な問題は、必ずしも管理職による文化的な反対ではない。職員には時間、信頼できる出力、明確なルール、そしてより良い統合が必要だ。
OPMはまた、最低評価の調査項目が、承認済みAIツールが部門のパフォーマンスを改善したかどうかに関するものだったと報告した。機関全体のスコアは10点満点中7.3だった。
このスコアは失敗を意味しないが、利用と組織的な影響の間には明確な隔たりが残る。積極的な利用者が個別タスクで時間を節約しても、部門全体のパフォーマンスが変わるとは限らない。
そのため、OPMのAIツール展開はアクセスの試験と初期導入の試験には合格した。しかし、均一な効果の試験にはまだ合格していない。
トレードオフは選択肢と業務統制の間にある
職員に6つの選択肢を与えることは実験を促す一方で、データ、品質、支出、組織知識を統治するために必要な作業を増やす。
単一プラットフォーム戦略は、管理上の単純さを提供する。トレーニングは1つのインターフェースに集中でき、方針は1つの環境を参照でき、サポートチームは再現可能な回答を整備できる。
その単純さには依存が伴う。選定ベンダーが遅れを取り、条件を変更し、特定のタスクで失敗した場合、職員の代替手段は限られる。
OPMは、競争圧力を維持するためにより多くの複雑さを受け入れている。同機関は製品を比較でき、1つのモデルがすべてのカテゴリーで最良であり続けると決めつけずに済む。
中心的なリスクは、モデルの選択が、情報に基づくポートフォリオではなく断片化した行動になることだ。職員には、承認済みの各タスクにどのツールが適しているかについて実践的な指針が必要だ。
その指針がなければ、6つのアシスタントは6種類の回答、文書化の習慣、作業場所を生み出しかねない。職員は、どの違いが重要かを理解しないまま、複数のプラットフォームで同じプロンプトを繰り返す可能性がある。
正確性もまた制約となる。生成システムは確率的な出力を生み出すため、保証された事実を取得するのではなく、もっともらしい応答を生成する。流暢な文章は、裏付けのない詳細や欠落した文脈を隠しかねない。
連邦政府の人事業務では、リスクがより大きい。OPMは、採用、福利厚生、退職サービス、労働力方針、政府全体の人的資本システムに影響を及ぼす。
誤ったドラフトはレビューを通じて修正できる。しかし、福利厚生のプロセスに誤った値が入力されれば、個人への影響と機関の追加作業を招きかねない。
セキュリティ方針も、具体性を保たなければならない。エンタープライズ契約は消費者向けアカウントより強力な統制を提供できるが、あらゆるデータセットをあらゆる用途に適したものにするわけではない。
記録保存の義務は、さらに別の層を加える。AIが公的業務に寄与する場合、機関にはプロンプト、出力、判断、裏付けとなる証拠を保存するためのルールが必要だ。
システムが雇用関連の活動に影響を与える場合、バイアスと公平性への配慮が必要となる。OPMのコンプライアンス枠組みは、品質、データの出所、潜在的なバイアスを検証する影響評価を求めている。
これらの要件は導入を禁じるものではない。汎用アシスタントへのアクセスよりも、業務統合を慎重に進める必要がある理由を示している。
契約が成熟するにつれて、コスト統制の重要性は増す。従量課金モデルは支出を活動量に結び付けるため、価値ある利用と気軽な実験を区別するインセンティブが生まれる。
単純なプロンプト数では、その問いに答えられない。短い対話が数時間の手作業を防ぐこともあれば、長いセッションが何ら利用可能な成果を生まないこともある。
OPMが提案する測定枠組みは、より良い方向性を示している。利用、意識、影響を同一視せず、分けて扱っている。
利用は、職員が製品を試しているかどうかを示す。意識は摩擦と信頼を特定する助けになる。影響は、ツールを処理時間、サービス品質、採用スピードといった既存の指標に結び付けなければならない。
最後のカテゴリーが最も難しい。機関はアクティブユーザーをすぐに数えられるが、ミッションの成果は複数のシステムと方針変更に左右されることが多い。
OPMが比較可能なタスク間で成果を比較すれば、6プラットフォーム設計は役立つ可能性がある。各部門が一貫した測定なしに異なる製品を採用すれば、評価の妨げになりうる。
同機関はまた、ベンダー間の競争が職員の混乱に変わることを避けなければならない。ポートフォリオには、共通の基準、明確なタスク境界、単一のアシスタントの外部にも有用な作業を保存する方法が必要だ。
中核となるトレードオフは管理可能だが、一時的なものではない。新たなモデル能力、コネクター、購買形態はいずれも、柔軟性と統制の均衡を変える。
幅広いアクセスが実際に機能するかを示す3つの兆候
次の段階は、更新の選択、ワークフロー単位の成果、そして運用評価が低い部門が導入格差を縮めている証拠によって判断される。
最初の兆候は、OneGovの条件変更に対するOPMの対応だ。ChatGPTの次の契約は10月1日に始まり、他の初期提案も予定された終了時期に近づいている。
OPMの購買判断は、導入時のアクセス期間が終了した後も同機関が6つすべてのプラットフォームを維持するかを示す。利用可能な状態が継続すれば、Starrのポートフォリオ戦略を支持することになる。
集約は、実際の需要または管理コストが少数のベンダーを有利にしていることを示唆する。いずれの結果も、最初の調達発表より多くの証拠をもたらす。
詳細が重要になる。OPMは複数のツールへのアクセスを維持しつつ、特定のタスクには優先製品を割り当てることができる。また、全職員向けの広範なアシスタントと、専門的な開発・調査サービスを分けることも可能だ。
第2の兆候は、OPMがミッションレベルのパフォーマンス指標を公表するかどうかだ。アクティブユーザーの割合は到達範囲を示すが、退職処理の短縮や採用成果の改善を示すものではない。
保険料不足額計算ツールは、有用な手本を提供する。反復されるタスク、従来必要だった時間、より速いワークフロー、監査可能な出力を明らかにしている。
今後の証拠もこの構造に従うべきだ。OPMは、AI支援プロセスをサイクルタイム、エラー率、手戻り、サービス品質、または別の確立された業務指標に結び付けるべきである。
こうした証拠は、政府全体での導入を支持する根拠を強める。ログイン数と調査上の意識に焦点を当て続ければ、幅広いアクセスが機関のパフォーマンスを変えるという主張は弱まる。
第3の兆候は、AIが既存システムに入った後、低評価の部門が改善するかどうかだ。退職サービス部門は、業務が構造化され、意識が弱いため、最も明確な試験対象となる。
統合されたツールがレビューと監査可能性を保ちながらケース業務を改善すれば、OPMはAIがドラフト作成と分析を超えて活用できることを示すだろう。
格差が残れば、幅広いアクセスは、管理職、技術者、その他の非構造化情報を扱う職員にとって最も有用なままとなる。
その結果は、プログラムを無価値にするものではない。汎用アシスタントのより限定的な境界を確立し、ワークフロー固有のエンジニアリングへ投資を向けることになる。
他の機関は、OPM戦略の目に見える部分を模倣する前に、これらの兆候を注視すべきだ。複数のアシスタントを調達することは、測定可能な成果を生む統治されたポートフォリオを維持することより容易である。
これまでで最も重要な教訓は、すべての従業員に6つの製品が必要だということではない。中央集約型の調達は選択肢を生み出せる一方、社内で得られたエビデンスが、その選択肢のどこに継続的な投資を行う価値があるかを決めるということだ。
ナレッジワーカーにとって、実務上の問いも同じく明快だ。アシスタントは単に孤立した作業を速く感じさせるだけなのか。それとも、同僚や顧客が依存するプロセスを改善するのか。
次回のOPM AIツール展開データは、この区別を念頭に追うべきだ。ワークフローの成果、更新判断、そして構造化された業務運用の中で得られる改善に注目してほしい。こうした指標が、OneGovが持続的な能力を生み出したのか、あるいは単に実験を容易にしただけなのかを明らかにする。



