「聞かない、言わない」AI経済の台頭
Google Newsは、ルールが未整備で測定も不十分なまま、より少ないリソースでより多くの成果を出す圧力が高まる中、従業員がAIを導入しているというBloombergの鋭い論考を取り上げた。
「聞かない、言わないAI経済」という表現は、不都合な取引を捉えている。雇用主はより速い成果を求める一方で、その成果がどのように生み出されたのかを詳しく検証しないことが多い。従業員は個人のAIアカウントを使い、公開ツールに資料をコピーし、承認済みの代替手段は遅いか利用できない可能性があるため、黙っている。
これは単なるチャットボット導入の話ではない。目に見える生産性と、目に見えないプロセス上のリスクとの対立である。Microsoft、Anthropic、職場研究者はこの隔たりの一部を記録してきたが、その全容を捉える単一のデータセットは存在しない。
中心にある緊張関係は単純だ。企業はAIが生む効率化を望むが、多くはAI利用を可視化するために必要な方針、システム、インセンティブを備えていない。この隔たりが、日常的なオフィス業務の内部にシャドー経済を生み出している。
Google Newsが浮き彫りにしたこと
重要な変化は、従業員がAIを発見したことではない。非公式なAI利用が日常的な業務プロセスの一部になったことだ。
生成AIは、計画的なソフトウェア導入ではなく、多くの職場で個人の行動を通じて入り込んだ。従業員は個人アカウントを開設し、プロンプトを試し、モデルによって時間を節約できる業務を見つけた。調達、セキュリティ、法務のチームがプロセスに加わるのは、その後であることが多い。
この導入パターンは、従来のエンタープライズソフトウェアの展開とは異なる。通常、企業はベンダーを選定し、アクセスを設定し、ユーザーを訓練し、活動を監視する。シャドーAIでは、組織がサービスを評価する前に従業員が使い始めるため、この順序が逆転する。
MicrosoftとLinkedInによる職場でのAIに関する調査では、2024年に従業員主導の導入が広く見られた。AIを利用していた調査対象のナレッジワーカーのうち、78%が自分自身のツールを職場に持ち込んでいた。
この数字は、すべての個人向けツールがセキュリティインシデントを引き起こしたことを証明するものではない。正式な購買記録だけでは、職場における実際の導入水準を説明できないことを示した。ソフトウェアのインベントリと現場の実態が乖離していたのである。
この行動は組織階層をまたぐ。担当者はAIを使って文書を要約し、メッセージを下書きし、コードを書き、フィードバックを分析し、プレゼンテーションを準備する。マネージャーも同様のツールを使い、計画をレビューし、会議を整理し、不完全なメモを洗練された文書へと仕上げる。
個々のプロンプトは小さいため、これらの活動はしばしば無害に見える。しかし、累積的な影響は異なる。プロンプトの連続は、顧客名、製品計画、ソースコード、財務上の前提、法的戦略、社内の意見対立を明らかにし得る。
Bloombergの枠組みが重要なのは、その活動を取り巻く社会的な取り決めに名前を与えているからだ。従業員はAIをどの程度使っているかを自ら進んで明かさないかもしれない。マネージャーも、成果が改善し明白な問題が生じない限り、調べないかもしれない。
したがってGoogle Newsが取り上げたのは、技術トレンド以上のものだ。戦略的な曖昧さを基盤とする、労働とガバナンスの問題である。全員がツールから利益を得られる一方で、責任は定義されないまま残る。
この曖昧さは、通常の業務運営の間は効率的に感じられる。だが、顧客が回答に疑義を呈したとき、機密データが承認済みシステムの外部に現れたとき、あるいは自動化された判断が誰かに損害を与えたとき、それは脆弱になる。そのとき組織は、そもそも観察することを選ばなかったプロセスを再構築しなければならない。
これを隠れた経済と呼ぶことは、AI支援を受けたすべての業務が禁止されているという意味ではない。AIが、公式なワークフロー、予算、業績指標、リスク登録簿に一貫して現れないまま、経済的価値に貢献していることを意味する。
成果は見える。手法は見えない。
なぜ雇用主と従業員の双方が沈黙を受け入れるのか
この非公式な取引が続くのは、AI利用を部分的に語らないままにすることで、双方が即時の利益を得るからだ。
雇用主は、生産性を高める強い圧力にさらされている。モデル、アシスタント、インフラ、実験に投資してきたにもかかわらず、多くはその投資を測定可能な事業成果と結び付けることに苦慮している。静かな従業員主導の導入は、包括的な変革プログラムを必要とせずに成果をもたらす。
従業員は別種の圧力に直面している。増え続けるメッセージ、文書、会議、調査、事務作業を処理しなければならない。AIは、情報をある形式から別の形式へ変換する時間を削減できる。
会議メモをプロジェクトの進捗報告に変える従業員には、すべてのプロンプトを開示する動機がほとんどない。開示は追加のレビュー、仕事の質に関する質問、あるいはさらなる成果要求を引き起こしかねない。沈黙は節約できた時間を守る。
マネージャーにとっても、尋ねないことには利点がある。チームがより早く納品すれば、マネージャーはデータ処理、帰属、評価に関する難しい問題に向き合わずに結果を得られる。目先の報酬は具体的である一方、リスクは遠く感じられる。
この取り決めは、パフォーマンスに対する期待を歪める可能性がある。従業員がAIを使い、4時間かかっていた仕事を2時間で完了できるかもしれない。経営側がその速さを通常の水準として扱うようになると、節約された時間は従業員のものではなくなる。
生産性向上は、より高い基準値となる。従業員は、以前のAI利用によって生まれた期待を満たすためだけに、ツールへの継続的なアクセスを必要とするようになる。自発的な近道は、徐々に非公式な職務要件へと変わる。
開示をめぐる問題もある。一部の従業員は、AIを広範に使っていると認めれば、自らの役割が代替可能に見えることを恐れる。隠していれば、後になって不誠実に見えることを恐れる人もいる。
マネージャーは別の角度から同じ矛盾に直面する。実験を奨励しながら、機密情報を公開しないよう従業員に警告する場合がある。承認済みツールと明確な事例がなければ、こうしたメッセージは実用的な運用モデルを伴わない野心にとどまる。
研究は、AIが定義された環境においてパフォーマンスを改善し得るという主張を裏付けている。NBERのフィールド調査は、カスタマーサポート担当者が利用する生成AIアシスタントを調査し、平均で14%の生産性向上を報告した。
その効果は均等ではなかった。経験の浅い、またはスキルの低い従業員ほど恩恵を受けており、このシステムがより優れたパフォーマーに見られるパターンの移転を支援したことを示唆している。この知見は、単純な置き換えの物語を複雑にする。
統制されたサポート環境は、経済全体と同じではない。研究者はツール、ワークフロー、成果、業績指標を観察できた。多くのオフィス導入には、その可視性がない。
従業員が未承認サービスを使う場合、組織は有用な支援と、捏造された内容、コピーされた表現、隠れたバイアス、不適切に扱われたデータを確実に区別できない。目にするのは最終文書または最終判断だけである。
だからこそ、「聞かない、言わない」は魅力的であり続ける。測定にはコストがかかる。沈黙は、誰がリスクを負うのかを定める前に、双方が利益を主張することを可能にする。
本当の争点は、生産性対説明責任だ
主な対立は、従業員対雇用主ではない。測定可能な成果対、説明責任を伴う生産である。
組織はすでに完成した仕事を評価している。売上成果、解決済みチケット、リリースされた機能、完了した分析、公開された文書をレビューする。生成AIは、こうした成果を生み出す隠れた工程を変える。
洗練された回答に、捏造された主張が含まれている場合がある。動作するコードに、安全性の低い依存関係が含まれていることもある。簡潔な顧客要約が、重大な異議を省く可能性もある。説得力のある採用評価が、過去の判断に由来するバイアスを再生産することもある。
こうした失敗は、必ずしも成果物からは見えない。したがって説明責任は、情報源、レビュー手順、モデルの挙動、人間の判断に関する情報に依存する。シャドーAIは、その文脈の多くを取り去ってしまう。
Anthropic初のEconomic Indexは、アンケート回答だけに依存せず、Claudeの会話パターンを分析した。初期の調査結果は、完全な自動化よりも拡張的利用が多いことを示したが、その境界はタスクの分類方法によって左右された。
拡張的利用とは、人とモデルが共同で仕事を完了することを意味する。自動化とは、人の関与が限定された状態でモデルがタスクを実行することを意味する。どちらも成果を改善し得るが、必要となる統制は異なる。
従業員がモデルに代替となる見出し案を求める場合、選択の責任は依然として本人にある。レビューなしに見出しを生成・公開するシステムは、より多くの責任をワークフロー設計者とモデル運用者へ移す。
調査の際には、この違いが重要になる。企業は、従業員が支援を受けたのか、判断を委任したのか、あるいは確認せずに出力を受け入れたのかを知る必要がある。最終ファイルだけでは、そうした疑問に答えられることはほとんどない。
正式なAIシステムは、ログを保存し、データ保持を制限し、ID管理を強制し、モデルへのアクセスを制限できる。また、出力を承認済みの知識ソースに接続することもできる。個人アカウントが同じ設定に従うとは限らない。
承認だけでは問題は解決しない。従業員はエンタープライズ向けチャットボットを受け取っていても、応答がより良い、必要なファイル形式に対応している、あるいは使いやすいという理由で別のモデルを使い続ける可能性がある。ガバナンスは利便性と競争しなければならない。
これはテクノロジーリーダーへの圧力を生む。あらゆる公開サービスを単にブロックして成功を宣言することはできない。過度に制限的な方針は、より多くの活動を可視化できないシステムの外へ追いやる。
一方で、すべての実験を許容可能だと宣言することもできない。顧客契約、プライバシー上の義務、職業上の責務、著作権に関する懸念、セキュリティ要件は、モデルが仕事を速くしてもなお適用される。
実務上の争いは、二つの運用モデルの間にある。
一つのモデルは、結果だけを測定する。何かが失敗するまで、AI支援を目に見えない個人的な手法として扱う。このアプローチは摩擦を最小化するが、残る証拠は少ない。
もう一つのモデルは、AI利用を生産システムの一部として扱う。承認済みタスクを特定し、重要なやり取りを記録し、出力をテストし、レビューの責任を割り当てる。このアプローチには投資が必要で、実験の速度を落とす可能性がある。
どちらのモデルも人間の判断をなくすものではない。違いは、その判断を意図的な統制とするか、当然に備わる安全網とみなすかにある。
Google Newsの記事は、より広い経済的な問いを示唆している。AIによる生産性が隠されたままであれば、企業はその価値を従業員、雇用主、テクノロジー提供者の間で正確に分配できない。関連するリスクに価格を付けることもできない。
従業員は、業界知識、機密性の高い文脈、プロンプト設計、検証、最終的な説明責任を提供している可能性がある。モデルは生成された文章や分析を提供する。組織はデータ、システム、評判、法的なリスク負担を提供する。
最終結果を「AI生成」と呼べば、こうした貢献を消してしまう。完全に人間が生み出したものと呼べば、その仕組みを消してしまう。より良い測定は、その両方を保たなければならない。
生産性の数字が証明できないこと
AIが特定のタスクを加速するという証拠は、組織全体を改善することの証明にはならない。
多くのAI研究は、明確な成果物を伴う限定的な活動をテストしている。参加者はテキストを要約し、ビジネス文書を下書きし、コードを書き、サポート問い合わせに回答する。研究者は完了時間を比較し、定義された基準に照らして品質を評価できる。
実際の仕事には、より多くの依存関係がある。最初の下書きが速くなれば、レビューは遅くなる可能性がある。生成されるコードが増えれば、テスト要件も増え得る。簡潔な要約は不確実性を隠し、後に誤った判断につながる可能性がある。
ローカルな生産性と組織全体の生産性は同じではない。ある従業員が1時間を節約しても、検証作業を同僚に移している可能性がある。ある部門がより多くの成果物を生み出しても、別の場所でレビューコストを増大させている場合がある。
品質の測定も、タスクの複雑さによって変わる。構造化されたサポート回答であれば正確性をテストしやすいが、戦略的な提言ではそうはいかない。後者は、前提条件、文脈、将来の出来事に左右される。
Stanford AI Indexは、AIの能力と導入が急速に向上していることを示す研究をまとめている。同時に、評価における継続的な課題や、タスクごとに不均一な性能も記録している。
ベンチマークは、モデルが定義済みの質問群に回答できることを示せる。しかし、従業員がモデルの誤りを見抜くタイミングを理解していることまでは立証できない。そのような人間側の判断力は、別個の能力である。
シャドーAIは、その判断力を検証しにくくする。組織は、どのモデルが回答を生成したのか、どの情報がプロンプトに入力されたのか、従業員が引用元を確認したのかを把握できない場合がある。
調査データにも別の限界がある。従業員は、禁止された行為を過少申告したり、生産性を過大に申告したり、「AIを使用する」という言葉を異なる意味で解釈したりする可能性がある。ある人は時折の編集を含める一方、別の人は下書き全体をAIに委ねる。
利用ログにも独自の死角がある。サービス内でのやり取りは示すものの、出力が有用だったかどうかは分からない。また、個人端末、外部アカウント、組み込みAI機能での活動を見落とすこともある。
こうした不確実性が、生産性向上の根拠を消し去るわけではない。ただし、リーダーが責任を持って主張できる範囲は変わる。企業は、従業員がAIを導入していること、あるいは特定の導入が測定可能なワークフローを改善したことは言える。
しかし、サブスクリプション数だけから全社的な成果を推論すべきではない。また、従業員がより多くの文章、コード、プレゼンテーションを生成したというだけで、変革が起きたと主張すべきでもない。
懐疑的に問うべきなのは純価値である。AIは、レビュー、修正、調整、セキュリティ対応を経た後も、信頼できる成果を生み出す総コストを削減したのか。
この問いには、ワークフローごとに答えなければならない。普遍的な生産性向上率では、カスタマーサポート、ソフトウェア開発、法務レビュー、調査、営業、管理職の間にある大きな違いが隠れてしまう。
同じ規律は、雇用喪失に関する主張にも当てはまる。タスクの一部を自動化しても、周辺の職務が自動的になくなるわけではない。必要なスキル構成が変わり、初級レベルの業務が減り、成果への期待が高まり、責任が別の場所へ移る可能性がある。
ただし、不確実性を消極姿勢の言い訳にすべきではない。組織はすでに、目に見えないAI利用に依存している。それを測定しないことは、安全性も雇用の安定性も守らない。
適切な対応は、慎重な可視化である。企業には、些細なプロンプトすべてをコンプライアンス案件にせず、重大なリスクを理解するのに十分な情報が必要だ。
シャドーAIは異なるガバナンスモデルを求める
実行可能な方針は、隠すよりも安全に開示するほうが容易でなければならない。
多くのガバナンスプログラムは、禁止事項の一覧から始まる。制約は重要であり、とりわけ機密データ、規制対象の意思決定、影響の大きい自動化アクションでは不可欠だ。しかし、禁止だけで利用しやすいツールと理解しやすいプロセスを置き換えることはできない。
従業員には明確な分類が必要である。幅広い実験を認められるタスクもあれば、承認済みアカウント、保護されたデータ処理、人間によるレビュー、あるいは生成AIシステムからの完全な除外を必要とするタスクもある。
有用な方針は、抽象的な原則だけでなく、具体例を示す。従業員が公開レポートを要約できるのか、社内文書を編集できるのか、顧客記録を分析できるのか、法的文言を下書きできるのか、ソースコードをレビューできるのかを説明すべきだ。
組織はまた、低リスクの支援と重大な意思決定を区別しなければならない。文法修正は、誰が融資、雇用、保険、医療、サービスへのアクセスを受けるかを決めることとは、同じ重大性を持たない。
影響の大きい利用には、より強いレビューと文書化が必要である。出力を承認する人は、意思決定の根拠を理解していなければならない。誰も説明責任を果たせない結果について、チャットボットが都合のよい説明役になってはならない。
データの境界も同様に具体的でなければならない。従業員は、どの情報分類を各承認済みシステムに入力できるかを知るべきである。また、公開ツールにはある機能が企業向け製品にはない場合に、安全な代替手段も必要になる。
技術的な統制は、こうしたルールを支援できる。ID管理、保持設定、アクセス制限、監査ログ、データ損失防止は、露出を減らせる。しかし、どれも回答が事業上の文脈に照らして適切かどうかを判断することはできない。
人間によるレビューは依然として必要だが、「human in the loop」だけでは完全な統制にならない。疲れた従業員は、意味のある検証をせずに出力を承認する可能性がある。レビューには、定義された基準、十分な時間、自動化された作業を却下する権限が必要だ。
組織は速度だけでなく、修正も測定すべきである。主張の検証、誤りの修復、顧客問題の解決、生成物の書き直しに必要な時間を追跡できる。これらのコストが純生産性を決定する。
また、AIがジュニア層の業務をどう変えるかも検討すべきだ。初級レベルのタスクは、専門性を育てる練習の機会になることが多い。基本的な課題をすべて取り除けば、高度な誤りを見抜ける将来のレビュアー層を弱めかねない。
管理職にも研修が必要である。リーダーが手法を議論せずに量だけを評価すれば、従業員は目に見える出力を最適化する。責任ある仕組みは、業績目標を検証と開示に整合させる。
最良の報告メカニズムは、告白用紙のようなものにはならない。通常のワークフロー設計を通じて、意味のあるAI利用を把握すべきだ。承認済みのアシスタントなら、従業員に一文ごとの記録を求めずに、関連する記録を保存できる。
知識の来歴も重要である。チームは、公開ウェブの資料、ライセンス取得済みコンテンツ、社内記録、人間の専門知識を区別すべきだ。パーソナルナレッジシステムは、AIが情報を回答に圧縮する前に、個人が情報源と推論を保持する助けになる。
その情報源の軌跡は、コンプライアンス以上の意味を持つ。モデルの要約によってニュアンスが失われた場合に、従業員が元の証拠に戻れるようになる。また、一時的なチャットの中で失われかねない貴重な人間の文脈も守る。
従業員が回避行為なしに正当な業務を完了できるとき、ガバナンスは機能する。承認済みシステムが利用しにくい、遅い、あるいはタスクに適していなければ、方針違反は予測可能になる。
目標は完璧な監視ではない。価値あるデータと重大な出力に対する、比例した説明責任である。
「聞かない、言わない」AI経済を試す3つのシグナル
次の段階は、企業が成果を測定し、業務を再設計し、従業員にAI利用を開示する信頼できる理由を与えられるかにかかっている。
最初のシグナルは、報告の変化である。企業はしばしば、AIへのアクセス、ライセンス、アシスタント、研修プログラムを発表する。より強い証拠は、こうした投入を、完了したワークフロー、エラー率、レビュー時間、顧客成果、運用コストへと結び付けるものだ。
雇用主が信頼できる純生産性の指標を公表すれば、隠れた経済は評価しやすくなる。ツールの利用可能性を強調し続けるなら、AIへの支出と実証された価値の間の隔たりは残る。
2つ目のシグナルは、ワークフローの再設計である。変わらないプロセスの横にチャットボットを追加しても、誰が出力をレビューするのか、誰がエラーの責任を負うのか、誰が情報源を記録するのかという問題は、ほとんど解決しない。持続可能な導入には、役割、チェックポイント、成果への期待の変更が必要だ。
再設計されたプロセスは、モデルの貢献を可視化する。従業員がいつAIに依拠できるのか、いつ検証しなければならないのか、いつ人間の判断を委ねられないのかを定義する。
3つ目のシグナルは、承認済みツールが改善された後の従業員の行動である。従業員が個人アカウントから管理対象システムへ移行するなら、利便性がシャドーAIの主な原因だったことになる。隠れた利用が続くなら、従業員は監視を信頼していないか、雇用主が提供していない能力を好んでいる可能性がある。
この違いは重要だ。技術的な問題には、より良い製品とアクセスが求められる。信頼の問題には、より明確なインセンティブ、監視の制限、生産性向上が業務負荷や雇用にどう影響するかについての率直な議論が必要である。
Google Newsは、現在の状況にふさわしい表現に注目を集めた。経済はすでにAIによって形作られた仕事を受け取っているが、組織はしばしば、それが正確にどこで、どのように、誰の権限の下で行われたのかを説明できない。
答えは、AI支援を受けたすべてのタスクが危険だと装うことではない。また、より速い出力をプロセスが健全である証拠として扱うことでもない。
雇用主は、AIがどこで重大な業務を変えているのかを問う必要がある。従業員には、有益な実験を自己告発に変えることなく答えられる安全な方法が必要だ。双方には、最初の下書き後の品質を測る証拠が必要である。
読者は、企業が選ぶ指標に注目すべきだ。ライセンス数は導入の物語を後押しする。純生産性、修正コスト、インシデント率、従業員の承認済みシステムへの移行は、運用モデルが実際に機能しているかを明らかにする。
「聞かない、言わない」という取り決めは、利益がすぐに得られ、失敗が散発的である間は続きうる。しかし、顧客、規制当局、監査人、従業員が重要な業務がどのように生み出されたのかについて明確な説明を求めれば、それは弱まる。
決定的な問いは、もはや人々が職場でAIを使っているかどうかではない。制度がその利用を認識し、責任を割り当て、機械に異議を唱えるために必要な人間の知識を保持できるかどうかである。



