IBM、AIが生産性を向上させると主張、MITは境界が重要と指摘
- Aisha Washington

- 6月5日
- 読了時間: 5分
IBMの研究ではAIが職場の生産性を向上させると示されている一方、MITの調査結果は、タスクをAIツールの限界内に留めることが結果を左右すると強調している。
2つの研究は今週、調査結果を発表した。IBMはさまざまな役割の数百人の従業員を追跡した。MITは人々が標準的なAIプロンプトの範囲外に出た場合に生産性がどう変化するかを調べた。両チームはAI生産性研究という同じ中核領域を調査したが、成果が現れる場所について異なる結論に達した。
IBMはタスク完了率の上昇とターンアラウンドタイムの短縮を報告した。MITは、人々がツールを定義された境界を超えて利用しようとした場合、それらの成果が消失したと報告した。この対比は、企業がAIをどこまで押し進められるかについて疑問を投げかけている。
IBM Data Shows Clear Output Gains
IBMは480人の知識労働者を対象に4か月間にわたり調査を実施した。AIを利用したグループは、対照群よりも週あたり28%多い完了タスクを生産した。会議の要約やレポートの下書きは通常の半分の時間で返ってきた。
研究者らは完了した成果物の数を数え、タイムログを追跡することで生産性を測定した。最大の改善は反復的な調査と初稿作成で見られた。参加者は、ツールが白紙の状態を克服するのに役立ったと述べた。
IBMの研究者らは、労働者が一般的なユースケース内に留まった場合に結果が最も強かったと述べた。彼らは極端な創造的タスクや高度に専門化された技術的作業はテストしなかった。
MIT Study Highlights Hard Limits
MITの研究者らは210人の参加者で並行実験を実施した。彼らはユーザーがAIを通常の範囲を超えて利用しようとした場合に何が起こるかを測定した。生産性はタスクが標準的な境界内に留まる場合に上昇した。人々がモデルの訓練パターン外の新規分析やカスタムコードを求めた場合、生産性は低下した。
MITチームはIBMと同じタスクセットを使用したが、境界テストを追加した。労働者がAIにソースデータから遠く離れたアイデアを生成するよう求めた場合、エラー率が急上昇した。その後、出力の修正に要するレビュー時間が増加した。
MITの研究者らは、他の研究で報告される成果の多くが狭く反復可能な作業から来ていると指摘した。その狭い範囲を超えてプロンプトセットを拡大すると、測定された利益は失われた。
Two Studies, One Shared Condition
両グループとも、AIが慣れ親しんだワークフローの範囲内に留まる場合に成果が見られた。差異は境界で生じた。IBMは平均的な日常タスクに焦点を当てた。MITはそれらのタスクがモデルの信頼できる領域外に移った場合に何が起こるかをテストした。
このパターンは、成果が構造化された活動に集中することを発見した以前のAI生産性研究と一致する。オープンエンドの作業には、速度向上を相殺する追加の人による監督が必要だった。
AIの導入を追跡する企業は今、より狭い目標に直面している。彼らはどの作業がツールの有効範囲内に留まり、どの作業がそうでないかを特定しなければならない。
What Counts as Inside the Boundary
IBMは境界内タスクをデータ要約、標準的なレポート書式設定、会議のトランスクリプション整理と定義した。MITは同じタスクが信頼できる結果を生むことを確認した。境界外タスクにはカスタム財務モデリング、投機的な戦略文書作成、新規プログラミング言語向けコードが含まれた。
境界内に留まった労働者は修正回数が少なかったと報告した。境界外に出た労働者は初稿で節約した時間よりも編集に多くの時間を費やした。
共有された発見は実践的なルールを指し示している。AIアクセスを拡大する前に現在のタスクタイプを測定せよ。テンプレートや反復的な手順で既に処理されているタスクが、測定可能な向上を示すものである。
Limits Appear in Real Workflows
MIT研究の従業員ログは明確な低下を示した。プロンプトが訓練例から2標準偏差以上離れた場合、精度は19%低下した。エラー修正に要する時間は1文書あたり平均34分増加した。
IBMは、ユーザーが新しい業界向けのクライアント提案を生成しようとした場合に同様の修正を記録した。ツールはもっともらしいテキストを生成したが、業界固有の制約を見逃した。レビュアーは大規模なセクションを書き直す必要があった。
これらのパターンは、企業が広範な生産性向上を宣言する前にワークフローを監査すべきことを示唆している。IBMのヘッドライン数値は、日常業務の大部分がテストされたカテゴリ内に留まる場合にのみ成立する。
Companies Now Watch Task Categories
研究をレビューした複数の企業が、タスクを境界適合度で分類し始めた。あるチームはMITの基準に対して週ごとの成果物をすべてマッピングした。彼らは現在の業務の62%が安全範囲内に留まっていることを発見した。
残りの38%はより重い人的レビューか、まったく異なるアプローチを必要とした。マネージャーはAIをすべてのプロセスに適用するのではなく、それに応じて展開計画を調整した。
この調整は、初期の速度向上がより広範な利用の3か月後に消失するという一般的なパターンを回避する。
Next Signals to Track
生産性効果がどこまで及ぶかを明確にする3つの展開がある。第一に、IBMは創造的および技術的役割を含むフォローアップデータセットを8月に公開する予定である。第二に、第三の学術グループが来四半期に営業およびエンジニアリングチームで同じ境界フレームワークをテストする。第三に、MITは9月までに最も一般的なモデルファミリーのエラー率曲線を公開する。
各リリースは、境界効果が一貫して維持されるか、新しいモデルバージョンで変化するかを示すだろう。それらの数値を待つ企業は、同じタスクカテゴリを使用して meantime に小規模な内部監査を実施できる。
2つの研究は合わせて、企業が主張できる内容を狭めた。AIは定義された限界内に留まる作業の生産性を向上させる。それらの限界外の結果は別途測定を必要とする。


