top of page

長時間稼働するAIエージェントがコストを押し上げ、価値の方程式は複雑化している

Google Newsは8月2日、長時間稼働するAIエージェントについて率直な警告を取り上げた。「メーターは動き続けている」。この見出しは、AI: Reset to Zeroの第1166号に掲載された。対立構造は明白だ。エージェントの稼働時間は伸びているが、計画の各ステップ、ツール呼び出し、再試行、評価のすべてがリソースを消費する。

この警告は、主要なAI企業が顧客に短いチャットボットのやり取りを超える活用を促す中で出された。Google、Anthropic、OpenAIはいまや、アプリケーションをまたいで動作し、タスクの状態を保持し、ユーザーが離席した後も作業を続けられるエージェントを説明している。

稼働時間の長期化は新たな価値を生む一方、購買判断の問いも変える。購入者は、印象的なデモや個別のモデル呼び出しではなく、完了した成果を測定しなければならない。いま中心となる争点は、自律性と説明責任の両立だ。

この争点が重要なのは、AIにおける経済的な単位が変わりつつあるためだ。チャットボットは、人がすぐに確認する回答を生成する。一方、エージェントは複数のプロセスを開始し、作業を委任し、結果を検査し、失敗した手順を繰り返すことができる。

行動が一つ増えるたびに、コストやエラーが増幅する場所も一つ増える。メーターが測るのは知能だけではない。有用なものを届けるまでにシステムが試みたすべてを記録する。

Google Newsの見出しが実際に示していること

重要なのは、あるニュースレターの見出しそのものではない。エージェントの運用コストが主流のテクノロジー報道のテーマになったことだ。

Google Newsは、AIモデルに関する報道の一部としてAI: Reset to Zeroの記事を集約した。この掲載は、Googleが著者の主張を支持したことを意味しない。Google Newsは元の発行元ではなく、発見と集約のための面だ。

それでも、どの問いが専門家の領域を越え始めているかを示すため、集約には意味がある。かつてトークン消費は主にAPIドキュメントやエンジニアリングダッシュボードの話題だった。いまでは人員計画、ソフトウェア予算、企業の購買判断に関する議論を左右している。

別のニュースレターであるCO/AIも、同じメーターの比喩をコストに関する主張で用いた。その論旨は、AIの利用状況が可視化・計測可能になるにつれて、補助金で支えられた知能の時代は終わりつつある、というものだった。同記事は従量課金型AIを人間の労働との経済比較として位置づけた。

この比較は刺激的だが、誤解を招く可能性もある。稼働中のエージェントは、自動的に従業員と同等になるわけではない。組織上の責任を独力で負うことも、明示されていないすべての制約を理解することも、誤った判断の結果を引き受けることもできない。

また、エージェントは人間の労働との比較で見落とされがちなインフラにも依存している。モデル、ツール連携、アイデンティティ制御、データアクセス、監視、評価、エスカレーション経路が必要だ。真剣な計算には、こうした支援システムも含めなければならない。

したがって、この見出しが捉えているのは物語の前半にすぎない。確かにメーターは動いている。未解決なのは、それが生産的な作業、失敗した探索、重複した努力、あるいはそのすべてを測っているのかという点だ。

この違いが、有用なエージェントと高コストなループを分ける。システムは、持続的な価値をほとんど生まずに何時間も活動し続けることがある。別のシステムは、検証済みの短い一連の行動で、何日分もの手作業による調整を取り除くことができる。

稼働時間だけでは生産性は証明されない。トークン量だけでは品質は証明されない。出力の確認や修復に、オートメーションによって節約した以上の労力がかかるなら、タスクが完了していても経済的にはマイナスになり得る。

Google Newsは、この緊張関係をより広い読者層に示す一助となっている。議論は、エージェントが長時間のタスクを実行できるかどうかから、組織がそれらのタスクを経済的に統制できるかどうかへ移りつつある。

長時間稼働するAIエージェントは実際のワークフローになりつつある

長時間稼働するエージェントは、研究室でのデモから、一時停止・再開し、組織の境界をまたぐワークフローへと移行している。

GoogleのAgent Development Kitは、この移行をよく示している。2026年5月のエージェントワークフローガイドでは、状態を保持しながら数週間にわたって継続できるプロセスが説明された。

例の中心は従業員のオンボーディングだった。エージェントは書類を送信し、署名を待ち、テクノロジーのプロビジョニングを委任し、ハードウェアの配送を追跡し、初日の予定を準備する。

これは一つの長いモデル応答ではない。能動的な作業、保存された状態、非稼働期間を含む持続的なワークフローだ。エージェントは、何が完了し、何がブロックされ、どの行動に承認が必要かを把握しなければならない。

このアーキテクチャは、運用コストの捉え方を変える。署名を待っているエージェントは、継続的にモデルリソースを消費すべきではない。状態を保存して実行を停止し、検証済みのイベントの後に再開すべきだ。

設計の不十分なエージェントは、その逆を行う可能性がある。不要にシステムをポーリングしたり、中断のたびにコンテキストを再構築したり、変化していない情報をモデルに繰り返し解釈させたりする。こうしたパターンは、経過時間を回避可能な利用量へと変えてしまう。

同じ問題はコーディングにも見られる。Anthropicは、大規模なソフトウェアプロジェクトは一つのセッションに収まらないため、エージェントが多くのコンテキストウィンドウにまたがって作業すると説明している。新しいセッションごとに、前のセッションから信頼できる引き継ぎが必要になる。

Anthropicの長時間エージェントに関する研究では、初期化処理と段階的なコーディングプロセスが用いられている。エージェントは、完了した作業を説明し、その後のセッションを導く成果物を残す。

こうした成果物は、単なる事務的な装飾ではない。経済的な制御手段だ。明確なタスク台帳は、新しいセッションが分析を繰り返したり、決着済みの判断を再び開いたり、完成済みのコンポーネントを作り直したりする可能性を下げる。

長時間の作業は、明示的なテストからも恩恵を受ける。コーディングエージェントには、その変更が機能しているかを示す客観的なシグナルが必要だ。そのシグナルがなければ、モデルは正しい回答を改訂し続けたり、壊れた回答を自信を持って受け入れたりしかねない。

科学計算は、もう一つの具体例を提供する。Anthropicは、およそ2,000セッションにまたがって動作したコンパイラプロジェクトを報告した。その後のガイダンスでは、複数日にわたる研究タスクに向けて、進捗ファイル、テストオラクル、構造化されたオーケストレーションを重視している。

このような例は、実際の能力を示している。同時に、なぜメーターが加速し得るかも明らかにする。継続性には、繰り返し行われるコンテキスト構築、検証、調整が必要だ。エージェントは、時間をまたいで一貫性を保つための運用税を支払っている。

この税が正当化される場合もある。本来なら専門家の注意を何週間も必要とするプロジェクトでは、相当な計算コストとレビューコストを許容できる可能性がある。日常的な管理業務で許容される幅は、はるかに狭い。

したがって、「長時間稼働するAIエージェント」という表現は、二つの異なる次元を含んでいる。一つは、待機時間を含む経過時間だ。もう一つは、推論、ツール利用、再試行を含む能動的な計算の深さである。

企業の購入者は、これらを分けて考えなければならない。2週間続くワークフローでも、意味のあるイベントのときだけ起動するなら効率的になり得る。制御されないループに入れば、10分間のプロセスでも無駄になり得る。

エージェントのコストが単純に予測できない理由

モデルが固定された手順に従うのではなく、自ら経路を選ぶとき、エージェントへの支出は予測不能になる。

従来のソフトウェアは、比較的安定した実行パターンを持つ。リクエストが入り、既知のコードが実行され、システムが結果を返す。エンジニアはトラフィックとベンチマークデータからリソース使用量を見積もれる。

エージェントは異なる振る舞いをする。計画し、行動し、観察し、修正する。似た二つのリクエストでも、モデル呼び出し、ツール呼び出し、委任タスク、検証ステップの数が異なることがある。

この変動は、有用な柔軟性から生じる。エージェントは、ウェブサイトが変わった場合、データベースが不完全な情報を返した場合、最初の試みが失敗した場合にも回復できる。同じ条件で、固定的な自動化はしばしば停止する。

柔軟性は同時にばらつきも生む。エージェントは誤ったツールを選んだり、エラーを読み違えたり、アプローチを変えずに行動を再試行したりする可能性がある。一つの誤った計画判断が、その後のすべてのステップに影響し得る。

Google Cloudは、Agent Development Kitのオブザーバビリティを論じる際に、こうしたリスクを強調した。監視に関するガイダンスでは、ループ、再試行、引き継ぎの失敗、予期しないコスト、セキュリティ上の問題が挙げられている。

ループは特に示唆的だ。モデルは失敗したツール呼び出しを一時的な問題と解釈し、再試行するかもしれない。根本原因が権限の欠如であれば、どれほど繰り返しても解決しない。

人間のオペレーターならパターンを認識し、エスカレーションする。制約が不十分なエージェントは、より多くの失敗データを生み出しながらリソースを使い続ける。自律性が、小さな設定上の問題を変動する運用請求額へと変えてしまう。

マルチエージェントシステムは、この影響を増幅させる。プランナーがリサーチャーに委任し、リサーチャーが資料をライターに送り、ライターが出力を評価者に渡す。引き継ぎのたびに、コンテキスト、レイテンシー、誤解の機会が増え得る。

評価者は品質を改善できるが、リソースも消費する。曖昧なフィードバックを与えると、生成エージェントは一つの欠陥に対処するのではなく、成果物全体を改訂する可能性がある。すると評価ループは、改善に見合わないまま拡大する。

Anthropicは、長時間にわたるアプリケーション開発でこのトレードオフを検証した。そのマルチエージェントハーネスは、数時間のセッションにわたり、プランナー、ジェネレーター、評価者の役割を使用した。このシステムは、より短時間の単独実行よりも優れたアプリケーションを生み出した。

ただしAnthropicによると、より充実したプロセスのコストは20倍を超えた。この結果を普遍的な比率として扱うべきではない。一つのタスクにおいて、オーケストレーションがコスト構造をどれほど変え得るかを示している。

重要な比較は、完全なハーネスと単独エージェントを孤立して比べることではない。購入者は、利用可能な成果を比較する必要がある。使えないソフトウェアを生む低コストの実行には経済的価値がほとんどない一方、高コストの実行でも手作業のプロジェクトを上回る可能性がある。

このため、トークン当たりの効率だけでは議論を決着させられない。より高性能なモデルは、正しい経路により早く到達するため、消費トークンが少ない可能性がある。より安価なモデルは、追加の再試行、評価者、人間による修復を必要とするかもしれない。

OpenAIも、2026年7月のAI投資管理に関するガイダンスでこの点を指摘した。最も低いトークン価格が、必ずしも最も低い総コストにつながるわけではないと論じている。

この観察は、モデルルーターやエンタープライズプラットフォームに圧力をかける。すべてのステップを最も安価なモデルにルーティングすると、弱い判断がより大きな下流の作業負荷を生む場合、逆効果になり得る。

反対の戦略もリソースを浪費する。分類、検索、整形のすべてに最も高性能なモデルを割り当てることは、より小規模なシステムでも信頼性高く処理できるタスクを無視することになる。

効率的なオーケストレーションには、タスクに応じたルーティングが必要だ。複雑な計画では、より強い推論が正当化されることがある。決定論的な変換では、生成モデルがまったく不要な場合もある。高リスクな行動には、元に戻せるリサーチの手順よりも多くの検証が必要だ。

課題は、チームが十分な本番データを持つ前に、こうした方針を設計しなければならないことにある。初期導入ではベンチマーク精度に頼ることが多いが、ベンチマークが実際のツール障害、期限切れの権限、曖昧な社内指示を再現することはほとんどない。

その結果、企業には予測上の隔たりが残る。個々のモデル呼び出しのコストは分かっている。しかし、受け入れられる業務成果の安定したコストは、まだ分かっていない。

自律性対説明責任こそが本当の競争

長時間稼働するAIエージェントが経済的に有用になるのは、組織があらゆる行動を担当者、目的、予算、結果に結び付けられる場合に限られる。

AI: Reset to Zeroという見出しは、この問題を積算メーターとして捉えている。この枠組みは、何がメーターを動かし、なぜ動いたのかをチームが追跡できるようになったとき、実行可能なものになる。

Google Cloudの現在のagent observabilityモデルは、ログ、メトリクス、トレースを重視している。ログはイベントとエラーを記録し、メトリクスはレイテンシーとトークン使用量を要約する。

トレースは実行経路を再構築する。モデル呼び出しが何回行われたか、どのツールが選択されたか、ワークフローがどこで分岐したかを示せる。この詳細は、挙動だけでなくコストをデバッグするうえでも不可欠だ。

月次の合計値では、無駄の原因を特定できない。同じ合計値でも、価値ある10件の調査を表す場合もあれば、些細な再試行が数千回行われたことを表す場合もある。集計された支出がもたらす統制は、事後的なものにとどまる。

ワークフロー単位のトレースは、より良い問いを可能にする。どの一連の手順が受け入れられた成果物を生んだのか。チームは、成功した実行、失敗した実行、放棄された実行を、それぞれのリソース使用量を同一視せずに比較できる。

経済的な単位は、検証済みの結果であるべきだ。コーディングでは、テストを通過してマージされた変更がそれに当たるかもしれない。カスタマーオペレーションでは、再オープンされない解決済みケースが該当するだろう。

リサーチでは、引用がレビューに耐える意思決定メモが成果になり得る。オンボーディングでは、すべての承認が記録された完了済みの従業員レコードがその例になる。

この成果重視のアプローチは、社内のインセンティブも変える。トークン量の削減で評価されるチームは、人間による後処理を増やす弱いモデルを導入するかもしれない。タスク完了だけで評価されるチームは、過剰な再試行を見過ごす可能性がある。

有用な指標は、品質、コスト、時間を組み合わせるものだ。リスクも反映すべきである。不正確な社内要約を送るエージェントと、支払いを承認したり本番インフラを変更したりするエージェントは、同じではない。

自律性は、それを裏付ける証拠がある領域でのみ高めるべきだ。低リスクのタスクでは、より広い探索を許容できる。重大な行為には、権限境界、確認ステップ、可能な限り可逆的な実行が必要となる。

Anthropicは、エージェントを自らのプロセスとツール利用を指揮するモデルと定義している。そのagent governance frameworkは、挙動がモデル、ハーネス、ツール、環境に依存することを強調している。

このより広い視点は、コスト管理において重要だ。強力なモデルでも、設定の悪いハーネスの中ではリソースを浪費し得る。適切な計画でも、ツールが曖昧なエラーを返せば失敗し得る。

環境がリスクの大きさを決める。ドキュメントコレクションへの読み取り専用アクセスしか持たないエージェントなら、安全に探索できる。同じエージェントでも、メール、財務、デプロイメントのシステムに接続されるなら、はるかに厳しい制限が必要になる。

説明責任には、永続的な記憶も必要だ。ワークフローは、意思決定、承認、情報源、未解決の義務を保持すべきである。しかし、永続的な記憶には、古い指示や誤って昇格した仮定といった固有のリスクもある。

長いコンテキストだけでは、この問題は解決しない。履歴全体をモデルのウィンドウに入れると、処理量が増える一方で重要な事実を見つけにくくする可能性がある。保持するテキストが増えることは、より適切に統治された状態と同義ではない。

構造化されたナレッジ層は、検証済みの意思決定と生の会話を分離する助けになる。ナレッジワーカーにとって、personal knowledge baseは、エージェントの実行ごとにすべてを読み直させることなく、ソース資料を保持できる。

エージェントは、現在のステップで必要なものだけを取得すべきだ。また、重要な意思決定をどのソースが支えたかも記録すべきである。このアプローチはコンテキスト負荷を抑え、監査可能性を高める。

したがって、説明責任は自律性へのブレーキではない。自律性を商業的に正当化可能にするインフラである。それがなければ、より長い稼働は各結果をめぐる不確実性を大きくするだけだ。

メーターだけでは購入者にまだ分からないこと

利用データはリソースの行き先を明らかにできるが、エージェントが価値を生んだことや、より大きな権限に値することまでは証明できない。

Anthropicの2026年6月のEconomic Indexは、利用パターンがどれほど急速に変化しているかを示している。Claudeのセッションでは、Claude CodeとCoworkを通じた長時間稼働タスクが増えている。

このレポートは、より複雑な出力ほど、単純な応答より多くのトークンを消費する傾向があるとした。アプリケーション構築に関する会話では、中央値の会話の3倍を超えるトークンが使われていた。

また、トークン使用量と、対応付けられた職種の経済的価値との関係も見出した。高賃金の仕事に関連する会話ほど、より多くの出力、より多くのユーザー関与、そしてやや長い推論を含む傾向があった。

これらの知見は、妥当な直感を支持する。難しい仕事には、より多くの計算が必要になることが多い。タスクの複雑さを考慮せずに利用量を削減すれば、効率を高めるのではなく価値を損なう可能性がある。

しかし、相関関係は生産性の証明ではない。高給の職種に対応付けられた会話が、その職種の市場価値に見合う仕事を自動的に生み出すわけではない。

モデルは、有用な下書き、不正確な成果物、あるいは専門家の検証を必要とするもっともらしい回答を生成するかもしれない。トークン消費が示すのは活動である。どれだけの責任がユーザーに残ったかは測れない。

Anthropicのレポート自体が重要な手がかりを示している。Claudeがより多くの出力を生成するようになっても、ユーザーは高価値タスクにより深く関与し続けていた。このパターンは、完全な労働代替というより拡張に近い。

この知見は、エージェントのシートを人間の役職と直接比較しようとする試みを複雑にする。エージェントは専門家の出力を増やせる一方で、方向付け、判断、説明責任については依然としてその専門家に依存する可能性がある。

そのため、最適な導入では人を深く関与させ続けることになるかもしれない。ドメイン専門家は受け入れ基準を定義し、微妙な誤りを認識し、追加の探索がもはやコストに見合わない時点を判断できる。

より長い自律性を無条件の目標として扱うべきではない。Anthropicの2月の調査では、最長のClaude Codeセッションは3か月の間に25分未満から45分超へと伸びていた。

このほぼ2倍の時間は、能力とユーザーの信頼の拡大を示す。ただし、追加されたすべての1分が成果を改善したかどうかは分からない。長いセッションには、生産的な粘り強さと非生産的な迷走の両方が含まれ得る。

選別の問題もある。ユーザーは、ソフトウェアのコンパイルのようにテストが明確なタスクに、より長い実行を許可するかもしれない。交渉、戦略、曖昧な好みを含む仕事では、停止のシグナルが弱い。

テストスイートを持つエージェントは、ソフトウェアが失敗した時点を把握できる。戦略文書を作成するエージェントは、停止すべきことを示す二値の判定器がないため、文体上の変更を続ける可能性がある。

評価エージェントは一つの答えを提供するが、その判断は生成器と同じ弱点を共有し得る。Anthropicは、特に主観的なタスクにおいて、モデルが自分の仕事を過度に甘く採点しがちだと指摘している。

生成と評価を分けることで設計は改善する。しかし、評価が客観的になるわけではない。両エージェントが、事実の深さより洗練された表現を評価したり、同じ隠れた仮定を受け入れたりする可能性は残る。

誤りが重大な結果をもたらす領域では、人間のレビューが依然として必要だ。レビューの負担は経済計算に含めなければならない。そうしなければ、組織はモデルの出力を完成した仕事として数えながら、それを検証するために必要な労働を隠すことになる。

セキュリティは、価格に織り込まれていないもう一つの変数を加える。長時間稼働するエージェントは、より多くのドキュメント、メッセージ、ウェブサイト、ツール応答に接触する。追加される各入力には、誤解を招く指示やプロンプトインジェクションの試みが含まれ得る。

ツールへのアクセスが増えるほど、潜在的な被害も大きくなる。暴走するリサーチループは計算資源を浪費する。侵害されたオペレーショナルエージェントは、誰かが気付く前にデータを露出させ、メッセージを送り、システムを変更する可能性がある。

コスト上限は有用だが、不完全な安全策である。ワークフローは予算内に収まりながら深刻な被害を引き起こし得る。権限設計、アクション確認、異常検知は、リソース制御と並行して機能しなければならない。

したがって、メーターだけでは最も重要な管理上の問いに答えられない。エージェントが何を消費したかは示せる。しかし、そのエージェントにより多くの仕事を任せるべきかどうかは判断できない。

Google Newsの読者が次に注目すべきこと

次の段階を決めるのは、成果会計、永続的な実行、そして実際の本番障害下でも機能する厳格な制限だ。

最初のシグナルは、ベンダーが検証済み成果あたりのコストを公開するかどうかだ。トークン総数やモデル呼び出し回数は有用なエンジニアリングデータだが、購入者には受け入れられた結果に結び付くワークフローレベルの指標が必要である。

プラットフォームは、成功、失敗、再試行、人間による救済が行われた実行を区別すべきだ。また、どのモデル、ツール、分岐が最終コストに最も寄与したかも示すべきである。

こうした制御が標準になれば、Google Newsの見出しの根拠は生産的な形で強まる。メーターは警告灯ではなく、最適化の手段になる。

ベンダーが広範な利用総量を強調し続ければ、エンタープライズチームは導入を比較するのに苦労する。どのワークフローが価値を生むのか特定できないため、無差別にアクセスを減らすかもしれない。

二つ目のシグナルは、永続的な実行パターンの採用だ。Googleの一時停止・再開アーキテクチャはその一例である。エージェントはアイドル期間中に状態を永続化し、検証済みのイベントから再開できるべきだ。

このアーキテクチャは障害にも耐えなければならない。再起動されたプロセスは、どのアクションがすでに発生したかを把握すべきである。同じメッセージを二度送ったり、完了済みチケットを再オープンしたり、外部取引を繰り返したりしてはならない。

進捗台帳、冪等なツール、明示的な承認記録は、モデルの知性ほど目立たない。だが、長時間稼働するAIエージェントがオペレーション上の混乱を招かずに何日も稼働できるかどうかを決めるのは、これらである。

これらのパターンが広く使われれば、長時間稼働する自律性を支持する根拠になる。永続的な障害や重複アクションは、ベンチマークが改善してもその根拠を弱める。

三つ目のシグナルは、強制可能なリソースと権限の境界が現れることだ。完了後に過剰な消費を報告するダッシュボードは、厳格な上限ではない。

チームには、想定ステップ数を超えたとき、ツール呼び出しを繰り返したとき、計画を頻繁に変更しすぎたとき、あるいは定義済みのリソース予算に近づいたときに、ワークフローを一時停止する制御が必要だ。

一時停止時には、レビューのための証拠を保持すべきである。運用担当者は、エージェントの最後に検証された状態、未解決の目標、最近のツール応答、エスカレーションの理由を確認できる必要がある。

権限境界も同じように機能すべきだ。エージェントは購入を実行せずに調査できる。送信せずにメールを準備できる。本番環境を変更せずにデプロイを提案できる。

プラットフォームがこれらの境界をシンプルかつ信頼性高く実現すれば、企業は段階的に自律性を付与できる。制御がカスタムエンジニアリングプロジェクトのままであれば、導入は大規模なインフラチームを持つ組織に集中するだろう。

Google Newsでは、エージェントがタスクを置き換え、何時間も働き、ソフトウェア全体で稼働するという記事が増える可能性が高い。読者は稼働時間だけでなく、何がワークフローを止めたのかに目を向けるべきだ。

目標が検証されたから止まったのか、人が結果を承認したから止まったのか、それとも予算が尽きたから止まったのか。これらは実質的に異なる結果である。

メーターという比喩は、隠れた消費を可視化するため有用だ。その弱点は、複雑な仕事を一つの積算数値に還元してしまう点にある。

成熟したエージェント市場には、複数のメーターが必要だ。一つはリソースを追跡する。もう一つは受け入れられた成果を追跡する。三つ目は、リスク、介入、可逆性を追跡するべきである。

ナレッジワーカーは、タスクごとにコンテキストを再構築するのではなく、エージェントが必要とするソース資料や意思決定を保存しておくことで、備えを整えられます。検索可能なセカンドブレインがあれば、こうした引き継ぎをより選択的かつ監査可能なものにできます。

実務上の問いは、長時間稼働するAIエージェントが作業を続けられるかどうかでは、もはやありません。Google Newsは、より難しい問いを世間の注目に押し出しました。メーターが止まる前に、そのエージェントが何を達成したのかを、誰かが説明できるのでしょうか。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page