OpenAIのAIスコアカード、「1ドル当たりの有用な知能」へコスト論争を転換
- Martin Chen

- 7 日前
- 読了時間: 22分
更新日:6 日前
OpenAIは7月17日、企業の購買判断を形作ってきた「最安モデル」重視の論理に異議を唱えるAIスコアカードを発表した。提案された指標「1ドル当たりの有用な知能」は、AIシステムが総支出額に対して、どれだけ信頼できる業務を遂行できるかを問う。
この転換が重要なのは、購入者がしばしばトークン単価、ベンチマークスコア、ユーザー導入率を比較するからだ。これらの数値からは、AIシステムが何度も試行したり、修正したり、高額な人間の監督を必要としたりせずに、価値ある業務を完了できるかどうかはほとんど分からない。
OpenAIは、代わりに成功した成果を経済的な単位とすることを目指している。この主張は明白な利害対立も生む。同社はフロンティアモデルを販売しており、顧客が目に見える最低利用コストよりも能力を重視すれば利益を得る。
企業はすでに別の道を進んでいる。多くの企業は日常業務を安価なモデルに振り分け、より困難な業務にはフロンティアシステムを使用し、あるいはモデルを動的に選択するルーターを活用している。OpenAIは、たとえ他社のプロバイダーが勝つ場合でも、成果ベースのスコアカードがこうした選択を支持することを示さなければならない。
その結果として生まれるのは、単なる新しい性能指標ではない。これは、調達慣行がトークン価格やモデルルーティングを中心に定着する前に、企業によるAIの購入方法を再定義しようとする試みである。
OpenAIのAIスコアカード、利用量を完了した業務に置き換える
OpenAIのAIスコアカードは、モデルの活動量ではなく、実際に利用可能な業務成果をAI価値測定の出発点とする。
OpenAIのCFOであるSarah Friarは、AIスコアカードでこの枠組みを提示した。彼女は、ソフトウェアが業務を遂行し始めると、従来のソフトウェア指標は有用性を失っていくと主張している。
企業は長年、購入したシート数、アクティブユーザー数、更新されたライセンス数を追跡してきた。これらの指標は導入状況を示すが、ツールが価値ある成果を生み出したことを証明するものではない。
AIはこの区別をさらに複雑にする。人はビジネス成果を改善することなく、何十件もの要約を生成し、何百件ものメッセージを下書きし、エージェントを繰り返し実行できる。
そのため、この枠組みは相互に関連する4つの問いを提示する。AIは重要な業務を完了しているか。成功した各タスクにはどれほどのコストがかかるか。人々はその結果を信頼できるか。利用量が増えるにつれて、1ドル当たりの価値は高まるか。
これらの問いが、OpenAIのAIスコアカードにおける「1ドル当たりの有用な知能」という枠組みを形成する。成果量、コスト、信頼性、規模拡大に伴う経済性を、単一の経営視点に統合するものだ。
最初の問いによって、企業は特定のワークフロー内で有用な業務とは何かを定義せざるを得なくなる。サポート部門であれば、生成した回答数ではなく、解決した顧客問題の件数を数えるかもしれない。
エンジニアリングチームなら、テストに合格し、レビューを通過したコード変更を数えられる。法務部門なら、合意された期限内に正確にレビューした契約書を追跡できる。
こうした定義は単純に聞こえるが、規律を要求する。チームは生産性向上を主張する前に、「完了」が何を意味するのかを明確にしなければならない。
この要件により、有用な知能と生成物が区別される。トークン自体には独立したビジネス価値がない。その出力が合意された成果を前進させる場合にのみ意味を持つ。
OpenAIは一例として財務予測を挙げている。レビューの準備には、最新予測の特定、スプレッドシートの照合、変更点の特定、スライドの更新、計算の確認などが含まれる。
これらの手順を完了するAIシステムは、財務チームに時間を取り戻させることができる。しかし、価値を生むのは、処理したファイル数ではなく、正確で意思決定に利用できる一式の資料である。
この区別は、リーダーによる導入状況の解釈も変える。利用量の多さは、需要、混乱、反復的な失敗、あるいはそのすべてを同時に示している可能性がある。
モデルは多くのユーザーを引き付けながら、追加のレビュー作業を生み出すことがある。別のシステムでは、より少ない介入で各業務を完了するため、プロンプト数が少なくなるかもしれない。
両者が同等の業務を扱う場合、スコアカードは後者を高く評価する。目に見える活動量よりも、タスクの完了と受け入れを重視するためだ。
この捉え直しは、AIツールが下書き作成の域を超えつつある中で登場した。システムはますます、コンテキストの取得、ツールの呼び出し、アプリケーションの更新、複数の連続した手順の実行を担うようになっている。
アクションが追加されるたびに、ワークフローへエラーが入り込む箇所も増える。したがって、タスクを開始する能力は、安全に完了する能力に比べてはるかに価値が低くなる。
OpenAIの提案は、能力と経済的有用性を結び付けることでこれに対応する。より高性能なシステムが価値を生むのは、その高度な推論によって失敗を減らすか、より価値の高い業務を可能にする場合に限られる。
このアプローチは、すべてのタスクを同等に扱うことも避けている。日常的な質問への回答と財務分析の完了では、必要となる推論、監督、コンピューティングの量が異なる。
適切な比較対象は、単に各システムが消費したトークン数ではない。それぞれが必要な成果に到達したか、そしてそこに至る全行程にどれだけのコストがかかったかである。
これがスコアカードの中核となる変化だ。AIの購入判断は、アクセス数や消費量を数えることから、受け入れられた業務成果を測定することへ移行する。
1ドル当たりの有用な知能がコスト計算を変える
1ドル当たりの有用な知能は、成功したタスクを、AIベンダーと購入者が正当性を示すべき分母とする。
OpenAIは、ワークフロー全体のコストを合算し、合意された品質基準を満たす結果を数えることで、成功したタスク当たりのコストを計算するよう提案している。その合計を成功した成果数で割る。
この合計はモデルの利用料だけにとどまらない。従業員の作業時間、必要なレビュー、再試行、修正、手戻り、ツール、インフラ、失敗した実行も含まれる。
同じ調査業務を処理する2つのシステムを考えてみよう。1つ目は安価な推論を使用するが、引用の質が低く、3回の試行と広範なファクトチェックを必要とする。
2つ目はより多くのコンピューティングを使用し、1回の試行で受け入れ可能なレポートを完成させる。目に見えるモデルコストは高くても、完了した業務当たりのコストは低い可能性がある。
この仕組みは、OpenAIの主張の中で最も説得力のある部分だ。トークン価格は技術的な投入量を測定する一方、成功したタスク当たりのコストは業務上の成果を測定する。
また、異なる設計のシステムを比較するための共通構造を調達チームに提供する。ホスト型フロンティアモデル、小規模モデル、オープンウェイトのデプロイメントは、いずれも同じ受け入れテストにかけられる。
ただし、この比較が機能するのは、タスクと品質基準が一定の場合に限られる。軽く編集した下書きと、承認済みの最終成果物を比較することはできない。
組織には、繰り返し測定できるほど小さく、かつ意味を持つほど価値のある評価単位が必要だ。単一のプロンプトでは範囲が狭すぎることが多く、部門全体では広すぎる。
定義されたワークフローが、より適切な中間地点となる。たとえば、1件のサポート案件の解決、テスト済みコード変更1件のマージ、検証済み顧客概要1件の作成などだ。
人間によるレビューには特に注意を払う必要がある。実際のコストがそこに隠れていることが多いためだ。システムは評価作業を従業員へ移すことで、効率的に見せかけることができる。
レビュー時間は必ずしも無駄ではない。機密性の高い意思決定、曖昧な証拠、説明責任には、人間の判断が不可欠であり続ける。
測定上の問いは、AIによって受け入れ可能な成果へ到達するための労力が減るかどうかだ。レビュー担当者が結果の確認に、導入前の作成作業と同じだけの時間を費やすのであれば、コスト削減効果は疑わしいままである。
再試行は、もう一つの隠れた費用を生む。失敗した実行は、受け入れ可能な結果を生み出すことなく、モデルのリソース、ツール呼び出し、従業員の注意、経過時間を消費する。
成功したAPI呼び出しだけを追跡する組織は、その無駄を見落とす。OpenAIのAIスコアカードでは、代わりにそのコストを、最終的に合格した成果へ配賦する。
遅延が価値に影響する場合、レイテンシーも分析に含める必要がある。正しい回答であっても、期限後に届けば、ビジネス成果としては失敗となり得る。
この枠組みによって、モデルルーティングは中核的な経済手段となる。日常的な業務は効率的なシステムに振り分け、複雑な業務にはより高い推論能力を割り当てられる。
企業の購買パターンによると、企業はすでに日常業務を安価なモデルへ振り分けている。要求の厳しい業務に限って、フロンティアシステムを選択的に使用している。
この行動は、必ずしも1ドル当たりの有用な知能と矛盾しない。単一のモデルですべてを処理すべきだと仮定する代わりに、タスク単位で指標を適用しているからだ。
OpenAI自身も、階層化されたモデルファミリーを、この方程式を最適化する方法として説明している。さまざまな能力レベルが、大量処理型、バランス型、推論集約型のワークフローに対応できる。
重要なのは、選択が証拠に基づき続けるかどうかだ。プレミアムモデルがフロンティアという看板だけで選ばれるべきではなく、小規模モデルもトークンコストだけで選ばれるべきではない。
すべての候補に同じ成功基準を適用しなければならない。そのうえで購入者は、総合コスト、受け入れ率、完了時間、介入負担を比較する。
OpenAIは自社製品の内部データによって、その主張を裏付けている。同社によると、GPT-5.6 SolはDeepSWE v1.1エンジニアリング評価で72.7パーセントを達成した。
Claude Fable 5は69.9パーセントだったと報告し、GPT-5.6 SolのAPIコストは36.2パーセント低かったと推定している。OpenAIはさらに、別の主要モデルと比較して出力トークンが54パーセント少なかったと主張している。
これらの数値は想定される仕組みを示しているが、依然としてベンダーが選択した証拠である。ベンチマーク上の優位性だけでは、顧客の本番環境全体におけるコスト削減を証明できない。
実際のワークフローには、非公開データ、変化する要件、レガシーツール、承認待ちのキュー、不明確な目標が含まれる。こうした条件が管理された評価にきれいに収まることはめったにない。
したがって、効果的な導入はローカルなベースラインの設定から始まる。チームはAIを追加する前に、現在の完了時間、品質、人件費、失敗率を記録すべきだ。
その後、導入後の同じワークフローと比較できる。このベースラインがなければ、AIコストの数値がどれほど正確でも、投資収益を証明することはできない。
真の競争は成果の経済性と表示価格の対決
OpenAIは購入者に成果の経済性を重視するよう求める一方、企業は特定のフロンティアベンダーが既定の選択肢になることを防ぐシステムを構築している。
この物語における主な対立相手は、特定の競合モデルプロバイダーではない。安価な推論を自動的な経済的勝利とみなす、表示価格重視の購買論理である。
OpenAIには、この論理に異議を唱える明確な理由がある。より高性能なモデルは多くのリソースを消費することが多く、目に見えるコストが財務チームから疑問視されやすいためだ。
購入者が利用料金だけを重視すれば、フロンティアプロバイダーは、小規模モデル、オープンウェイトシステム、特化型の代替手段から圧力を受ける。成果の経済性は、彼らに別の防衛手段を与える。
この防衛策は、推論品質が再試行を減らすワークフローでは説得力がある。小規模モデルがすでに必要な基準を安定して満たしている場合、その説得力は弱まる。
予測可能な定型書類を処理する企業にとって、利用可能な最強モデルによる利点はほとんどないかもしれない。複雑なエンジニアリングエージェントなら、より高度な推論能力とツール操作能力から大きな恩恵を受ける可能性がある。
1ドル当たりの有用な知能は、この選択を事前に決定するものではない。適切に適用すれば、選択を実証的なものにする。
そこでは、OpenAIの提案がOpenAI自身に不利に働く可能性もある。中立的なスコアカードは、競合他社が総コストに対してより多くの受け入れ可能な業務を生み出す場合、それを認めなければならない。
企業はルーティングを利用して、その競争を継続的なものにできる。ルーターはタスク要件を評価し、各リクエストを適切なモデルまたはシステムへ送信する。
このアーキテクチャは、単一プロバイダーへの依存を減らす。また、1ドル当たりの有用な知能を、ベンダーのスコアではなくポートフォリオ指標へと変える。
チームは、分類をコンパクトモデルに、詳細な調査をフロンティアモデルに、機密性の高い社内情報の検索を管理されたデプロイメントに振り分けることができます。
勝つシステムとは、コストとリスクの制約内で、受け入れ可能な作業量を最大化できる組み合わせです。個々のモデルがすべてのカテゴリーで優位に立つ必要はありません。
オープンウェイトモデルは、単純な比較にさらなる難題をもたらします。表面上の推論費用には、デプロイメントエンジニアリング、ハードウェア利用率、監視、セキュリティ、保守が含まれていません。
ホステッドシステムでは、そうした責任の多くがサービスに組み込まれています。妥当なコスト比較では、両方の運用モデルを考慮しなければなりません。
同様に、ホステッドモデルの利便性が、切り替えリスク、データガバナンス上の問題、変化するサービス挙動への依存を解消するわけではありません。これらの要因には、実質的な経済的負担が伴う可能性があります。
スコアカードは、こうした違いを捉えることで価値を持ちます。売り手のアーキテクチャに有利なコストだけを含めるなら、それはマーケティングに過ぎません。
したがって、独立した測定が不可欠です。調達チームは、タスクの定義、評価データ、合格基準を自ら管理すべきです。
ベンダーはベンチマーク結果やツールを提供できますが、成功の定義を独占すべきではありません。そうでなければ、買い手はサプライヤーが最も得意とするテストに最適化してしまうおそれがあります。
対立は組織内にも存在します。エンジニアリングチームはトークン消費量を最適化できますが、ビジネスチームが重視するのは、完了した案件、リリースされた機能、短縮されたサイクルタイムです。
財務チームにはAI関連費用の増加が見えても、その費用がどのような仕事を支えているのかは見えない場合があります。従業員は、利用状況ダッシュボードには記録されない追加のレビュー負担を経験するかもしれません。
共通の成果指標は、こうしたグループの足並みをそろえるのに役立ちます。それにより、技術チームにはコスト構造が、事業責任者には測定可能な価値単位が与えられます。
その整合には、信頼できるコンテキストが必要です。多くのナレッジタスクは、システムに正しい文書、意思決定の履歴、最新の顧客情報が不足しているために失敗します。
モデルの推論能力を向上させても、欠落したソース資料は補えません。組織は、情報検索とナレッジブレンディングをワークフロー設計の一部として扱う必要があります。
同じ原則はツールへのアクセスにも当てはまります。回答を作成できても、必要なシステムを更新できないエージェントは、仕事の一部しか完了していません。
一方、広範な権限はリスクを高める可能性があります。行動を実行できるモデルには、明確な制限、承認ゲート、エスカレーション経路が必要です。
したがって、OpenAIの「1ドル当たりの有用なインテリジェンス」というAIスコアカードの枠組みは、モデルベンダーだけに圧力をかけるものではありません。企業にも、自社の業務を計測するよう迫ります。
多くの企業には、成功、手戻り、レビュー時間について安定した定義がありません。自動化によってワークフローの境界を無視しにくくなるため、AIはそうした測定上の欠落を浮き彫りにします。
組織がこうした欠落に対処すれば、あらゆるモデルをより正確に評価できるようになります。対処しなければ、「1ドル当たりの有用なインテリジェンス」は、比較可能なデータを伴わない魅力的な言葉に過ぎなくなります。
信頼性には価値があるが、スコアカードは操作され得る
スコアカードで最も扱いにくい変数は信頼性です。成功基準は主観的で変更可能なうえ、選択的な報告によって操作されやすいためです。
OpenAIは成果を3つの実用的なカテゴリーに分類しています。結果は、そのまま利用できる、修正が必要、または人へのエスカレーションが必要、のいずれかです。
この分類は、単一の精度スコアよりも運用上の実態をよく捉えています。受け入れ可能な自動化と、単に人間の作業の出発点となる出力を区別できます。
信頼性には直接的な経済価値があります。修正が減れば、人件費、遅延、推論のやり直し、エラーが顧客に届く可能性を抑えられます。
また、組織が重要な業務をAIに任せられるかどうかも左右します。メッセージの下書きに必要な信頼度は、財務記録の変更やコードのデプロイに必要な信頼度より低くて済みます。
しかし、チームは品質基準を下げることで指標を操作できます。ほぼすべての出力を成功と見なせば、成功タスク当たりのコストは極めて優秀に見えるでしょう。
また、難しいケースを分母から除外することもできます。評価が予測可能な業務だけを対象としていれば、システムは信頼性が高いように見えるかもしれません。
管理された導入段階では、タスクを選択的に選ぶことが適切な場合もあります。しかし、その結果を職務や部門全体に一般化すれば、誤解を招きます。
したがって、成功の定義には品質、適時性、対象範囲を含める必要があります。また、どの失敗が修正、エスカレーション、却下につながるのかも明確にすべきです。
独立したサンプリングは、都合のよい事例だけを選ぶことの防止に役立ちます。レビュアーは、導入チームが選定した事例だけでなく、本番環境の成果を無作為に抽出して確認できます。
チームは、モデルの失敗とワークフローの失敗も区別すべきです。権限の不足、古いデータ、壊れた連携、不明確な指示は、いずれも完了を妨げる可能性があります。
この区別は原因診断に役立ちますが、それらの失敗を総合的な経済性から除外すべきではありません。システム全体が失敗すれば、買い手は依然としてコストを負担します。
長期的な作業では、信頼性の確保が特に難しくなります。ステップが増えるたびに、逸脱、不適切なツール呼び出し、裏付けのない仮定が生じる機会も増えます。
長時間タスクの完遂に関する研究は、有用な比較を提示しています。これは、モデルが一定の成功率で完了できる人間のタスクの長さを測定するものです。
この研究は、個別のスキルだけでなく、信頼性とエラー回復を重視しています。また、ベンチマーク性能を職場全体の自動化に直接置き換えて解釈することへの警告も示しています。
OpenAI独自のスコアカードも境界を認識しています。システムが行動を実行する前に、組織はアクセス可能なデータ、利用を許可するシステム、必要な人間の承認を定義すべきです。
こうした統制はレビューやガバナンスを追加するため、見かけ上のコストを増加させる可能性があります。しかし、統制を取り除けば、より大きな財務上、セキュリティ上、コンプライアンス上の損失につながるおそれがあります。
したがって、完全なスコアカードでは、あらゆる人間の監督を非効率と見なすべきではありません。一部の監督は、品質基準そのものの一部です。
重要なのは比例性です。日常的で取り消し可能な行動にはサンプリングで十分かもしれませんが、影響の大きい意思決定には明示的な承認が必要となる場合があります。
この枠組みには、損害を表す方法も必要です。多くのタスクを低コストで完了しても、まれに高額な損失を生じさせるシステムは、平均値では効率的に見える可能性があります。
チームは、失敗の頻度とともに深刻度も追跡すべきです。1件の不正な行動が、何千件もの低リスクタスクの成功を帳消しにすることもあります。
同じ理由で、ばらつきも重要です。平均値が同じでも予測不能な失敗を起こすシステムより、安定したシステムの方が計画上の価値は高くなります。
OpenAIは、信頼できる出力は正確で、出典があり、一貫性を持ち、適切にエスカレーションされるべきだと述べています。こうした特性は、各ワークフロー内で測定可能な合格基準に変換する必要があります。
調査では、情報源の網羅性と事実確認が求められるかもしれません。コーディングでは、テスト、セキュリティチェック、レビュー承認、本番環境の安定性などが含まれ得ます。
カスタマーサポートでは、問題の解決だけでは不十分な場合があります。組織は、ポリシー遵守、満足度、再発に関するデータも必要とするかもしれません。
OpenAIの「1ドル当たりの有用なインテリジェンス」というAIスコアカードの提案は、こうした違いに対応する単一の普遍的な計算式を提示していません。それは長所であると同時に短所でもあります。
柔軟性があることで、組織は実際の業務を反映できます。一方で、ベンダー間、部門間、公開された主張の間での比較は、はるかに難しくなります。
より広範な経済研究でも、同じ問題が認識されています。生産性の枠組みでは、正しい解決策を時間や労働力と比較できますが、タスクの定義が決定的に重要であることに変わりはありません。
企業がAIのリターンを報告する際には、その方法論を社内で公開すべきです。記録には、タスクの範囲、合格基準、除外したケース、レビュー要件を含める必要があります。
また、過去の定義も保持すべきです。品質基準をひそかに変更すれば、スケーリング分析を有意義にするトレンドラインが損なわれます。
OpenAIの枠組みが説明責任を向上させられるのは、その入力を監査可能な状態に保つ場合に限られます。そうでなければ、どのベンダーも自社に都合のよい分母を使い、高い有用なインテリジェンスを主張できてしまいます。
スコアカードが定着するかを示す3つのシグナル
次の焦点は、「1ドル当たりの有用なインテリジェンス」が説得力のあるベンダーの物語ではなく、再現可能な運用指標になるかどうかです。
最初のシグナルは、顧客または独立評価機関によるワークフローレベルの結果の公開です。こうした研究には、完全なコスト範囲と安定した合格基準が必要です。
有力な証拠となるのは、同じ本番タスクで複数のシステムを比較した結果です。そこには、再試行、人間によるレビュー、レイテンシー、インフラストラクチャ、失敗した結果を含める必要があります。
フロンティアシステムが完了タスク当たりのコストを繰り返し引き下げるなら、そうした結果はOpenAIの主張を裏付けます。より小型のモデルが、より低い総費用で同等の品質を実現するなら、その主張は弱まります。
2つ目のシグナルは、モデルルーティングの動向です。企業はすでに、1つの汎用モデルを選ぶのではなく、複数のシステムにタスクを割り当てています。
OpenAIのスコアカードが普及すれば、ルーティングプラットフォームはトークン価格だけでなく、受け入れ可能な成果に基づいて最適化するはずです。ダッシュボードには修正率とエスカレーション率が表示されるべきです。
この結果は指標の妥当性を証明する一方で、OpenAIによる支配を制限するでしょう。買い手はこの枠組みを採用しつつ、同じ測定システム内ですべてのプロバイダーを競争させることになります。
異なる結果も示唆に富みます。企業がほぼ価格だけでルーティングを続けるなら、成果を測定するために必要なデータが不足している可能性があります。
3つ目のシグナルは、財務責任者が成功タスクの経済性を予算や業務レビューに組み込むかどうかです。調達で使われる用語は、どの指標が定着するかを左右することがよくあります。
本格的な導入では、AI支出を、明確に名付けられたワークフロー、品質基準、ベースライン性能に関連付けることになります。リーダーは単に利用量がどれだけ増えたかではなく、どの業務が改善したかを問うでしょう。
そうした実践は、スコアカードの中核的な主張を裏付けます。組織がモデルの利用状況と測定可能なビジネス成果を結び付けられることを示すからです。
その関連付けを確立できなければ、この指標はケーススタディやベンダーのベンチマークに依存したままになります。問いとしては有用でも、財務基準としては脆弱なままでしょう。
読者は、OpenAIが自社の証拠をどのように報告するかにも注目すべきです。より安価な代替手段が勝つ比較可能なタスクを示せば、同社は信頼性を高められます。
常に提唱者に有利なスコアカードは、信頼される市場標準にはなりません。トレードオフを明らかにするスコアカードの方が、定着する可能性は高いでしょう。
この枠組みが登場したタイミングは適切です。AIエージェントによって、プロンプトから完成した成果までの距離が広がっているためです。その距離には、再試行、修正、ツールの失敗、レビュー作業が隠れています。
「1ドル当たりの有用なインテリジェンス」は、買い手がそうしたコストを見つけるための言葉を提供します。しかし、成功を定義し、ワークフローを計測するという困難な作業がなくなるわけではありません。
開発者が直ちに取るべき行動は、モデルの利用状況と併せて成果を記録することです。各実行が合格したか、修正を要したか、エスカレーションされたか、失敗したかを記録してください。
企業の買い手は、AI導入前のベースラインに照らして、完全なワークフローを測定するようパイロットに求めるべきです。同一のタスクと合格基準でベンダーを比較してください。
ナレッジワーカーは、AIが最終成果物を完成させるための労力を減らしているかを確認すべきです。検証と修正によって節約した時間が消費されるなら、下書きが速くなっても意味はほとんどありません。
OpenAIの「1ドル当たりの有用なインテリジェンス」というAIスコアカードのアプローチは、最終的に市場の双方に厳しい責任を課します。ベンダーは能力に関する主張を受け入れ可能な成果に結び付け、買い手は業務を誠実に測定しなければなりません。
これは、コンテキストなしでトークン単価を比較するよりも有意義な競争です。しかし、その結論はまだ出ていません。
次の四半期に、繰り返し発生するワークフローを1つ選んでください。成功の成果を定義し、すべての修正を記録し、完了に必要な人間の作業時間も含めてください。
そして、モデルやルーティング戦略ごとに結果を比較してください。OpenAIの主張が正しければ、最良のシステムが常に最も低い表面上のコストを持つとは限りません。
組織が実際に抱える制約の中で、最も信頼できる完成成果物を生み出せるでしょう。次にAIへ投じる資金に値するものは、ベンチマークの見出しやベンダーの宣伝文句ではなく、その実証結果に基づいて決めるべきです。


