Salesforce Koa推論モデルが汎用AIラボに警鐘を鳴らす
Salesforceは初のCRM専用モデルを発表し、Salesforce Koa推論モデルを汎用AIラボへの直接的な挑戦として位置付けた。
同社は、NvidiaのオープンウェイトモデルであるNemotron 3 Superを基盤にKoaを構築した。その後、営業、マーケティング、カスタマーサポートのワークフロー向けにKoaを訓練した。Salesforceによると、このモデルは主要モデルと同等以上の性能を維持しながら、CRMアクションにおけるエラーを3分の1に削減するという。
この主張には、なお独立した検証が必要だ。それでも、すべてのベンチマーク結果が確認される前から、Koaの背後にある戦略には重要な意味がある。Salesforceは、適応可能な基盤モデルに数十年分のワークフロー知識、自社ソフトウェアプラットフォーム、そして企業顧客への即時のアクセスを組み合わせられる。
OpenAI、Anthropic、Googleは、ほぼあらゆる知的作業をこなすモデルに莫大な資源を投入してきた。Koaは、エンタープライズ顧客が、より狭い用途に特化し、より制御しやすく、従業員の業務環境にすでに組み込まれたものを選ぶかどうかを試す。
脅威は、Salesforceが突如として最も賢いモデルを構築したことではない。そうする必要がない可能性にある。
Salesforce Koa、NemotronをCRM専門モデルへ転換
Koaは汎用のオープンウェイト基盤を取り込み、エンタープライズソフトウェアを有用にするアクションを中心に訓練する。
SalesforceとNvidiaは9月15日、Koaを発表した。現在は一部のAgentforce顧客によるパイロット導入に入り、2026年冬には米国でより広範な提供が見込まれている。
このモデルは、Nvidiaの1200億パラメータの基盤モデル、Nemotron 3 Superから始まる。オープンウェイトとは、外部API経由でしか利用できないモデルとは異なり、モデルの学習済みパラメータが管理された適応のために利用可能であることを意味する。
Salesforceは単にCRM検索システムをNemotronに接続したわけではない。同社の研究者は、エンタープライズワークフローをまたいで推論し、必要なツールを実行できるよう、基盤モデルを追加学習させた。
この違いは重要だ。検索は汎用モデルに関連レコードや文書を与えられる。しかし、ビジネスプロセスの各段階でどのアクションを取るべきかを、モデルに自動的に教えるものではない。
進捗が止まった営業案件を考えてみよう。エージェントは最近の活動を確認し、不足情報を特定し、業務ルールを確認し、次のステップを提案し、フォローアップを予定する必要がある。判断の一つひとつがワークフローの状態を変える。
カスタマーサポートのケースでは、別の一連の処理が生じる。モデルは問題を分類し、アカウントの詳細を確認し、適用可能なポリシーを検索し、ケースを振り分け、ステータスを更新する可能性がある。流暢な回答だけでは不十分だ。
Salesforceは、教師ありファインチューニングと強化学習でKoaを訓練した。教師ありファインチューニングでは、望ましい振る舞いの例をモデルに示す。強化学習では、タスクを成功裏に完了した振る舞いに報酬を与える。
同社は、この強化学習段階にGroup Relative Policy Optimization、すなわちGRPOを採用した。GRPOは複数の試行応答を比較し、より良い結果に結び付く振る舞いを強化する。
Salesforceによると、訓練シナリオは14を超える業界を対象としている。製造、医療、金融サービス、旅行などの分野で、シミュレートされたペルソナをタスク、期待されるアクション、ツール呼び出しと組み合わせている。
Salesforceによれば、この訓練に顧客データは使われていない。代わりに同社は、27年にわたるCRM導入で蓄積したビジネスパターンをもとに、合成的な状況を生成した。
この表現には注意が必要だ。Salesforceは、機密性の高い顧客レコードがKoaに取り込まれたとは主張していない。蓄積された知見が、訓練に用いたシミュレート済みワークフローを形作ったとしている。
このモデルは研究デモにとどまらない。Salesforceはすでに、従業員による情報検索や定型業務の完了を支援するSlackエージェントを通じて、社内でKoaを利用している。
パイロット顧客には、1-800Accountant、Baxter Credit Union、Engine、Formula 1、UChicago Medicine、Xeroが含まれる。こうした導入は、管理された評価が本番環境での信頼性につながるかを明らかにするはずだ。
したがって、直近の製品変更は具体的だ。Agentforceは、汎用の外部モデルだけに依存するのではなく、プラットフォーム固有のアクションを中心に設計されたSalesforceホストの推論モデルを得ることになる。
Salesforce Koa推論モデルがAIラボに圧力をかける理由
Salesforceは、あらゆる汎用知能ベンチマークで勝つことではなく、ワークフローの所有権、流通、制御で競争している。
最先端AIラボは、汎用性を大きな優位性として扱ってきた。有能な単一モデルが、ソフトウェアの作成、文書分析、調査、質問への回答、幅広い業務機能の支援を担える。
この幅広さは依然として価値がある。しかしエンタープライズエージェントは、正確な権限、データ構造、許容される成果が定められた、より限定的な環境で動作する。こうした制約は、アプリケーション層を理解する企業に有利に働く。
Salesforceは、自社プラットフォーム内の業務を定義するレコード、オブジェクト構造、権限、オートメーションシステムを保有している。また、多くの従業員がCRMソフトウェアに接するインターフェースも管理している。
この立場は、API経由で参入するモデル提供者に対して、Salesforceに3つの優位性を与える。
第一に、Salesforceはタスクの成功完了をプラットフォーム固有の用語で定義できる。案件が更新されたか、ケースが正しいキューに到達したか、フォローアップがカレンダーに表示されたかを把握している。
第二に、そうした成果を中心に訓練シミュレーションを構築できる。モデルは、良い回答に見えるテキストを生成したことだけでなく、プロセスを完了したことに対して報酬を受けられる。
第三に、Salesforceは得られたモデルをAgentforce経由で提供できる。顧客は、既存ワークフローに対してモデルを試す前に、別個のオーケストレーション層を組み立てる必要がない。
基盤となる研究は、この戦略をより明確にしている。Koaの研究論文は、ペルソナベースのマルチターンタスクを生成するための、シミュレーションから報酬へとつなぐパイプラインを説明している。
これらのタスクには、ツールの利用成功を必要とする、データ依存の要求が含まれる。Salesforceは、Agentforceの振る舞いを指定するための宣言型言語であるAgent Scriptを使い、エンタープライズ領域のワークフローを定義する。
これは、アプリケーション企業が活用しやすい訓練ループを生み出す。彼らのソフトウェアにはすでに、構造化されたアクション、権限、業務ルール、タスク完了のシグナルが含まれている。
汎用モデル開発者も、提携、顧客プロンプト、ツールの文書を通じて、その構造の一部を学べる。だがアプリケーション所有者は、環境の詳細な地図を最初から持っている。
この圧力はSalesforceにとどまらない。ServiceNowはITおよび従業員ワークフローを中心にモデルを特化できる。SAPは財務、調達、サプライチェーンに焦点を当てられる。Workdayは人事プロセスを中心に訓練できる。
各社は、最先端規模の事前学習プロジェクトに資金を投じる代わりに、適応可能な基盤を利用できる。Nvidiaにとっても、これらの企業が依然としてモデル、訓練ソフトウェア、アクセラレータ、推論インフラを必要とするため、利益となる。
この競争モデルは、経済的な問いを変える。エンタープライズソフトウェア企業はもはや、最先端ラボ全体を再現できるかを問う必要がない。
自社製品内で価値あるタスクを、より小さな専門モデルが実行できるかを問えばよい。これははるかに達成可能な目標だ。
Salesforceは顧客関係も保有している。KoaをAgentforceとパッケージ化し、既存のガバナンス制御を適用し、管理者がすでに理解しているツールを通じてモデルを提供できる。
AIラボは、その体験の下にある代替可能な供給者になるリスクを抱える。顧客は、どの基盤モデルが結果に寄与したかを知らないまま、Agentforceがタスクを完了したと認識するかもしれない。
これこそAIラボが恐れるべき部分だ。技術の重要性が保たれていても、ブランド、価格決定力、エンタープライズユーザーとの直接的なつながりは弱まる可能性がある。
オープンウェイトが価値を基盤モデルの上位へ移す
Koaは、オープンウェイトモデルが競争上の価値を事前学習から、専門化、導入、ワークフローフィードバックへ移し得ることを示している。
Nvidiaは、モデル、訓練リソース、リファレンス実装をNemotron model hubを通じて公開している。このアプローチは、他社がゼロから始めるのではなく、有能な基盤モデルを変更することを促す。
SalesforceはNemotron 3 Superを原材料として使用した。その後、ドメイン固有のデータ生成、教師あり訓練、NvidiaのNeMoツールを使った強化学習を適用した。
このプロセスは分業を表す。Nvidiaはモデルアーキテクチャ、訓練スタック、コンピューティングプラットフォームを提供する。Salesforceはワークフロー仕様、エンタープライズ文脈、流通、製品の境界を提供する。
クローズドモデルの提供者は通常、プロンプト、検索、ファインチューニング、またはマネージド訓練サービスを通じてカスタマイズを提供する。これらの選択肢は、特に基盤モデルに大きな能力上の優位性がある場合、十分に機能し得る。
一方で、重要な判断は提供者側に残る。モデル更新、推論の実行場所、運用ポリシー、ウェイトの可視性は、アプリケーション企業の管理外にとどまる場合がある。
KoaはSalesforceにウェイトへの直接的な制御を与える。Salesforceによると、追加学習と推論はいずれも、顧客情報がSalesforceのセキュリティ制御下に置かれる同社の信頼境界内で行われる。
この構成は規制対象の購入者に訴求する。また、第三者ラボの製品ロードマップを待たずに、Salesforceがモデルを変更する助けにもなる。
制御が自動的に低コストや高性能を意味するわけではない。Salesforceは、多様な顧客環境にわたってそのいずれかを結論付けるのに十分な本番環境の証拠を公開していない。
それでも制御は戦略的な選択肢を生む。Salesforceは、幅広い学術評価では重要でなく見える場合でも、Agentforce内で価値を生むタスクを優先できる。
Koa論文は、専門化による最も明確な改善が、マルチターンのツール利用で生まれたと報告している。これはまさに、エンタープライズエージェントがしばしば苦戦する領域だ。
単一のツール呼び出しは比較的評価しやすい。より長いワークフローでは、モデルが状態を維持し、ツール結果に反応し、権限を尊重し、予期しない状況から回復することが求められる。
こうした能力は、数学テストでの数パーセントの向上よりも、サービスマネージャーにとって重要だ。また、ビジネスプロセスに関するSalesforceの既存知識にも適合する。
モデルの合成訓練設計は、別の重要な仕組みも加える。顧客レコードは価値が高い一方で、機密性があり、一貫性に欠け、組織横断で統合することが難しい。
合成シナリオにより、Salesforceは実際の顧客データを共有訓練コーパスにコピーせずに、エンタープライズ業務の構造を再現できる。また、まれな障害やエッジケースも必要に応じて生成できる。
ただし、合成データには固有の弱点もある。シミュレーションは設計者の前提を反映する。整然としたテスト環境では機能するが、複雑な組織では失敗する振る舞いに報酬を与える可能性がある。
実際のCRMシステムには、不完全なレコード、矛盾するポリシー、カスタムオブジェクト、古いオートメーション、特殊な権限構造が含まれる。本番パイロットでは、安全性を損なうことなくKoaをその複雑さにさらさなければならない。
このため、Salesforce Koa推論モデルは、確実な勝利ではなく仕組みを示すものだ。オープンウェイトは専門化を可能にする。Salesforceのワークフロー上の立場は、その専門化に説得力を与える。
最終的に、同じツールに接続された最先端モデルよりも統合システムが優れているかどうかは、実際の顧客成果が決める。
ベンチマークの主張には、より厳しい検証が必要だ
Salesforceが報告した結果は有望だが、企業自身が設計したCRMベンチマークだけでは、フロンティアモデルとの比較に決着を付けられない。
Salesforceによれば、KoaはCRMアクションにおいて主要モデルと同等以上の性能を示しながら、エラーを3分の1に抑えたという。評価対象には、商談情報の更新、ケースの振り分け、フォローアップの予定設定が含まれる。
同社はこの主張を、知能の普遍的な尺度として提示してはいない。Koaの想定領域に合わせたベンチマーク内で選定されたCRMアクションに関する結果だ。
付随する論文には重要な留保もある。KoaはNemotronベースモデルを上回り、有力な独自ベースラインも超えたとされるが、総合的には最強のフロンティアモデルには及ばない。
この結果は、より限定的な解釈を支持する。特化によって、オープンウェイトモデルは対象を絞ったエージェントタスクで競争力を持てるが、最上位のクローズドモデルが持つ幅広い能力上の優位性まで消えるわけではない。
購入者は、アクションの正確性と完全な業務価値も区別すべきだ。エージェントが正しいツールを呼び出しても、顧客の意図を誤解したり、不適切なポリシーを適用したり、不要なエスカレーションを発生させたりする可能性がある。
エラー件数には文脈が必要だ。フィールド更新の誤り、無許可の情報開示、質の低いメール下書きは、同じ事業リスクを伴うものではない。
独立した評価者には、タスク定義、比較モデル、採点ルール、実行トレースへのアクセスが必要になる。そうでなければ、外部の人間は報告された優位性がどこから来ているのかを判断できない。
このベンチマークは、Salesforce固有のスキーマへの習熟を有利に評価している可能性がある。Salesforce製品にとっては正当な評価となり得るが、他の業務アプリケーション全般での優位性を証明するものではない。
本番環境はさらに別の難しさを加える。Salesforce自身も、インフラや利用パターンが異なるため、sandbox performanceは本番環境での挙動を確実には予測しないと警告している。
同じ原則はエージェントにも当てはまる。制御されたタスクでは、変化するデータ、同時利用ユーザー、カスタム統合、レイテンシー制約、曖昧な依頼を完全には再現できない。
したがって、Koaの顧客パイロットではベンチマーク完了以上のものを測定すべきだ。有用な指標には、解決の成功率、人間による介入率、取り消されたアクション、ポリシー違反、顧客満足度が含まれる。
これらの測定には明確なベースラインが必要だ。Koaを自動化なしの状態と比較すれば、一つの問いには答えられる。フロンティアモデルを使うAgentforceシステムと比較すれば、より難しい問いに答えることになる。
Salesforceは、顧客がこの特化モデルを統制できることも証明しなければならない。管理者には、エージェントが何を試みたのか、どのツールを使ったのか、なぜアクションが失敗したのかを可視化する機能が必要だ。
影響の大きいプロセスでは、人間によるレビューが引き続き重要となる。与信判断、医療コミュニケーション、契約上の約束、アカウント変更には、平均的なベンチマーク精度以上のものが求められる。
セキュリティも未解決の問題を生む。Salesforceのトラスト境界内で推論を実行すれば、外部モデルAPIへの露出は減るが、プロンプトインジェクションや過剰な権限をなくすことはできない。
攻撃者は、エージェントが読むコンテンツ内に悪意ある指示を埋め込む可能性がある。広範なアクセス権を持つ信頼済みモデルであっても、入力が操作されれば有害なアクションを取る可能性がある。
顧客はツールを制限し、出力を検証し、承認ゲートを維持しなければならない。モデルの所有権はアプリケーションセキュリティの代わりにはならない。
市場に関する問いもある。一部の企業は、多くの部門で単一のフロンティアプロバイダーを選好する。特化モデルの集合は、ガバナンスと統合作業を増やしかねない。
フロンティアラボは、自社モデルを特化、ホスティング、評価しやすくすることで対応できる。エンタープライズソフトウェアベンダーとの連携をより深めることも可能だ。
最も強力な汎用モデルは、難しい例外処理のために依然として必要かもしれない。Salesforceは定型的なCRM業務にKoaを使い、異例のケースをより大きな外部モデルへ回すことができる。
このハイブリッドアプローチは、単一の勝者という考えを弱める。それでも、エンタープライズ推論のうち自動的にフロンティアプロバイダーへ流れる割合を減らすことになる。
KoaはAgentforceの当初のモデル戦略に挑む
Salesforceは、モデルの選択からモデルの所有へと移行し、アプリケーション層がかつて外部AIプロバイダーに依存していた構図を覆そうとしている。
Salesforceが2023年にAI Cloudを導入した際、複数プロバイダーのモデルへのアクセスを強調していた。顧客はパートナーモデルを利用でき、Salesforceはデータグラウンディング、ガバナンス、業務アプリケーションを提供していた。
Agentforceは2024年、Atlas推論エンジンとともに登場した。Atlasはモデル、データ、ワークフロー、ツールを連携させ、エージェントが次に何をすべきかを判断できるようにする。
Koaはこのアーキテクチャのすべてを置き換えるものではない。言語モデルと推論エンジンは異なる役割を担う。エンジンはより広いプロセスを管理し、モデルはタスクを解釈してアクションを選択する。
しかし、KoaはSalesforceを知能レイヤーのさらに深い位置へ進める。同社はもはやモデルを選択し、オーケストレーションするだけではない。現在では、特化モデルのウェイト、トレーニング、ホスティング、展開を管理している。
これが戦略上の反転だ。エンタープライズソフトウェアベンダーはかつて、高度な推論で少数のフロンティアラボに依存しているように見えた。オープンウェイトによって、これらのベンダーはより多くのモデル能力を自社製品に取り込めるようになった。
Salesforceが蓄積してきたワークフロー知識は、この構造の下でより価値を増す。Marc Benioffは、Koaが商談、サービスケース、業界プロセスに関する知識をモデルそのものに組み込むと主張している。
この主張を、顧客履歴がウェイトに埋め込まれているという意味に文字どおり解釈すべきではない。Salesforceによれば、Koaは顧客データではなく、公開データと合成トレーニングデータを利用した。
価値ある資産は、業務がどのように進むかについての抽象化だ。Salesforceは、一般的なCRM状況にまたがる役割、オブジェクト、ツールの連続手順、例外、完了条件を記述できる。
その記述は、Agentforce内でより効果的に振る舞うようモデルを訓練できる。また、Salesforceがアプリケーションを変更するたびに更新することもできる。
配布によって、この循環は完成する。同社はパイロットの性能を観察し、繰り返し発生する失敗タイプを特定し、関連シナリオを生成して、次のポストトレーニングサイクルを実行できる。
プライバシールールは、Salesforceが収集・再利用できる情報を制限する。それでも、集約された運用パターンは評価設計や製品改善に役立てられる可能性がある。
フロンティアラボも、数百万人のユーザーにまたがる独自のフィードバック上の利点を持つ。ただし、その活動の多くは会話、コーディングセッション、一般的な依頼で構成される。
Salesforceは、事業成果に結び付いたより狭いシグナルに注力できる。ケースは正しいチームに届いたか。レコードは更新されたか。人間がアクションを取り消したか。
これらのシグナルは、成功の定義をより容易にするため、強化学習にとって非常に有用だ。
KoaはSalesforceの交渉上の立場も変える。同社は外部モデルの提供を続けながら、選択されたワークロード向けの社内代替手段を維持できる。
この柔軟性により、特定のラボへの依存を減らせる。また、自社の本拠地に最適化されたモデルを基準にプロバイダーを比較できるようにもなる。
AIラボにとって、この教訓はCRMを超える。最も手強いエンタープライズ競合はフロンティアモデルを構築しないかもしれない。オープンモデルを適応させ、推論呼び出しの周辺にあるすべてを所有するかもしれない。
Koaが本番環境へ移行する際に注目すべきこと
KoaがエンタープライズAIにおける持続的な変化なのか、それとも適切に位置付けられた製品発表なのかを示すシグナルは3つある。
最初のシグナルは顧客パイロットからの証拠だ。Salesforceは、会計、金融、医療、旅行、ソフトウェア、スポーツにまたがる組織を挙げている。
重要なのは、何社がパイロットに参加するかではない。測定可能なエラー削減と人間による処理の減少を伴い、Koaを再現可能な本番ワークフローへ移行させるかどうかだ。
タスク量、介入率、評価方法、展開境界を開示する詳細な事例研究に注目すべきだ。生産性に関する曖昧な主張では、モデルの優位性を検証できない。
強い本番結果は、Salesforceの中心的な主張を補強する。ドメイントレーニングによって、より広範なモデルを価値の高い業務で上回るのに十分な能力差を埋められることを示すからだ。
頻繁な取り消しや限定的な展開は、その主張を弱める。それらは、ベンチマークが運用上の複雑性よりも、制御されたCRMアクションをうまく捉えていたことを示唆するだろう。
2つ目のシグナルは、2026年冬に予定されている米国でのリリースだ。一般提供は、より幅広いSalesforce環境における信頼性、容量、管理、統合を試すことになる。
顧客が求めるのは固定されたモデル挙動ではなく、設定コントロールだ。また、監視、監査証跡、承認、失敗したアクションへの明確な手順も必要になる。
このリリースは、Salesforceが外部モデルと並んでKoaをどう位置付けるかを明らかにする。Agentforce内でのデフォルトの役割は、自信を示し、意味のある配布を生むことになる。
少数のワークフロー向けに留保されたオプションモデルであれば、より慎重な戦略を示すだろう。それでも有用ではあり得るが、フロンティアプロバイダーへの圧力はより小さくなる。
3つ目のシグナルは競争上の反応だ。OpenAI、Anthropic、Google、Microsoft、ServiceNow、SAP、その他のベンダーにはいずれも、エンタープライズエージェントスタックでの地位を守る理由がある。
フロンティアラボは、より強力なツール利用評価を公表したり、プライベート展開の選択肢を改善したり、より深いポストトレーニングを提供したりできる。アプリケーションベンダーは、オープンな基盤から独自のドメインモデルを構築できる。
Salesforceによる以前のAgentforce展開は、すでにエンタープライズエージェントを競争の激しい市場へ投入していた。ServiceNowのような競合や専門的なカスタマーサービス企業は、同じ購入者の多くを狙っている。
戦略上の問いは、Koaが持続的な優位性を生むのか、それとも他社がすぐに再現するパターンになるのかだ。Nvidiaには、多くのソフトウェアベンダーが同じ道をたどることを支援する動機がある。
この可能性はSalesforceにとって両刃の剣だ。Koaはオープンモデルインフラの恩恵を受けるが、同じインフラが競合他社の障壁も下げる。
政府向け展開は、もう一つの試金石となる。Salesforceは、制御されたプライベートクラウドとエアギャップネットワーク向けに、ポストトレーニング済みのNvidiaモデルをMissionforceへ導入する計画だ。
一部の顧客は、2026年10月にそれらのモデルを受け取る見込みだ。そこでの成功は、規制環境においてモデルの制御が重要だという主張を支えるだろう。
より広い結論は、SalesforceがすべてのAIラボを打ち負かすかどうかには依存しない。Koaが証明すべきなのは、エンタープライズ価値が基盤モデルの上位に集中し得ることだけだ。
開発者とエンタープライズ購入者にとって、次のステップは実践的だ。実際のワークフローでモデルを比較し、失敗したツール呼び出しを記録し、すべての人間による修正を追跡する。
チームは、検索可能なAI knowledge baseを使って、展開全体にわたる評価、意思決定、運用ルールを保存できる。
どのモデルが最高スコアを出すかだけを問うべきではない。誰がワークフローを管理し、誰が成功を定義し、データがどこを移動し、失敗がどれだけ速く改善されるのかを問うべきだ。
Salesforce Koa reasoning modelが信頼できる本番結果を示せば、汎用AIラボは引き続き不可欠な技術を提供することになる。ただし、エンタープライズの成果に占める所有分は小さくなる。



