Salesforce Koa推論モデル、CRM業務で最先端AIに挑む
Salesforceは9月15日、Salesforce Koa推論モデルを発表し、主要な汎用モデルと比べてCRMアクションのエラーを3分の1に削減したと主張した。Nvidiaと共同開発されたKoaは、Salesforceがこれまで外部の最先端モデルに委ねてきた、販売、サービス、コマースにまたがる複数ステップのワークフローを対象としている。
この変化は、単なるベンチマーク上の勝利以上の意味を持つ。KoaによってSalesforceは、長年蓄積してきたCRMプロセスの知識を、自社で管理、ホスト、適応できるモデルへと変換し、自社の信頼境界内に収める。
当面の圧力は、OpenAIやAnthropicなどの最先端AIプロバイダーにかかる。これらのモデルは複数の幅広いテストで依然として優位だが、Salesforceは、あらゆる価値の高いエンタープライズ業務を幅広い知能で処理しなければならないという前提を受け入れなくなった。
Koaが投げかけるのは、より限定的な問いだ。特化型モデルは、より大規模な汎用モデルよりも、反復的な業務プロセスを高い信頼性、プライバシー、効率性で実行できるのか。
Salesforceはまだこの問いに完全には答えていない。結果は同社主導の評価に基づくものであり、Koaは2026年冬に予定される米国での提供開始に先立ち、選定されたパイロットに限定されている。
それでも今回の発表は、すべての推論タスクを最先端プロバイダーから借り受けることに代わる、信頼できる選択肢を示した。またエンタープライズの購買担当者にとって、ドメイン特化が汎用ベンチマークでの首位以上に重要になり得るかを検証する具体的な機会にもなる。
Salesforce Koa推論モデル、Agentforceへ展開
KoaによりSalesforceは、最先端推論の顧客から、特化型推論レイヤーの所有者へと変わる。
SalesforceとNvidiaは、Nvidiaの1,200億パラメータのオープンウェイト基盤モデルであるNemotron 3 SuperをポストトレーニングしてKoaを開発した。オープンウェイトとは、開発者がモデルのパラメータを調査・変更できることを意味するが、すべての構成要素が自動的にオープンソースになるわけではない。
このモデルは、企業データや業務ツールを利用するエージェントを作成するSalesforceのプラットフォーム、Agentforce内で稼働する。こうしたエージェントは、リードの選別、商談情報の更新、ケースの振り分け、フォローアップの設定、サービスリクエストの解決を行える。
Koa以前、Salesforceは複雑な複数ステップのタスクを支える中核的な推論を、汎用の最先端モデルに依存していた。Salesforceの小型モデルはすでに、分類、評価、有害性スクリーニング、検索の再ランキングといった、より限定的な業務を担っていた。
Koaは、より難しい中間層を担う。要求を解釈し、適切なツールを選択し、複数ターンにわたって状態を維持し、依頼された作業が実際に完了したかを判断しなければならない。
Salesforceはこれを、汎用知能ではなくCRM推論と説明する。この区別はKoaの対象範囲を限定する一方で、モデルにとって成功の定義をより明確にする。
返金について問い合わせる顧客に必要なのは、返金ポリシーの洗練された説明ではない。アカウントを確認し、正しいポリシーを適用し、認可されたツールを呼び出し、結果を記録するエージェントである。
Salesforceによれば、Koaは27年にわたるCRM経験を基にした合成シナリオから、こうしたプロセスを学習した。同社のKoa発表によると、これらのシナリオは14以上の業界をカバーしている。
トレーニングセットには、製造、金融サービス、医療、旅行分野のシミュレートされたワークフローが含まれる。各シナリオは、ペルソナ、タスク、必要なアクション、有効な結果に到達するために必要なツール呼び出しを組み合わせている。
Salesforceは、このトレーニングコーパスの作成に顧客データを一切使用していないとしている。KoaはSalesforceが管理するインフラ内でも稼働し、顧客データと推論トレースは同社の信頼境界内にとどまる。
このアーキテクチャは提案の中核にある。Salesforceは、混み合った選択肢の中で単に別のモデルを提供しているわけではない。ウェイト、推論環境、ワークフロー知識、運用データの経路を管理することを提供している。
Koaはすでに、Slack上のSalesforce社内従業員向けエージェントを支援している。Salesforceはまた、Formula 1、UChicago Medicine、Xero、Engine、Baxter Credit Union、1-800Accountantを含むパイロット参加者を公表した。
このモデルは、選定されたAgentforceのパイロット顧客に提供されている。Salesforceは2026年冬、米国リージョンでの一般提供開始を見込んでいる。
これらのパイロットには今、通常とは異なる重みがある。統制されたCRM評価での性能が、不整合なデータ、変化するポリシー、複雑な承認ルールを持つ実際の組織へ移転するかを示さなければならない。
特化型CRM AIが最先端モデルに与える圧力
Koaは、最も高性能な汎用モデルが自動的にエンタープライズ業務に最適なモデルになるという前提に異議を唱える。
最先端モデルは、コーディング、執筆、数学、調査、分析、自由形式の対話まで幅広く実行できるよう設計されている。この幅広さにより、企業はワークフローごとに別のモデルを訓練せずとも、多様なタスクに対応できる。
一方で、反復的な運用業務にはミスマッチも生じる。営業プロセスに必要なのは、無制限の創造性であることはほとんどない。すべてのリードに同じ適格性ポリシーを一貫して適用することだ。
Salesforceは、汎用モデルが各リクエストに第一原理から取り組むと主張する。指示とコンテキストを受け取り、必要な手順を推論し、やり取りのたびに解決策を再構築する。
特化型モデルは、ポストトレーニング中にその手順のより多くを内部化できる。組織固有の指示は依然として受け取るが、ワークフロー、ツール、有効な結果について、より強い期待値を持った状態から始められる。
SalesforceのAI担当エグゼクティブ・バイスプレジデントであるJayesh Govindarajanは、この依存関係を明確に要約した。同氏はTechCrunchに対し、Salesforceは推論について「これまで」最先端プロバイダーに依存してきたと語った。
この発言はKoaの本当の相手を示している。それはOpenAIやAnthropicの個別モデルではない。困難なエンタープライズ推論業務をすべて、クローズドな汎用システムへ送るという既定の慣行である。
Salesforce Koa推論モデルは、Agentforce全体でこれらのシステムを置き換えるものではない。Salesforceによれば、同社のオーケストレーションレイヤーは引き続き、特化型モデルと最先端モデルに異なるタスクを割り当てられる。
このルーティングのアプローチは、モデルを完全なプラットフォームではなくコンポーネントとして扱う。分類は小型の分類器に、CRM推論はKoaに、例外的な汎用タスクは引き続き最先端モデルに送ることができる。
こうしたルーティングはサプライヤーとの関係も変える。Salesforceは、モデルアクセス、導入条件、レイテンシー、ガバナンス、将来の統合について交渉する際の代替手段を得る。
エンタープライズソフトウェアプロバイダーには、別の動機もある。彼らは、汎用モデル開発者が所有していない、長年にわたるプロセス設計、スキーマ、実装パターン、ドメイン固有の用語を保有している。
Koaは、その知識の一部をSalesforceのAIレイヤーに組み込む。これはSalesforceプラットフォームの価値を深める一方で、外部モデルプロバイダーが提供できる差別化を縮小する可能性がある。
この戦略はCRMを超えて広がる。Constellation Researchは、エンタープライズソフトウェアベンダーが特化型ワークロード向けにNemotronモデルを適応させ、AIコストを管理する動きを強めていると指摘した。
Palantirは、カスタマイズされたモデルと統制されたエンタープライズ導入で関連する方向性を追求している。オープンウェイトの基盤モデルが競争力を維持するなら、他のアプリケーションベンダーも同様の選択を行える。
これは、すべてのソフトウェア企業が推論モデルを訓練すべきだという意味ではない。この取り組みには、高品質なタスクシミュレーション、評価環境、インフラ、そして特化を正当化できるだけの反復的なワークフローが必要になる。
Salesforceは、こうした要素を異例の規模で備えている。同社には数十年に及ぶCRM製品開発の歴史があり、エージェントがすでに構造化されたレコードや定義済みのアクションとやり取りするプラットフォームを持つ。
最先端ラボには依然として大きな優位性がある。研究コストを多数の顧客に分散でき、頻繁な改善をリリースでき、1社のベンダーの業務ドメイン外にあるタスクも支援できる。
したがってKoaは、依存関係を解消することなく圧力を生む。最先端プロバイダーに対し、幅広い外部モデルがなぜ各エンタープライズワークロードに値するのかを証明するよう迫る。これまでのように、デフォルトでそのワークロードを受け取るのではなく。
Nvidia NemotronはいかにしてCRMスペシャリストになったか
Koaを特徴づける仕組みは、より大規模なCRM文書コレクションに単純に触れさせることではなく、シミュレートされたワークフロー内での強化学習にある。
Salesforceは、基盤モデルをゼロから訓練するのではなく、Nvidia Nemotron 3 Superを出発点とした。ベースモデルは、Salesforceが適応できるアクセス可能なウェイトと汎用的な推論能力を提供した。
ポストトレーニングは、広範な基盤学習の後に既存モデルを変更することを指す。元の基盤モデルを構築するための膨大なプロセスを繰り返すことなく、特定タスク向けに挙動を洗練できる。
Salesforceは当初、成功した作業の例を模倣するようモデルに教える教師ありファインチューニングを試みた。これは、完了済みのケースを従業員に見せ、同じパターンを再現するよう求めることに似ている。
同社によれば、このアプローチによる複数ステップのツール利用への改善は限定的だった。成功したトランスクリプトを読むだけでは、モデルにミスからの回復や実際のタスク完了の検証を十分に教えられなかった。
そこでSalesforceとNvidiaは、強化学習を重視した。このプロセスでは、モデルがタスクを試行し、結果に基づくスコアを受け取り、より高い報酬を得る戦略に向けて挙動を調整する。
トレーニングには、Group Relative Policy Optimization、すなわちGRPOが使用された。この強化学習手法は、同じタスクに対する複数の応答を比較し、相対的に優れた結果に結び付く挙動を強化する。
Salesforceは、異なる目標や感情状態を持つペルソナを生成した。また、先行するアクションの結果を保持しながら、シミュレートされた業務レコードを読み取りまたは変更できるツールも構築した。
その後、判定器がワークフローが実際に意図した結果に到達したかを評価した。この結果に根ざした報酬は重要である。なぜなら、エージェントは約束したアクションを実行せずとも、もっともらしいメッセージを生成できるからだ。
チームは、正しいツールが利用できない状況もテストした。ガバナンスが不十分なエージェントは、似たツールを呼び出したり、誤ったレコードを変更したり、サポートされていないアクションが成功したと主張したりする可能性がある。
Koaは、こうした境界を認識するよう訓練された。この挙動は、不正なツール利用が運用上またはコンプライアンス上の問題を引き起こし得るシステムでは不可欠である。
技術論文では、SalesforceのAgent Script仕様に基づくシミュレーションから報酬までのパイプラインが説明されている。Agent Scriptは、Agentforceのルーティング、アクション、ツール、ワークフロー指示を定義する宣言型言語である。
このシステムは、これらの仕様を実行可能なワークフローグラフへ変換する。これらのグラフは、利用可能なツール、引数形式、ルーティング条件、状態変化、タスク終了のルールを記述する。
トレーニング環境は、これらのグラフを中心にペルソナベースの会話を生成できる。同じワークフロー定義が、エージェントの構成、トレーニングタスクの生成、モデルがそれらを完了したかの判定に役立つ。
このつながりは、モデルのCRM語彙よりも重要である。Koaは、ワークフローがどのように状態を変えるか、いつツールが適切になるか、どの結果が解決済みと見なされるかを学ぶ。
リードの適格性評価を考えてみよう。有効なプロセスでは、企業規模、アカウント履歴、担当テリトリー、顧客の意図、組織のルーティング基準を確認する必要がある。
汎用モデルは、これらの要件をプロンプトから読み取れる。Koaの優位性は、このプロセスが複数のツール、不足情報、修正、反復的なやり取りにまたがる場合に現れるはずだ。
この仕組みにより、Koaの知識は検索とは異なるものになります。検索は関連ドキュメントをモデルのコンテキストに取り込む一方、ポストトレーニングはモデルが学習した振る舞いそのものを変えます。
両方のアプローチは引き続き必要です。KoaはCRM業務の一般的な構造を学習できますが、最新のアカウント詳細、社内ポリシー、権限、顧客記録は依然として必要です。
ナレッジワーカーにとって、この違いは適切に整理されたソース資料の価値を改めて示します。パーソナルナレッジベースは最新の事実を提供する助けとなり、専門モデルはそれらにどう対応するかを判断します。
Salesforceは他のモデルにも役割を残しています。同社の技術的説明によれば、Koaは単一の万能エンジンになるのではなく、HyperClassifier、TextEval、Moiraiといった専門システムに加わります。
このポートフォリオ型のアプローチは、実用的なエンタープライズアーキテクチャを提示します。幅広いタスクには汎用モデルを、予測可能な機能には小型モデルを、反復的な業務推論にはドメインモデルを使用するという考え方です。
ベンチマークでの勝利は現実だが限定的
Koaは公開テストで競争力のある性能を示したものの、結果は最先端モデルに対する全面的な優位性よりも、専門化の有効性を強く裏付けています。
Salesforceによると、Koaは主要モデルと同等以上の性能を保ちながら、CRMアクションにおけるエラーを3分の1に減らします。ただし、評価ごとに測定対象となる能力が異なるため、この見出しは慎重に解釈する必要があります。
同社の論文は、KoaをNvidiaのNemotronベースモデルおよび3つのプロプライエタリモデルと比較しています。これらはOpenAI GPT-4.1、OpenAI GPT-5.5、Anthropic Claude Opus 4.8です。
KoaはTau2Benchのタスク加重平均で69.41を記録しました。このベンチマークは、航空、小売、通信の各シナリオにおける複数ステップのカスタマーサービス会話を測定します。
Nemotron 3 Superは68.64、GPT-4.1は54.48でした。Claude Opus 4.8は74.00に達し、GPT-5.5が83.99で首位となりました。
Berkeley Function Calling Leaderboardでは、Koaは66.63パーセントを記録しました。ベースとなるNemotronモデルは64.73パーセント、GPT-4.1は53.96パーセントでした。
Claude Opus 4.8は同テストで78.18パーセントを記録しました。GPT-5.5は67.63パーセントで、Koaを1ポイント上回りました。
最も有利な比較結果は、SalesforceがCRMおよびAgentforceワークフロー向けに実施した評価、CRM Benchで見られます。Koaは加重スコア0.86を達成しました。
この結果はGPT-4.1の0.81とNemotronの0.84を上回りました。Claude Opus 4.8の0.87にほぼ並び、GPT-5.5は0.90に達しました。
KoaのCRM関数呼び出し精度は0.77で、ベースモデルの0.71から向上しました。このサブカテゴリーでは、GPT-4.1が0.85、Claudeが0.83、GPT-5.5が0.82を記録しました。
これらの結果は、単純な勝利という見方よりも複雑な全体像を示しています。Koaはオープンウェイトのベースモデルを改善し、報告された総合ベンチマークでGPT-4.1を上回り、CRMでは最先端レベルの性能に近づいています。
ただし、すべてのテストで首位に立っているわけではありません。論文は、Koaが総合的には最も強力な最先端モデルをなお下回ると明記しています。
この認識は中心的な主張を強めます。Salesforceにとって必要なのは、Koaがあらゆるタスクであらゆる最先端モデルを打ち負かすことではありません。価値あるSalesforceワークフローで十分な性能を発揮することです。
最大の未解決点は、評価の独立性にあります。Salesforceの研究者がKoaを開発して結果を報告しており、CRM Benchは同社独自の業務領域に焦点を当てています。
これはデータを無効にするものではありません。ただし、購入検討者は外部テスト、パイロット結果、自社ワークフローを用いた透明性の高い比較を待つべきことを意味します。
報告された3倍のエラー削減も、普遍的に解釈するには公開情報の文脈が不足しています。エラー率は、選択されたベースライン、タスクセット、採点ルール、エラーの定義に左右されます。
本番システムでは、さらに複雑な問題が生じます。記録には欠落があり、カスタムフィールドは競合し、統合は失敗し、ポリシーは変化し、ユーザーはトレーニングシナリオで想定されなかった要求を行います。
合成データはプライバシーと制御をもたらしますが、設計者の前提を再現する可能性があります。シミュレーションは、実際の従業員が当然と見なす組織上の慣行を見落とすかもしれません。
Salesforceによると、シナリオには異なる業界、人格、利用できないツールが含まれます。この多様性は有用ですが、14を超える業界にはなお何千もの専門プロセスと規制上の差異が存在します。
モデルの1,200億パラメータの基盤は、インフラ面にも影響を及ぼします。Salesforceは、レイテンシー、提供効率、ワークロード単位のコスト比較に関する完全な本番情報を公開していません。
より慎重な結論は明確です。Koaは、ワークフローに基づく強化学習が、オープンウェイトモデルを競争力のあるCRM推論モデルに変えられるという信頼できる証拠を示しています。
実際の顧客導入全体で最先端システムを上回るという、より広範な主張は、一般提供前の段階では未証明です。
制御とプライバシーも競争の一部
Koaは、生の推論スコアだけでなく、導入における制御性でも競争しています。
SalesforceはKoaのウェイトを管理し、自社が運用するインフラ内で推論を実行します。同社によると、モデルがAgentforceタスクを処理する際、顧客情報が信頼境界を越えることはありません。
Salesforceはまた、顧客のプロンプト、データ、推論トレースがKoaのトレーニングに使用されないとしています。エージェントが業務記録を変更できるようになると、この構成はより深刻になる懸念に対応します。
テキストを下書きするアシスタントが目にするコンテキストは限られています。一方、CRMエージェントは顧客履歴を確認し、値引きを適用し、ケースを振り分け、通話を予定し、営業案件を更新できます。
アクションが増えるほど、ガバナンスの対象範囲も広がります。購入者は、どのモデルが要求を処理したか、どのツールを呼び出したか、機密情報が承認済み環境の外に出たかを把握する必要があります。
クローズドな最先端サービスも強力なエンタープライズ向けプライバシー制御を提供できます。Koaの違いは、Salesforceがその制御を支えるモデルおよび提供スタックのより大きな部分を所有している点です。
この所有形態は、より厳格な導入要件を支え得ます。SalesforceとNvidiaはまた、政府機関や規制対象組織を対象とするMissionforceへ、Nemotronベースのシステムを拡張しています。
両社は、プライベートクラウド、機密環境、エアギャップネットワークへの対応を説明しています。エアギャップネットワークは、公共インフラから物理的または論理的に隔離されたままです。
Missionforce Operationsは、すでに米国の地域で一般提供されています。ポストトレーニング済みのNvidiaモデルは、2026年10月に一部のMissionforce顧客へ提供される見込みです。
この提携の側面は、重要性を広げています。Koaは、ソフトウェアベンダーがデータ、導入、モデルの振る舞いを制御しながら、オープンウェイトの基盤モデルを適応できることを示しています。
また、Nvidiaにアクセラレータ販売を超えた戦略的役割を与えます。Nemotronは、エンタープライズプラットフォームがブランド化されたドメイン特化型インテリジェンスへと転換できる基盤になります。
Nvidiaにとって、専門化の成功は一つひとつ、同社のトレーニングソフトウェア、推論スタック、モデル、コンピューティングインフラに対する需要を増やし得ます。Salesforceが顧客向けモデルを所有していても、同社は利益を得られます。
Salesforceにとって、この構成は単一のクローズドプロバイダーへの依存を減らします。また、モデル選択をランキング競争ではなく、ガバナンス上の判断として提示できます。
ただし、プライベート推論ですべてのリスクがなくなるわけではありません。周辺のエージェントは依然として、権限、検索品質、アプリケーションロジック、適切なツール設定に依存します。
モデルは信頼境界内に留まりながらも、誤った判断を下す可能性があります。ポリシーを誤解したり、承認済みであっても不適切なアクションを選んだり、不完全な記録に依存したりすることがあります。
ウェイトの制御は、より大きな責任もSalesforceに移します。同社は更新を評価し、モデルを安定して運用し、弱点を修正し、振る舞いが安定していることを示さなければなりません。
したがって、最も意義ある顧客テストでは、会話品質だけでなく、完了した業務を測定すべきです。有用な指標には、未承認のアクション、復旧失敗、人によるエスカレーション、修正された記録が含まれます。
企業はまた、同一の権限とツール定義のもとでKoaを最先端モデルと比較すべきです。そうでなければ、統合品質の差がモデル知能の差に見えてしまう可能性があります。
Koaのプライバシーアーキテクチャは、一部の購入者にとって大きな利点であり続けます。しかし、最も強い証拠は、制御によって測定可能なほど安全または一貫した成果が得られることを示す、監査済みの導入から得られるでしょう。
Koaの広範なリリース前に注目すべきこと
KoaがエンタープライズAI戦略のモデルとなるか、有望なSalesforceの実験にとどまるかは、3つのシグナルによって決まります。
第1のシグナルは、ベンチマークの主張に対する独立した検証です。研究者と顧客は、公開テストおよび現実的なCRM実装においてKoaの改善を再現する必要があります。
技術論文はすでに、手法と限界について有用な詳細を提供しています。Koaが報告された総合結果でGPT-4.1を上回る一方、より強力な最先端システムには及ばないことも確認しています。
独立テストでは、精度以上の要素を調べるべきです。ツール選択の失敗、誤った確認、利用不可能なアクション後の復旧、レイテンシー、反復実行における一貫性を測定すべきです。
Koaが未知のデータやカスタムワークフローでも優位性を維持できれば、そのようなテストはSalesforceの主張を強化します。移転性能が低ければ、Salesforceが設計したシミュレーションへの過学習を示唆するでしょう。
第2のシグナルは、名前が挙がっている顧客パイロットからの証拠です。Formula 1、UChicago Medicine、Xero、Engine、Baxter Credit Union、1-800Accountantは、非常に異なる環境で事業を行っています。
その結果は、Koaがヘルスケア、金融、旅行、会計、顧客エンゲージメントをまたいで一般化できるかを明らかにし得ます。具体的な証拠には、完了したワークフローと人による介入率を含めるべきです。
Salesforceのトレーニングに関する説明によると、初期パイロットはサービス、営業、コマースにまたがっています。ただし、本番規模の成果データはまだ示されていません。
パイロットが成功すれば、シミュレーション優先のアプローチが裏付けられます。例外の反復発生や大規模な人手レビューは、モデル化されたワークフローと実際の組織との隔たりを明らかにするでしょう。
第3のシグナルは、最先端AIプロバイダーおよびエンタープライズソフトウェアの競合企業がどう反応するかです。OpenAIとAnthropicは、ツール利用、プライバシーオプション、カスタマイズ、導入の柔軟性を改善できます。
他のアプリケーションベンダーも、オープンウェイトの基盤モデルを適応できます。Constellation Researchは、これをSalesforceだけの展開ではなく、エンタープライズ特化モデルへのより広い動きとして位置づけています。
ベンダー所有の推論モデルが相次げば、Koaの戦略的重要性は強まります。エンタープライズプラットフォームが、ドメイン推論を知的財産として捉える傾向を強めていることを示すためです。
反応が限定的であれば、最先端APIが経済面でも技術面でも魅力を保っていることを示唆します。多くのベンダーは、モデルのトレーニングと運用が自社のアプリケーションレイヤーから注意をそらすと判断するかもしれません。
Salesforceは、発表済みの2026年冬の提供開始時期にも到達しなければなりません。リリースが遅れたり制限されたりすれば、Koaが重要な最先端ワークロードを置き換える準備が整っているという主張は弱まります。
一般提供では、モデルアクセス、ルーティング制御、対応するAgentforceワークフロー、地域カバレッジ、評価ツールを明確にすべきです。購入者には、Koaを代替モデルと比較する手段も必要になります。
実践的な教訓は、専門モデルがすでに勝利したということではありません。Koaは、企業が基盤モデルを構築することと、すべての判断を外部から借りることの間に、信頼できる選択肢が存在することを示しています。
その道を検討するチームは、反復可能で高価値なワークフローから始めるべきです。そして、成功した成果、許可されたツール、エスカレーションルール、あらゆるアクション前に必要な証拠を文書化すべきです。
構造化されたAI workflowは、エージェントに業務を委任する前に、そうした運用上の文脈を保持する助けとなる。
Salesforceの推論モデルKoaは、より少ないミス、より厳格な制御、そして許容可能な運用負荷でこれらのワークフローを完遂できれば、その地位を獲得するだろう。
顧客による裏付けが得られるまでは、Koaはフロンティアモデルへの依存に対する本格的な技術的挑戦として扱うべきであり、汎用モデルがエンタープライズAIでの地位を失った証拠とみなすべきではない。



