Salesforce Koa CRMモデル、汎用AIが標準とされる潮流に挑む
Salesforceは、Agentforce向けに特化して構築した初の推論モデルとして、Salesforce Koa CRMモデルを発表した。これにより、汎用フロンティアモデルに対する直接的な代替案を提示する。NVIDIAと共同で2026年9月15日に発表されたKoaは、営業、サービス、コマースなどの顧客業務を支えるマルチステップ作業を対象としている。
重要なのは、Salesforceがカタログに新たな言語モデルを追加したことではない。Koaによって、Agentforceの中核的な知能の一部が、Salesforce自身が管理するインフラとモデル重みに組み込まれる。同社によれば、この構成は顧客データを信頼境界内に保持しながら、ツール選択、文脈的な記憶、実行の一貫性を向上させる。
これは、主流となっているエンタープライズAIのアプローチに対する挑戦でもある。多くのエージェントプラットフォームは、AnthropicやOpenAIなどの幅広い能力を持つモデルに依存し、その周囲に業務データ、指示、権限、ツールを追加している。Salesforceは、複雑なCRM業務には、単に優れたプロンプトを受け取る高性能モデルではなく、業務そのものを軸に訓練された推論が必要だと主張する。
Salesforce Koa CRMモデルで何が変わったのか
Koaは、Salesforceが運用、適応、そしてAgentforceへ直接統合できる特化型推論レイヤーを提供する。
SalesforceとNVIDIAは、サンフランシスコで開催されたDreamforceでKoaを発表した。両社の発表資料によれば、Koaは選定されたAgentforceのパイロット顧客に提供されている。Salesforceは、2026年冬に米国リージョンで一般提供を開始する見込みだ。
Koaは、1,200億パラメータを持つオープンウェイトの基盤モデル、NVIDIA Nemotron 3 Superを基にしている。オープンウェイトとは、他社のクローズドAPIを通じて接続するだけでなく、Salesforceがモデルの学習済みパラメータにアクセスし、変更できることを意味する。
SalesforceはKoaをゼロから訓練したわけではない。同社はNemotron 3 Superにポストトレーニングを施し、初期学習後の既存モデルを適応させた。この選択により、特化システムの構築に必要な時間とデータ量を削減した。
同社はこの取り組みのため、合成CRMシナリオからなる独自のコレクションを構築した。生成されたシナリオは、リードの評価、商談情報の更新、サービスケースの解決、ツールの選択、人による支援を要請すべきタイミングの判断といった活動を表現している。
Salesforceによれば、これらのシナリオには、27年にわたるCRM導入を通じて蓄積した知見が反映されている。トレーニング素材は、医療、金融サービス、製造、旅行を含む14以上の業界にまたがる。
Salesforceによると、モデルの訓練に実際の顧客記録は使用されていない。同社は代わりに、架空の顧客、事業状況、感情状態、ポリシー、期待されるアクションシーケンスを生成したとしている。
この区別は重要だ。トレーニングデータと実行時データは、それぞれ異なるリスクを生む。合成トレーニングにより、顧客記録がKoaの学習済み重みに組み込まれることを避けられる。一方、導入時には、エージェントが割り当てられたタスクを完了できるよう、顧客コンテキストが引き続きシステムに入力される。
Salesforceは、推論とポストトレーニングの両方を自社インフラ内で実施するとしている。同社はモデル重みを管理し、既存の信頼境界内で管理される選択肢としてKoaを提示している。
顧客は、テストのためにすべてのAgentforceワークフローを再構築する必要はない。Salesforceは、Data Cloudの生成モデルカタログ、組織全体のAgentforce設定、個々のエージェントまたはサブエージェントのレベルで、Koaを選択可能にする計画だ。
この設計により、モデル選択は管理上の意思決定となる。企業は、サービスワークフローにはKoaを使いながら、執筆、調査、あるいはより広範な知識を必要とする別のタスクには汎用モデルを維持できる。
Koaはすでに、従業員がSlack内で情報を探し、定型業務を完了するのを支援するSalesforceの社内従業員エージェントで稼働している。外部パイロットには、1-800Accountant、Baxter Credit Union、Engine、Formula 1、UChicago Medicine、Xeroが含まれる。
これらのパイロットは、もっともらしい回答だけでは不十分な環境を対象とする。会計エージェントは税務規則と顧客の状況に従わなければならない。医療ワークフローは、必要な手順を飛ばすことなく情報を調整する必要がある。旅行エージェントは、1件の旅程の乱れを解決するために複数のツールを必要とする場合がある。
こうした例は、今回の発表における中心的な主張を明確にしている。Salesforceは、あらゆる知的タスクにおいてKoaを最高のモデルにしようとしているのではない。AgentforceエージェントがCRMの状態を解釈し、許可された一連のアクションを実行しなければならない場面で、モデルの信頼性を高めようとしている。
なぜ今、CRM特化の推論が重要なのか
エンタープライズエージェントは、言語が正確で認可されたアクションへ変わる地点で、ますます失敗するようになっている。
チャットボットは、業務記録を変更せずに製品に関する質問へ回答できる。しかし自律型CRMエージェントには、商談情報の更新、ケースの振り分け、返金の承認、フォローアップの予定設定などを行う可能性があるため、より厳しい基準が求められる。
各アクションは、業務固有の制約に左右される。エージェントは、どの記録が重要か、ユーザーが何を変更できるか、要求に適したツールはどれか、会社ポリシーがそのアクションを許可しているかを理解しなければならない。
汎用モデルは、実行時にそれらの指示を基に推論できる。しかしSalesforceは、プロンプトとコンテキストからワークフローを繰り返し再構成することが、不要なばらつきを生むと主張する。
同社のポストトレーニングに関する解説は、モデルの専門化を従業員研修になぞらえている。有能な新入社員であっても、一貫して行動する前に、組織の基準値、エスカレーション規則、定義、手順を学ぶ必要がある。
Koaは、この考え方をモデルの振る舞いに適用する。Salesforceは、複数の会話ターンにわたって正しいツール利用を必要とする、シミュレーションされた業務でKoaを訓練した。
シミュレーションには、協力的なペルソナと不満を抱くペルソナが含まれていた。ツールはKoaの呼び出しに応答し、評価器が根本的な問題が実際に解決されたかを確認した。失敗した試行からは、追加のトレーニング信号が生成された。
Salesforceは、強化学習にGroup Relative Policy Optimization、すなわちGRPOを用いた。GRPOは同一タスクに対する複数の候補応答を比較し、定義済みの基準に基づいてより良い成果を出す振る舞いに報酬を与える。
この手法は、成功した対話記録を見せるだけではなく、モデルに実践の機会を与える。Salesforceによると、モデルに例を模倣させる教師ありファインチューニングでは、複雑なマルチステップ対話に対して限定的な改善しか得られなかった。
同社は、拒否とエスカレーションの振る舞いも訓練した。一部のシミュレーションタスクでは、必要なツールを意図的に省いていた。その場合、Koaは制約を説明し、不足情報を求める、またはタスクを人へ引き渡すことで報酬を得た。
これはエンタープライズAIにとって意味のある目標である。完了していないアクションを完了したと誤って確認するエージェントは、拒否するエージェントよりも大きな損害を与えかねない。基礎となる記録が実際には変更されていないことを顧客、従業員、監査人が発見するまで、失敗は表面化しない可能性がある。
したがって、圧力は汎用モデルの提供事業者と、あらゆるタスクをそれらに振り分けるソフトウェア企業にかかる。幅広さには引き続き価値があるが、エンタープライズの購入者は、狭い業務境界の中で予測可能に実行されることをますます求めている。
特化モデルは、Salesforceに導入面でのさらなる制御も与える。Agentforce、CRMスキーマ、ツール定義、社内評価システムと併せて、モデルの振る舞いを調整できる。
同じ戦略は、単一の外部モデル提供事業者への依存を軽減する可能性もある。Salesforceはすでにモデル選択をサポートしており、フロンティアラボとの提携も引き続き重要だ。Koaは、その重みと提供環境をSalesforceの管理下に置く選択肢を追加する。
これは、汎用モデルが不要になることを意味しない。幅広いモデルは、オープンエンドな分析、創造的な作業、多数の知識領域にまたがるタスクに引き続き適している。
有力なエンタープライズアーキテクチャは、モデルのポートフォリオになるだろう。小規模なモデルは、意図の分類、コンテンツのスクリーニング、検索結果の再ランキングを担える。特化型推論モデルは、統制されたワークフローを管理できる。フロンティアモデルは、より幅広い知能を必要とするタスクを処理できる。
Salesforceはすでに、HyperClassifier、TextEval、Moiraiなどのモデルでこの方向へ進んでいる。Koaは、このポートフォリオを推論段階へ拡張するものであり、その部分は従来、主に汎用知能モデルに依存していた。
購入者にとって重要な問いは、ルーティングになる。すべての要求を最も高性能なフロンティアモデルへ送れば、リソースを無駄にし、より多くの業務を予測不能な振る舞いにさらす可能性がある。すべての要求を特化モデルへ送れば、柔軟性が制限される可能性がある。
Koaの戦略的価値は、Agentforceが各業務に適したモデルを選べるかどうかにかかっている。その選択では、タスクの複雑さ、リスク、レイテンシー、データ境界、エージェントがアクセスできるツールを考慮しなければならない。
Koaと汎用モデルの違いはワークフローの実践にある
Koaの主な技術的な賭けは、シミュレーションされた業務プロセス内での反復的な実践が、第一原理からの推論を上回り得るという点にある。
Salesforce Koa CRMモデルは、未訓練のネットワークではなくNemotron 3 Superから始まる。そのため、NVIDIAの基盤モデルに由来する一般的な言語能力、推論能力、ツール利用能力を継承している。
次にSalesforceは、エージェント仕様をシミュレーション環境へ接続する。エージェント仕様には、ルーティング、サブエージェント、利用可能なアクション、ツール権限、ワークフロー指示が記述される。
これらの仕様は、実行可能なトレーニング状況へ変換される。ペルソナは複数ターンにわたってエージェントと対話し、ツールがデータを読み取り、または更新するたびに環境は変化する。
報酬システムは、応答が参照回答に似ているかではなく、タスクが解決されたかを評価する。複数の対話経路が有効であり得る一方、正しい業務結果につながるものは一部に限られるため、これは重要だ。
付随する技術論文では、これをシミュレーションから報酬へのパイプラインと呼んでいる。特徴は、エージェントの構成に用いられる宣言的仕様と、モデル訓練に使われるタスクを結び付ける点にある。
この仕組みにより、製品構成とモデルの振る舞いの結び付きがより強くなる。ワークフロー定義は、推論時に読み込まれる指示にとどまらない。モデルの実践環境も形成できる。
リード評価を考えてみよう。企業は、最低アカウント規模、サポート対象地域、検証済みの連絡先情報、購入意向を示す証拠を要求する場合がある。エージェントはそれらの項目を取得し、規則を適用し、結論を記録し、リードを振り分けなければならない。
汎用モデルは、各リードについて規則を受け取り、それを基に推論する。Koaのトレーニングアプローチは、想定されるツール呼び出しや失敗条件も含め、この一連の流れを馴染みのある業務に変えようとする。
同じ考え方はサービスケースにも当てはまる。返金要求を扱うエージェントは、購入履歴を確認し、適格性を確認し、例外を検出し、承認を求め、返金を実行し、結果を記録する場合がある。
流暢な回答は、そのタスクの一部にすぎない。エージェントは、権限を尊重し、対話をまたいで状態を維持しながら、正しい順序で正しいシステムを呼び出さなければならない。
Salesforceは、Koaがタスク加重Tau2Bench平均で69.41を記録したと報告している。これはNemotronベースの68.64、GPT-4.1の54.48と比較される。Tau2Benchは、航空、小売、通信の設定におけるマルチステップのカスタマーサービス業務を評価する。
Berkeley Function Calling Leaderboardで、Koaは66.63%を記録した。ベースとなるNemotronは64.73%、比較対象として報告されたGPT-4.1は53.96%だった。
SalesforceのCRM Benchでは、Koaは総合スコア0.86を達成した。GPT-4.1は0.81、Nemotronベースは0.84、Claude Opus 4.8は0.87、GPT-5.5は0.90だった。
これらの結果からは、慎重ながらも一定の結論を導ける。ポストトレーニングはNemotronの性能を改善し、特に関数呼び出しと複数ステップのツール利用で効果を示した。またKoaは、報告された総合ベンチマーク全体で、プロプライエタリなベースラインの一つであるGPT-4.1を上回った。
ただし、この結果はKoaがすべてのフロンティアモデルを凌駕することを示すものではない。論文はKoaが最強のフロンティアシステムにはなお及ばないと明記しており、同論文の表でもTau2BenchとCRM BenchではGPT-5.5がKoaを上回っている。
Salesforceの製品ページは、追加の社内測定値も提示している。同社によれば、Koaは適切なアクションを呼び出す精度が11%高く、顧客コンテキストを想起する信頼性は2.1倍であり、長時間の会話におけるコンテキスト保持能力も15%高いという。
また、CRMアクションでは、主要モデルと同等以上の性能を、エラーを3分の1に抑えて実現すると主張している。これらはSalesforce独自の評価に基づく数値であり、同社報告の結果として扱うべきだ。
単一のリーダーボード順位よりも重要なのは、その仕組みである。Salesforceは、領域に特化した訓練が、適応性の高いオープンウェイトモデルと、より大規模なクローズド型フロンティアシステムの差をどこまで縮められるかを検証している。
この仮説が本番環境で成立すれば、深いワークフロー知識を持つソフトウェアベンダーは新たな優位性を得る。蓄積された専門知識を、訓練環境、評価器、ツール仕様、タスク報酬へと変換できるからだ。
これはプロンプトライブラリより模倣が難しい。また、プロプライエタリデータの意味も変える。価値ある資産は顧客テキストそのものだけでなく、ルール、結果、失敗事例、アクションの連鎖を含む業務構造なのかもしれない。
SalesforceのKoaベンチマークでは判断できないこと
初期の結果はパイロット導入を正当化するには十分に信頼できるが、異なるSalesforce組織における本番信頼性を確立するものではない。
Salesforceは、モデル名とベンチマークスコアを明示した技術論文を公開した点で評価に値する。同論文は、Koaが最強のフロンティアモデルには後れを取ることも示しており、無条件のリーダーシップ主張より有益な情報だ。
それでも、ベンチマーク性能は、企業の稼働中CRM内で信頼性高く動作することと同義ではない。実際の組織には、カスタムオブジェクト、古い自動化、不整合なデータ、文書化されていない例外、相反する指示が存在する。
CRM Benchには、ケースの振り分け、商談情報の更新、フォローアップの予定設定といったタスクが含まれる。これらは有用なテストだが、SalesforceはモデルとCRM向け評価環境の両方を管理している。
独立した研究者は、まだKoaの結果を再現していない。モデルは限定的なパイロットを通じてのみ利用可能であり、多様な実装環境での外部検証も制限されている。
報告された相対的な改善には、追加の文脈が必要だ。「エラーが3分の1になる」という表現は、基準エラー率、サンプル数、信頼区間、カテゴリ別の失敗内訳がなければ解釈が難しい。
正しいアクション選択の改善も、残るミスの深刻度を明らかにしない。誤ったフォローアップ日を選ぶことと、誤った顧客レコードを変更すること、あるいは承認されていない返金を実行することは異なる。
論文の公開ベンチマーク表は、より適切な比較基準を提供する。KoaのCRM Benchスコア0.86はClaude Opus 4.8の0.87に近いが、GPT-5.5の0.90を下回る。関数呼び出し精度は0.77に達しており、なお無視できないエラーの余地が残る。
性能はベンチマーク間でも異なった。Tau2BenchにおけるKoaの加重平均69.41は、報告されたClaude Opus 4.8およびGPT-5.5のスコアを大幅に下回った。
これは必ずしもSalesforceの戦略にとって問題ではない。より強力なデータ制御、予測可能な導入、あるいは低い運用複雑性を提供できるなら、すべてのベンチマークで首位でなくともモデルは有用になり得る。
ただし、購入者はCRM特化を優位性の保証と解釈すべきではない。自社のレコード、ポリシー、権限、統合、失敗コストに基づくテストが必要だ。
合成訓練は別の不確実性も生む。生成されたシナリオはプライバシー管理を容易にし、実在のユーザーをさらすことなく、まれなケースや危険なケースを研究者が作成できる。
しかし、シミュレートされた顧客やワークフローは、本番環境に見られる不規則な振る舞いを取りこぼす可能性がある。従業員は不完全な言葉を使う。レコードは矛盾する。統合はタイムアウトする。ポリシーには、誰もエージェント仕様に組み込んでいない例外が含まれる。
形式的なワークフロー定義に従うよう訓練されたモデルは、その定義の品質を反映する。組織の指示が不完全なら、特化によってシステムが誤ったプロセスを一貫して実行することになりかねない。
したがってガバナンスは、依然としてシステム全体の責任である。モデルウェイト、権限、検索、ツール設計、可観測性、人間へのエスカレーションが連携しなければならない。
Salesforceによれば、Koaはtemperature zeroで動作する。これは生成応答のランダム性を減らすことを意図した設定だ。変動を抑えれば再現性は改善し得るが、事実の正確性や安全なツール利用を保証するものではない。
トラスト境界に関する主張も慎重に読む必要がある。Salesforceは、顧客データがKoaの訓練には使用されず、推論中もSalesforce管理下のインフラ内にとどまるとしている。
これは、外部モデルAPIへレコードを送信することに懸念を抱く組織にとって価値がある。ただし、アクセス制御、保持ポリシー、監査ログ、地域提供状況、プロンプトインジェクション対策の必要性をなくすものではない。
Koaの初の一般提供は、米国リージョンに限られる見込みだ。Salesforceは、より広い地域での提供、最終的な商用条件、リリースに付随するすべての管理機能をまだ公表していない。
顧客パイロットは、ローンチ時のデモより有用な証拠をもたらすはずだ。購入者は、タスク完了率、人間の介入頻度、ロールバックの挙動、レイテンシー、深刻度別のエラーを確認すべきである。
また、すでに自社のAgentforce導入で使用している正確なモデルとKoaを比較すべきだ。旧世代のプロプライエタリなベースラインとの比較では、強力なツールと領域コンテキストを設定した現行フロンティアモデルに対する結果を予測できない可能性がある。
エージェントを評価するチームには、要件、テスト、例外、観測された失敗について、永続的な記録が必要だ。検索可能なAI knowledge baseは、パイロットをまたいでその証拠を保存する助けとなるが、技術的な監視の代わりにはならない。
したがって中心的な不確実性は、現実の条件下での導入にある。Koaにはもっともらしい仕組みと有望なベンチマークデータがある。それでも、顧客固有のSalesforce環境全体で、高コストなミスを特化型推論が減らせることを示さなければならない。
Salesforce Koaが機能するかを示す3つのシグナル
Koaの成否は、ローンチ時の主張ではなく、パイロットの証拠、モデルルーティング、一般提供の品質によって決まる。
第1のシグナルは、名前が挙げられたパイロット顧客からの本番データである。Salesforceは会計、ヘルスケア、金融サービス、旅行、スポーツ、ソフトウェアにまたがる組織を特定しているが、詳細な成果測定値は公表していない。
有用な証拠は、タスク完了と回答品質を分けて示すだろう。Koaが人間の介入なしにどの程度ワークフローを完了するか、どれほどの頻度で誤ったツールを選ぶか、どの失敗が業務データを変更するかを報告すべきだ。
高度にカスタマイズされた組織でも性能が維持されるなら、顧客からの証拠はSalesforceの主張を強める。例外が繰り返し発生したり、広範な手作業レビューが必要になったりすれば、CRM特化が信頼できる業務上の専門性を生むという主張は弱まる。
第2のシグナルは、SalesforceがKoaと他モデルの間で仕事をどのようにルーティングするかだ。同社は引き続きAnthropic、Google、OpenAIなどのプロバイダーと提携しており、Koaがモデル選択を置き換えるわけではない。
成熟したAgentforce導入では、狭く統制されたワークフローをKoaに割り当て、より広範なタスクは別の場所へ振り向けるべきだ。管理者には、組織、エージェント、サブエージェントの各レベルでモデルを選ぶための明確な制御も必要である。
ルーティングの品質は、特化が実用的な優位性になるか、単なる設定負担になるかを決める。顧客には、理解しやすいデフォルト、評価ツール、特定のモデルがタスクを処理した理由を追跡可能な説明が必要だ。
ここで、Koaと汎用モデルの比較はアーキテクチャ上の意思決定になる。最も強力なシステムは、すべてのワークロードを一つの推論エンジンに通すのではなく、両方のアプローチを組み合わせるかもしれない。
第3のシグナルは、Salesforceの2026年冬の一般提供だ。米国リージョンでの提供開始は、Koaが予定どおり統制されたパイロットから通常の顧客環境へ移行するかを示すことになる。
リリースでは、対応するSalesforceエディション、容量、レイテンシー、地域制約、監視、最終的な管理機能を明確にすべきだ。また、本番エージェントを変更する前に、顧客が同じ評価セットに対してモデルを比較できるかも示す必要がある。
一般提供後の独立したテストも同様に重要となる。開発者とエンタープライズ購入者には、カスタムアクション、大規模スキーマ、権限境界、長時間の会話にわたって再現可能な結果が必要だ。
NVIDIAの役割にも注目する価値がある。NemotronはSalesforceにモデルウェイトと訓練来歴へのアクセスを与え、NVIDIAは適応に使用されるNeMoツール群とコンピューティングスタックを提供する。
Koaが良好な性能を示せば、この提携は他のソフトウェアベンダーにとってのひな型になる。ベンダーはオープンウェイトモデルから始め、自社のワークフローに関する専門知識をシミュレーションへ変換し、製品がすでに管理しているアクション向けに訓練できる。
このモデルは、エンタープライズAIに関する一般的な前提に異議を唱える。最大の汎用モデルが、必ずしも最も安全または最も正確な業務上の結果をもたらすわけではない。
特化型モデルも自動的に勝つわけではない。統合作業、モデル更新、テスト、ミスのコストを考慮したうえで、適切に構成されたフロンティアシステムを上回る必要がある。
開発者にとって、Koaはエージェント評価の重要性をさらに高める。ツール呼び出し、状態変更、拒否、エスカレーション経路には、通常のソフトウェアに適用するのと同程度に厳格なテストが必要だ。
エンタープライズ購入者にとって、このローンチは交渉力を生む。自社が利用するエージェントが、クローズドな外部モデル、社内で統制されたモデル、あるいは特化型と汎用システムをルーティングした混合構成のどれに依存しているかを、ベンダーに尋ねられる。
ナレッジワーカーにとって、直近の影響は目立ちにくいだろう。KoaはAgentforceの下層に位置するため、ユーザーは同じ質問を繰り返されることの減少、より優れた継続性、複数ステップの依頼をより正確に完了できることとして体験するかもしれない。
したがってSalesforce Koa CRMモデルは、単に新しい名前を持つ別のアシスタントではない。これはSalesforceが製品知識をモデルの振る舞いへ変換し、その振る舞いを自社の運用境界内に置こうとする試みだ。
independent launch coverageは、当面の範囲を裏付けている。すなわち、特化型Agentforceモデル、選定されたパイロット、ツールを利用するCRMワークフローへの焦点だ。より困難な検証は、発表後に始まる。
Koaを導入する前に、チームは一つの範囲を限定したワークフローを特定し、期待するアクションを文書化し、現在のエラー率とエスカレーション率を測定すべきだ。そのうえで、同一の権限とデータのもとでKoaを既存モデルと比較できる。
パイロット導入の結果、ルーティング制御、そして冬季リリースに注目すべきだ。これらのシグナルが柔軟性を損なうことなく重大なエラーの減少を示せれば、SalesforceはCRMに特化した推論の有効性を強く主張できるだろう。そうでなければ、より優れたコンテキストとツールを備えた汎用モデルが、引き続きよりシンプルなデフォルトとなる。



