Modelo CRM Salesforce Koa desafia o padrão de IA de uso geral
A Salesforce apresentou o modelo CRM Salesforce Koa como seu primeiro modelo de raciocínio desenvolvido especificamente para o Agentforce, criando uma alternativa direta aos modelos de fronteira de uso geral. Anunciado com a NVIDIA em 15 de setembro de 2026, o Koa é voltado ao trabalho em múltiplas etapas por trás de vendas, atendimento, comércio e outras operações com clientes.
A mudança importante não é o fato de a Salesforce ter adicionado mais um modelo de linguagem ao seu catálogo. O Koa leva parte da inteligência central do Agentforce para uma infraestrutura e pesos de modelo controlados pela Salesforce. A empresa afirma que esse arranjo aprimora a seleção de ferramentas, a recuperação de contexto e a consistência, ao mesmo tempo que mantém os dados dos clientes dentro de seu perímetro de confiança.
Isso coloca o Koa em confronto com a abordagem predominante de IA empresarial. A maioria das plataformas de agentes depende de modelos abrangentes de empresas como Anthropic e OpenAI, adicionando então dados de negócio, instruções, permissões e ferramentas ao redor deles. A Salesforce argumenta que o trabalho complexo de CRM precisa de um raciocínio treinado em torno do próprio trabalho, e não apenas de um modelo capaz recebendo prompts melhores.
O que mudou com o modelo CRM Salesforce Koa
O Koa oferece à Salesforce uma camada de raciocínio especializada que ela pode operar, adaptar e integrar diretamente ao Agentforce.
A Salesforce e a NVIDIA anunciaram o Koa durante a Dreamforce, em San Francisco. Segundo o anúncio de lançamento das empresas, o Koa está disponível para clientes-piloto selecionados do Agentforce. A Salesforce espera disponibilidade geral nas regiões dos EUA durante o inverno de 2026.
O Koa é baseado no NVIDIA Nemotron 3 Super, um modelo de base de pesos abertos com 120 bilhões de parâmetros. Pesos abertos significa que a Salesforce pode acessar e modificar os parâmetros aprendidos pelo modelo, em vez de se conectar apenas pela API fechada de outro provedor.
A Salesforce não treinou o Koa desde o início. Ela realizou pós-treinamento do Nemotron 3 Super, ou seja, adaptou um modelo existente após seu treinamento inicial. Essa escolha reduziu o tempo e os dados necessários para criar um sistema especializado.
A empresa criou para esse trabalho uma coleção proprietária de cenários sintéticos de CRM. Esses cenários gerados representam atividades como qualificar leads, atualizar oportunidades, resolver casos de atendimento, escolher ferramentas e decidir quando solicitar assistência humana.
A Salesforce afirma que os cenários refletem o conhecimento acumulado ao longo de 27 anos de implantações de CRM. O material de treinamento abrange mais de 14 setores, incluindo saúde, serviços financeiros, manufatura e viagens.
Nenhum registro real de cliente foi usado para treinar o modelo, segundo a Salesforce. A empresa afirma que gerou clientes fictícios, situações de negócio, estados emocionais, políticas e sequências de ações esperadas.
Essa distinção é importante porque dados de treinamento e dados de execução criam riscos separados. O treinamento sintético evita colocar registros de clientes nos pesos aprendidos pelo Koa. Durante a implantação, o contexto do cliente ainda entra no sistema para que um agente possa concluir a tarefa atribuída.
A Salesforce afirma que tanto a inferência quanto o pós-treinamento ocorrem dentro de sua infraestrutura. A empresa controla os pesos do modelo e apresenta o Koa como uma opção gerenciada dentro de seu perímetro de confiança existente.
Os clientes não precisarão reconstruir cada fluxo de trabalho do Agentforce para testá-lo. A Salesforce planeja tornar o Koa selecionável no catálogo de modelos generativos do Data Cloud, nas configurações do Agentforce para toda a organização e no nível de cada agente ou subagente.
Esse design transforma a seleção de modelos em uma decisão administrativa. Uma empresa poderia usar o Koa para um fluxo de atendimento, mantendo um modelo geral para redação, pesquisa ou outra tarefa que exija conhecimento mais amplo.
O Koa já opera no agente interno de funcionários da Salesforce, que ajuda a equipe a encontrar informações e concluir tarefas rotineiras no Slack. Os pilotos externos incluem 1-800Accountant, Baxter Credit Union, Engine, Formula 1, UChicago Medicine e Xero.
Os pilotos abrangem ambientes em que uma resposta plausível não basta. Um agente de contabilidade precisa seguir regras tributárias e circunstâncias dos clientes. Um fluxo de trabalho de saúde precisa coordenar informações sem ignorar etapas obrigatórias. Um agente de viagens pode precisar de várias ferramentas para resolver um único itinerário interrompido.
Esses exemplos esclarecem a alegação central do lançamento. A Salesforce não está tentando tornar o Koa o melhor modelo para todas as tarefas intelectuais. Ela busca tornar o modelo mais confiável quando um agente do Agentforce precisa interpretar o estado do CRM e executar uma sequência de ações permitidas.
Por que o raciocínio especializado para CRM é importante agora
Os agentes empresariais falham cada vez mais no ponto em que a linguagem precisa se transformar em uma ação correta e autorizada.
Um chatbot pode responder a uma pergunta sobre produto sem alterar um registro empresarial. Um agente autônomo de CRM enfrenta um padrão mais exigente porque pode atualizar uma oportunidade, encaminhar um caso, aprovar um reembolso ou agendar um acompanhamento.
Cada ação depende de restrições específicas do negócio. O agente precisa saber qual registro importa, o que o usuário pode alterar, qual ferramenta corresponde à solicitação e se a política da empresa permite a ação.
Um modelo geral pode raciocinar sobre essas instruções em tempo de execução. No entanto, a Salesforce argumenta que reconstruir repetidamente o fluxo de trabalho a partir de prompts e contexto cria variação desnecessária.
Seu relato sobre o pós-treinamento compara a especialização de modelos ao treinamento de funcionários. Uma nova contratação capaz ainda precisa aprender os limites, regras de escalonamento, definições e procedimentos da organização antes de agir de modo consistente.
O Koa aplica esse argumento ao comportamento do modelo. A Salesforce o treinou em trabalho simulado no qual concluir a tarefa exigia o uso correto de ferramentas ao longo de várias interações conversacionais.
As simulações incluíam perfis cooperativos e frustrados. As ferramentas respondiam às chamadas do Koa, enquanto um avaliador verificava se o problema subjacente havia sido realmente resolvido. Tentativas malsucedidas geravam sinais adicionais de treinamento.
A Salesforce usou Group Relative Policy Optimization, ou GRPO, para aprendizado por reforço. O GRPO compara várias respostas candidatas para a mesma tarefa e recompensa o comportamento que tem melhor desempenho segundo critérios definidos.
Esse método dá prática ao modelo, em vez de apenas mostrar transcrições bem-sucedidas. A Salesforce afirma que o ajuste fino supervisionado, que ensina um modelo a imitar exemplos, produziu ganhos limitados em interações complexas de múltiplas etapas.
A empresa também treinou comportamentos de recusa e escalonamento. Algumas tarefas simuladas omitiram deliberadamente uma ferramenta necessária. Nesses casos, o Koa foi recompensado por explicar a limitação, solicitar informações ausentes ou transferir a tarefa para uma pessoa.
Esse é um objetivo significativo para a IA empresarial. Um agente que confirma falsamente uma ação concluída pode ser mais prejudicial do que um que recusa. A falha pode permanecer oculta até que um cliente, funcionário ou auditor descubra que o registro subjacente nunca foi alterado.
A pressão, portanto, recai sobre os provedores de modelos de uso geral e as empresas de software que encaminham todas as tarefas por meio deles. A amplitude continua valiosa, mas compradores empresariais precisam cada vez mais de execução previsível dentro de um limite operacional estreito.
Modelos especializados também dão à Salesforce mais controle sobre a implantação. Ela pode ajustar o comportamento do modelo junto com o Agentforce, esquemas de CRM, definições de ferramentas e sistemas internos de avaliação.
A mesma estratégia pode reduzir a dependência de qualquer provedor externo de modelos. A Salesforce já oferece suporte à escolha de modelos, e suas parcerias com laboratórios de fronteira continuam importantes. O Koa acrescenta uma opção cujos pesos e ambiente de serviço ficam sob controle da Salesforce.
Isso não significa que os modelos gerais se tornem desnecessários. Modelos abrangentes continuam mais adequados para análises abertas, trabalho criativo e tarefas que atravessam muitos domínios de conhecimento.
A provável arquitetura empresarial é um portfólio. Modelos menores podem classificar intenção, filtrar conteúdo ou reordenar resultados de busca. Um modelo de raciocínio especializado pode gerenciar fluxos de trabalho governados. Modelos de fronteira podem lidar com tarefas que exigem inteligência mais ampla.
A Salesforce já avançou nessa direção com modelos como HyperClassifier, TextEval e Moirai. O Koa expande esse portfólio para a etapa de raciocínio, que antes permanecia amplamente dependente de modelos de inteligência geral.
Para os compradores, a questão central passa a ser o roteamento. Enviar cada solicitação ao modelo de fronteira mais capaz pode desperdiçar recursos e expor mais trabalho a comportamentos imprevisíveis. Enviar cada solicitação a um modelo especializado pode limitar a flexibilidade.
O valor estratégico do Koa depende de o Agentforce conseguir escolher o modelo certo para cada trabalho. Essa escolha deve considerar a complexidade da tarefa, o risco, a latência, os limites dos dados e as ferramentas que um agente pode acessar.
Koa versus modelos gerais se resume à prática do fluxo de trabalho
A principal aposta técnica do Koa é que a prática repetida dentro de processos de negócio simulados pode superar o raciocínio a partir de primeiros princípios.
O modelo CRM Salesforce Koa começa com o Nemotron 3 Super, e não com uma rede não treinada. Portanto, ele herda habilidades gerais de linguagem, raciocínio e uso de ferramentas do modelo de base da NVIDIA.
A Salesforce então conecta especificações de agentes a ambientes simulados. Uma especificação de agente descreve roteamento, subagentes, ações disponíveis, permissões de ferramentas e instruções de fluxo de trabalho.
Essas especificações se transformam em situações de treinamento executáveis. Perfis interagem com o agente ao longo de várias interações, e o ambiente muda à medida que as ferramentas leem ou atualizam dados.
Um sistema de recompensas avalia a resolução da tarefa, não apenas se a resposta se parece com uma resposta de referência. Isso importa porque vários caminhos conversacionais podem ser válidos, enquanto apenas alguns produzem o resultado comercial correto.
O artigo técnico que acompanha o lançamento chama isso de pipeline de simulação para recompensa. Sua característica distintiva é vincular as mesmas especificações declarativas usadas para configurar um agente às tarefas usadas para treinar o modelo.
Esse mecanismo cria uma conexão mais estreita entre a configuração do produto e o comportamento do modelo. Uma definição de fluxo de trabalho deixa de ser apenas uma instrução lida durante a inferência. Ela também pode moldar o ambiente de prática do modelo.
Considere a qualificação de leads. Uma empresa pode exigir um porte mínimo de conta, uma região atendida, informações de contato verificadas e evidências de intenção de compra. O agente precisa recuperar esses campos, aplicar as regras, registrar sua conclusão e encaminhar o lead.
Um modelo geral recebe as regras e raciocina sobre elas para cada lead. A abordagem de treinamento do Koa busca transformar a sequência em trabalho familiar, incluindo chamadas de ferramentas esperadas e condições de falha.
A mesma ideia se aplica a casos de atendimento. Um agente que lida com uma solicitação de reembolso pode inspecionar o histórico de compras, confirmar a elegibilidade, detectar uma exceção, solicitar aprovação, emitir o reembolso e documentar o resultado.
Uma resposta fluente é apenas uma parte dessa tarefa. O agente deve chamar os sistemas corretos na ordem correta, respeitando permissões e preservando o estado ao longo da conversa.
A Salesforce relata que o Koa obteve 69,41 na média ponderada por tarefa do Tau2Bench, em comparação com 68,64 de sua base Nemotron e 54,48 do GPT-4.1. O Tau2Bench avalia tarefas de atendimento ao cliente em múltiplas etapas nos setores de companhias aéreas, varejo e telecomunicações.
No Berkeley Function Calling Leaderboard, Koa obteve 66,63%. Sua base Nemotron alcançou 64,73%, enquanto o GPT-4.1 chegou a 53,96% na comparação reportada.
Koa alcançou uma pontuação geral de 0,86 no CRM Bench da Salesforce. O GPT-4.1 obteve 0,81, a base Nemotron obteve 0,84, o Claude Opus 4.8 obteve 0,87 e o GPT-5.5 obteve 0,90.
Esses resultados sustentam uma conclusão ponderada. O pós-treinamento melhorou o desempenho do Nemotron, especialmente em chamadas de função e uso de ferramentas em múltiplas etapas. Koa também superou uma referência proprietária, o GPT-4.1, nos benchmarks agregados reportados.
Os resultados não mostram que Koa supera todos os modelos de fronteira. O artigo afirma explicitamente que Koa permanece abaixo dos sistemas de fronteira mais fortes, e sua própria tabela posiciona o GPT-5.5 acima de Koa no Tau2Bench e no CRM Bench.
A página de produto da Salesforce apresenta medições internas adicionais. A empresa afirma que Koa é 11% mais preciso ao chamar a ação correta, recupera o contexto do cliente com confiabilidade 2,1 vezes maior e retém o contexto 15% melhor em conversas mais longas.
Também afirma que Koa iguala ou supera o desempenho dos principais modelos em ações de CRM com três vezes menos erros. Esses números vêm das próprias avaliações da Salesforce e devem ser tratados como resultados reportados pela empresa.
O mecanismo importa mais do que uma única posição em um ranking. A Salesforce está testando se a prática em um domínio pode reduzir parte da diferença entre um modelo de pesos abertos adaptável e um sistema de fronteira fechado maior.
Se essa tese se confirmar em produção, fornecedores de software com conhecimento profundo de fluxos de trabalho ganham uma nova vantagem. Sua experiência histórica pode se tornar ambientes de treinamento, avaliadores, especificações de ferramentas e recompensas de tarefas.
Isso é mais difícil de copiar do que uma biblioteca de prompts. Também muda o significado dos dados proprietários. O ativo valioso pode ser a estrutura do trabalho — incluindo regras, resultados, casos de falha e sequências de ação — e não apenas o texto dos clientes.
O que os benchmarks de Koa da Salesforce não definem
Os primeiros resultados são suficientemente críveis para justificar pilotos, mas não estabelecem confiabilidade em produção em diferentes organizações Salesforce.
A Salesforce merece crédito por publicar um artigo técnico com modelos identificados e pontuações de benchmark. O artigo também afirma que Koa fica atrás dos modelos de fronteira mais fortes, o que é mais informativo do que uma alegação de liderança sem ressalvas.
Ainda assim, o desempenho em benchmarks não é o mesmo que uma operação confiável dentro do CRM ativo de uma empresa. Organizações reais contêm objetos personalizados, automações antigas, dados inconsistentes, exceções não documentadas e instruções conflitantes.
O CRM Bench inclui tarefas como encaminhar um caso, atualizar uma oportunidade e agendar um acompanhamento. São testes úteis, mas a Salesforce controla tanto o modelo quanto seu ambiente de avaliação orientado a CRM.
Pesquisadores independentes ainda não reproduziram os resultados de Koa. O modelo também está disponível apenas por meio de um piloto limitado, restringindo testes externos em implementações variadas.
As melhorias relativas reportadas exigem contexto adicional. Dizer que um sistema produz três vezes menos erros é difícil de interpretar sem uma taxa-base de erro, tamanho da amostra, intervalo de confiança e detalhamento de falhas por categoria.
Uma melhoria na seleção da ação correta também não revela a gravidade dos erros restantes. Escolher a data errada de acompanhamento é diferente de alterar o registro do cliente errado ou emitir um reembolso não autorizado.
A tabela pública de benchmarks do artigo oferece uma calibração melhor. A pontuação de 0,86 de Koa no CRM Bench é próxima da pontuação de 0,87 do Claude Opus 4.8, mas fica abaixo dos 0,90 do GPT-5.5. Sua precisão em chamadas de função chegou a 0,77, deixando uma margem significativa para erros.
O desempenho também variou entre os benchmarks. A média ponderada de 69,41 de Koa no Tau2Bench ficou substancialmente abaixo das pontuações reportadas para Claude Opus 4.8 e GPT-5.5.
Isso não é necessariamente um problema para a estratégia da Salesforce. Um modelo pode ser útil sem liderar todos os benchmarks, especialmente se oferecer maior controle de dados, implantação previsível ou menor complexidade operacional.
No entanto, compradores não devem interpretar a especialização em CRM como superioridade garantida. Eles precisam de testes construídos em torno de seus próprios registros, políticas, permissões, integrações e custos de falha.
O treinamento sintético introduz outra incerteza. Cenários gerados facilitam os controles de privacidade e permitem que pesquisadores criem casos raros ou perigosos sem expor usuários reais.
No entanto, clientes e fluxos de trabalho simulados podem omitir o comportamento irregular encontrado em produção. Funcionários usam linguagem incompleta. Registros entram em conflito. Integrações expiram. Políticas contêm exceções que ninguém codificou na especificação do agente.
Um modelo treinado para seguir definições formais de fluxo de trabalho refletirá a qualidade dessas definições. Se as instruções de uma organização estiverem incompletas, a especialização pode fazer com que o sistema siga consistentemente o processo errado.
A governança, portanto, continua sendo uma responsabilidade no nível do sistema. Pesos do modelo, permissões, recuperação, design de ferramentas, observabilidade e escalonamento humano devem funcionar em conjunto.
A Salesforce afirma que Koa opera com temperatura zero, uma configuração destinada a reduzir a aleatoriedade nas respostas geradas. Menor variabilidade pode melhorar a repetibilidade, mas não garante correção factual nem uso seguro de ferramentas.
A alegação sobre o limite de confiança também exige uma leitura cuidadosa. A Salesforce diz que os dados dos clientes não treinam Koa e permanecem dentro de uma infraestrutura controlada pela Salesforce durante a inferência.
Isso é valioso para organizações preocupadas em enviar registros a uma API externa de modelo. Não elimina a necessidade de controles de acesso, políticas de retenção, logs de auditoria, disponibilidade regional e proteções contra injeção de prompt.
O primeiro lançamento geral de Koa é esperado apenas em regiões dos EUA. A Salesforce não detalhou publicamente uma disponibilidade regional mais ampla, os termos comerciais finais ou todos os controles administrativos que acompanharão o lançamento.
Os pilotos com clientes devem fornecer evidências mais úteis do que demonstrações de lançamento. Compradores devem observar taxas de conclusão de tarefas, frequência de intervenção humana, comportamento de reversão, latência e erros por gravidade.
Eles também devem comparar Koa com os modelos exatos já usados em suas implantações do Agentforce. Uma comparação com uma referência proprietária mais antiga pode não prever resultados frente a modelos de fronteira atuais configurados com boas ferramentas e contexto de domínio.
Equipes que avaliam agentes precisam de registros duradouros de requisitos, testes, exceções e falhas observadas. Uma base de conhecimento de IA pesquisável pode ajudar a preservar essas evidências entre pilotos, embora não substitua o monitoramento técnico.
A incerteza central é, portanto, a adoção em condições reais. Koa tem um mecanismo plausível e dados de benchmark encorajadores. Ainda precisa mostrar que o raciocínio especializado reduz erros caros em ambientes Salesforce específicos de cada cliente.
Três sinais mostrarão se Salesforce Koa funciona
O sucesso de Koa será determinado pelas evidências dos pilotos, pelo roteamento de modelos e pela qualidade de seu lançamento geral, e não por suas alegações de lançamento.
O primeiro sinal são os dados de produção dos clientes-piloto identificados. A Salesforce identificou organizações de contabilidade, saúde, serviços financeiros, viagens, esportes e software, mas não divulgou medições detalhadas de resultados.
Evidências úteis separariam a conclusão de tarefas da qualidade das respostas. Elas deveriam informar com que frequência Koa conclui fluxos de trabalho sem intervenção humana, com que frequência seleciona a ferramenta errada e quais falhas alteram dados de negócios.
As evidências dos clientes fortaleceriam o argumento da Salesforce se o desempenho se mantivesse em organizações altamente personalizadas. Exceções recorrentes ou revisões manuais extensas enfraqueceriam a alegação de que a especialização em CRM cria expertise operacional confiável.
O segundo sinal é como a Salesforce encaminha o trabalho entre Koa e outros modelos. A empresa continua parceira da Anthropic, Google, OpenAI e outros fornecedores, portanto Koa não substitui a escolha de modelo.
Uma implantação madura do Agentforce deve atribuir fluxos de trabalho restritos e governados a Koa, enquanto direciona tarefas mais amplas para outros sistemas. Administradores também precisam de controles claros para selecionar modelos nos níveis de organização, agente e subagente.
A qualidade do roteamento determinará se a especialização se torna uma vantagem prática ou mais uma carga de configuração. Os clientes precisam de padrões compreensíveis, ferramentas de avaliação e explicações rastreáveis sobre por que um modelo específico tratou uma tarefa.
É nesse ponto que Koa versus modelos gerais se torna uma decisão arquitetural. O sistema mais forte pode combinar as duas abordagens, em vez de forçar todas as cargas de trabalho por um único mecanismo de raciocínio.
O terceiro sinal é o lançamento geral da Salesforce no inverno de 2026. A disponibilidade em regiões dos EUA revelará se Koa passará de um piloto controlado para ambientes comuns de clientes dentro do cronograma.
O lançamento deve esclarecer as edições Salesforce compatíveis, capacidade, latência, restrições regionais, monitoramento e controles administrativos finais. Também deve mostrar se os clientes podem comparar modelos no mesmo conjunto de avaliação antes de alterar um agente de produção.
Testes independentes após a disponibilidade geral serão igualmente importantes. Desenvolvedores e compradores empresariais precisam de resultados reproduzíveis em ações personalizadas, esquemas grandes, limites de permissão e conversas longas.
O papel da NVIDIA também merece atenção. Nemotron dá à Salesforce acesso aos pesos do modelo e à procedência do treinamento, enquanto a NVIDIA fornece as ferramentas NeMo e a infraestrutura computacional usada para adaptação.
Se Koa tiver bom desempenho, a parceria oferece um modelo para outros fornecedores de software. Um fornecedor pode começar com um modelo de pesos abertos, transformar sua expertise em fluxos de trabalho em simulações e treinar para as ações que seu produto já gerencia.
Esse modelo desafia uma suposição comum sobre IA empresarial. O maior modelo geral não entrega automaticamente o resultado operacional mais seguro ou mais preciso.
Um modelo especializado também não vence automaticamente. Ele precisa superar um sistema de fronteira bem configurado após considerar o trabalho de integração, atualizações do modelo, testes e o custo dos erros.
Para desenvolvedores, Koa torna a avaliação de agentes mais central. Chamadas de ferramentas, mudanças de estado, recusas e caminhos de escalonamento precisam de testes tão rigorosos quanto os aplicados a software convencional.
Para compradores empresariais, o lançamento cria poder de negociação. Eles podem perguntar aos fornecedores se seus agentes dependem de um modelo externo fechado, de um modelo controlado internamente ou de uma combinação roteada de sistemas especializados e gerais.
Para trabalhadores do conhecimento, o efeito imediato será menos visível. Koa opera sob o Agentforce, portanto os usuários podem percebê-lo como menos perguntas repetidas, melhor continuidade ou conclusão mais precisa de solicitações em múltiplas etapas.
O modelo de CRM Salesforce Koa, portanto, não é simplesmente mais um assistente com um novo nome. É a tentativa da Salesforce de converter conhecimento de produto em comportamento de modelo e colocar esse comportamento dentro de seu próprio limite operacional.
A cobertura independente do lançamento confirma o escopo imediato: um modelo especializado do Agentforce, pilotos selecionados e foco em fluxos de trabalho de CRM que usam ferramentas. A prova mais difícil começa após o anúncio.
Antes de adotar Koa, as equipes devem identificar um fluxo de trabalho delimitado, documentar suas ações esperadas e medir as taxas atuais de erro e escalonamento. Em seguida, podem comparar Koa com seu modelo existente sob permissões e dados idênticos.
Acompanhe os resultados do piloto, os controles de roteamento e a versão de inverno. Se esses sinais indicarem menos erros consequentes sem sacrificar a flexibilidade, a Salesforce terá um forte argumento a favor de um raciocínio especializado para CRM. Caso contrário, modelos de propósito geral com melhor contexto e ferramentas continuarão sendo a opção padrão mais simples.



