Anthropic Diz que a Injeção de Prompt Está Quase Resolvida, mas o Zero Precisa de Contexto
A Anthropic afirma que suas defesas mais recentes reduziram os ataques de injeção de prompt bem-sucedidos a quase zero, desafiando um risco que muitos pesquisadores consideravam fundamental para os agentes de IA.
Boris Cherny, que lidera o Claude Code, atribuiu a mudança principalmente a um treinamento mais robusto do modelo. Ele disse que salvaguardas em camadas reduziram ainda mais a taxa de sucesso medida. Essas camadas incluem sondas de injeção de prompt e o modo automático do Claude Code, que classifica ações de ferramentas antes de permitir que prossigam.
A alegação é relevante porque a injeção de prompt limitou a segurança com que os agentes podem navegar na web, ler repositórios, processar e-mails e operar ferramentas conectadas. A OpenAI descreveu o problema como comparável a golpes online e improvável de desaparecer completamente. A Anthropic agora oferece uma resposta mais otimista, sustentada por resultados excepcionalmente baixos em suas avaliações mais recentes.
No entanto, uma taxa de ataques observada igual a zero não estabelece imunidade universal. Ela descreve o desempenho contra uma coleção definida de ataques, ambientes, ferramentas e regras de pontuação. Novos ataques, permissões mais amplas ou configurações de implantação diferentes podem gerar resultados distintos.
Essa distinção se tornará mais importante à medida que a Anthropic fizer do modo automático a experiência padrão do Claude Code. A empresa está passando de solicitações conservadoras de permissão para decisões automatizadas justamente quando afirma ter obtido uma grande melhoria de segurança.
A Alegação da Anthropic sobre Injeção de Prompt Vem de um Teste em Camadas
A mudança importante não é que a Anthropic adicionou mais um filtro. Seu modelo subjacente parece consideravelmente mais difícil de manipular antes que os filtros intervenham.
A injeção de prompt ocorre quando conteúdo não confiável contém instruções destinadas a uma IA, e não ao seu usuário. Um agente pode encontrar essas instruções em uma página da web, repositório, resposta de ferramenta, imagem ou documento baixado.
O ataque funciona porque um agente precisa interpretar tanto comandos confiáveis quanto dados não confiáveis em seu contexto de trabalho. Um documento malicioso pode imitar uma instrução, pedindo ao agente que ignore sua tarefa, revele informações ou chame uma ferramenta perigosa.
A alegação de defesa em camadas de Cherny aponta para três proteções separadas. A primeira é o alinhamento do modelo, isto é, um treinamento que ensina o Claude a distinguir o objetivo do usuário de comandos incorporados em conteúdo externo.
A segunda camada é uma sonda de injeção de prompt. Essa salvaguarda do lado do servidor examina o material retornado por ferramentas antes que ele entre no contexto do agente. Ela pode sinalizar instruções suspeitas ocultas em arquivos, saída de shell, sites ou serviços externos.
A terceira camada é o classificador de intenção do modo automático. O modo automático não concede ao Claude permissão irrestrita. Ele avalia as ações propostas e bloqueia atividades classificadas como destrutivas, irreversíveis ou fora do ambiente pretendido.
Os resultados publicados pela Anthropic indicam que cada camada aborda um ponto de falha diferente. O treinamento reduz a probabilidade de o modelo seguir uma instrução hostil. A sonda tenta identificar conteúdo hostil antes que o modelo aja com base nele. O classificador de ações limita o que um invasor pode realizar depois de influenciar o modelo.
Essa separação importa. Um detector pode não identificar conteúdo habilmente disfarçado, enquanto um modelo alinhado ainda pode interpretar mal instruções ambíguas. Um classificador de ferramentas oferece outra oportunidade para interromper a ação resultante.
A Anthropic descreveu anteriormente essa estratégia em sua pesquisa sobre defesas contra injeção em navegadores. Durante o treinamento, o Claude encontra páginas da web simuladas contendo instruções maliciosas. O modelo recebe uma recompensa quando identifica e recusa essas instruções enquanto continua a tarefa legítima.
Esse objetivo de treinamento é mais difícil do que ensinar um modelo a recusar textos obviamente maliciosos. Um agente de navegador útil ainda precisa ler instruções em sites legítimos, seguir procedimentos fornecidos pelo usuário e interagir com interfaces desconhecidas. Cautela excessiva pode torná-lo seguro, mas ineficaz.
Os novos resultados sugerem que a Anthropic melhorou esse equilíbrio entre segurança e utilidade. Eles não mostram que toda possível injeção foi eliminada.
O Resultado Próximo de Zero Tem Mais de um Número
“Aproximadamente zero” combina vários cenários de avaliação, e esses cenários não devem ser tratados como evidências intercambiáveis de segurança completa.
Segundo o cartão de sistema do Claude Opus 5, o modelo foi avaliado contra injeções indiretas de prompt em ambientes de navegador e uso de computador. Ataques indiretos colocam instruções maliciosas no conteúdo que o agente recupera, em vez de no pedido direto do usuário.
Um resumo dos resultados do cartão de sistema informa que adicionar uma sonda de injeção de prompt reduziu o sucesso dos ataques para 0,18% em duas configurações testadas. Outra avaliação de navegador teria coberto 129 ambientes que não foram usados durante o treinamento.
Com o modo automático adicionado à pilha, nenhum ataque foi bem-sucedido nos cenários de navegador avaliados. Essa é a base para descrever a taxa observada como aproximadamente zero. Trata-se de um resultado de teste notável, especialmente porque os ataques miravam ambientes não vistos anteriormente.
Ainda assim, zero sucessos e risco subjacente igual a zero são afirmações diferentes. Quando um benchmark não registra nenhum ataque bem-sucedido, ele estabelece um limite superior dentro daquela amostra. Ele não pode estabelecer que a taxa real seja exatamente zero em todos os ataques futuros.
O denominador também importa. Um sistema testado contra centenas ou milhares de tentativas fornece evidências mais fortes do que um testado contra uma pequena coleção. Ataques repetidos contra o mesmo ambiente não representam necessariamente a diversidade de ataques que surgem após a implantação.
O modelo de ameaça da avaliação é igualmente importante. Um ataque de navegador projetado para alterar uma tarefa de compras difere de um ataque a repositório que oculta comandos em comentários de código-fonte. Ambos se qualificam como injeção indireta de prompt, mas expõem ferramentas, permissões e oportunidades de dano diferentes.
Pesquisas independentes reforçam essa cautela. O benchmark LivePI testa agentes em fluxos de trabalho semelhantes aos de produção, contendo páginas da web, arquivos, repositórios, e-mails e conteúdo de chats em grupo. Seus autores relataram taxas totais de sucesso de ataques entre 10,7% e 29,6% em cinco sistemas de ponta na configuração testada.
Esses testes realistas de agentes não contradizem diretamente os números da Anthropic. Eles usam modelos, estruturas de teste, ataques, permissões e critérios de pontuação diferentes. Em vez disso, demonstram o quanto a segurança medida pode mudar conforme o benchmark.
O NetInjectBench oferece outro alerta contra conclusões estreitas. Seus cenários de operações de rede separam artefatos não confiáveis de metadados de políticas confiáveis e medem o uso inseguro de ferramentas. A execução ingênua produziu uma taxa de ações inseguras de 82,5% em 240 instâncias de ataque.
O benchmark de agentes de rede mira um ambiente especializado, e não a pilha de produção exata do Claude Code. Ainda assim, ele ilustra por que agentes com ferramentas de impacto relevante precisam de controles em nível de sistema além do comportamento de recusa de um modelo.
A evidência mais forte da Anthropic é, portanto, comparativa. O Opus 5 parece ser substancialmente mais resistente do que modelos Claude anteriores nas avaliações da Anthropic. A empresa também informa que sua sonda e seu classificador de ações reduzem ainda mais as falhas restantes.
Isso sustenta a alegação de progresso significativo. Não sustenta a remoção de isolamento, controles de acesso, logs de auditoria ou revisão humana de fluxos de trabalho de alto impacto.
A Defesa contra Injeção de Prompt do Claude Começa pelo Treinamento
A mudança técnica central é a decisão da Anthropic de tratar a resistência à injeção de prompt como uma capacidade treinada do modelo, e não apenas como um problema de segurança de perímetro.
As primeiras defesas frequentemente colocavam filtros entre um agente e o conteúdo que ele consumia. O filtro procurava frases óbvias, instruções codificadas, formatação suspeita ou padrões de ataque conhecidos.
Essa abordagem se assemelha a um filtro de spam de e-mail. Ela funciona bem contra ataques conhecidos, mas pode falhar quando invasores mudam a redação, distribuem instruções por várias páginas ou ocultam a intenção em dados legítimos.
A OpenAI levantou essa limitação diretamente. Sua pesquisa sobre design de segurança para agentes afirma que ataques avançados se assemelham cada vez mais à engenharia social. Eles criam histórias plausíveis que manipulam o raciocínio de um agente, em vez de apresentar um comando óbvio para ignorar instruções anteriores.
Um detector precisa decidir se um texto é dado, procedimento legítimo ou ataque. Essas categorias podem se sobrepor. Um repositório pode instruir corretamente um desenvolvedor a executar um comando de configuração, enquanto uma dependência comprometida pode colocar uma instrução quase idêntica em um arquivo malicioso.
O treinamento em nível de modelo oferece ao agente outra fonte de contexto. O Claude pode avaliar se uma instrução apoia o objetivo declarado pelo usuário, se sua fonte tem autoridade e se segui-la exigiria uma mudança de plano sem explicação.
A Anthropic chama esse trabalho de hierarquia de instruções e alinhamento de parte da defesa do modelo. O modelo aprende que o conteúdo recuperado do ambiente não deve herdar automaticamente a autoridade do usuário ou do sistema.
Esse enquadramento aborda uma explicação comum para a injeção de prompt: confusão de papéis. Modelos de linguagem podem entender as palavras de uma instrução sem identificar quem tem o direito de emiti-la.
Pesquisas recentes testaram essa teoria medindo como os modelos representam o autor por trás de diferentes instruções. Um estudo constatou que raciocínios falsificados inseridos em prompts de usuários ou saídas de ferramentas podiam produzir altas taxas de ataque em vários sistemas.
O treinamento pode reduzir essa confusão ao expor o modelo a exemplos adversariais. A Anthropic cria conteúdo simulado que combina informações úteis com diretivas maliciosas e, em seguida, recompensa o modelo por concluir a tarefa pretendida com segurança.
A vantagem é a generalização. Um modelo pode potencialmente reconhecer um novo ataque por sua relação com o objetivo do usuário, mesmo quando nenhum detector viu a formulação exata.
A limitação é que os dados de treinamento não podem representar todos os ambientes futuros. Um ataque pode explorar uma ferramenta incomum, uma longa cadeia de solicitações individualmente inofensivas ou detalhes contextuais que façam um comportamento malicioso parecer legítimo.
Os invasores também podem otimizar contra o modelo implantado. Quando descobrem quais padrões acionam uma recusa, podem procurar entradas que preservem a intenção prejudicial enquanto evitam esses padrões.
É por isso que a Anthropic ainda usa sondas e classificadores apesar do modelo mais robusto. A arquitetura da empresa pressupõe que toda camada pode falhar.
Para desenvolvedores, essa é a lição mais transferível dos resultados da Anthropic sobre injeção de prompt. O treinamento fornece uma base mais sólida, mas a implantação segura ainda depende do sistema ao redor.
Um agente de programação deve receber apenas as credenciais, o acesso à rede e as permissões de sistema de arquivos necessários para sua tarefa. As equipes devem separar entradas não confiáveis de instruções executáveis e registrar chamadas de ferramentas relevantes.
Esse princípio também se aplica quando um agente pesquisa a base de conhecimento técnica de uma empresa. A documentação recuperada pode melhorar o trabalho de um agente, mas o caminho de recuperação também amplia o conteúdo que um invasor pode influenciar.
O Modo Automático Transforma a Alegação de Segurança em uma Aposta de Produto
A Anthropic está usando suas defesas aprimoradas para eliminar a fricção de permissões, tornando o resultado de segurança parte do design central de produto do Claude Code.
Tradicionalmente, o Claude Code pede confirmação antes de executar muitos comandos, editar arquivos ou realizar ações com consequências mais amplas. Essas solicitações mantêm uma pessoa no circuito, mas também interrompem trabalhos de longa duração.
Alguns desenvolvedores respondem concedendo permissões amplas ou usando configurações que contornam aprovações repetidas. Essa escolha aumenta a produtividade, mas enfraquece a fronteira entre um agente manipulado e o sistema ao seu redor.
O modo automático é o meio-termo proposto pela Anthropic. Ele encaminha ações por meio de um classificador que decide se cada ação pode prosseguir sem uma resposta manual.
A arquitetura do modo automático da Anthropic descreve controles em vários pontos. Uma sonda no lado do servidor examina as saídas de ferramentas em busca de tentativas de injeção. Um classificador separado analisa as ações propostas e bloqueia aquelas consideradas inseguras.
O classificador se concentra na intenção, em vez de uma lista fixa de comandos. Excluir um único arquivo temporário gerado pode ser razoável, enquanto excluir um grande diretório de projeto deve acionar um bloqueio. Enviar dados para um endpoint desconhecido representa um risco diferente de buscar documentação pública.
Quando o sistema bloqueia uma ação, o Claude pode tentar uma abordagem mais segura. Tentativas repetidas ou casos incertos podem devolver o controle ao usuário.
Essa estrutura reduz interrupções sem equiparar conveniência a acesso irrestrito. Ela também cria uma nova dependência: os desenvolvedores precisam confiar na interpretação do classificador tanto da tarefa quanto do comando.
Os falsos negativos são o perigo evidente. Uma instrução maliciosa pode provocar uma ação que parece comum quando vista isoladamente, como ler um arquivo de configuração antes de enviar uma solicitação rotineira.
Os falsos positivos criam um problema mais discreto. Se o modo automático bloquear ações legítimas com muita frequência, os desenvolvedores podem desativar salvaguardas para concluir seu trabalho. Controles de segurança que regularmente impedem tarefas normais podem incentivar comportamentos mais arriscados.
A decisão da Anthropic de ativar o modo automático por padrão proporcionará um teste muito maior do que qualquer benchmark de pré-lançamento. Desenvolvedores usam sistemas de build incomuns, ferramentas internas de linha de comando, serviços remotos e repositórios com automação complexa.
Essa diversidade mostrará se o classificador permanece preciso fora dos ambientes selecionados pela Anthropic. Também revelará se a sonda de injeção de prompt lida com conteúdo de plugins, servidores de protocolo de contexto de modelo, gerenciadores de pacotes, rastreadores de issues e logs de build gerados.
A aposta de produto vai além do Claude Code. Agentes de navegador, assistentes de pesquisa e ferramentas corporativas de fluxo de trabalho enfrentam todos uma troca semelhante entre autonomia e aprovação.
Um agente que pede permissão a cada etapa não consegue concluir um trabalho substancial sem supervisão. Um agente com autoridade ampla e persistente pode transformar uma única injeção bem-sucedida em roubo de dados ou ação destrutiva.
O modo automático tenta deslocar a revisão humana de cada operação rotineira para o conjunto menor de ações que apresentam risco material. Se funcionar em escala, outros fornecedores de agentes enfrentarão pressão para oferecer automação comparável.
Se falhar de forma visível, solicitações frequentes de permissão podem voltar como uma fronteira de segurança necessária.
Anthropic e OpenAI Agora Enquadram o Risco de Forma Diferente
Os resultados da Anthropic desafiam uma visão pessimista da injeção de prompt, mas a posição da OpenAI captura melhor a incerteza que vai além de qualquer benchmark fixo.
A OpenAI comparou a injeção de prompt a golpes e engenharia social. Sua orientação pública afirma que é improvável que o problema seja totalmente resolvido, porque adversários se adaptam continuamente às defesas implantadas.
Essa posição não significa que o treinamento de modelos seja ineficaz. A OpenAI também usa treinamento especializado, monitores automatizados, confirmações de usuários, restrições de rede e supervisão para contextos sensíveis.
A divergência diz respeito ao que “resolvido” deve significar. A Anthropic está enfatizando resistência mensurada a ataques após a combinação de várias defesas. A OpenAI está enfatizando a disputa aberta entre atacantes e agentes implantados.
Ambas as posições podem ser verdadeiras dentro de seu escopo pretendido. A Anthropic pode alcançar zero sucessos observados em uma avaliação difícil, enquanto a injeção de prompt continua sendo uma categoria de segurança não resolvida.
A distinção se assemelha à segurança de software tradicional. Um produto pode passar por testes de invasão sem se tornar invulnerável. O teste fornece evidências sobre ameaças conhecidas e a superfície de ataque testada, não sobre todos os exploits futuros.
A injeção de prompt é especialmente difícil porque conteúdo legítimo e malicioso usam a mesma interface: linguagem natural. Não existe um equivalente simples a separar código executável de texto simples quando um agente precisa interpretar texto para decidir o que fazer.
Um atacante também precisa de apenas um caminho através da pilha de defesa. O modelo, a sonda, o classificador, o sistema de permissões, o serviço conectado e o operador humano contribuem, cada um, para o resultado.
A pilha da Anthropic oferece várias oportunidades para interromper um ataque. Ela também produz vários componentes cujas interações precisam ser testadas em conjunto.
Por exemplo, um modelo pode sinalizar corretamente conteúdo suspeito, mas depois resumi-lo de uma forma que preserve a instrução maliciosa. Um classificador pode bloquear a transferência direta de dados, mas permitir várias etapas aparentemente benignas que alcançam o mesmo resultado.
Um ataque também pode mirar o usuário, e não o modelo. Uma página comprometida pode persuadir o agente a solicitar aprovação usando uma explicação enganosa. O usuário passa então a fazer parte do caminho do ataque.
Benchmarks raramente capturam todas as condições organizacionais. Implantações corporativas incluem credenciais compartilhadas, ferramentas personalizadas, repositórios antigos, proxies internos, políticas de permissão inconsistentes e usuários com diferentes níveis de consciência de segurança.
É por isso que a manchete deve continuar sendo “quase resolvido”, e não “eliminado”. A Anthropic divulgou evidências de uma grande redução sob condições testadas. A garantia no mundo real exige reprodução independente e dados contínuos de implantação.
Uma defesa confiável do Claude contra injeção de prompt também deve informar a utilidade ao lado da resistência a ataques. Um sistema que recusa tarefas desconhecidas pode alcançar uma excelente pontuação de segurança enquanto falha como agente.
A pesquisa pública da Anthropic reconhece esse equilíbrio, mas comparações detalhadas entre cargas de trabalho continuam importantes. Compradores precisam saber com que frequência as salvaguardas bloqueiam trabalho seguro, não apenas com que frequência interrompem ataques.
O Que Observar Enquanto a Anthropic Torna o Modo Automático o Padrão
As próximas evidências virão da implantação, de testes independentes e da resposta da Anthropic a ataques elaborados depois que suas defesas se tornaram públicas.
O primeiro sinal é a implementação padrão do modo automático. Observe se a Anthropic o limita por modelo, tipo de conta, ambiente ou política organizacional. Uma implementação cautelosa indicaria que a empresa ainda vê diferenças significativas entre configurações de implantação.
Observe também a taxa de bloqueios voltados ao usuário. Recusas frequentes sugeririam que o classificador mantém a segurança em parte restringindo atividades normais. Pouquíssimas recusas podem indicar boa calibragem, ou cautela insuficiente.
O segundo sinal são testes adaptativos independentes contra a pilha completa do Claude Code. Os benchmarks públicos existentes estabelecem bases valiosas, mas muitos não reproduzem a combinação exata da Anthropic de Opus 5, sondas, modo automático, ferramentas e permissões.
O teste independente mais forte usaria ataques criados depois que pesquisadores estudassem o sistema lançado. Ele incluiria repositórios contaminados, saída enganosa de ferramentas, instruções baseadas em imagens, exfiltração em várias etapas e ataques distribuídos ao longo de uma sessão extensa.
Pesquisadores devem relatar tanto o sucesso dos ataques quanto a conclusão das tarefas. Devem documentar qual acesso o agente recebeu, quais salvaguardas estavam ativas e se os ataques eram conhecidos durante o treinamento.
Um resultado zero sob essas condições fortaleceria a alegação da Anthropic. Ataques adaptativos bem-sucedidos não apagariam o progresso, mas definiriam os limites da defesa atual.
O terceiro sinal é a rapidez com que a empresa lida com incidentes reais. A proteção contra injeção de prompt não é uma propriedade única do modelo. É um processo operacional que envolve detecção, investigação, treinamento atualizado e implantação rápida de novas salvaguardas.
A Anthropic deve divulgar informações suficientes sobre incidentes para que os clientes entendam a superfície afetada. Equipes de segurança precisam saber se uma falha veio do modelo, de uma sonda, de um classificador de ações, de uma regra de permissão ou de uma ferramenta conectada.
Desenvolvedores não devem esperar por essas evidências antes de adotar precauções básicas. Execute agentes autônomos de programação em ambientes isolados, quando possível. Restrinja segredos, destinos de rede e credenciais de produção. Revise alterações antes da implantação e mantenha operações destrutivas recuperáveis.
Trate o texto de repositórios, a saída de ferramentas e arquivos baixados como não confiáveis, mesmo quando parecerem familiares. Uma dependência contaminada ou uma resposta de suporte copiada pode conter instruções que nenhum desenvolvedor aprovou intencionalmente.
Mais importante ainda, não interprete o zero aproximado da Anthropic como permissão para dar autoridade ilimitada a um agente. Interprete-o como evidência de que defesas em camadas podem reduzir um risco sério sem exigir aprovações manuais constantes.
Essa é uma mudança significativa. A questão em aberto é se ela sobrevive ao contato com milhões de repositórios, novas estratégias de ataque e desenvolvedores que esperam que o modo automático continue funcionando sem supervisão.
A Anthropic estabeleceu um padrão mensurável para esse debate. Agora, pesquisadores independentes e usuários do mundo real precisam testá-lo. Se os resultados se confirmarem, a injeção de prompt parecerá menos uma barreira inevitável e mais um problema de segurança que pode ser gerenciado. Se não se confirmarem, as falhas mostrarão onde a próxima camada precisa ser adicionada.



