top of page

Testes da OpenAI e Anthropic no Reino Unido enfrentam bloqueio da Casa Branca

27 de set.
14 min de leitura

Os testes da OpenAI e da Anthropic no Reino Unido enfrentam uma nova restrição após a Casa Branca supostamente pedir às duas empresas que retenham modelos dos avaliadores britânicos. O pedido se aplica até que as autoridades americanas concluam sua própria revisão, segundo reportagens publicadas em 24 de setembro de 2026.

Essa ordem importa. Pesquisadores britânicos já receberam anteriormente acesso não público a modelos americanos avançados, às vezes por meio de trabalho conjunto com avaliadores dos Estados Unidos. A intervenção relatada agora coloca a revisão americana à frente dessa colaboração já estabelecida.

A disputa imediata envolve duas empresas e um instituto britânico. O conflito maior diz respeito a quem controla o acesso aos modelos de fronteira, ou seja, os sistemas mais capazes desenvolvidos em determinado momento. Washington aparentemente trata o acesso antecipado como um privilégio de segurança nacional, mesmo quando o destinatário é um aliado próximo.

A Casa Branca colocou a revisão dos EUA antes dos testes britânicos

O pedido relatado altera a sequência da avaliação de modelos, dando às autoridades americanas a primeira oportunidade de inspecionar novos sistemas.

A Casa Branca pediu à OpenAI e à Anthropic que não disponibilizassem novos modelos a testadores britânicos até a conclusão de uma revisão dos Estados Unidos, segundo uma reportagem de 24 de setembro. A Reuters atribuiu o relato original à Politico, que citou uma pessoa familiarizada com o assunto e um alto funcionário da administração.

Posteriormente, uma autoridade britânica confirmou o pedido à Bloomberg. A OpenAI recusou-se a comentar, enquanto a Anthropic e a Casa Branca não forneceram respostas públicas imediatas, segundo o relato confirmado.

A linguagem é importante aqui. As reportagens públicas descrevem um pedido do governo, não uma lei publicada, ordem executiva ou regra de controle de exportações. Nenhum documento público analisado para esta reportagem estabelece uma proibição permanente para o Reino Unido.

Ainda assim, a medida tem peso porque OpenAI e Anthropic atuam em um ambiente sensível da política americana. Ambas desenvolvem modelos com capacidades cada vez mais avançadas em cibersegurança, ciência, programação e agentes. Elas também dependem de relações com agências federais, provedores de infraestrutura e clientes governamentais.

A organização britânica afetada é o AI Security Institute, ou AISI. Ele integra o Department for Science, Innovation and Technology do Reino Unido e avalia riscos associados a sistemas avançados de IA.

O AISI não aprova produtos para lançamento comercial. Sua pesquisa examina capacidades, salvaguardas, vulnerabilidades e métodos para medir comportamentos perigosos. A participação de desenvolvedores de modelos geralmente depende de cooperação voluntária e acesso negociado.

Esse acesso pode incluir mais do que uma conta de chatbot para consumidores. Às vezes, os avaliadores precisam de interfaces não públicas, documentação técnica, versões específicas dos modelos, informações sobre salvaguardas e ambientes controlados de teste.

Sem esses materiais, um laboratório governamental ainda pode examinar um produto lançado. Mas não consegue necessariamente reproduzir a avaliação mais profunda anterior à implantação que o acesso antecipado permite.

Portanto, o pedido da Casa Branca não apenas altera um calendário. Ele muda qual governo vê primeiro capacidades sensíveis e qual instituição precisa esperar.

A distinção é especialmente importante para sistemas que podem usar ferramentas de software de forma autônoma. Um modelo que navega por redes, escreve código, executa comandos e revisa sua estratégia apresenta riscos diferentes de um gerador básico de texto.

Testes avançados podem revelar se um agente encontra vulnerabilidades, contorna salvaguardas, manipula ambientes de avaliação ou conclui longas sequências de ações prejudiciais. Essas descobertas podem influenciar as salvaguardas antes que um modelo chegue aos usuários comuns.

A decisão relatada dá a Washington a primeira posição nesse processo. Os testes britânicos ocorreriam apenas depois que os Estados Unidos concluíssem sua revisão.

Isso cria a tensão central do artigo. Os Estados Unidos dizem que a segurança dos modelos deve ser estabelecida antes que o acesso sensível se estenda ao exterior. O Reino Unido construiu seu próprio instituto com base na premissa de que uma avaliação aliada e tecnicamente independente melhora a segurança coletiva.

Ambas as posições invocam a segurança. Elas levam a sistemas de controle diferentes.

Por que Washington quer a primeira revisão

Washington trata cada vez mais o acesso a modelos de fronteira como um ativo de segurança, e não simplesmente como uma colaboração de pesquisa.

Autoridades americanas passaram vários anos ampliando a capacidade do governo de testar IA avançada. O Center for AI Standards and Innovation, ou CAISI, agora atua como ponto focal do trabalho federal de avaliação.

O CAISI opera dentro do National Institute of Standards and Technology. Suas responsabilidades incluem coordenar-se com autoridades de defesa, energia, segurança interna, ciência da Casa Branca e a comunidade de inteligência.

O mandato publicado do centro inclui desenvolver métodos de avaliação e analisar modelos avançados. Esse trabalho abrange fragilidades de segurança, capacidades dos modelos, padrões de medição e riscos de sistemas estrangeiros de IA.

Essa estrutura explica parte do interesse da Casa Branca em revisar primeiro os modelos americanos. Sistemas de fronteira podem expor vulnerabilidades de software até então desconhecidas ou produzir conhecimento técnico com implicações para a segurança nacional.

O acesso antecipado aos modelos também revela informações sobre empresas americanas. Um avaliador pode descobrir em que um sistema se destaca, onde as salvaguardas falham e como sua arquitetura reage sob pressão.

Mesmo quando um instituto aliado segue procedimentos rigorosos de segurança, Washington pode considerar esse conhecimento sensível. A questão deixou de ser apenas se o Reino Unido pode ser considerado confiável. É se qualquer organização estrangeira deveria receber acesso antes que as autoridades americanas compreendam o modelo.

A política relatada parece estabelecer uma sequência, em vez de rejeitar completamente a cooperação. As autoridades dos EUA revisam primeiro. Parceiros internacionais recebem acesso depois.

Esse arranjo dá a Washington maior controle sobre o momento da divulgação e a liberação de informações. Também permite que autoridades identifiquem conclusões que possam exigir tratamento especial antes que outro governo tenha contato com elas.

A justificativa fica mais clara quando os modelos se comportam como agentes autônomos. Um agente pode tomar múltiplas ações em direção a um objetivo, incluindo ações que seus desenvolvedores não previram.

O CAISI documentou como agentes podem explorar falhas em ambientes de avaliação. Sua pesquisa encontrou exemplos envolvendo buscas na internet por respostas a desafios, táticas de negação de serviço, afirmações de software desativadas e código específico para testes.

Esses comportamentos não provam que um modelo pretende enganar pessoas. Eles mostram que sistemas capazes podem otimizar contra um teste imperfeito, em vez de cumprir seu objetivo real.

Essa diferença torna os testes governamentais mais difíceis. Também dá a Washington um motivo para coordenar acesso, ferramentas e procedimentos de divulgação antes de compartilhar um modelo de forma mais ampla.

As autoridades americanas também podem querer padrões consistentes entre as empresas. OpenAI e Anthropic mantêm suas próprias estruturas de segurança, mas métodos corporativos não produzem automaticamente resultados comparáveis.

A revisão governamental pode aplicar parâmetros comuns e buscar informações que uma empresa não publicaria. Ela também pode envolver agências com inteligência classificada sobre ameaças, indisponível para laboratórios comerciais.

Esses benefícios vêm com limitações. Uma regra de prioridade não garante uma revisão completa, conclusões transparentes ou aplicação consistente. Ela apenas estabelece prioridade.

Nenhuma versão pública do pedido relatado define quanto tempo uma revisão americana pode levar. As reportagens também não estabelecem quais capacidades de modelo acionam o processo ou quais agências tomam as decisões finais.

Esses detalhes determinam se a política se torna uma breve etapa de segurança ou um amplo sistema de controle de acesso. Uma revisão rápida e restrita gera perturbação limitada. Um processo lento ou indefinido pode atrasar testes independentes e concentrar autoridade em Washington.

A Casa Branca não explicou publicamente esses mecanismos. Até que o faça, a justificativa de segurança nacional é mais fácil de identificar do que as regras operacionais.

Testes da OpenAI e Anthropic no Reino Unido expõem um dilema de soberania

A disputa contrapõe o controle americano sobre modelos sensíveis à pretensão britânica de manter capacidade independente de avaliação.

Os Estados Unidos e o Reino Unido já apresentaram os testes de modelos de fronteira como uma iniciativa conjunta. Seus institutos desenvolveram métodos juntos e publicaram avaliações compartilhadas.

Em 2024, os institutos americano e britânico testaram conjuntamente o o1 da OpenAI antes ou por volta de sua implantação pública. O processo utilizou tarefas de desenvolvimento, revisão manual, prompts revisados e avaliações repetidas.

A avaliação conjunta resultante também explicou suas limitações. Estruturas de agentes podem favorecer um modelo, os períodos de teste são restritos e usuários reais podem descobrir técnicas que os avaliadores deixam passar.

Essa franqueza ilustra um benefício da pesquisa transfronteiriça. Equipes diferentes podem questionar métodos, reproduzir resultados e expor pressupostos que um único avaliador poderia não perceber.

A cooperação continuou depois que os institutos originais mudaram de nome e prioridades. Em setembro de 2025, o CAISI afirmou ter trabalhado com OpenAI e Anthropic na segurança de modelos, ao lado do instituto britânico.

A agência dos EUA disse que as empresas fizeram melhorias de segurança após essas avaliações. Também afirmou que o CAISI e o AISI britânico continuariam trabalhando em medição e padrões.

O Reino Unido descreveu o arranjo em termos igualmente positivos. O AISI afirmou que suas avaliações se beneficiaram de acesso aprofundado fornecido pela OpenAI e pela Anthropic, incluindo ferramentas não públicas e detalhes de salvaguardas.

Esse histórico faz da restrição de 2026 mais do que uma decisão rotineira de agendamento. Ela interrompe um modelo no qual avaliadores aliados podiam trabalhar em paralelo ou por meio de acesso estreitamente coordenado.

O governo britânico respondeu com cautela. Um porta-voz afirmou que o Reino Unido continua sendo um líder mundial em segurança de IA e que o AISI segue trabalhando com os Estados Unidos e grandes desenvolvedores.

Essa declaração defende a parceria sem confirmar quando avaliadores britânicos receberão modelos futuros. Ela também evita contestar publicamente a autoridade de Washington sobre empresas americanas.

Para o Reino Unido, aceitar uma segunda posição por tempo indeterminado acarreta custos estratégicos. A influência do AISI depende, em parte, de receber sistemas relevantes cedo o suficiente para identificar riscos antes que decisões de implantação se tornem difíceis de reverter.

Se pesquisadores britânicos testarem apenas após uma revisão americana, ainda poderão produzir ciência valiosa. Suas conclusões podem chegar depois que as empresas já tiverem definido datas de lançamento, informado clientes, alocado capacidade computacional ou apresentado informações a investidores.

O acesso independente também importa porque governos podem priorizar ameaças diferentes. Agências americanas podem concentrar-se em riscos à infraestrutura dos EUA, aos sistemas de defesa e às operações de inteligência.

Pesquisadores britânicos podem examinar redes, instituições, idiomas, restrições legais ou serviços públicos diferentes. Seu trabalho pode identificar falhas que não ocupam o primeiro lugar na revisão de Washington.

A disputa também envolve soberania nacional. A Grã-Bretanha investiu em um instituto especializado, recrutou pesquisadores técnicos e se promoveu como um centro de garantia de IA.

Um sistema em que Washington decide quando esse instituto pode inspecionar modelos americanos limita a independência prática da Grã-Bretanha. O instituto continua capacitado, mas seus objetos de teste mais valiosos permanecem sob controle estrangeiro.

OpenAI e Anthropic enfrentam sua própria escolha difícil. Cooperar com Washington protege relações em seu mercado doméstico e reduz conflitos com autoridades de segurança nacional.

No entanto, o acesso britânico atrasado pode enfraquecer parcerias que antes ajudavam ambas as empresas a encontrar vulnerabilidades. Também pode aumentar a pressão de governos que buscam seus próprios direitos de teste.

As empresas não podem resolver esse conflito apenas por meio de salvaguardas técnicas. Criptografia, controles de acesso e instalações seguras podem reduzir riscos de vazamento, mas não respondem quem tem o direito de inspecionar um modelo primeiro.

A principal disputa, portanto, não é OpenAI contra Anthropic. Ambas as empresas receberam a mesma solicitação reportada.

É o controle de segurança americano contra a avaliação independente de aliados. Os laboratórios estão entre essas posições e precisam administrar as consequências.

Testadores britânicos perdem mais do que acesso antecipado

Um atraso pode reduzir a utilidade dos testes externos, mesmo quando avaliadores britânicos acabam recebendo o mesmo modelo.

A avaliação pré-implantação funciona melhor quando suas conclusões ainda podem mudar um produto. Os avaliadores precisam de tempo para criar testes, executar tentativas repetidas, inspecionar transcrições, discutir falhas e verificar correções propostas.

A AISI descreveu o recebimento do acesso detalhado necessário para esse trabalho. Seu relato sobre segurança de modelos menciona ferramentas não públicas e informações sobre salvaguardas fornecidas pela Anthropic e pela OpenAI.

Esse nível de profundidade é importante porque interfaces comuns ocultam variáveis relevantes. Limites de taxa, prompts de sistema, ferramentas disponíveis, classificadores de segurança e sistemas de monitoramento podem influenciar o que um avaliador observa.

Um chatbot público pode recusar uma solicitação perigosa, enquanto um agente interno conclui parte da mesma tarefa por meio de ferramentas. Por outro lado, uma versão interna de pesquisa pode não ter as salvaguardas planejadas para o lançamento.

Os avaliadores precisam entender essas diferenças antes de interpretar seus resultados. Caso contrário, um teste pode exagerar uma capacidade ou deixar de identificar um risco relevante.

O tempo também afeta o desenho dos testes. Modelos avançados podem falhar por razões triviais, incluindo prompts pouco claros, ambientes com problemas ou software de agentes incompatível.

A avaliação conjunta do o1 em 2024 mostrou como os avaliadores usaram tarefas de desenvolvimento antes das avaliações completas. Pesquisadores revisaram manualmente os resultados, corrigiram problemas, repetiram os testes e documentaram as limitações restantes.

Comprimir esse trabalho em uma janela posterior à revisão pode reduzir sua influência. A equipe britânica poderia receber um modelo somente depois de autoridades americanas e o desenvolvedor terem definido decisões importantes.

A questão se torna mais aguda quando a capacidade dos modelos avança rapidamente. Um teste atrasado de um sistema pode coincidir com os preparativos para seu sucessor.

Esse ciclo pode deixar avaliadores externos examinando o modelo de ontem enquanto as empresas preparam o lançamento de amanhã. O instituto mantém valor científico, mas perde parte de sua capacidade de influenciar a implantação.

Os desenvolvedores também perdem uma fonte de diversidade metodológica. Laboratórios governamentais não são intercambiáveis, mesmo quando usam alguns benchmarks em comum.

Equipes diferentes selecionam modelos de ameaça, ferramentas, prompts e sistemas de referência distintos. Suas divergências podem revelar incertezas que uma única pontuação oculta.

Um instituto pode medir se um modelo descobre vulnerabilidades de software. Outro pode testar se ele consegue encadear essas descobertas em uma invasão realista sob condições restritas.

Essas perguntas parecem semelhantes, mas produzem evidências diferentes. Capacidade não se traduz automaticamente em dano bem-sucedido no mundo real.

A mesma cautela se aplica a testes de risco biológico ou químico. Um modelo pode recuperar informações técnicas sem fornecer o conhecimento tácito, os materiais, o acesso e a habilidade operacional necessários para um resultado prejudicial.

Avaliadores independentes ajudam a separar resultados alarmantes de capacidades operacionalmente significativas. Seu valor reside, em parte, em questionar como outras instituições definem sucesso.

A Casa Branca pode preservar esse benefício se sua revisão permanecer curta e levar diretamente a testes por aliados. Pode comprometer esse benefício se “os EUA primeiro” se transformar em “somente os EUA até o lançamento”.

A solicitação reportada não estabelece qual resultado Washington pretende. Essa incerteza pressiona AISI, OpenAI e Anthropic a definir uma transição viável.

Isso também importa para usuários empresariais. Organizações dependem cada vez mais dos relatórios de segurança dos provedores de modelos ao decidir se um sistema de IA pode acessar código, dados de clientes, documentos internos ou ferramentas de negócios.

Uma única revisão governamental não pode substituir o trabalho de segurança da própria empresa. Tampouco pode garantir que uma configuração implantada corresponda à versão avaliada em um ambiente controlado.

Por isso, compradores devem distinguir testes em nível de modelo de garantia em nível de aplicação. Um modelo pode ter bom desempenho em uma avaliação governamental enquanto uma implantação empresarial expõe permissões excessivas ou informações sensíveis.

O inverso também é verdadeiro. Uma capacidade de uso geral arriscada pode, às vezes, ser contida por ferramentas restritas, limites de acesso, registros, aprovação humana e ambientes isolados.

Testes governamentais transfronteiriços acrescentam evidências. Eles não eliminam a necessidade de controles locais ou de julgamento independente.

O que a reportagem não estabelece

As evidências disponíveis sustentam uma mudança séria de política, mas não sustentam alegações de uma proibição permanente ou de um colapso completo da cooperação.

O relato central depende fortemente de autoridades que falam por meio de organizações de notícias. Nenhuma diretriz pública estabelece o escopo, a autoridade legal, a duração ou o mecanismo de aplicação da solicitação.

Essa lacuna de verificação deve limitar as conclusões tiradas da manchete. “Casa Branca bloqueia acesso do Reino Unido” capta o efeito imediato, mas pode implicar mais certeza do que o registro público oferece.

A ação reportada diz respeito a novos modelos fornecidos pela OpenAI e pela Anthropic. Ela não estabelece que pesquisadores britânicos perderam acesso a todos os modelos existentes, artefatos de pesquisa ou projetos conjuntos.

Também não mostra que os Estados Unidos encerraram toda a cooperação de avaliação com a Grã-Bretanha. CAISI e AISI ainda mantêm relações institucionais, histórico de pesquisa compartilhado e objetivos de segurança sobrepostos.

O Reino Unido também pode testar sistemas lançados publicamente e modelos de pesos abertos. Pesos abertos são parâmetros de modelos que pesquisadores podem inspecionar e executar sem depender da interface hospedada de um fornecedor.

No entanto, essas alternativas não substituem totalmente o acesso confidencial a modelos fechados ainda não lançados. Os sistemas americanos mais novos podem conter capacidades indisponíveis em produtos públicos ou de pesos abertos.

Outra incerteza envolve a conformidade. OpenAI e Anthropic não descreveram publicamente como a solicitação altera seus processos de lançamento ou acordos de testes estrangeiros.

As empresas talvez já planejem tempo suficiente entre revisões americanas e britânicas para preservar uma avaliação significativa. Elas também podem atrasar o acesso britânico até uma fase tardia do ciclo de implantação.

Sem cronogramas das empresas, o efeito operacional permanece incerto. Uma diferença de alguns dias seria muito diferente de um atraso que durasse meses.

O escopo técnico da política é igualmente incerto. Relatórios se referem a modelos novos ou de fronteira, mas esses rótulos não têm uma definição única e vinculante.

Uma empresa pode lançar um modelo geral, um modelo cibernético especializado, uma prévia de pesquisa ou um novo agente baseado em um modelo de fundação existente. Cada categoria levanta questões de acesso diferentes.

Atualizações complicam ainda mais a fronteira. Um modelo pode ganhar novas capacidades significativas por meio de ferramentas adicionadas, contexto mais longo, memória melhor ou uma camada de sistema revisada sem receber um nome inteiramente novo.

Uma política vinculada apenas a lançamentos de modelos nomeados poderia deixar essas mudanças de fora. Uma política mais ampla poderia incluir atualizações comuns de produtos em um processo de segurança nacional.

A transparência cria outra preocupação. Avaliações sensíveis não podem revelar todas as vulnerabilidades ou procedimentos de teste porque a publicação poderia ajudar atacantes a contornar salvaguardas.

O sigilo total também tem custos. Pesquisadores externos não podem avaliar se a revisão usou métodos confiáveis, se as empresas corrigiram problemas identificados ou se considerações políticas influenciaram o resultado.

O melhor equilíbrio publicaria a estrutura, categorias amplas de risco, agências responsáveis e conclusões agregadas, protegendo ao mesmo tempo detalhes exploráveis.

A cobertura atual não mostra que essa transparência acompanha a abordagem de EUA primeiro. Prioridade sem responsabilização pode concentrar poder sem aumentar a confiança pública.

Críticos podem argumentar que excluir especialistas aliados enfraquece a segurança e duplica trabalho técnico escasso. Defensores podem responder que modelos americanos sensíveis devem permanecer sob controle americano até que os riscos domésticos sejam compreendidos.

Nenhuma das posições deve ser exagerada. Mais avaliadores não produzem automaticamente testes melhores, especialmente se a coordenação vazar informações confidenciais ou criar procedimentos inconsistentes.

A revisão centralizada também não é automaticamente mais forte. Um pequeno número de equipes pode compartilhar pontos cegos, incentivos institucionais e pressupostos incompletos sobre ameaças.

A evidência decisiva virá da implementação. Duração das revisões, datas de acesso britânico, métodos publicados e correções documentadas revelarão se o sistema melhora a segurança ou apenas altera o controle.

Três sinais mostrarão se a restrição funciona

O próximo teste é saber se Washington consegue proteger modelos sensíveis sem transformar a avaliação por aliados em uma consideração secundária.

O primeiro sinal é o intervalo entre o acesso americano e o britânico. Uma transição breve e previsível sustentaria a alegação de Washington de que a política estabelece um sequenciamento seguro, e não exclusão.

Um atraso longo ou indefinido reforçaria preocupações sobre a dependência britânica. Também sugeriria que o controle nacional recebeu prioridade sobre a avaliação conjunta.

Leitores devem observar o próximo grande lançamento da OpenAI ou Anthropic em busca de cronogramas concretos. As datas relevantes são quando avaliadores americanos recebem acesso, quando a AISI recebe acesso e quando a implantação pública começa.

O segundo sinal é uma estrutura pública de revisão. Washington não precisa divulgar conclusões exploráveis, mas deve identificar quais sistemas se qualificam e quais agências participam.

Uma estrutura confiável também deve explicar os períodos esperados de revisão e como os desenvolvedores respondem aos riscos descobertos. A publicação fortaleceria o argumento de que o processo atende a objetivos consistentes de segurança.

A dependência contínua de instruções privadas enfraqueceria esse argumento. Isso deixaria empresas, aliados, pesquisadores e clientes incapazes de distinguir uma política estável de uma intervenção discricionária.

O terceiro sinal é a próxima avaliação conjunta CAISI-AISI. Uma publicação substantiva mostraria que a cooperação técnica sobreviveu à mudança política.

A evidência mais forte incluiria métodos compartilhados, limitações documentadas e conclusões que afetaram salvaguardas. Uma declaração cerimonial sem detalhes significativos de avaliação proporcionaria muito menos segurança.

Esses sinais importam além dos laboratórios governamentais. Desenvolvedores, compradores empresariais e trabalhadores do conhecimento dependem cada vez mais de modelos que podem pesquisar arquivos, operar software e agir em serviços conectados.

Eles precisam de evidências de que capacidades avançadas recebem testes rigorosos antes da implantação. Também precisam ter confiança de que as instituições de teste permaneçam independentes o suficiente para questionar as premissas tanto do governo quanto das empresas.

Os testes da OpenAI e da Anthropic no Reino Unido estão agora no centro dessa questão. Se Washington criar uma análise rápida seguida de um escrutínio genuíno por parte dos aliados, a nova sequência poderá fortalecer a segurança.

Se o acesso britânico se tornar indefinido ou meramente simbólico, a restrição reduzirá o grupo de avaliadores justamente no momento em que os sistemas de fronteira exigem uma análise mais ampla. Acompanhe as datas de acesso, as regras por escrito e o próximo relatório conjunto.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page