Anthropic, Google e OpenAI entram em um teste da Casa Branca sobre regras voluntárias de IA
- Ethan Carter

- 12 de ago.
- 14 min de leitura
Anthropic, Google e OpenAI aderiram a um novo experimento regulatório em 4 de agosto, apesar da promessa de Washington de evitar a aprovação obrigatória de lançamentos de IA de fronteira.
A reunião na Casa Branca reuniu essas empresas com Meta, Nvidia e outros representantes do setor. Autoridades apresentaram regras para testes governamentais voluntários de modelos avançados antes do lançamento público. As conversas ocorreram após uma ordem executiva de junho que criou o processo de testes sem estabelecer um sistema de licenciamento.
As discussões entre Anthropic, Google e OpenAI, portanto, envolviam mais do que outra consulta sobre políticas públicas. Elas testaram se a cooperação voluntária pode administrar riscos à segurança nacional sem se tornar uma permissão informal do governo para lançar um modelo.
Essa tensão cresceu à medida que os principais modelos se tornam mais capazes de encontrar vulnerabilidades de software e apoiar operações cibernéticas complexas. Ela também expõe uma grande lacuna na estrutura. A abordagem atual se concentra em modelos fechados, enquanto exclui sistemas de pesos abertos que podem ser baixados.
A distinção beneficia empresas que liberam os pesos dos modelos, incluindo desenvolvedores americanos e estrangeiros. Ela impõe maior pressão de revisão sobre laboratórios que mantêm o controle de seus modelos, restringem o acesso e podem cumprir tecnicamente os testes antes do lançamento.
A reunião foi agendada antes da data de publicação deste artigo. Reportagens posteriores esclareceram seu resultado, incluindo o tratamento dado pela estrutura a modelos fechados e de pesos abertos. O que começou como uma prévia da reunião tornou-se um teste de como Washington pretende regular a IA de fronteira.
O que Anthropic, Google e OpenAI foram convidados a analisar
A reunião de 4 de agosto transformou uma ampla ordem executiva em uma estrutura de testes de modelos mais específica, mas ainda não publicada.
A Casa Branca convidou representantes das principais empresas de IA e chips para Washington a fim de analisar as regras de testes propostas pelo governo. Entre os participantes, segundo relatos, estavam Anthropic, Google, OpenAI, Meta e Nvidia.
A estrutura diz respeito a modelos de fronteira, ou seja, sistemas próximos à vanguarda das capacidades gerais de IA. A atenção do governo se concentra em modelos que demonstram capacidades avançadas de cibersegurança ou invasão.
O presidente Donald Trump estabeleceu o processo subjacente por meio de uma ordem sobre IA de junho. Ela orienta agências federais a buscar acordos voluntários com desenvolvedores americanos para testar modelos.
As agências participantes incluem os departamentos de Comércio, Defesa, Segurança Interna e Tesouro. A ordem também atribui às agências de segurança nacional funções no desenvolvimento de avaliações e na resposta aos riscos identificados.
O processo pede que os desenvolvedores participantes forneçam acesso antes de lançar os modelos abrangidos. Especialistas do governo podem então avaliar capacidades que possam ameaçar infraestrutura crítica ou a segurança nacional.
No entanto, a ordem estabelece um limite importante. Ela afirma que o processo não autoriza licenciamento obrigatório, autorização prévia ou permissão governamental para lançamentos de IA.
Essa linguagem reflete a tentativa da administração de conciliar duas posições. As autoridades querem acesso antecipado a capacidades perigosas, mas se opõem a um sistema regulatório amplo que poderia desacelerar os desenvolvedores americanos.
O arranjo resultante depende fortemente da cooperação. Um desenvolvedor pode participar, compartilhar um modelo quase concluído e considerar as conclusões do governo sem abrir mão formalmente do controle sobre sua data de lançamento.
Esse modelo difere de um sistema convencional de aprovação de produtos. O governo não emite um certificado público e não aprova nem rejeita formalmente cada lançamento.
Segundo relatos, a reunião incentivou as empresas a submeter modelos próximos do lançamento. Essa abordagem daria aos avaliadores um produto mais representativo do que um marco de pesquisa ainda inacabado.
Ela também deixa pouco tempo para correção. Uma vulnerabilidade grave descoberta perto do lançamento poderia forçar uma empresa a adiar a implantação, limitar o acesso ou negociar uma alternativa com as autoridades.
A Casa Branca não publicou a estrutura completa. Isso limita o escrutínio independente de seus limites, métodos de avaliação, controles de acesso e procedimentos para resolver divergências.
A natureza confidencial de alguns parâmetros de referência em cibersegurança acrescenta outra restrição. A divulgação pública poderia ajudar adversários a treinar modelos especificamente para passar nos testes sem enfrentar o perigo subjacente.
Ainda assim, o sigilo também torna a responsabilização externa mais difícil. Pesquisadores, clientes e legisladores não conseguem determinar facilmente se os mesmos padrões se aplicam a empresas concorrentes.
A reunião de agosto, portanto, mudou o cenário prático da supervisão de IA. Washington agora tem um caminho definido para revisar determinados lançamentos de fronteira, mesmo que a participação continue legalmente voluntária.
Por que os modelos fechados carregam o ônus regulatório
A principal contrapartida é uma cobertura desigual: modelos que permanecem sob controle das empresas passam por revisão, enquanto pesos baixáveis escapam da estrutura inicial.
Segundo reportagens após a reunião, a estrutura define um modelo de fronteira abrangido como fechado e de última geração, com capacidades relevantes para a segurança nacional.
Um modelo fechado mantém seus parâmetros treinados sob o controle do desenvolvedor. Os clientes geralmente o acessam por meio de um aplicativo ou de uma API, que permite que o software se comunique remotamente com o modelo.
Um modelo de pesos abertos disponibiliza esses parâmetros treinados para download. Os usuários podem executar, modificar, ajustar e redistribuir o modelo sem depender do serviço hospedado por seu desenvolvedor original.
Pesos abertos não são idênticos a software de código aberto. Um lançamento pode fornecer os parâmetros do modelo, enquanto retém os dados de treinamento, o código de desenvolvimento ou outros materiais necessários para plena reprodutibilidade.
Essa distinção importa porque um provedor de modelo fechado pode monitorar o acesso, atualizar proteções, suspender contas e retirar um modelo. Um lançamento de pesos abertos se torna difícil de conter após a distribuição.
Apesar dessa diferença, a estrutura da Casa Branca atualmente exclui modelos abertos de seu escopo de revisão. Detalhes da estrutura divulgados após a reunião descreveram a cobertura como limitada a sistemas fechados avançados.
Autoridades também teriam informado às empresas que modelos de pesos abertos não passariam pelo processo voluntário de testes de segurança. A política reflete o apoio da administração ao desenvolvimento aberto e a preocupação em não restringir a inovação americana.
A isenção cria uma aparente contradição de segurança. Os sistemas que os desenvolvedores ainda podem atualizar e restringir recebem escrutínio antes do lançamento. Sistemas que qualquer pessoa pode baixar e modificar evitam o mesmo processo.
Há uma explicação prática. Um governo pode negociar acesso com uma empresa americana que opera um serviço fechado. Ele tem menos instrumentos contra um modelo lançado por um laboratório no exterior.
Modelos abertos também apoiam pesquisa, personalização e implantação local. Universidades e empresas menores podem estudá-los sem pagar por cada solicitação a um provedor remoto.
A OpenAI argumentou que sistemas fechados e de pesos abertos atendem a propósitos complementares. Sua posição sobre pesos abertos afirma que lançamentos abertos podem apoiar a pesquisa, ampliar o acesso e fortalecer a liderança americana em IA.
Meta e Nvidia também defenderam modelos abertos contra restrições prematuras. Sua posição trata a abertura como uma vantagem econômica e estratégica, particularmente diante de laboratórios chineses que avançam rapidamente.
Anthropic e Google adotaram posições públicas mais cautelosas em relação aos lançamentos mais capazes. Ambas as empresas enfatizaram avaliações, acesso controlado e proteções para sistemas que apresentam riscos cibernéticos graves.
A lacuna política é especialmente importante porque a arquitetura do modelo não determina sua capacidade. Um modelo de pesos abertos pode se aproximar do desempenho de um modelo fechado, enquanto um produto fechado pode permanecer abaixo de qualquer limite significativo de risco.
Uma estrutura duradoura, portanto, precisa de gatilhos baseados em capacidade. Ela não pode presumir que um método de distribuição sempre prevê o risco à segurança nacional.
A abordagem atual do governo aparentemente usa tanto a capacidade quanto a estrutura de lançamento. Um sistema abrangido deve, segundo relatos, ser fechado, avançado e relevante para preocupações específicas de segurança.
Essa combinação reduz o número de modelos sujeitos à revisão. Ela também diminui a probabilidade de que ferramentas empresariais comuns ou sistemas de pesquisa menores fiquem presos em um processo federal de testes.
No entanto, ela cria incentivos que os formuladores de políticas talvez não pretendam. Um desenvolvedor poderia favorecer um lançamento de pesos abertos em parte para evitar as expectativas associadas à implantação fechada.
As empresas também podem debater se um modelo se qualifica como de última geração. Sem limites publicados, esse rótulo pode se tornar uma fonte de negociação, e não um resultado técnico objetivo.
A reunião entre Anthropic, Google e OpenAI não resolveu esse desequilíbrio. Ela formalizou a distinção, deixando às autoridades espaço para revisitar os modelos abertos à medida que suas capacidades avançam.
Testes voluntários ainda podem moldar decisões de lançamento
Uma estrutura voluntária pode exercer pressão substancial quando o governo controla contratos, acesso a informações sigilosas e relações de segurança nacional.
A palavra voluntário sugere que as empresas mantêm independência completa. Na prática, recusar testes governamentais pode trazer consequências comerciais, políticas e reputacionais.
Laboratórios de fronteira buscam contratos federais, parcerias de pesquisa, credenciais de segurança e acesso à expertise do governo. Eles também querem que os formuladores de políticas os vejam como fornecedores confiáveis de infraestrutura americana.
Uma empresa que rejeitasse testes após identificar capacidades cibernéticas avançadas enfrentaria perguntas difíceis. Clientes empresariais poderiam perguntar por que o desenvolvedor recusou uma avaliação governamental disponível.
As autoridades também poderiam reconsiderar decisões de contratação. Elas poderiam restringir o uso de um produto em sistemas sensíveis mesmo sem bloquear formalmente seu lançamento público.
A relação recente da Anthropic com Washington ilustra essa pressão. A empresa já entrou em conflito com a administração por restrições ao uso militar e pelo acesso federal ao Claude.
A Anthropic se opôs ao uso de sua tecnologia em armas totalmente autônomas e vigilância doméstica. A disputa escalou para tentativas de restringir o uso governamental de seus produtos.
Reuniões posteriores entre a liderança da Anthropic e autoridades da Casa Branca se concentraram em cibersegurança, segurança de IA e a continuidade da liderança americana. A relação mostrou como divergências políticas podem afetar rapidamente os negócios governamentais de um provedor de modelos.
A postura da administração mudou à medida que capacidades cibernéticas avançadas se tornaram mais urgentes. O modelo Mythos da Anthropic, mencionado em relatos, atraiu atenção devido a alegações de que poderia identificar vulnerabilidades significativas de software.
Essas capacidades criaram um problema de duplo uso. O mesmo modelo poderia ajudar defensores a localizar falhas ou ajudar atacantes a explorar sistemas antes que correções estejam disponíveis.
A ordem de junho surgiu desse debate sobre segurança. Seu processo oferece aos avaliadores federais acesso antecipado, sem chegar a um veto formal de lançamento.
Anthropic, OpenAI e Google acolheram a ordem em declarações públicas. O diretor de assuntos globais da OpenAI, Chris Lehane, enfatizou as instituições democráticas, a expertise técnica, a responsabilização e a confiança pública.
O apoio deles é compreensível. Um processo federal compartilhado pode substituir negociações improvisadas sempre que um modelo demonstrar uma nova capacidade preocupante.
Ele também pode impedir que um desenvolvedor se torne a única empresa a adiar um lançamento. A pressão competitiva torna difícil a contenção unilateral quando concorrentes podem lançar sistemas comparáveis.
Uma janela comum de testes reduz esse problema se todos os desenvolvedores relevantes participarem. Cada empresa ganha alguma segurança de que seus concorrentes mais próximos enfrentam expectativas semelhantes.
Ainda assim, os testes voluntários não eliminam a corrida. As empresas ainda decidem quando um modelo está suficientemente concluído para ser submetido, que acesso os avaliadores recebem e como respondem às descobertas.
A janela de 30 dias reportada é curta em comparação com a revisão regulatória convencional. Ela reflete um mercado em que os cronogramas de produto mudam rapidamente e as vantagens de desempenho podem desaparecer em poucos meses.
O feedback do governo recebido perto do lançamento ainda pode alterar uma estreia. Uma empresa pode restringir certas ferramentas, reforçar o monitoramento, adiar o acesso amplo ou fornecer o sistema apenas a parceiros selecionados.
Esse resultado não constituiria legalmente uma aprovação governamental. Para clientes e investidores, porém, um atraso após uma avaliação federal poderia parecer muito semelhante.
O oposto também é possível. Uma empresa poderia avançar apesar das preocupações do governo e declarar que a participação nunca transferiu a decisão final.
As autoridades então enfrentariam uma escolha. Poderiam divulgar a divergência, aplicar pressão por meio de compras públicas, buscar outra autoridade legal ou aceitar a decisão da empresa.
Portanto, a força real do arcabouço virá dos relacionamentos, e não de penalidades previstas em lei. Isso torna o tratamento consistente essencial.
Se um laboratório receber flexibilidade discreta enquanto outro enfrenta pressão pública, a cooperação voluntária perderá credibilidade. As empresas tratarão o processo como negociação política, em vez de gestão de risco técnico.
Esse é o principal antagonismo nesta história de política pública: cooperação voluntária versus pré-aprovação informal. O limite será definido por disputas reais de lançamento, não apenas pela linguagem da ordem executiva.
As Regras Não Publicadas Criam um Problema de Responsabilização
O governo quer testes confidenciais que adversários não possam estudar, mas o sigilo impede que pessoas de fora avaliem se o processo é justo ou eficaz.
As avaliações de cibersegurança frequentemente exigem detalhes confidenciais. Publicar cada prompt, ambiente de exploração e limite de pontuação poderia permitir que desenvolvedores otimizassem especificamente para o teste.
Isso também poderia revelar fraquezas defensivas. Um benchmark voltado à infraestrutura crítica poderia expor informações que atacantes poderiam usar contra sistemas reais.
Portanto, componentes sigilosos são compreensíveis. Os avaliadores do governo precisam de espaço para testar capacidades perigosas sem criar um manual público de instruções.
A preocupação é o sigilo mais amplo em torno do próprio arcabouço. Segundo relatos, a Casa Branca não planeja publicar o documento completo analisado pelas empresas.
Essa decisão obscurece questões básicas de governança. O público não conhece o limite exato de capacidade, o processo decisório, o mecanismo de recurso ou as regras que regem o acesso dos avaliadores.
Também não está claro como as autoridades separarão a capacidade de um modelo de seu comportamento. Um sistema pode possuir conhecimento técnico perigoso enquanto recusa pedidos nocivos em condições normais.
Os avaliadores precisarão testar se as salvaguardas resistem a tentativas determinadas de contorná-las. Essas tentativas são comumente chamadas de jailbreaks, ou seja, prompts ou técnicas desenvolvidos para derrotar as restrições de um modelo.
Um jailbreak bem-sucedido não estabelece automaticamente um risco catastrófico. Os avaliadores devem considerar a confiabilidade, a expertise necessária, as alternativas disponíveis e se o modelo reduz materialmente os custos de um atacante.
A mesma distinção importa para o uso defensivo. Um modelo que encontra vulnerabilidades pode ajudar organizações a corrigir software, analisar incidentes e testar aplicações antes da implantação.
As conclusões do governo podem, portanto, respaldar várias respostas. As autoridades podem recomendar salvaguardas mais fortes, acesso limitado, monitoramento reforçado, lançamento adiado ou disponibilidade controlada para parceiros defensivos.
Sem princípios públicos, observadores não conseguem saber por que uma resposta foi escolhida. Tampouco conseguem comparar resultados entre Anthropic, Google e OpenAI.
O arcabouço enfrenta outro desafio de verificação. Autoridades governamentais podem não dispor de computação independente, talento de engenharia ou tempo de avaliação suficientes para testar profundamente todos os modelos importantes.
Uma revisão curta pode identificar riscos óbvios, mas deixar passar comportamentos incomuns. O desempenho do modelo também muda após a implantação por meio de acesso a ferramentas, prompts de sistema, atualizações e integrações criadas por usuários.
Os testes antes do lançamento capturam um retrato momentâneo. Eles não podem substituir o monitoramento contínuo depois que um modelo chega aos clientes e encontra condições do mundo real.
A diretriz anterior sobre IA foi apresentada como uma medida restrita de segurança nacional, e não como supervisão de cada novo modelo. Esse escopo limitado pode manter o processo administrável.
Ainda assim, a cobertura restrita levanta questões de seleção. As autoridades precisam de critérios críveis para decidir quais sistemas merecem escrutínio e quais permanecem fora do arcabouço.
O histórico político amplia a preocupação. A administração removeu várias salvaguardas federais anteriores para IA antes de reconstruir um processo mais restrito em torno da cibersegurança.
Os apoiadores veem essa mudança como uma abordagem mais bem direcionada. Os críticos a consideram um retorno improvisado à supervisão depois que sistemas avançados produziram riscos que o governo não podia ignorar.
O senador Mark Warner acolheu a política de junho, ao mesmo tempo que criticou a administração por desmontar proteções anteriores. Sua reação capturou a tensão bipartidária entre a necessidade de testes e a execução inconsistente.
O atual arcabouço também depende das alegações das empresas sobre seus próprios modelos. Os desenvolvedores possuem os melhores dados internos, mas têm incentivos financeiros para lançar produtos rapidamente.
Avaliadores independentes podem contestar essas alegações. Contudo, sua credibilidade depende de autoridade clara, métodos consistentes e transparência suficiente para demonstrar tratamento justo.
O processo envolvendo Anthropic, Google e OpenAI não deve ser descrito como regulamentação consolidada. Trata-se de um experimento confidencial cujos procedimentos mais importantes ainda não foram testados em disputas públicas.
Três Sinais Mostrarão se o Arcabouço Funciona
As próximas evidências relevantes virão de lançamentos de modelos, do tratamento dado a pesos abertos e da resposta do governo às divergências.
O primeiro sinal é um modelo abrangido entrando no processo de revisão voluntária. Observadores devem acompanhar se um desenvolvedor concede acesso perto do lançamento e depois altera sua estratégia de disponibilização.
Um atraso, lançamento restrito ou atualização de salvaguardas mostraria que os testes afetam decisões reais. Um lançamento inalterado não provaria fracasso, pois os avaliadores podem não encontrar nenhuma preocupação séria.
A evidência mais forte incluiria uma empresa explicando qual categoria de risco mudou seus planos. Ela poderia proteger detalhes sigilosos enquanto descreve o raciocínio geral.
Uma ausência completa de divulgação enfraqueceria a confiança pública. Os clientes saberiam que ocorreu uma revisão, mas não se a empresa tratou de conclusões relevantes.
O segundo sinal é como as autoridades respondem a um modelo de pesos abertos de fronteira com fortes capacidades cibernéticas. Esse caso pressionará a isenção mais visível do arcabouço.
Relatos após a reunião afirmaram que a administração não testaria sistemas de pesos abertos sob as regras atuais. Também indicaram que essa posição poderia mudar à medida que a tecnologia avança.
Um lançamento aberto americano capaz testaria se Washington valoriza a abertura doméstica acima de uma avaliação consistente. Um lançamento estrangeiro exporia os limites de um processo americano voluntário.
A administração poderia responder por meio de pesquisa, controles de exportação, regras de compras públicas ou preparação defensiva, em vez de testes antes do lançamento. Cada opção traz implicações diferentes para inovação e acesso.
A questão dos modelos abertos também afeta a concorrência. Provedores fechados podem contestar se enfrentarem atrasos enquanto rivais de pesos abertos distribuem capacidades comparáveis sem revisão governamental.
Essa objeção se fortalece se os avaliadores medirem risco pelo desempenho, e não pela controlabilidade. Um modelo baixável pode permanecer disponível indefinidamente depois que seu desenvolvedor original deixa de fornecer suporte.
O terceiro sinal é a primeira divergência séria entre autoridades e uma empresa participante. Esse evento definirá o que voluntário significa na prática.
Se a empresa avançar sem retaliação, o arcabouço parecerá uma consulta genuína. Se agências federais aplicarem pressão não relacionada, os críticos o chamarão de licenciamento informal.
Um processo transparente para disputas poderia reduzir esse risco. As autoridades poderiam declarar a preocupação geral, permitir que a empresa responda e identificar a autoridade legal por trás de qualquer ação do governo.
O arcabouço também precisará de tratamento consistente entre empresas. A relação política difícil da Anthropic não pode se tornar um motivo para aplicar padrões mais rígidos do que os usados para Google ou OpenAI.
A mesma regra se aplica no sentido inverso. Os contratos governamentais ou as relações com o Executivo de uma empresa não devem reduzir o escrutínio aplicado ao seu modelo.
Para desenvolvedores e compradores empresariais, esses sinais importam antes de qualquer mudança legislativa. Revisões voluntárias podem afetar cronogramas de lançamento, disponibilidade de recursos e acesso a sistemas avançados.
As equipes de segurança devem esperar mais implantações em fases. Os provedores podem inicialmente limitar ferramentas de alto risco, monitorar usuários selecionados e ampliar o acesso após testes adicionais.
As equipes de produto também devem distinguir as garantias dos provedores da avaliação independente. Uma revisão governamental pode aumentar a confiança sem garantir desempenho seguro em todos os fluxos de trabalho.
Os trabalhadores do conhecimento enfrentam um impacto mais discreto. Suas organizações podem restringir novos modelos até que as equipes de segurança, jurídica e compras entendam o resultado da revisão.
Esse atraso pode complicar a documentação interna quando as equipes comparam vários provedores. Uma base de conhecimento de IA pesquisável pode preservar notas de avaliação, mudanças de política e decisões de implantação ao longo dessas revisões.
A reunião da Casa Branca não criou um regulador abrangente de IA. Ela criou um acordo mais restrito no qual empresas selecionadas compartilham modelos fechados avançados para testes confidenciais.
Esse acordo pode identificar riscos cibernéticos reais antes da implantação. Também pode concentrar influência entre autoridades federais e os maiores laboratórios.
Sua legitimidade dependerá de consistência observável. O governo deve demonstrar que evidências técnicas, e não política ou poder de mercado, determinam sua resposta.
A isenção para pesos abertos continua sendo a questão não resolvida mais difícil. Ela separa sistemas pelo método de distribuição, mesmo enquanto suas capacidades continuam convergindo.
Nos próximos três meses, acompanhe o lançamento de um modelo revisado, um lançamento aberto de alta capacidade e a primeira divergência pública sobre testes. Juntos, esses eventos revelarão se Anthropic, Google e OpenAI aderiram a um processo de segurança útil ou a um sistema de aprovação não publicado.
As equipes que avaliam novos produtos de IA devem documentar esses sinais antes de alterar fluxos de trabalho sensíveis. Perguntem qual modelo foi testado, o que a revisão abrangeu e quem controla o acesso após a implantação. As respostas importam mais do que a linguagem geral de segurança de um provedor.


