top of page

Anthropic Afirma que a Amplitude de Nove Loops do Claude Superou a Marca de Oito Loops da Física

26 de set.
13 min de leitura

A Anthropic afirma que um cálculo de amplitude de nove loops feito pelo Claude levou um resultado especializado de física teórica além do recorde anterior de oito loops. Segundo a empresa, o Claude trabalhou em grande parte sem supervisão durante vários dias após receber um único prompt inicial.

O cálculo trata do espalhamento de seis partículas na teoria planar de super Yang-Mills N=4. Esse modelo altamente simétrico não é uma descrição direta da natureza. Físicos o utilizam como um ambiente controlado para desenvolver métodos capazes de revelar estruturas ocultas na teoria quântica de campos.

Essa distinção é importante. A Anthropic não afirma que o Claude previu uma nova partícula ou explicou uma anomalia experimental. A empresa diz que um agente de IA ampliou um cálculo simbólico difícil em uma área de pesquisa na qual a complexidade aumenta acentuadamente a cada ordem de loop.

O resultado desafia uma suposição mais restrita, porém importante, sobre a IA na ciência. Até agora, muitos exemplos impressionantes dependiam de benchmarks cuidadosamente delimitados, ampla orientação humana ou problemas com respostas fáceis de verificar. Essa tarefa veio de um físico externo, estava além da fronteira publicada e exigiu uma longa sequência de decisões técnicas.

No entanto, as evidências públicas ainda não equivalem a um artigo científico revisado por pares com um pacote completo de reprodutibilidade. O relato da Anthropic, a avaliação do desafiante e uma checagem por especialista fornecem evidências significativas. Eles não resolvem com que frequência outra equipe conseguiria reproduzir o resultado.

O que a Anthropic Afirma que o Claude Realmente Calculou

A alegação central é específica: o Claude estendeu uma amplitude conhecida de seis partículas de oito para nove loops dentro de uma teoria de campos quânticos simplificada.

Uma amplitude de espalhamento é um objeto matemático usado para calcular como as partículas interagem. Físicos frequentemente a aproximam como uma série, em que cada loop adicional representa uma correção quântica de ordem superior.

Mais loops podem fornecer mais informações, mas as expressões se tornam dramaticamente mais difíceis de construir. O desafio não consiste simplesmente em acrescentar mais uma linha a uma fórmula existente. Cada ordem amplia o espaço de funções possíveis, restrições e verificações de consistência.

O alvo era uma amplitude de seis partículas com violação máxima de helicidade, ou MHV. MHV identifica uma configuração específica de helicidades de partículas que é mais simples do que muitas alternativas, mas continua matematicamente rica.

A teoria era a super Yang-Mills planar N=4. “Planar” significa que o cálculo mantém contribuições que dominam em um limite de grande número de cores e podem ser desenhadas sem linhas que se cruzam. N=4 descreve o grau excepcionalmente alto de supersimetria da teoria.

Essas propriedades tornam o modelo muito mais restrito do que a cromodinâmica quântica, a teoria que governa quarks e glúons. Elas também fazem dele um laboratório importante para testar ideias sobre amplitudes, simetria, geometria e estrutura matemática.

A Anthropic publicou o resultado em um post convidado intitulado Claude and nine loops. O físico e escritor de ciência Matt von Hippel descreveu como seu desafio público chegou aos pesquisadores da empresa.

Von Hippel havia perguntado se um sistema de IA poderia calcular a amplitude de seis partículas em nove loops usando recursos computacionais acessíveis a um grupo acadêmico. Seu desafio deliberadamente mirava um problema não resolvido, mas claramente definido.

A fronteira anterior não era hipotética. Lance Dixon e Yu-Ting Liu publicaram uma amplitude de oito loops em 2023 usando dualidade antipodal, que conecta a amplitude a outro objeto matemático chamado fator de forma.

Esse cálculo passou por verificações envolvendo vários limites cinemáticos importantes. Ele forneceu tanto um recorde quanto uma base que um esforço de nove loops poderia ampliar.

Segundo a Anthropic, o Claude usou métodos desenvolvidos por Dixon e colaboradores, em vez de inventar uma teoria sem relação com o tema. A empresa afirma que o sistema encontrou duas rotas independentes que produziram respostas coincidentes.

A concordância entre métodos distintos é valiosa porque reduz a chance de um simples erro de implementação. Ela não substitui a replicação externa, mas é mais robusta do que apresentar uma única expressão não verificada.

O resultado, portanto, tem um escopo claro. O Claude teria avançado um cálculo simbólico específico em um modelo altamente estruturado. Ele não resolveu amplitudes de espalhamento em geral, substituiu a física experimental ou estabeleceu uma nova lei fundamental.

Por que a Amplitude de Nove Loops do Claude Importa

A parte mais consequente da história não é apenas o loop adicional, mas a forma como um agente aparentemente cruzou a fronteira computacional.

Von Hippel apresentou o problema como um teste para saber se a IA poderia realizar algo significativo em sua antiga especialidade. Seu desafio original distinguiu o progresso genuíno de pesquisa de exercícios de sala de aula ou derivações conhecidas.

Ele escolheu amplitudes porque cálculos de alta ordem de loops combinam julgamento matemático com computação substancial. Métodos conhecidos podem apontar para uma solução, mas aplicá-los à ordem seguinte pode exigir anos de atenção especializada.

Isso torna o resultado diferente de uma IA produzir uma explicação plausível de física estabelecida. Um resumo fluente pode ocultar erros porque os leitores talvez não examinem cada equação. Um cálculo de fronteira enfrenta restrições mais rígidas.

O objeto final deve obedecer a simetrias e limites físicos conhecidos. Rotas de construção diferentes devem concordar. Especialistas podem compará-lo com a estrutura herdada de ordens inferiores de loops.

A Anthropic afirma que o Claude recebeu um prompt descrevendo o problema e, em seguida, operou em grande parte sem supervisão durante dias por meio do Claude Science. Claude Science é uma estrutura de pesquisa que permite a um modelo usar ferramentas, gerenciar trabalho intermediário e continuar ao longo de muitos ciclos de inferência.

“Um prompt” não deve ser confundido com uma única resposta do modelo. A estrutura forneceu um ambiente no qual o Claude podia escrever código, executar cálculos, analisar falhas e revisar sua abordagem.

Essa distinção é central para entender a realização. O sistema relevante não era apenas um modelo de linguagem respondendo de memória. Era um agente inserido em um fluxo de trabalho computacional.

O modelo subjacente conseguia interpretar artigos e formular etapas técnicas. Ferramentas externas podiam realizar álgebra exata, manipular expressões extensas ou testar resultados candidatos. A estrutura conseguia preservar o estado ao longo de um projeto que durava vários dias.

A literatura sobre o integrando de todos os loops já fornece conhecimento estrutural profundo sobre amplitudes planares de super Yang-Mills N=4. Métodos posteriores de bootstrap usam simetria, analiticidade e comportamento em limites para restringir respostas possíveis sem avaliar cada diagrama de Feynman.

Segundo relatos, o Claude reuniu e aplicou esse aparato acumulado. Isso ainda é significativo. O trabalho científico frequentemente avança pelo uso eficaz de técnicas estabelecidas, e não por lampejos isolados de teoria inteiramente nova.

O resultado também testa a confiabilidade em horizontes longos. Um agente de pesquisa precisa acompanhar suposições, arquivos, expressões intermediárias e etapas de validação. Uma única convenção equivocada pode corromper tudo o que vem depois.

Projetos longos expõem fraquezas que benchmarks curtos não detectam. Os modelos podem esquecer por que uma escolha foi feita, aceitar um resultado intermediário falho ou otimizar em direção a um teste incompleto.

Uma execução bem-sucedida sugere que ambientes científicos cuidadosamente projetados podem compensar algumas dessas fraquezas. Arquivos persistentes, verificações executáveis e acompanhamento explícito do progresso transformam o raciocínio em trabalho inspecionável.

Esse mecanismo importa muito além da física de amplitudes. Modelagem de materiais, exploração de teoremas, química computacional e projeto de algoritmos contêm tarefas com longas cadeias de estados intermediários verificáveis.

A lição transferível, portanto, diz respeito à arquitetura de pesquisa. Um modelo capaz se torna mais útil quando combinado com literatura do domínio, ferramentas exatas, estado durável e testes que podem rejeitar erros atraentes.

A Verdadeira Disputa É Entre Pesquisa Agêntica e Computação Liderada por Especialistas

A tensão principal não é Claude contra um físico; é um fluxo de trabalho autônomo de pesquisa contra o processo tradicional de cálculo liderado por especialistas.

Projetos de amplitudes em alta ordem de loops normalmente dependem de pequenos grupos de especialistas. Esses pesquisadores desenvolvem os espaços de funções, identificam dualidades úteis, escrevem código sob medida e decidem quais condições de consistência são decisivas.

Esse processo incorpora anos de julgamento acumulado. O artigo final pode apresentar uma rota concisa, mas essa rota se apoia em amplo conhecimento sobre quais cálculos valem a pena tentar.

O relato da Anthropic sugere uma divisão diferente do trabalho. Pesquisadores humanos selecionaram o problema e construíram o ambiente operacional. O Claude então conduziu grande parte do processo prolongado de busca, implementação e verificação.

Isso não é automação completa da ciência. Os humanos ainda forneceram o objetivo, acesso a ferramentas, literatura e uma estrutura capaz de sustentar a execução. Um especialista também avaliou o resultado posteriormente.

Ainda assim, a divisão de esforços parece significativamente diferente. Segundo relatos, o agente executou um projeto que normalmente exigiria atenção humana especializada e contínua.

Isso pressiona equipes de pesquisa, laboratórios de IA e desenvolvedores de software científico. Cada grupo agora precisa perguntar quais partes da computação especializada podem ser convertidas em procedimentos legíveis por agentes.

Para equipes acadêmicas, a oportunidade imediata é a produtividade. Um agente pode explorar ansätze alternativos, repetir verificações e documentar ramificações malsucedidas enquanto os pesquisadores se concentram na interpretação.

Um ansatz é uma hipótese estruturada restringida por propriedades matemáticas conhecidas. No bootstrap de amplitudes, os pesquisadores reduzem um grande espaço de candidatos até que uma função satisfaça todas as condições exigidas.

Agentes podem ser bem adequados para esse trabalho porque o processo combina recuperação de literatura, geração de código, manipulação simbólica e testes iterativos. Cada etapa pode deixar artefatos que outro programa ou pessoa pode inspecionar.

Para laboratórios de IA, o resultado levanta uma questão de avaliação mais difícil. Um sucesso espetacular em um problema escolhido não revela a taxa de sucesso do sistema em problemas comparáveis.

A Anthropic já enfatizou que avaliações de agentes precisam de resultados verificáveis e testes repetidos. Sua própria orientação sobre avaliação de agentes distingue obter um sucesso em várias tentativas de ter sucesso de maneira consistente.

Essa distinção se aplica aqui. A história pública descreve uma trajetória bem-sucedida, mas ainda não estabelece quantas abordagens falharam ou quão sensível foi o resultado.

As equipes de software científico enfrentam outro tipo de pressão. Se agentes de pesquisa gerais conseguem operar sistemas especializados de álgebra de forma eficaz, a interface em torno dessas ferramentas se torna estrategicamente importante.

Documentação, erros legíveis por máquina, pontos de salvamento e ambientes reproduzíveis podem importar tanto quanto a velocidade bruta de execução. Ferramentas projetadas apenas para uso interativo por especialistas podem ser mais difíceis de agentes controlarem com segurança.

A comparação histórica não é entre IA e substituição de software simbólico. Programas auxiliam cálculos de amplitudes há décadas. A mudança é que um agente de modelo de linguagem pode potencialmente decidir qual ferramenta usar, interpretar sua saída e redirecionar o projeto.

Essa camada de orquestração é a nova alegação. Ela conecta objetivos científicos em linguagem natural a bibliotecas e rotinas de verificação que antes exigiam supervisão constante de especialistas.

A interpretação mais forte não é que Claude soubesse mais física do que o campo. É que Claude supostamente coordenou o conhecimento e a computação existentes em física de forma eficaz o suficiente para ampliar o resultado publicado do campo.

O Que a Verificação Independente Estabelece — e o Que Não Estabelece

A checagem por especialistas torna a alegação mais crível, mas a reprodutibilidade exige mais do que um físico respeitado examinando a resposta.

A Anthropic afirma que Lance Dixon verificou independentemente o resultado de nove loops. Dixon é um avaliador especialmente relevante porque foi coautor do cálculo publicado de oito loops que definiu a fronteira anterior.

Seu envolvimento confere peso substancial à verificação. Ele compreende a estrutura matemática da amplitude, a construção anterior e os limites que uma extensão válida deve satisfazer.

A expressão “verificado independentemente” ainda requer interpretação cuidadosa. Ela pode significar verificar a expressão final em relação a restrições, reproduzir valores selecionados ou derivar o resultado por meio de um pipeline separado.

Esses não são níveis equivalentes de validação. O resumo público da Anthropic não explica, por si só, todos os detalhes do protocolo de verificação.

Duas derivações internas que concordam também fortalecem o caso. Se suas premissas e caminhos de código diferirem o bastante, a concordância se torna uma defesa significativa contra erros acidentais.

No entanto, métodos supostamente independentes podem compartilhar dependências ocultas. Eles podem usar a mesma base, dados importados, convenção ou artefato intermediário falho.

Uma divulgação científica convencional permite que grupos externos inspecionem essas dependências. Pesquisadores podem examinar o prompt exato, o código, as versões das ferramentas, os arquivos intermediários e os testes.

No momento da publicação, o relato voltado ao público deve ser tratado como um resultado relatado e crível, e não como um consenso comunitário concluído. Um artigo revisado por pares e um pacote reutilizável de artefatos reduziriam a lacuna restante.

A questão da verificação também se estende à autoria. Claude pode ter gerado código e escolhido táticas, mas humanos definiram o ambiente e determinaram se a saída contava como um resultado.

Os leitores precisam de um registro claro de contribuições. Ele deve distinguir o prompt inicial, intervenções humanas posteriores, métodos gerados pelo modelo, algoritmos herdados e validação por especialistas.

Isso não é um detalhe burocrático. A atribuição ajuda outros pesquisadores a entender qual capacidade produziu o resultado.

Se a etapa crucial veio de um prompt que codificava uma estratégia de solução especializada, a história diz respeito à execução em escala. Se Claude selecionou a estratégia após ler a literatura, o resultado sugere uma autonomia de pesquisa mais ampla.

Se humanos redirecionaram o sistema sempre que ele travava, o trabalho se assemelha a uma colaboração próxima. Se as intervenções se limitaram ao monitoramento operacional, a alegação de autonomia se torna mais forte.

A palavra “não supervisionado” pode obscurecer essas diferenças. Um sistema pode operar sem orientação em tempo real e ainda assim depender de ampla estrutura de apoio, recursos curados e regras de validação pré-escritas.

A comunidade científica deve, portanto, pedir um registro no nível da execução, e não apenas a fórmula final. Um registro útil mostraria quando Claude mudou de direção, quais testes falharam e quais informações os humanos forneceram.

Essa documentação também pode revelar se o processo é generalizável. Pesquisadores poderiam adaptar o fluxo de trabalho a outra amplitude ou testá-lo em um problema com resposta oculta.

A lacuna de verificação não deve apagar a realização relatada. Ela deve determinar o grau de confiança atribuído a conclusões mais amplas.

O julgamento atual mais seguro é restrito. A Anthropic apresentou um resultado tecnicamente plausível, vinculou-o a um desafio aberto reconhecido e relatou a revisão pelo detentor do recorde anterior.

A alegação mais ampla — de que agentes de pesquisa podem cruzar fronteiras computacionais de forma confiável — exige demonstrações repetidas sob condições transparentes.

Por Que Isso Ainda Não É um Avanço Geral na Física

Um resultado dentro da teoria planar N=4 super Yang-Mills não se transfere automaticamente para a física de partículas experimentalmente realista.

A teoria é valiosa, em parte, porque suas simetrias tornam administráveis cálculos que, de outra forma, seriam esmagadores. Ela atua como um campo de testes teórico no qual estruturas se tornam visíveis antes que pesquisadores busquem ideias relacionadas em outros lugares.

Previsões reais para colisores frequentemente envolvem cromodinâmica quântica. A QCD possui menos simetrias simplificadoras, escalas adicionais e interações complexas vinculadas a processos observáveis.

Passar de um resultado de nove loops no modelo simplificado para um cálculo comparável em QCD não seria uma substituição rotineira. Os espaços de funções e as restrições relevantes podem mudar substancialmente.

Além disso, uma ordem de loop mais alta nem sempre produz valor prático imediato. Pesquisadores podem usar o resultado para testar conjecturas, investigar padrões em todas as ordens ou aprimorar sua compreensão da geometria das amplitudes.

Essas contribuições podem ser importantes sem afetar um experimento no próximo ano. O trabalho pertence à física matemática e teórica antes de pertencer à fenomenologia.

Essa limitação também torna mais nítido o significado real do resultado. A Anthropic não escolheu uma teoria trivial, mas escolheu um domínio com forte estrutura formal e verificações precisas.

Essa combinação é favorável a agentes de IA. A literatura é extensa, os objetos são digitais e respostas candidatas enfrentam restrições exatas.

Outras ciências frequentemente não dispõem dessas condições. Um agente de biologia precisa lidar com medições ruidosas, modelos incompletos e experimentos que demandam tempo. Um agente de materiais pode depender de validação física dispendiosa.

A amplitude de nove loops do Claude, portanto, oferece evidências sobre uma classe de problema de pesquisa. Ela diz menos sobre descoberta empírica aberta.

Também há risco de viés de seleção. Laboratórios de IA podem tentar muitos problemas e anunciar o sucesso mais impressionante. Sem relatar a distribuição de tentativas, os leitores não podem estimar a confiabilidade de base.

Um único cálculo bem-sucedido pode refletir um sistema geralmente capaz. Também pode refletir um problema excepcionalmente compatível, uma estrutura de apoio eficaz e uma trajetória de busca favorável.

Essas possibilidades não são mutuamente exclusivas. Um problema pode ser bem adequado a agentes enquanto a capacidade resultante continua importante.

A comparação correta é com outras tarefas de fronteira que combinam literatura densa, ferramentas programáveis e validação objetiva. Matemática formal e criptoanálise fornecem casos relevantes.

A Anthropic relatou um trabalho no qual Claude ajudou a encontrar fraquezas criptográficas. Esse projeto também dependeu de uso prolongado de ferramentas, testes computacionais e validação humana substancial.

Em conjunto, esses projetos sugerem uma estratégia deliberada. A Anthropic está testando Claude em questões de pesquisa nas quais um agente pode gerar artefatos e especialistas podem rejeitar respostas erradas.

Isso é mais informativo do que depender de prosa persuasiva. Também cria um padrão exigente para futuros anúncios.

Os próximos resultados devem mostrar se a abordagem funciona fora de domínios matemáticos cuidadosamente estruturados. Eles também devem revelar se agentes científicos podem originar perguntas úteis, e não apenas executar desafios definidos.

Por ora, desenvolvedores e organizações de pesquisa devem resistir a dois extremos. O resultado não é nem prova de ciência geral automatizada nem apenas mais uma demonstração de chatbot.

É um teste sério de agência técnica de longa duração em um domínio favorável, mas exigente. Sua importância mais ampla depende de replicação e transferência.

Três Sinais Que Decidirão Se o Resultado se Generaliza

As próximas evidências devem se concentrar em reprodutibilidade, desempenho repetido e extensão útil além deste único cálculo.

O primeiro sinal é uma divulgação científica completa. Pesquisadores externos precisam de material suficiente para reconstruir o resultado e entender a contribuição do agente.

Esse pacote deve incluir o prompt exato da tarefa, o código, o ambiente computacional, as representações intermediárias e os testes de validação. Também deve descrever toda intervenção humana substancial.

Se outro grupo reproduzir a amplitude a partir desses materiais, o relato da Anthropic se torna muito mais forte. Se a reprodução exigir conhecimento especializado não documentado, a alegação de autonomia enfraquece.

O segundo sinal é o desempenho em problemas vizinhos. Claude deve enfrentar tarefas de amplitude relacionadas cujas soluções sejam desconhecidas dos operadores do sistema ou mantidas em sigilo durante a avaliação.

Um estudo útil relataria sucessos, falhas, novas tentativas e uso de recursos em todo o conjunto. Ele evitaria destacar apenas a melhor trajetória.

Essa evidência separaria uma execução bem-sucedida de uma capacidade confiável de pesquisa. Também mostraria quais partes do fluxo de trabalho dependem da estrutura especial dessa teoria.

O terceiro sinal é o uso científico. Pesquisadores devem demonstrar que o resultado sustenta uma nova conjectura, viabiliza outro cálculo ou revela um padrão não visível em oito loops.

Uma expressão de nove loops pode estar correta e, ainda assim, permanecer em grande medida como um recorde. Seu valor científico aumenta se outros físicos a utilizarem como insumo para trabalhos posteriores.

Esses sinais importam mais do que outra demonstração refinada. A reprodutibilidade testa a alegação, ensaios repetidos testam a confiabilidade e o uso posterior testa a relevância.

O evento também oferece orientação prática para equipes que experimentam agentes de pesquisa. Elas devem preservar fontes, decisões e saídas de testes durante toda uma execução.

Projetos técnicos longos rapidamente excedem o que qualquer pessoa consegue acompanhar em uma janela de chat. Uma base de conhecimento de engenharia pesquisável pode conectar artigos, premissas, código e notas de revisão sem tratar a saída do modelo como autoridade.

Essa disciplina favorece tanto a produtividade quanto o ceticismo. Pesquisadores podem rastrear onde uma alegação se originou, comparar derivações alternativas e identificar quais conclusões continuam provisórias.

A amplitude de nove loops do Claude já cruzou um limiar significativo. Um agente de IA de fronteira supostamente enfrentou um problema proposto externamente e produziu uma resposta aceita por um especialista de destaque.

O próximo limiar é coletivo, e não computacional. Equipes independentes devem conseguir inspecionar o processo, reproduzir o resultado e aplicar o método em outros contextos.

A Anthropic divulgará o suficiente da execução para que outro grupo possa reconstruí-la? Essa é a pergunta seguinte mais importante, porque o futuro da ciência assistida por IA depende de trabalho repetível, e não de vitórias isoladas.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page