top of page

Revisão por Pares da Sakana AI Detecta 73% dos Erros Centrais, mas Artigos Reais Revelam o Limite

há 2 horas
13 min de leitura

A Sakana AI afirma que seu sistema de revisão por pares detectou 73,43% dos erros inseridos que afetavam a alegação central de um artigo. No entanto, esse resultado de destaque veio de quatro revisões de contradições sintéticas, e não de revisões rotineiras de pesquisas não modificadas.

O sistema, chamado Multi-Layered Review, teve desempenho muito superior ao de três referências de revisão automatizada no novo benchmark da Sakana AI. Porém, sua taxa de detecção exata caiu para 16,11% quando foi testado contra problemas documentados em artigos retirados do arXiv.

Essa lacuna define a história real. A revisão por pares da Sakana AI oferece evidências de que uma leitura cuidadosa, em múltiplas passagens, pode melhorar a crítica automatizada. Ela não demonstra que um LLM possa validar trabalhos científicos de forma confiável.

Em vez disso, a pesquisa pressiona desenvolvedores a reconsiderar como avaliam revisores de IA. Igualar pontuações humanas ou produzir feedback convincente não basta. Um revisor útil precisa conectar alegações, métodos, experimentos e evidências de forma suficiente para identificar quando entram em conflito.

O resultado da Sakana AI também surge em meio a um histórico complicado. A empresa já usou IA para gerar artigos científicos e enfrentou questionamentos sobre o que, de fato, a aprovação na revisão por pares demonstrava. Seu projeto mais recente inverte a mesma preocupação ao perguntar se a IA pode ajudar humanos a detectar pesquisas frágeis.

A Revisão por Pares da Sakana AI Muda o Teste

A mudança mais importante não é o resultado de 73,43%. É a decisão de avaliar revisores de IA pela capacidade de detectar erros.

Grande parte dos trabalhos anteriores sobre revisão por pares automatizada mediu similaridade. Pesquisadores compararam uma revisão gerada por IA com o feedback humano, verificaram se suas pontuações se correlacionavam ou mediram a sobreposição entre seus comentários.

Esses testes avaliam se um sistema se comporta como um revisor. Eles não mostram diretamente se ele percebeu o erro central de um artigo.

O artigo sobre revisão por pares da Sakana AI propõe uma alternativa focada em verificação. Seus autores argumentam que a detecção de erros é uma das funções mais importantes e intensivas em recursos da revisão por pares.

A equipe criou um Contradiction Benchmark contendo 1.164 variantes modificadas de artigos. Essas variantes vieram de 257 artigos publicados na ACL, AISTATS, CVPR e ICML em 2025, além da NeurIPS em 2024.

Os pesquisadores limitaram a coleta a artigos com licenças permissivas Creative Commons. Essa restrição permitiu modificar e redistribuir os manuscritos.

Para cada artigo, o Gemini 2.5 Pro gerou um grafo de conhecimento. Um grafo de conhecimento representa alegações, métodos, evidências e suas relações como nós conectados.

Os pesquisadores então mediram a distância de cada nó em relação a uma alegação principal. Uma distância zero significava que o nó representava uma alegação central. Distâncias maiores representavam detalhes cada vez mais periféricos.

O GPT-4.1 reescreveu passagens selecionadas para contradizer os nós correspondentes. O texto alterado foi inserido na fonte original, que foi compilada novamente em um PDF completo.

Esse procedimento forneceu aos pesquisadores um erro conhecido e uma localização conhecida. Também permitiu classificar quão diretamente cada erro ameaçava a conclusão principal do artigo.

Um modelo o3 avaliou se as revisões geradas haviam detectado cada contradição. O processo de avaliação foi executado dez vezes por exemplo, e os pesquisadores calcularam a média dos resultados.

Em artigos limpos, o avaliador atingiu 99,9% de precisão, segundo o estudo. Uma análise manual encontrou sensibilidade de 86,8% nas detecções confirmadas, sugerindo que a pontuação automatizada por vezes deixou de reconhecer detecções legítimas.

Essa configuração oferece um teste mais claro do que perguntar se um modelo soa como um revisor. Um sistema aponta a contradição inserida ou não aponta.

No entanto, o benchmark mede uma parte cuidadosamente definida da revisão. Ele não abrange todas as formas de falha científica, incluindo fabricação de dados, pressupostos estatísticos inadequados, erros ocultos de pré-processamento ou experimentos irreproduzíveis.

A distinção importa porque o destaque se refere especificamente a contradições em alegações centrais. Não deve ser interpretado como uma taxa geral de precisão de 73% para revisão científica.

Por Que o Sistema MLR da Sakana AI Encontra Mais Erros

O Multi-Layered Review melhora a detecção de erros ao forçar o modelo a entender um artigo antes de julgá-lo.

O sistema MLR completo da Sakana AI contém três funções: um Appendix Agent, um Literature Review Agent e um Review Agent. Esses componentes processam diferentes partes do manuscrito antes de produzir uma avaliação consolidada.

O Appendix Agent usa Claude Haiku 3.5 para resumir detalhes de implementação e experimentais fora do texto principal. Essa etapa ajuda a evitar que o sistema critique omissões que o apêndice já aborda.

O Literature Review Agent opcional usa Claude Sonnet 4 e busca na web. Sua função é situar o manuscrito na pesquisa existente e testar se suas alegações de novidade parecem justificadas.

O Review Agent central também usa Claude Sonnet 4. Ele recebe até dez páginas do texto principal como PDF, preservando equações, gráficos e informações de layout que a extração em texto simples poderia danificar.

Seu fluxo de trabalho se baseia no consolidado método de três passagens para leitura de artigos científicos. A primeira passagem cria um esboço de alto nível das ideias principais do manuscrito.

A segunda passagem lê mais atentamente e conecta essas ideias às evidências de apoio. Ela também registra pressupostos, lacunas e fragilidades.

A terceira passagem combina essas anotações com descobertas relevantes do apêndice e da revisão de literatura. Em seguida, produz pontos fortes, fraquezas, perguntas, uma recomendação, uma pontuação e uma lista de ações.

Essa sequência aborda uma falha comum em ferramentas de revisão com LLM. Um único prompt grande pode pedir a um modelo que resuma, verifique, compare, critique, pontue e formate um artigo de uma só vez.

O modelo pode produzir uma revisão bem acabada sem construir uma representação estável da pesquisa. Ele pode repetir alegações do resumo enquanto deixa passar evidências contrárias nos resultados.

O MLR separa compreensão de avaliação. Esse design fornece ao modelo anotações intermediárias que podem conectar uma conclusão ao método ou experimento que a sustenta.

Os resultados do benchmark sugerem que tanto a escolha do modelo quanto o design do fluxo de trabalho contribuíram para a melhoria. Substituir o GPT-4.1 pelo Claude Sonnet 4 dentro da referência mais simples LLM-Review elevou a detecção de erros centrais de 14,56% para 35,40%.

Uma única revisão MLR então atingiu 60,79% na mesma classe de contradições centrais. Um conjunto de quatro revisões MLR elevou a detecção para 73,43%.

O melhor resultado concorrente para erros em alegações centrais foi 14,81%, produzido pelo AgentReview. O AI Reviewer atingiu 11,17%, enquanto a configuração original do LLM-Review chegou a 14,56%.

Entre contradições de todos os níveis de gravidade medidos, quatro revisões MLR detectaram 40,95%. Os sistemas concorrentes ficaram entre 5,95% e 6,50%.

Essas comparações tornam o mecanismo mais interessante do que a pontuação absoluta. A mudança do modelo subjacente produziu um grande ganho, enquanto o design de revisão em múltiplas passagens produziu outro.

Isso significa que compradores não podem tratar “multiagente” como explicação suficiente para o desempenho. O AgentReview já usa papéis de revisor, autor e presidente de área, mas seu resultado no benchmark continuou muito menor.

A pergunta importante é o que os agentes fazem. Dividir uma tarefa entre várias personas é diferente de separar um manuscrito em componentes que carregam evidências e construir entendimento ao longo de passagens repetidas.

O MLR também desafia a suposição de que mais tokens produzem automaticamente melhor qualidade de revisão. Ele usou 189.062 tokens de entrada por revisão completa no estudo, menos da metade dos 403.654 do AI Reviewer.

O LLM-Review mais simples usou apenas 6.517 tokens de entrada, em parte porque truncava conteúdos longos. Essa abordagem consumiu menos recursos, mas perdeu informações que poderiam expor contradições.

O equilíbrio útil, portanto, não é simplesmente entre pequeno e grande. É saber se o sistema investe contexto na construção de um modelo do artigo que possa ser revisado.

A Alegação de 73% Encolhe Fora do Benchmark

A evidência mais forte contra tratar o MLR como um árbitro autônomo vem da própria avaliação de erros reais da Sakana AI.

Os pesquisadores testaram o Review Agent contra o WithdrarXiv-Check, um conjunto de dados baseado em artigos retirados do arXiv e seus comentários de retirada associados. Seu conjunto de teste contém 211 artigos.

Essa avaliação é mais difícil do que detectar contradições inseridas. Erros reais de pesquisa podem estar distribuídos entre pressupostos, derivações, citações e experimentos, sem gerar um conflito óbvio no nível da frase.

Os autores desativaram o componente de busca de literatura para esse teste. Caso contrário, o sistema poderia localizar avisos públicos de retirada em vez de descobrir os problemas nos manuscritos.

O MLR identificou uma correspondência exata com o problema de retirada documentado em 16,11% dos casos. Sob um padrão mais flexível, que aceitava uma preocupação substancialmente semelhante, alcançou 26,07%.

A referência mais forte atingiu 9% em correspondências exatas e 18,48% em correspondências semelhantes. O MLR ainda liderou a comparação, mas a margem foi muito menor do que no benchmark sintético.

O conjunto de dados de artigos retirados também inclui principalmente pesquisas teóricas de matemática e física. Os sistemas de revisão foram projetados em torno de artigos de conferências de aprendizado de máquina, o que limita a comparação direta.

Mesmo com essa incompatibilidade de domínio, a lacuna de desempenho revela uma limitação central. Contradições inseridas oferecem ao revisor uma discordância clara para encontrar. Defeitos reais muitas vezes exigem reconstruir uma prova, executar novamente um código, verificar dados ou possuir conhecimento especializado do domínio.

Os autores do benchmark reconhecem outro problema. Avaliadores humanos examinaram 50 contradições sintéticas e constataram que 34% não apresentavam fluxo coerente com as frases adjacentes.

Apenas 8% soavam claramente como conteúdo gerado por IA, mas o contexto interrompido ainda pode fornecer uma pista de detecção. Um revisor automatizado pode perceber que uma passagem não se encaixa sem entender por que a ciência subjacente está errada.

Os autores argumentam que isso torna o benchmark mais fácil, não inválido. Os sistemas de referência ainda tiveram dificuldades mesmo quando alguns erros inseridos continham irregularidades detectáveis.

Essa interpretação é razoável, mas muda o significado de 73,43%. O número é uma pontuação alta em uma tarefa controlada de contradição, não uma estimativa de com que frequência o MLR detecta erros graves em artigos submetidos.

A configuração de quatro revisões também merece atenção. O conjunto considera um erro detectado quando qualquer uma de quatro revisões independentes o menciona.

Isso é útil para triagem do lado dos autores, em que reunir vários sinais de alerta pode melhorar a cobertura. É menos diretamente comparável à atribuição de uma revisão automatizada para substituir um revisor humano.

O resultado de 60,79% para erros centrais em uma única revisão MLR continua substancial. Ainda assim, quase quatro em cada dez contradições centrais inseridas passaram despercebidas na configuração de revisão única.

O desempenho também caiu à medida que as contradições se afastavam da alegação principal de um artigo. Esse padrão sustenta a medida de gravidade do grafo de conhecimento, mas mostra que erros secundários detalhados continuam difíceis.

Para equipes de pesquisa, o caso de uso prático é, portanto, a auditoria antes da submissão. Um sistema automatizado pode sinalizar possíveis inconsistências e direcionar a atenção humana para alegações vulneráveis.

Ele não está pronto para certificar validade. Não se pode presumir que um artigo que não recebe alerta esteja correto, nem que um alerta seja justificado.

A Concordância Humana É Útil, mas Não É Verificação Científica

O MLR produz julgamentos semelhantes às pontuações de revisores humanos, mas a concordância com os revisores continua distinta de encontrar a verdade.

Em submissões da ICLR 2025, as pontuações do MLR tiveram uma correlação de Pearson de 0,586 com as pontuações humanas. A referência entre humanos foi de 0,742.

Em artigos da NeurIPS 2024, o MLR alcançou 0,451, em comparação com uma referência humana de 0,781. Na ICML 2025, o MLR chegou a 0,429, ligeiramente atrás do AI Reviewer, com 0,439.

Esses números mostram um alinhamento significativo, especialmente em comparação com sistemas cujas pontuações mal separavam artigos aceitos e rejeitados. Eles não mostram que decisões humanas ou automatizadas sejam factualmente corretas.

A revisão por pares inclui questões subjetivas sobre importância, clareza e novidade. Dois revisores criteriosos podem concordar que um artigo merece aceitação enquanto deixam passar a mesma fragilidade técnica.

A análise da Sakana AI também identificou diferenças no que humanos e sistemas automatizados enfatizavam. O MLR se concentrou mais fortemente em validade e experimentos, enquanto revisores humanos deram maior atenção à clareza e à novidade.

Essa divergência pode ser útil. Um assistente de revisão agrega mais valor quando revela preocupações negligenciadas do que quando apenas prevê os comentários que um humano escreverá.

No entanto, um foco complementar cria seu próprio problema de calibração. O sistema precisa distinguir uma fragilidade metodológica genuína de uma crítica plausível que não encontra respaldo no manuscrito.

A avaliação com usuários do estudo ilustra esse desafio. Pesquisadores ativos concluíram 38 sessões de revisão com o fluxo de trabalho completo do MLR.

Entre 378 comentários que receberam feedback direto de concordância, os usuários aceitaram 81%. As recomendações receberam 94% de concordância, e os pontos fortes receberam 92%.

As perguntas receberam 79%, enquanto os itens da lista de ações receberam 78%. As fragilidades tiveram a menor taxa de concordância, de 68%.

Os autores não são juízes neutros de críticas, portanto a discordância não significa necessariamente que o sistema estava errado. Ainda assim, as fragilidades são justamente onde acusações falsas podem causar mais danos.

Um revisor que alega incorretamente um erro matemático ou um experimento ausente pode distorcer uma decisão editorial. Uma linguagem fluente pode fazer essa alegação parecer mais certa do que as evidências permitem.

Revisores humanos podem cometer o mesmo erro. A diferença é que a automação pode replicar uma interpretação equivocada em milhares de submissões.

É por isso que o sistema de revisão por pares da Sakana AI se encaixa melhor como um segundo leitor do que como um tomador de decisões. Ele pode ampliar o conjunto de questões que um humano examina sem receber autoridade final sobre a aceitação.

As notas estruturadas do sistema também podem ajudar autores a administrar evidências complexas. Equipes que já usam uma base de conhecimento pesquisável podem aplicar um princípio semelhante, vinculando alegações a experimentos, citações e questões não resolvidas.

Isso não automatiza a verificação. Torna o rastro de evidências mais fácil de ser inspecionado por humanos.

A Injeção de Prompt Expõe o Risco da Automação

Um revisor que compreende um artigo ainda pode ser manipulado por texto inserido nesse artigo.

A Sakana AI testou injeção explícita de prompt ao adicionar instruções ocultas após a conclusão de 50 manuscritos rejeitados, a maioria originalmente submetida à ICLR 2025.

A injeção de prompt ocorre quando o conteúdo dentro de um documento tenta substituir as instruções que regem o modelo que o lê. Uma passagem maliciosa poderia instruir um revisor automatizado a ignorar fragilidades ou atribuir uma pontuação alta.

Os quatro sistemas de revisão foram fortemente influenciados pelo texto injetado. O MLR apresentou a menor alteração média de pontuação sob algumas métricas, mas seus resultados tiveram alta variância.

Ele detectou explicitamente a manipulação em apenas 8 dos 50 artigos. Nos casos restantes, o conteúdo injetado afetou a revisão sem ser identificado de forma confiável como hostil.

Os pesquisadores sugerem que o MLR recebeu alguma proteção de seu fluxo de trabalho focado primeiro na compreensão e de sua entrada multimodal. Claude viu tanto o texto do documento quanto suas páginas renderizadas, enquanto a instrução injetada estava ausente da imagem visível.

Essa discrepância deu ao sistema um possível sinal de que o texto oculto não pertencia ao artigo. Isso não foi suficiente para impedir a manipulação de forma consistente.

Essa fragilidade importa porque a revisão por pares envolve documentos não confiáveis. Os autores controlam o PDF, os arquivos-fonte, o material suplementar, as citações e, às vezes, os repositórios vinculados.

Qualquer revisor automatizado com ferramentas de navegação ou execução de código enfrenta uma superfície de ataque maior. Uma página vinculada pode conter instruções, um repositório pode incluir comentários adversariais e dados suplementares podem ocultar metadados enganosos.

As políticas de conferências já reconhecem que o uso de LLMs exige divulgação e tratamento cuidadoso. O guia de revisores da ICLR coloca a responsabilidade humana acima da assistência automatizada.

Uma implantação segura precisaria isolar o conteúdo do documento das instruções do sistema. Também precisaria restringir ferramentas, registrar ações do modelo, sinalizar texto oculto e exigir confirmação humana para alegações consequentes.

Mesmo esses controles não resolveriam todas as formas de manipulação. Uma passagem pode influenciar um modelo sem conter uma instrução óbvia.

Autores podem enquadrar comparações de forma seletiva, ocultar experimentos fracassados ou usar linguagem confiante para direcionar a atenção. Essas técnicas também influenciam revisores humanos, mas sistemas automatizados podem desenvolver pontos cegos previsíveis.

O trabalho anterior da Sakana AI oferece uma advertência relevante. Em 2025, a empresa retirou um artigo de workshop gerado por IA após sua aceitação e descreveu erros de citação na pesquisa gerada.

Pesquisadores externos questionaram se o episódio demonstrava capacidade científica autônoma ou uma seleção humana eficaz de resultados da IA. Uma posterior análise da revisão por pares enfatizou a diferença entre passar pela revisão e contribuir com conhecimento confiável.

O MLR aborda parte desse problema ao testar revisores em erros conhecidos. Ainda assim, seus resultados de injeção mostram que um avaliador construído a partir da mesma classe de modelos continua vulnerável a entradas estrategicamente redigidas.

Autores automatizados e revisores automatizados poderiam, eventualmente, otimizar uns contra os outros. Autores poderiam aprender qual linguagem evita críticas, enquanto revisores poderiam recompensar padrões que se parecem com trabalhos aceitos.

Sem verificações independentes, esse ciclo poderia melhorar as pontuações sem melhorar a ciência.

O Que Observar Após o Benchmark de Revisão por Pares com LLMs

Três sinais determinarão se o resultado da Sakana AI se tornará uma ferramenta de pesquisa útil ou continuará sendo um experimento controlado impressionante.

O primeiro sinal é a replicação independente. A Sakana AI afirma que os dados e o código estão disponíveis mediante solicitação, em vez de por meio de um repositório público imediatamente acessível.

Equipes externas precisam reproduzir o benchmark com os mesmos artigos, prompts, versões de modelos e procedimento de julgamento. Elas também devem testar diferentes modelos avaliadores e auditar manualmente detecções contestadas.

A replicação deve medir falsos positivos junto com a revocação. Detectar mais erros tem valor limitado se o sistema também gerar muitas críticas plausíveis, porém incorretas.

O segundo sinal é o desempenho em defeitos naturais. Benchmarks futuros devem incluir erros estatísticos verificados, alegações causais sem suporte, falhas de citação, resultados irreproduzíveis e provas inválidas.

Algumas tarefas exigirão acesso ao código e aos dados, e não apenas a um PDF. Um auditor de pesquisa sério pode precisar executar experimentos, inspecionar o pré-processamento e comparar valores relatados com resultados gerados.

O resultado de correspondência exata de 16,11% oferece um ponto de partida. Se sistemas futuros elevarem essa taxa em artigos diversos e selecionados de forma independente, o argumento a favor de assistência prática se fortalecerá.

O terceiro sinal é se as conferências implantarão esses sistemas com salvaguardas aplicáveis. Indicadores relevantes incluem regras de divulgação, controles de privacidade, defesas contra injeção de prompt e supervisão humana documentada.

Um teste limitado que forneça aos revisores alertas privados e opcionais avaliaria a ampliação sem delegar decisões. Um sistema que pontue submissões automaticamente traria um risco muito maior.

Pesquisadores também devem observar como mudanças nos modelos afetam o sistema MLR da Sakana AI. A ablação mostrou que trocar o modelo subjacente respondeu por uma grande parcela do ganho.

Isso cria pressão de manutenção. Um fluxo de trabalho validado com uma versão de modelo pode se comportar de maneira diferente após um provedor atualizar seu modelo ou descontinuar um endpoint.

Também levanta questões sobre reprodutibilidade. Benchmarks científicos se tornam mais difíceis de interpretar quando modelos comerciais mudam sem preservar checkpoints públicos idênticos.

A contribuição mais profunda de Beyond Imitation é, portanto, metodológica. Seu benchmark de revisão por pares com LLMs faz uma pergunta melhor do que se comentários gerados se parecem com comentários humanos.

Um revisor de IA consegue encontrar um problema concreto que ameaça o raciocínio do artigo?

A resposta da Sakana AI é encorajadora sob condições controladas e preocupante em trabalhos reais retirados. A compreensão em múltiplas etapas supera claramente a imitação superficial nos testes relatados.

A lacuna restante é grande demais para conceder autoridade automatizada. Artigos reais contêm erros que não se anunciam como contradições, e artigos maliciosos podem manipular diretamente o revisor.

Desenvolvedores devem tratar o número de 73,43% como um resultado de benchmark com limites definidos. Editores devem exigir validação independente antes de inserir pontuações automatizadas nas decisões de publicação.

Pesquisadores ainda podem usar hoje a ideia central do sistema. Peça a um assistente de IA que mapeie cada alegação importante para suas evidências, inspecione os vínculos resultantes e investigue manualmente cada salto sem suporte.

O próximo resultado decisivo não será outro recorde sintético. Será um sistema replicado que encontre erros sutis e naturais sem inundar revisores com falsos alarmes nem obedecer a instruções ocultas dentro do manuscrito.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page