QED Science Afirma Conseguir Classificar o 1% Superior dos Preprints. Os Pesquisadores Devem Confiar Nela?
A QED Science classificou 57.455 preprints de ciências da vida e incluiu 574 em seu 1% superior, apesar de questões não resolvidas sobre como sua IA define qualidade científica.
A startup de Tel Aviv afirma que seu sistema avalia originalidade e validade sem ver autores, afiliações, contagens de citações ou nomes de periódicos. Essa promessa contrapõe o QED Score aos sinais de prestígio que os pesquisadores já usam, muitas vezes a contragosto, para navegar uma literatura esmagadora.
A questão central levantada pela cobertura da Horizon Nature não é se a inteligência artificial pode ler artigos mais rápido do que as pessoas. Evidentemente, pode. A questão é se uma pontuação proprietária pode se tornar um filtro confiável antes que pesquisadores independentes testem plenamente suas premissas.
A QED Science transformou um ano de preprints em uma lista classificada
A QED Science converteu a triagem científica de um problema de leitura em um problema de classificação.
A empresa lançou “The 1%” em 24 de junho de 2026. Ela descreve o projeto como uma seleção dos preprints de ciências da vida mais originais e cientificamente válidos publicados durante um período de 12 meses.
A QED analisou 57.455 manuscritos submetidos ao bioRxiv entre maio de 2025 e abril de 2026. A coleção final contém 574 artigos, correspondendo ao 1% superior dessa população pontuada.
Um preprint é um manuscrito divulgado antes da revisão formal por pares de um periódico. Ele pode circular resultados rapidamente, mas os leitores precisam avaliar as evidências sem a garantia associada à revisão editorial.
Essa rapidez cria tanto valor quanto risco. Pesquisadores podem encontrar descobertas importantes meses antes da publicação em periódicos, mas também enfrentam mais material do que qualquer pessoa pode avaliar de perto.
A QED afirma que uma revisão convencional de todo o seu corpus exigiria entre 860.000 e 1.030.000 horas de trabalho especializado. Essa estimativa equivale a mais de 400 anos de trabalho de pesquisadores, segundo o artigo de validação da empresa.
Seu sistema concluiu as avaliações em horas. Essa diferença explica o apelo, especialmente para financiadores, equipes de pesquisa e empresas que monitoram áreas em rápida evolução.
O resultado não é uma decisão de aceitação. A QED descreve The 1% como um sinal inicial para decidir quais manuscritos merecem atenção.
Essa distinção importa. Um editor de periódico pode solicitar revisões, consultar pareceristas, inspecionar declarações e rejeitar um artigo após encontrar um problema fatal. Uma pontuação condensa um processo diferente em um único número.
A lista pública da QED abrange as categorias de ciências da vida do bioRxiv. A neurociência contribui com 83 artigos selecionados entre 11.058 manuscritos avaliados, enquanto a biologia celular contribui com 55 entre 3.408.
Outras categorias incluem genômica, imunologia, microbiologia, biologia do câncer, bioinformática, genética e biologia sintética. A distribuição reflete tanto o tamanho das áreas quanto as avaliações da QED.
A QED também relata adoção além do projeto de classificação. Em 31 de maio, sua plataforma atendia mais de 10.000 laboratórios em mais de 1.500 instituições de mais de 70 países.
Esses números vêm da QED, e não de uma auditoria independente de uso. Ainda assim, mostram que a avaliação de manuscritos assistida por IA está avançando além de um experimento de laboratório.
Portanto, a questão da Horizon Nature vai além de uma lista. Se pesquisadores usarem a QED para escolher o que ler, citar, financiar ou desenvolver, seus julgamentos poderão moldar a atenção antes do início da revisão por pares.
Essa é a verdadeira mudança. A QED não apenas resumiu preprints. Ela propôs uma porta automatizada na entrada da atenção científica.
Por que o debate da Horizon Nature importa agora
A pressão vem de uma lacuna crescente entre a rapidez com que a pesquisa aparece e a lentidão com que especialistas conseguem avaliá-la.
Servidores de preprints permitem que cientistas compartilhem descobertas sem esperar pelo ciclo completo de revisão de um periódico. Esse modelo se tornou especialmente visível quando pesquisadores precisavam de acesso rápido a evidências biomédicas emergentes.
Ele também eliminou um mecanismo familiar de seleção. Um manuscrito recém-publicado no bioRxiv não tem colocação final em periódico, histórico consolidado de citações nem revisão por pares concluída.
Os pesquisadores compensam isso com sinais imperfeitos. Eles reconhecem laboratórios, instituições, autores, métodos e áreas temáticas. Seguem recomendações sociais e examinam o que ganha destaque em redes profissionais.
Esses hábitos podem economizar tempo, mas também podem reproduzir o viés de prestígio. Trabalhos de uma instituição famosa recebem atenção mais facilmente do que trabalhos igualmente fortes de um grupo desconhecido.
A QED mira essa fragilidade. Seu anúncio de lançamento afirma que cada manuscrito é anonimizado antes da pontuação.
O sistema remove nomes de autores, afiliações e outras informações identificadoras. Ele também ignora contagens de citações, veículos de publicação e reputação de periódicos.
Oded Rechavi, cofundador e cientista-chefe da QED, argumenta que a qualidade científica deve ser julgada pelo próprio trabalho. A avaliação cega pretende impedir que a reputação substitua as evidências.
Esse objetivo tem uma base plausível. A revisão humana pode ser influenciada por status institucional, relações profissionais, idioma e expectativas sobre quem produz trabalho importante.
No entanto, o anonimato não cria neutralidade automaticamente. Um manuscrito pode conter sinais indiretos de sua origem, incluindo temas de pesquisa, equipamentos, conjuntos de dados, padrões de redação e referências.
Um modelo de IA também pode herdar associações de seus dados de treinamento. Remover o nome da instituição da entrada não apaga todas as relações aprendidas durante o desenvolvimento do modelo.
Pesquisas anteriores mostraram por que essa distinção importa. Um estudo de 2024 testou o GPT-3.5 em 30 resumos médicos associados a diferentes afiliações.
Os pesquisadores geraram 232.500 avaliações individuais sob condições de afiliação randomizadas. Seu estudo sobre viés de afiliação constatou que informações institucionais afetavam os julgamentos do modelo.
A anonimização da QED aborda a versão mais direta desse problema. No entanto, a empresa não divulgou detalhes suficientes do sistema para que observadores externos mapeiem todos os caminhos restantes.
O problema de escala também está piorando. A IA generativa reduziu o esforço necessário para redigir texto técnico, criar citações plausíveis e produzir manuscritos bem-acabados.
Isso não significa que todo artigo assistido por IA seja pouco confiável. Significa que a fluência superficial se tornou um sinal ainda mais fraco de qualidade científica.
Richard Sever, cofundador do bioRxiv, descreveu uma possibilidade mais sombria em reportagens sobre conteúdo científico sintético. Sistemas de preprints se tornam mais difíceis de usar quando artigos fabricados sufocam descobertas genuínas.
A avaliação automatizada parece quase inevitável nesse ambiente. Editores e cientistas não podem responder a submissões ilimitadas geradas por máquinas com revisão humana ilimitada.
A QED oferece uma versão da resposta: usar IA para decompor cada manuscrito, testar suas alegações e direcionar a escassa atenção humana para os candidatos mais fortes.
A pressão recai primeiro sobre pesquisadores que realizam revisões de literatura. Ela também alcança editores de periódicos, financiadores, equipes de biotecnologia e qualquer pessoa que tome decisões com base em evidências iniciais.
Esses grupos precisam de filtragem mais rápida. Também precisam saber por que um artigo passou pelo filtro, o que o sistema deixou passar e com que frequência seus erros se repetem.
Uma classificação pode reduzir a sobrecarga de informação ao mesmo tempo que cria uma nova concentração de influência. Se uma pontuação se tornar amplamente confiável, erros na camada de pontuação poderão redirecionar a atenção em toda uma área.
É por isso que o debate chegou agora. A publicação científica precisa de triagem em escala de máquina, mas os padrões para validar essa triagem continuam indefinidos.
O QED Score desafia o prestígio, não a revisão por pares
O argumento mais forte a favor da QED não é que ela substitui a revisão por pares, mas que testa artigos de forma mais direta do que a posição de um periódico.
O QED Score avalia duas dimensões declaradas. A originalidade mede o quanto uma descoberta amplia o conhecimento existente, enquanto a validade mede se as evidências sustentam as conclusões do manuscrito.
A empresa afirma que sua arquitetura multiagente primeiro decompõe cada artigo em uma meta-alegação, alegações principais, alegações relacionadas e experimentos de apoio.
Agentes de IA especializados então examinam diferentes características em paralelo. Eles procuram inconsistências em figuras, fragilidades estatísticas, conflitos com a literatura existente, hipóteses alternativas e problemas com padrões de relato.
Uma camada de verificação reavalia os problemas sinalizados. Uma camada de pontuação classifica alegações individuais, e um agregador combina essas avaliações em um percentil calibrado.
Uma pontuação de 80 significa que o manuscrito ficou acima de 80% do corpus de referência. Não significa que o artigo tenha 80% de probabilidade de estar correto.
Essa distinção é fácil de perder quando um julgamento complexo se transforma em um número familiar. Percentis descrevem posição relativa, não verdade absoluta.
A QED testou sua métrica em três estudos. O primeiro utilizou 925 artigos publicados de 185 autores que especialistas da área haviam colocado nas categorias Limitado, Satisfatório ou Forte.
O pipeline de pontuação não recebeu esses rótulos. A QED relata uma área sob a curva de 0,867 ao separar artigos Limitados das outras categorias.
A área sob a curva, ou AUC, mede quão bem um sistema distingue duas classes. Um valor de 0,5 representa o acaso, enquanto 1,0 representa separação perfeita.
Para 795 artigos com QED Scores e dados de classificação de periódicos, a QED relatou resultados mais fortes em duas comparações. Obteve 0,863 contra 0,804 para identificar artigos Limitados.
Para artigos Fortes, os resultados foram muito mais próximos. A QED relatou 0,782, em comparação com 0,774 para a medida de classificação de periódicos.
O segundo estudo pontuou 4.953 preprints do bioRxiv de abril de 2025. Em seguida, a QED acompanhou onde esses artigos foram publicados posteriormente.
Os pesquisadores associaram 2.879 preprints às versões publicadas com uma classificação de periódico correspondente. A QED relatou uma correlação de Spearman de 0,63 entre suas pontuações de preprints e a classificação posterior dos periódicos.
A correlação variou entre 21 disciplinas. Chegou a 0,78 em genética, mas caiu para 0,39 em biologia de sistemas.
Essas diferenças merecem atenção. Um único percentil multidisciplinar pode ocultar variações significativas no desempenho do modelo, nas convenções de evidência e no comportamento de publicação.
O terceiro estudo concentrou-se em discordâncias. A QED criou 100 pares de artigos em que sua pontuação preferia o artigo publicado no periódico de classificação inferior.
Quinze especialistas da área revisaram os pares sem ver os QED Scores ou os veículos de publicação. Eles produziram 70 julgamentos confiantes, incluindo 60 escolhas decisivas após a exclusão dos empates.
Os especialistas escolheram o artigo favorecido pela QED em 75% desses casos decisivos. O intervalo de confiança relatado de 95% variou de 63% a 84%.
Esse resultado sustenta o argumento da QED de que o prestígio do veículo pode representar incorretamente a qualidade no nível do artigo. Ele não estabelece que a QED consiga identificar a verdade sem julgamento humano.
O veículo de publicação também é uma referência desconfortável. A colocação em um periódico depende de novidade, escopo editorial, momento, apresentação, disponibilidade de pareceristas e escolhas estratégicas de submissão.
Uma pontuação que se correlaciona com a classificação do veículo pode validar o alinhamento com os resultados de publicação existentes. Ela não pode, por si só, validar a alegação de que o sistema escapa dos vieses do sistema de publicação.
A QED reconhece um limite importante. Sua metodologia afirma que The 1% não substitui a revisão por pares.
Esse é o enquadramento sensato. O QED pode priorizar manuscritos para análise, mas um percentil elevado não deve autorizar decisões clínicas nem encerrar disputas científicas.
O principal embate é, portanto, entre avaliação direta e inferência baseada em prestígio. O QED questiona se os leitores deveriam examinar afirmações e evidências em vez de recorrer à reputação de uma revista.
Esse desafio é útil mesmo que a pontuação do QED continue imperfeita. A marca de uma revista sempre condensou muitos julgamentos em uma forma abreviada que os leitores podem usar de maneira inadequada.
Uma pontuação de IA cuidadosamente validada pode se tornar mais um sinal. Ela não deve se tornar o único sinal, nem um novo rótulo de prestígio com menos responsabilização pública.
O que a alegação dos 1% melhores não comprova
Os resultados internos do QED justificam testes rigorosos, mas ainda não justificam confiança incondicional.
A principal limitação é a independência. A QED Science desenvolveu o sistema, elaborou a validação, publicou a metodologia e divulgou os números de desempenho em destaque.
Estudos conduzidos por empresas podem fornecer evidências valiosas. A replicação independente se torna essencial quando o valor comercial de um produto depende das mesmas alegações de desempenho.
Uma análise externa identificou fragilidades nos três estudos de validação. A crítica foi produzida por outro serviço de avaliação de pesquisa baseado em IA, portanto não constitui uma replicação humana definitiva.
Ainda assim, suas questões são concretas. O relatório de análise argumenta que os estudos do QED compartilham sinais de referência relacionados, em vez de oferecer confirmação plenamente independente.
O primeiro estudo depende de categorias de qualidade atribuídas por especialistas. O segundo usa a classificação da revista como resultado. O terceiro seleciona casos em que o QED e a classificação da revista divergem fortemente.
Essa estrutura pode demonstrar consistência nos testes escolhidos pelo QED. Ela deixa em aberto como o sistema atua em decisões prospectivas definidas por pesquisadores externos.
O segundo estudo também associou apenas 2.879 dos 4.953 preprints a versões publicadas com dados de classificação de revistas. Isso deixa 2.074 manuscritos fora da análise de correlação reportada.
Alguns artigos não associados podem ser publicados posteriormente, aparecer em veículos sem a métrica exigida ou nunca chegar à publicação formal. Sua exclusão pode alterar a relação aparente.
Os efeitos de seleção importam porque a publicação não é aleatória. Trabalhos sólidos podem permanecer inéditos, enquanto trabalhos fracos podem sobreviver à revisão.
O terceiro estudo oferece dados convincentes sobre divergências, mas utiliza uma amostra intencionalmente incomum. Os pesquisadores selecionaram pares porque o QED e a classificação da revista apontavam em direções opostas.
Esse desenho testa um conflito relevante. Ele não estima com que frequência o QED faz a melhor escolha entre artigos comuns.
O resultado de preferência de 75% também vem de 60 julgamentos conclusivos. Isso é informativo, mas pequeno em comparação com os 57.455 manuscritos apresentados em The 1%.
A lista selecionada introduz outra questão. “Top 1%” parece objetivo, mas continua sendo relativo ao corpus do QED, ao tratamento das categorias, à versão da pontuação e às dimensões de avaliação escolhidas.
Originalidade e validade são critérios valiosos. Eles não abrangem todas as qualidades que importam para os cientistas.
Um artigo tecnicamente válido pode ser restrito ou pouco importante. Um artigo original pode depender de medições frágeis. Uma replicação pode oferecer originalidade limitada e, ainda assim, fornecer enorme valor científico.
Ética, disponibilidade de dados, transparência metodológica, reprodutibilidade, importância prática e conflitos de interesse também podem afetar como os leitores devem usar um resultado.
Os agentes do QED examinam vários fatores relacionados, mas pessoas externas precisam de mais visibilidade sobre sua ponderação. Também precisam de análises de erros, calibração por área e exemplos de falsos positivos.
A opacidade do modelo levanta questões operacionais. O QED afirma que sua arquitetura combina vários grandes modelos de linguagem com modelos proprietários.
Sua metodologia pública não identifica todos os modelos subjacentes, prompts, pesos dos componentes ou cronogramas de atualização. Esses detalhes podem afetar a reprodutibilidade.
Se um provedor de modelos alterar um sistema, o mesmo manuscrito poderá receber um resultado diferente. O QED precisaria de pontuação versionada e registros de auditoria estáveis para respaldar usos consequentes.
Pesquisas já demonstraram que avaliadores baseados em LLM podem reproduzir vieses sociais. Um grande experimento de economia gerou 27.090 avaliações de 9.030 artigos.
Esse experimento de revisão por pares concluiu que os modelos distinguiam qualidade, mas favoreciam instituições de destaque, autores homens e economistas renomados.
A entrada cega do QED deve reduzir vários desses efeitos. Ela não responde se seu modelo aprendeu outras preferências por métodos conhecidos, temas populares ou estruturas convencionais de argumentação.
O sistema também pode recompensar manuscritos mais fáceis de analisar para os modelos. Uma estrutura clara de afirmações é positiva, mas a legibilidade não deve se tornar um substituto invisível para a força das evidências.
O comportamento adversarial é outra preocupação. Quando os autores entendem o que um sistema de pontuação recompensa, alguns otimizarão seus manuscritos para a métrica.
Esse padrão aparece sempre que rankings distribuem atenção. Mecanismos de busca, métricas universitárias, medidas de citação e fatores de impacto de revistas já incentivaram comportamento estratégico.
Uma pontuação pública, portanto, precisa resistir à manipulação. Também precisa de monitoramento para prompts ocultos, citações fabricadas, evidências duplicadas e táticas estilísticas criadas para influenciar um avaliador.
Os pesquisadores devem tratar o QED como um auxílio de descoberta até que essas questões recebam respostas independentes. Uma pontuação alta pode justificar ler um artigo mais cedo, não acreditar nele mais cedo.
O inverso é igualmente importante. Uma pontuação baixa não deve enterrar discretamente pesquisas não convencionais sem um caminho de recurso ou uma explicação clara.
Para profissionais do conhecimento que acompanham alegações científicas, manter o contexto das fontes é mais importante do que acumular rankings. Uma base de conhecimento pesquisável pode preservar juntos artigos, críticas, atualizações e evidências conflitantes.
Esse fluxo de trabalho mantém a pontuação em seu papel adequado. Ela se torna um filtro associado a uma fonte, não um veredito separado do trabalho subjacente.
Três sinais determinarão se os pesquisadores devem confiar nele
A confiança dependerá de validação independente, desempenho estável entre áreas e evidências de que os cientistas usam a pontuação sem abrir mão de seu julgamento.
O primeiro sinal é um estudo prospectivo e pré-registrado conduzido por pesquisadores externos à QED Science. Equipes independentes devem definir os critérios de avaliação antes de ver os resultados.
Elas devem testar manuscritos inéditos que nem os modelos nem os avaliadores tenham encontrado. O estudo deve incluir artigos publicados, artigos não publicados, replicações, resultados negativos e submissões deliberadamente falhas.
Especialistas externos devem avaliar as afirmações e as evidências sem receber os rótulos do QED. Os pesquisadores poderão então comparar o QED com painéis humanos, decisões de revistas, resultados de replicação e correções posteriores.
Nenhum benchmark isolado oferece uma verdade fundamental perfeita. A concordância entre medidas genuinamente independentes fortaleceria mais a alegação do QED do que outra comparação conduzida pela empresa.
O fracasso nessas condições enfraqueceria a afirmação de que o QED oferece uma medida geralmente confiável da qualidade científica. Ele ainda poderia permanecer útil para tarefas mais restritas de triagem.
O segundo sinal é um desempenho transparente por área ao longo do tempo. O QED já relata correlações que variam de 0,39 a 0,78 entre disciplinas.
Versões futuras devem divulgar padrões de falsos positivos, padrões de falsos negativos, deriva de calibração e alterações na pontuação para cada área. A precisão agregada pode ocultar desempenho fraco em áreas especializadas.
O versionamento é especialmente importante. Cada pontuação deve identificar a versão do sistema, o corpus de referência, a data de avaliação e a incerteza em torno da classificação.
Os pesquisadores também precisam de explicações que conectem as pontuações a afirmações e experimentos específicos. Um percentil sem raciocínio rastreável não pode sustentar correções significativas.
Se o QED publicar resultados estáveis e reproduzíveis por área, seu argumento se tornará mais forte. Se as pontuações mudarem silenciosamente após alterações nos modelos, os pesquisadores devem limitar a ferramenta à descoberta informal.
O terceiro sinal é como as instituições usam a classificação. Recomendações de leitura envolvem riscos menores do que triagens de financiamento, filtros de contratação ou decisões sobre evidências clínicas.
Uma ferramenta que ajuda cientistas a descobrir artigos negligenciados pode reduzir o viés de prestígio. A mesma ferramenta pode criar prestígio algorítmico se as instituições tratarem a pontuação como um critério de corte.
Observe se financiadores e revistas usam o QED junto à revisão por especialistas ou antes dela. Observe também se os autores podem contestar erros e obter nova pontuação após revisões.
A adoção mais saudável preservaria a responsabilidade humana. Os pesquisadores usariam o QED para identificar artigos, examinar seu raciocínio e então avaliar as evidências subjacentes.
A adoção mais arriscada esconderia decisões atrás de um percentil. Uma instituição poderia rejeitar trabalhos automaticamente e afirmar que o processo foi neutro porque os nomes foram removidos.
A pergunta da Nature tem uma resposta condicional. Os pesquisadores devem confiar no QED o suficiente para testar suas recomendações, mas não o bastante para terceirizar o julgamento científico.
O QED apresentou uma resposta crível para um gargalo real. Sua escala, pontuação cega e análise em nível de afirmação merecem cuidadoso exame independente.
O debate Horizon Nature agora precisa de evidências externas à empresa. Nos próximos meses, procure por replicação pré-registrada, relatórios de erros específicos por área e uso institucional divulgado.
Uma pontuação do QED mudaria qual preprint você leria primeiro? Provavelmente deveria mudar. Ela mudaria aquilo em que você acredita sem verificar os métodos e as evidências? Não deveria.



