Sinais da Intel e do MIT Expõem o Ingrediente que Falta à IA para a Ciência
Os sinais da Intel e do MIT agora desafiam uma das suposições mais persistentes da inteligência artificial: mais dados, por si só, não criarão um cientista autônomo. Pesquisas recentes mostram que agentes de IA podem concluir tarefas analíticas estruturadas sem testar evidências, revisar crenças ou justificar conclusões.
Essa distinção importa à medida que empresas de tecnologia e instituições de pesquisa avançam de modelos preditivos para agentes que planejam experimentos e propõem hipóteses. A disputa central já não é entre IA e cientistas humanos. Ela é entre a escalabilidade centrada em dados e sistemas projetados em torno do raciocínio científico.
Uma recente análise sobre IA na ciência enquadra esse debate diante de antigas declarações de que a ciência se aproximava da conclusão. Essas previsões repetidamente subestimaram como novas observações poderiam revelar falhas em teorias aceitas.
A IA introduz uma tentação semelhante. Os modelos agora podem absorver enormes volumes de literatura científica, recuperar artigos relevantes, escrever código e gerar explicações plausíveis. Essa fluência pode fazer o conhecimento acumulado parecer compreensão.
No entanto, a ciência não avança repetindo a resposta mais bem sustentada em um conjunto de dados. Ela avança quando pesquisadores identificam incertezas, desafiam pressupostos, projetam testes capazes de distinguir hipóteses e mudam suas conclusões quando as evidências exigem isso.
Essa é a inversão por trás da mais recente discussão entre Intel e MIT. A maior limitação da descoberta assistida por IA não é necessariamente o acesso a outro conjunto de dados. É se um sistema de IA consegue participar do processo autocorretivo que transforma uma observação em conhecimento defensável.
A Pesquisa da Intel e do MIT Desloca o Foco das Respostas para a Investigação
A mudança importante é que pesquisadores começaram a avaliar como agentes científicos pensam, e não apenas se chegam a uma resposta aceitável.
A primeira geração de aprendizado de máquina científico geralmente tratava de problemas restritos de previsão. Um modelo podia estimar uma estrutura proteica, classificar uma imagem médica ou prever uma propriedade de material a partir de exemplos rotulados.
Esses sistemas conseguiam oferecer resultados úteis sem gerenciar uma investigação inteira. Cientistas ainda escolhiam a pergunta, interpretavam o resultado, verificavam restrições físicas e decidiam qual experimento deveria vir em seguida.
Os agentes de IA prometem um papel mais amplo. Um agente combina um modelo de linguagem com ferramentas, memória, recuperação de informações e um ciclo de controle que lhe permite planejar e executar várias etapas. Na ciência, essas etapas podem incluir pesquisar a literatura, processar observações, escrever código de simulação e propor experimentos.
A promessa parece uma extensão natural da IA orientada por dados. Basta fornecer ao agente publicações e registros laboratoriais suficientes, conectá-lo às ferramentas certas e deixá-lo buscar padrões em uma escala que nenhum pesquisador individual consegue igualar.
No entanto, evidências recentes sugerem que concluir fluxos de trabalho e raciocinar cientificamente são capacidades diferentes. Um agente pode produzir um resultado correto por meio de um processo frágil, assim como um estudante pode acertar uma resposta sem compreender o problema.
Um estudo de 2026 intitulado AI scientists examinou mais de 25.000 execuções de agentes em oito domínios científicos. Os pesquisadores avaliaram tanto o desempenho nas tarefas quanto a estrutura epistêmica do raciocínio dos agentes.
Estrutura epistêmica descreve como um sistema trata evidências, explicações concorrentes, incerteza e possíveis refutações. Esses não são acréscimos decorativos à ciência. Eles determinam se uma conclusão merece confiança.
O estudo constatou que o modelo de linguagem subjacente explicava 41,4% da variância medida no desempenho e no comportamento. A estrutura do agente, isto é, o arcabouço de planejamento e ferramentas ao redor do modelo, explicava apenas 1,5%.
Mais preocupante ainda, os pesquisadores relataram que os agentes ignoraram evidências em 68% dos rastros analisados. A revisão de crenças orientada por refutação apareceu em 26%, enquanto o apoio convergente de múltiplos testes permaneceu incomum.
Essas conclusões não mostram que agentes científicos sejam inúteis. Mostram que um agente pode executar partes da pesquisa sem seguir de forma consistente as práticas de raciocínio que tornam a pesquisa confiável.
O trabalho da Intel em IA cognitiva aponta para uma preocupação técnica semelhante. A Intel Labs defende que sistemas futuros precisam de conhecimento estruturado, raciocínio de senso comum e operações simbólicas ao lado do aprendizado neural.
Pesquisadores do MIT chegaram à questão por outra direção. Eles estão testando se agentes conseguem fazer perguntas úteis, interpretar respostas incompletas e coordenar-se sob incerteza.
Juntos, esses sinais da Intel e do MIT mudam o objetivo. A IA científica precisa se tornar melhor em investigação, e não apenas em gerar respostas refinadas a partir de informações existentes.
Mais Dados Científicos Não Resolvem Explicações Concorrentes
Os dados restringem uma teoria, mas raramente selecionam a melhor explicação sem raciocínio sobre causas, pressupostos e incerteza.
Conjuntos de dados científicos não são coleções neutras de fatos. Eles refletem decisões sobre o que medir, quais instrumentos usar, quais observações excluir e como representar a incerteza.
Um modelo treinado com esses registros pode herdar as mesmas limitações sem reconhecê-las. Ele também pode aprender correlações produzidas por práticas de medição, em vez do fenômeno que os pesquisadores querem explicar.
Mais dados ajudam quando um problema permanece estável e as categorias relevantes são conhecidas. Tornam-se menos decisivos quando pesquisadores enfrentam uma anomalia, um mecanismo desconhecido ou várias teorias compatíveis com as mesmas observações.
Considere um agente de materiais em busca de um eletrólito melhor para baterias. Ele pode classificar compostos usando medições publicadas e propriedades previstas. Essa classificação é útil, mas não estabelece por que um composto se comporta conforme previsto.
Uma variável oculta, um artefato de laboratório ou uma interação não modelada pode produzir a relação aparente. Um sistema científico precisa perguntar qual explicação resistiria a um novo experimento, e não apenas qual padrão aparece com maior frequência.
O mesmo problema surge na biologia. Um agente pode encontrar uma associação entre uma molécula e o desfecho de uma doença. Passar da associação à intervenção exige raciocínio causal, controles, replicação e atenção ao contexto biológico.
O raciocínio causal pergunta o que aconteceria se um fator específico mudasse enquanto outras condições relevantes permanecessem controladas. Os dados de treinamento, por si só, não fornecem automaticamente esse teste contrafactual.
Essa limitação explica por que o progresso científico não pode ser reduzido à ingestão de literatura. As publicações contêm evidências, interpretações, discordâncias e resultados moldados por incentivos. Um sistema de IA precisa distingui-los.
Ele também precisa saber quando um consenso aparente se apoia em pressupostos compartilhados. Se todos os estudos usam o mesmo indicador indireto, outro milhão de observações desse indicador pode reforçar o modelo errado.
Sistemas de recuperação enfrentam um problema adicional. Eles priorizam material considerado relevante para a consulta atual. Isso pode dificultar a descoberta de um resultado negligenciado que contradiz a hipótese inicial do agente.
Quando um agente forma uma explicação plausível, o viés de confirmação pode entrar em seu processo de busca. O sistema pode recuperar evidências favoráveis, interpretar ambiguidades a seu favor e parar quando alcança uma narrativa coerente.
Cientistas humanos são vulneráveis ao mesmo comportamento. A ciência limita essa fraqueza por meio de revisão adversarial, métodos reproduzíveis, experimentos independentes e recompensas pela identificação de erros.
Um agente autônomo precisa de verificações comparáveis dentro de seu processo operacional. Ele deveria buscar deliberadamente evidências que o contradigam, registrar hipóteses descartadas e expor os pressupostos por trás de cada recomendação.
Esses requisitos transformam a IA científica em um problema de arquitetura do conhecimento. Pesquisadores precisam de sistemas que preservem relações entre alegações, fontes, experimentos e revisões.
Essa abordagem se assemelha ao knowledge blending, em que informações recuperadas permanecem conectadas ao contexto de trabalho do usuário. Aplicações científicas exigem uma versão ainda mais rigorosa, com proveniência, incerteza e linhagem experimental.
A questão central, portanto, não é se os dados importam. A IA científica depende de dados de alta qualidade, registros de pesquisa acessíveis e experimentos bem descritos.
O erro é tratar o volume de dados como substituto para o julgamento. Observações adicionais podem reduzir o campo de possibilidades, mas o raciocínio determina qual incerteza importa e quais evidências devem vir em seguida.
Agentes Científicos Ainda Têm Dificuldades Quando a Pergunta É Aberta
Os agentes atuais têm melhor desempenho quando humanos já converteram a descoberta em uma tarefa bem especificada, com uma linha de chegada visível.
Um benchmark pode fazer um sistema de IA parecer científico enquanto elimina a parte mais difícil da ciência. Se o prompt define o problema, fornece as ferramentas relevantes e especifica a regra de avaliação, o agente precisa principalmente executar.
A pesquisa real frequentemente começa antes que qualquer um desses elementos esteja definido. Cientistas precisam decidir qual pergunta vale a pena fazer, qual medição seria informativa e qual resultado os faria mudar de ideia.
O benchmark SciAgentArena, de 2026, tenta reduzir essa lacuna. Ele contém aproximadamente 200 tarefas extraídas de cenários de pesquisa científica e usa verificação passo a passo em um ambiente interativo.
Seus autores constataram que os agentes atuais podem contribuir de forma eficaz para fluxos de trabalho de análise de dados claramente especificados. O desempenho tornou-se menos consistente quando as tarefas exigiam exploração aberta, insight inédito ou soluções robustas sem um caminho predefinido.
Esse resultado identifica quem enfrenta pressão com as novas evidências. Desenvolvedores de agentes de propósito geral já não podem equiparar o uso bem-sucedido de ferramentas à autonomia científica.
Organizações de pesquisa também enfrentam pressão. Se implantarem agentes com base em benchmarks de resposta final, correm o risco de automatizar um processo que produz conclusões plausíveis sem justificativa confiável.
Laboratórios precisam de avaliações que examinem decisões intermediárias. O agente reconheceu evidências conflitantes? Escolheu um experimento capaz de separar duas hipóteses? Atualizou sua confiança depois disso?
A distinção também muda o papel da orquestração de agentes. Adicionar agentes especializados em literatura, programação, estatística e revisão pode aumentar a cobertura. Isso não garante que o grupo siga um método científico coerente.
Vários agentes podem reforçar o mesmo erro. Se compartilham um modelo-base, distribuição de treinamento ou sistema de recuperação, o aparente consenso pode refletir uma falha correlacionada, e não confirmação independente.
Equipes científicas evitam esse problema usando instrumentos, métodos, amostras e perspectivas teóricas diferentes. Sistemas de agentes precisam de diversidade significativa, e não de múltiplas cópias de um modelo com diferentes cargos atribuídos.
A pesquisa do MIT sobre questionamento colaborativo oferece um exemplo concreto. Em um jogo controlado, agentes precisavam fazer perguntas que ajudassem um parceiro a localizar objetos escondidos sob comunicação limitada.
O estudo sobre questionamento constatou que um modelo menor, cuidadosamente treinado, podia superar modelos muito maiores nesse ambiente. A melhoria veio da escolha de perguntas segundo seu valor informacional esperado.
Isso é importante para a ciência porque a descoberta depende da seleção de observações que reduzem a incerteza. Um modelo grande pode conhecer mais fatos e, ainda assim, formular uma pergunta fraca.
O resultado também desafia a ideia de que a quantidade de parâmetros, por si só, determina a qualidade de um agente. Um agente científico eficaz precisa de uma política para decidir o que não sabe e qual ação resolveria essa incerteza.
O trabalho da Intel com raciocínio estruturado e simbólico se encaixa nesse mecanismo. Métodos simbólicos representam entidades, regras e relações de forma explícita, permitindo que um sistema as manipule sob restrições definidas.
Os modelos neurais continuam valiosos porque podem interpretar linguagem não estruturada e detectar padrões em grandes conjuntos de dados. A arquitetura científica mais robusta provavelmente combinará esses pontos fortes com hipóteses explícitas, modelos causais e ferramentas de verificação.
Esse desenho híbrido cria um objetivo de engenharia diferente. O sistema precisa preservar a incerteza em vez de imediatamente comprimí-la em uma única resposta confiante.
Ele também deve separar a recuperação de informações da avaliação. Encontrar um artigo não é o mesmo que decidir se seus métodos sustentam a afirmação em questão.
O papel mais crível dos agentes no curto prazo é, portanto, a colaboração delimitada. Eles podem pesquisar, calcular, simular e redigir explicações candidatas, enquanto os cientistas mantêm a responsabilidade pela formulação e validação.
Esse arranjo é menos dramático do que um cientista de IA plenamente autônomo. Também está mais próximo do que as evidências sustentam.
O Verdadeiro Adversário É a Escala de Dados sem Raciocínio Científico
O conflito central está entre sistemas otimizados para reproduzir resultados bem-sucedidos e sistemas treinados para conduzir um processo de investigação defensável.
A ampliação da escala de dados transformou a IA moderna porque muitas tarefas melhoram quando os modelos encontram mais exemplos. Modelagem de linguagem, reconhecimento de imagens e conclusão de código se beneficiam de ampla exposição a padrões.
A ciência inclui reconhecimento de padrões, mas a descoberta também contém uma camada normativa. Pesquisadores precisam decidir o que conta como evidência, como a incerteza deve afetar uma afirmação e quando uma explicação falhou.
Essas decisões não podem ser julgadas apenas pela correspondência com uma resposta conhecida. Questões de fronteira não têm gabarito, e o resultado mais interessante pode contradizer a literatura existente.
Recompensas baseadas em resultados criam um risco específico. Se desenvolvedores recompensam um agente sempre que sua resposta final se assemelha a uma conclusão aceita, o modelo pode aprender a imitar o consenso sem aprender por que esse consenso é justificado.
Uma previsão correta produzida por meio de uma relação espúria continua sendo cientificamente fraca. Ela pode falhar sob uma nova condição, e o sistema pode não oferecer nenhum sinal confiável de quando essa falha ocorrerá.
A supervisão de processo oferece uma resposta. Ela avalia etapas intermediárias, como se um agente usou evidências corretamente, testou alternativas e calibrou sua confiança.
No entanto, o processo científico é mais difícil de pontuar do que a aritmética. Uma prova matemática às vezes pode ser verificada linha a linha, enquanto um argumento científico pode depender de evidências incompletas e de julgamento específico da área.
Pesquisadores propuseram a ideia de alinhamento científico, segundo a qual sistemas de IA devem seguir os valores epistêmicos que tornam as conclusões científicas utilizáveis. Eles incluem rastreabilidade, coerência, verificabilidade, calibração e inteligibilidade.
Um artigo de 2026 sobre alinhamento científico argumenta que métricas comuns de desempenho não capturam esses valores. O texto defende benchmarks e sistemas de recompensa concebidos em torno da prática científica.
Essa proposta não exige que os modelos copiem todas as convenções da pesquisa humana. Instituições científicas contêm vieses, incentivos de publicação e acesso desigual que não devem ser codificados cegamente.
Em vez disso, o objetivo é preservar os elementos que favorecem a correção. As afirmações devem se conectar às evidências, as premissas devem permanecer visíveis e observações contraditórias devem acionar uma revisão.
Um agente científico alinhado manteria várias hipóteses ativas, em vez de selecionar imediatamente uma única narrativa. Ele identificaria o experimento mais capaz de distingui-las.
Também diferenciaria ausência de evidência de evidência de ausência. Modelos de linguagem frequentemente confundem esse limite porque ambas podem aparecer em contextos linguísticos semelhantes.
A calibração da confiança é outro requisito. Um sistema calibrado demonstra menor confiança quando suas evidências são escassas, conflitantes ou estão muito fora de sua distribuição de treinamento.
Isso parece básico, mas uma linguagem fluente pode ocultar uma calibração fraca. Um parágrafo confiante não revela se a inferência subjacente se apoia em uma fonte indireta ou em vários experimentos independentes.
A discussão entre Intel e MIT é útil porque une arquitetura e comportamento. A direção de raciocínio estruturado da Intel trata de como conhecimento e regras são representados. A pesquisa de agentes do MIT examina como os sistemas coletam informações e agem sob incerteza.
Nenhuma das abordagens sugere abandonar modelos grandes ou conjuntos de dados extensos. Ambas sugerem inserir esses recursos em um processo construído para investigação e correção.
Esse mecanismo também determina se a IA pode contribuir para mudanças conceituais. Um modelo treinado para minimizar surpresa frequentemente favorecerá explicações próximas ao centro de sua distribuição de treinamento.
Um agente científico precisa, às vezes, preservar a surpresa. Uma anomalia pode ser ruído, mas também pode indicar onde um modelo aceito deixa de funcionar.
O sistema não deve celebrar toda contradição como uma descoberta. Ele deve classificar anomalias por credibilidade, reprodutibilidade e capacidade de distinguir entre explicações.
Isso exige raciocínio que atravesse dados, instrumentos e teoria. É um objetivo muito mais exigente do que produzir outra sequência provável de palavras.
A Geração Mais Rápida de Hipóteses Cria um Gargalo de Validação
Se agentes gerarem ideias mais rápido do que pesquisadores conseguem testá-las, a produção científica aumenta enquanto a confiança em cada resultado pode cair.
O risco mais imediato de cientistas de IA não é que deixem de gerar respostas. É que gerem respostas plausíveis demais para que as instituições existentes consigam avaliá-las.
Um agente pode pesquisar milhares de artigos, combinar conceitos distantes e propor experimentos candidatos sem parar. A capacidade de laboratório, a revisão por pares e a atenção de especialistas não escalam no mesmo ritmo.
Pesquisadores do Google DeepMind descrevem isso como um gargalo de validação. À medida que a produção de hipóteses acelera, a ciência precisa de melhor infraestrutura para verificar proveniência, reproduzir resultados e priorizar experimentos.
Esse gargalo enfraquece a afirmação simplista de que mais produção de IA significa automaticamente descoberta mais rápida. A taxa útil não é a de hipóteses geradas por hora. É a de hipóteses críveis testadas e incorporadas ao conhecimento compartilhado.
Revisores automatizados podem ajudar a filtrar submissões, mas introduzem preocupações com riscos correlacionados. Um revisor construído a partir da mesma família de modelos pode ignorar a mesma premissa sem sustentação que o agente gerador.
A verificação independente deve envolver mais do que perguntar a outro chatbot se uma resposta parece correta. Ela pode exigir dados separados, modelos diferentes, verificações formais, simulações ou experimentos físicos.
A validação física é especialmente importante porque os modelos científicos interagem com o mundo. Uma síntese química pode falhar por impurezas, sensibilidade à temperatura ou detalhes de manuseio ausentes na literatura.
Um agente de IA pode recomendar um experimento que seja teoricamente informativo, mas impraticável ou inseguro. Especialistas do domínio precisam avaliar restrições que nunca foram plenamente representadas em seus dados de treinamento.
A proveniência dos dados cria outra vulnerabilidade. Agentes frequentemente combinam afirmações de fontes com diferentes padrões de evidência. Um resultado revisado por pares, uma pré-publicação e uma entrada de banco de dados não verificada podem se tornar frases adjacentes em uma resposta confiante.
Um sistema confiável deve mostrar a origem de cada afirmação e como ela mudou durante o raciocínio. Não deve ocultar divergências sob um resumo fluido.
O ceticismo também deve se estender aos resultados de benchmarks. Um desempenho forte em aproximadamente 200 tarefas interativas não estabelece que um agente possa gerir todos os domínios de pesquisa.
Benchmarks necessariamente simplificam a realidade, e os modelos podem se tornar otimizados para sua estrutura recorrente. Um sistema que se sai bem em biologia computacional ainda pode falhar em um laboratório físico ou em um estudo de campo.
O estudo de mais de 25.000 execuções de agentes também permanece uma pré-publicação até a data de publicação. Sua ampla base experimental o torna valioso, mas a replicação independente e a revisão por pares continuam importantes.
Suas porcentagens não devem se tornar constantes universais para todos os agentes científicos. Elas descrevem os sistemas, tarefas e métodos de pontuação avaliados.
Ainda assim, é difícil descartar o alerta central. Agentes que ignoram evidências durante uma avaliação controlada não devem receber autoridade sem supervisão sobre pesquisas caras ou sensíveis à segurança.
As organizações devem separar assistência de autonomia. Um agente pode preparar um mapa da literatura sem decidir que um tratamento funciona. Pode sugerir um experimento sem controlar equipamentos perigosos.
As equipes também precisam de registros de raciocínios que falharam, e não apenas de resultados bem-sucedidos. Falhas ocultas impedem que pesquisadores aprendam quais tarefas excedem a competência do sistema.
É nesse ponto que o argumento Intel-MIT se torna operacional. O raciocínio científico precisa ser incorporado a fluxos de trabalho, avaliações e etapas de revisão antes que as instituições ampliem a implantação de agentes.
Caso contrário, o resultado será uma produção de conteúdo mais rápida ligada a uma verificação mais lenta e mais cara. Isso é automação da aparência científica, não progresso científico.
Três Sinais Mostrarão se Agentes de IA Estão se Tornando Cientistas
A próxima etapa deve ser julgada pela revisão de crenças, validação no mundo real e replicação independente, e não por demonstrações cada vez mais refinadas.
O primeiro sinal é o surgimento de benchmarks científicos de nível de processo. Esses testes devem avaliar se um agente procura contraevidências, distingue correlação de causalidade e revisa sua posição após uma previsão fracassada.
Um resultado de benchmark se torna mais persuasivo quando o rastro de raciocínio é auditável e a tarefa permanece oculta antes da avaliação. O sucesso sob essas condições reforçaria o argumento de que o raciocínio científico pode se tornar uma capacidade treinável.
O fracasso reforçaria a conclusão atual de que agentes de propósito geral executam principalmente fluxos de trabalho estruturados. Também mostraria que adicionar ferramentas e memória não resolve a lacuna subjacente de raciocínio.
O segundo sinal é a validação experimental de ponta a ponta. As equipes de pesquisa devem relatar quantas hipóteses geradas por agentes sobrevivem aos testes de laboratório, e não apenas quantas ideias o agente produz.
A evidência mais forte virá de casos em que o agente seleciona um experimento informativo, recebe um resultado inesperado e altera sua teoria de trabalho. Essa sequência testa o ciclo científico completo.
Uma descoberta bem-sucedida isolada atrairá atenção, mas o desempenho repetido importa mais. Pesquisadores precisam saber se o processo funciona em novas tarefas e se as falhas continuam detectáveis.
O terceiro sinal é a replicação independente por equipes que usam diferentes modelos, ferramentas e conjuntos de dados. A replicação pode revelar se um resultado depende das premissas ocultas de um agente ou do desenho de um benchmark.
A concordância entre cópias do mesmo modelo subjacente não deve contar como confirmação independente. Uma replicação significativa exige separação metodológica suficiente para expor erros correlacionados.
Esses sinais também esclarecem o mercado de curto prazo para agentes científicos. Sistemas que documentam a incerteza e se integram à revisão humana devem conquistar mais confiança do que produtos que prometem descobertas autônomas apenas por meio de escala.
Para desenvolvedores, a prioridade prática é criar agentes que exponham seu estado de trabalho. Cada hipótese deve estar conectada a fontes, premissas, testes planejados, resultados observados e revisões posteriores.
Para líderes de pesquisa empresarial, a avaliação deve começar com tarefas delimitadas. As equipes podem comparar as recomendações dos agentes com as decisões de especialistas e acompanhar onde ambas divergem.
Profissionais do conhecimento devem se importar porque a mesma distinção vai além dos laboratórios. Um agente que revisa contratos, pesquisa de produtos ou evidências de clientes também pode produzir uma resposta plausível sem testar as premissas subjacentes.
É por isso que o debate Intel MIT tem uma importância mais ampla. Ele pergunta se os sistemas de IA apenas acelerarão resultados conhecidos ou melhorarão a qualidade do raciocínio que os produz.
Mais dados continuarão sendo essenciais. Modelos melhores serão importantes, e ferramentas especializadas ampliarão o que os agentes podem fazer.
Nenhum desses investimentos elimina a necessidade de um processo autocorretivo. O conhecimento científico conquista seu status porque uma afirmação pode ser questionada, rastreada, testada e revisada.
O próximo cientista de IA confiável não será definido por quantos artigos leu. Será definido pelo que faz quando as evidências mostram que sua primeira resposta estava errada.
Pesquisadores, desenvolvedores e compradores de tecnologia devem agora fazer uma pergunta mais difícil a cada agente científico: o sistema consegue mostrar quais evidências o fariam mudar de opinião?
Se essa resposta continuar pouco clara, o agente ainda será um assistente de pesquisa competente, e não um cientista autônomo. Essa distinção deve orientar a forma como as organizações avaliam as próximas alegações de pesquisa Intel MIT e todas as demonstrações de IA científica que vierem a seguir.



