top of page

P&D de IA da Anthropic Claude Alcança 26%, mas Humanos Ainda Mantêm o Controle

há 5 dias
15 min de leitura

A Anthropic afirma que Claude agora lidera 26% de sua pesquisa e desenvolvimento internos de IA, embora não execute de forma totalmente autônoma nenhuma das tarefas medidas. O indicador de P&D de IA da Anthropic Claude descreve tarefas concluídas majoritariamente a partir de uma instrução de alto nível, com pessoas supervisionando, corrigindo e aprovando o resultado.

Essa distinção torna a divulgação mais relevante, não menos. Claude não se limita mais a responder às perguntas de pesquisadores ou gerar trechos isolados de código. Ele executa cada vez mais partes interligadas do trabalho usado para desenvolver sistemas de IA posteriores.

A descoberta também cria uma tensão na posição pública da Anthropic. A empresa quer que laboratórios de fronteira divulguem mais informações sobre a aceleração do desenvolvimento e coordenem esforços em torno da segurança. Ao mesmo tempo, seus próprios sistemas estão ajudando esse desenvolvimento a avançar mais rapidamente.

A questão central, portanto, não é se Claude está projetando de forma independente seu sucessor. A Anthropic diz que não está. A questão é se a supervisão humana consegue escalar tão rapidamente quanto a pesquisa automatizada que precisa avaliar.

O Que a P&D de IA da Anthropic Claude Realmente Mede

O número de 26% mede liderança supervisionada em tarefas, não um laboratório de IA autônomo.

A Anthropic divulgou o número em um relatório de 17 de setembro sobre a medição do desenvolvimento em laboratórios de IA de fronteira. A empresa publicou três indicadores propostos, cobrindo pesquisa conduzida por IA, supervisão de agentes e alocação de recursos computacionais.

Suas medições de desenvolvimento classificam tarefas de pesquisa em uma escala de automação de seis níveis. A escala vai de nenhuma participação significativa de IA até trabalho concluído sem participação humana.

No nível três, chamado de “colabora”, a IA executa grandes partes de uma tarefa sob orientação humana próxima. Uma pessoa ainda toma decisões fundamentais e integra o trabalho resultante.

No nível quatro, chamado de “lidera”, a IA conclui a maior parte de uma tarefa a partir de uma solicitação de alto nível. Humanos supervisionam o processo, redirecionam-no quando necessário e aprovam o resultado final.

A Anthropic afirma que Claude atingiu pelo menos o nível de liderança em 26% do trabalho medido de pesquisa e desenvolvimento de IA em agosto de 2026. Essa participação estava abaixo de 1% em fevereiro, segundo o relatório da empresa.

Mais de 90% do trabalho medido atingiu pelo menos o nível de colaboração. Esse número mais amplo inclui os 26% classificados como liderados por IA, portanto os dois indicadores não devem ser somados.

A empresa afirma que nenhuma categoria medida atingiu o nível cinco, que representa trabalho de ponta a ponta com pouca ou nenhuma participação humana. Claude, portanto, continua fazendo parte de um sistema de desenvolvimento orientado por humanos.

O índice subjacente tenta medir mais do que o uso de ferramentas. Ele pergunta quem executa a tarefa, quem escolhe a direção e quanta intervenção ainda é necessária.

Essa abordagem separa o controle significativo do fluxo de trabalho de estatísticas mais simples, como o volume de código gerado. Um modelo pode produzir uma grande quantidade de código, deixando decisões de arquitetura, avaliação e implantação para as pessoas.

A Anthropic construiu seu catálogo de tarefas examinando registros internos, incluindo documentação da empresa e comunicações no ambiente de trabalho. Em seguida, organizou as atividades em uma hierarquia que abrange responsabilidades de pesquisa e engenharia.

A empresa usou IA para classificar as tarefas e também pediu aos funcionários que avaliassem o trabalho em suas áreas. Essas classificações foram ponderadas pelo tempo estimado da equipe, dando maior influência às categorias de trabalho mais amplas.

Esse método oferece uma visão excepcionalmente detalhada de um laboratório. Ele não fornece um parâmetro de referência do setor verificado de forma independente.

As definições também envolvem julgamento. Uma tarefa rotulada como “liderada” ainda pode exigir revisão humana substancial, contexto especializado ou vários ciclos de correção antes que seu resultado se torne útil.

É por isso que a formulação precisa importa. A medição de P&D de IA da Anthropic Claude mostra uma mudança rápida na divisão do trabalho. Ela não estabelece que Claude compreende ou controla todo o processo de desenvolvimento de modelos.

Mesmo com essa limitação, o aumento relatado exige atenção. Passar de quase nenhum trabalho liderado por IA para 26% em poucos meses sugere que o sistema interno de produção do laboratório está mudando mais rápido do que sua estrutura de pessoal.

O resultado introduz a tensão central do artigo. A capacidade de pesquisa pode se expandir por meio de software, enquanto a supervisão confiável ainda depende de pessoas com tempo e atenção limitados.

Pesquisa Mais Rápida Pressiona a Revisão Humana

Automatizar a execução gera mais experimentos, código e propostas para os humanos inspecionarem, tornando a revisão o próximo gargalo crítico.

Laboratórios de IA tradicionalmente ampliam a pesquisa contratando especialistas e adicionando capacidade computacional. Sistemas baseados em agentes introduzem outro caminho ao permitir que as equipes existentes executem mais trabalho em paralelo.

Um agente de IA é um modelo conectado a ferramentas, memória e um ciclo de execução. Ele pode conduzir atribuições de múltiplas etapas, em vez de responder apenas a uma instrução.

A Anthropic relata que cerca de 30.000 agentes realizavam trabalho de pesquisa e engenharia dentro da empresa em qualquer momento durante o período de medição. Esse número descreve processos de software simultâneos, não pesquisadores autônomos separados.

A empresa afirma que as ações dos agentes passam por monitoramento online antes da execução. Também relata que sistemas offline revisam essas ações posteriormente.

Esse arranjo pode ampliar a quantidade de trabalho iniciada por uma equipe humana. Ele também pode multiplicar o número de decisões, resultados intermediários e comportamentos incomuns que os sistemas de monitoramento precisam processar.

A Anthropic relatou mais de um bilhão de decisões de agentes durante agosto. Seu sistema de monitoramento bloqueou aproximadamente uma decisão a cada 47.000, segundo a medição interna da empresa.

Uma baixa taxa de intervenção admite várias interpretações. A maioria das ações pode ser rotineira e aceitável, ou os monitores podem estar aplicando padrões restritos de bloqueio. A taxa publicada, por si só, não permite distinguir entre essas explicações.

A empresa reconhece que o monitoramento de agentes continua sendo uma disciplina emergente. Seu relatório afirma que a Anthropic opera esses sistemas de monitoramento há meses, não anos.

Esse histórico operacional limitado importa porque falhas em ambientes de pesquisa nem sempre são óbvias. Um erro de programação pode provocar uma falha de teste, mas uma premissa experimental defeituosa pode produzir resultados plausíveis.

Revisores humanos precisam avaliar mais do que se uma saída funciona. Eles precisam verificar pressupostos, métodos, implicações de segurança e se um resultado aparentemente bem-sucedido responde à pergunta pretendida.

A Anthropic descreveu separadamente a revisão humana de código como uma restrição crescente. Em sua discussão sobre melhoria recursiva, a empresa afirma que o aumento da produção de código transferiu a pressão para a revisão.

Este é um exemplo da lei de Amdahl, que afirma que a velocidade geral de um sistema continua limitada por seu componente mais lento. Acelerar a geração de código não pode eliminar atrasos em validação, coordenação ou julgamento.

A mesma restrição se aplica além do código. Agentes podem propor muitos experimentos, mas os laboratórios ainda precisam selecionar ideias úteis, alocar recursos computacionais e interpretar resultados conflitantes.

Isso muda o significado de “produtividade” dentro de um laboratório de fronteira. Pesquisadores podem dedicar menos tempo à redação de implementações individuais e mais tempo à definição de tarefas, à verificação de evidências e à gestão de trabalhadores automatizados.

Essas responsabilidades exigem sistemas e habilidades diferentes. As equipes precisam de registros rastreáveis, atribuição clara de responsabilidade e formas confiáveis de recuperar o contexto por trás da decisão de um agente.

Uma base de conhecimento de IA pesquisável pode ajudar equipes comuns a preservar esse contexto. Laboratórios de fronteira precisam de versões consideravelmente mais rigorosas, com controles de acesso, monitoramento e registros reproduzíveis.

A pressão se estende além da Anthropic. Se agentes supervisionados permitem que um laboratório teste mais ideias, os rivais enfrentam incentivos para ampliar seu próprio uso de pesquisa automatizada.

OpenAI, Google DeepMind e outros desenvolvedores de fronteira não precisam adotar o índice exato da Anthropic para sentir essa pressão competitiva. Ainda assim, precisam decidir quanto trabalho de desenvolvimento delegar e divulgar.

A resposta imposta é tanto técnica quanto institucional. Os concorrentes precisam de agentes mais fortes, mas também de evidências confiáveis de que seus sistemas de avaliação conseguem acompanhar o ritmo.

Essa corrida não será decidida pela maior contagem de agentes. A vantagem mais importante pertencerá aos laboratórios que transformarem trabalho paralelo em melhorias confiáveis de modelos sem sobrecarregar a supervisão humana.

A Verdadeira Disputa É Aceleração Versus Verificabilidade

A divulgação da Anthropic mostra que o desenvolvimento assistido por IA está acelerando antes que observadores externos disponham de métodos comuns para verificar sua velocidade ou segurança.

O principal conflito não é Claude contra outro chatbot. É a capacidade de pesquisa automatizada contra a capacidade de humanos e instituições verificarem essa capacidade.

A estrutura de medição da Anthropic baseia-se parcialmente em uma taxonomia de automação desenvolvida pela Epoch AI. Esse trabalho divide a participação da IA em seis níveis e os aplica a tarefas de pesquisa.

A taxonomia de automação da Epoch também enfatiza a incerteza. Seus autores descrevem as classificações como subjetivas e convidam a trabalhos adicionais sobre definições e validação de tarefas.

A subjetividade não torna o índice inútil. Ela significa que os leitores devem tratar 26% como uma estimativa interna estruturada, e não como uma pontuação de desempenho universalmente comparável.

Um laboratório pode definir tarefas em diferentes níveis de detalhe. “Executar uma avaliação” pode contar como uma única tarefa, enquanto outra estrutura separa preparação, execução, análise e relatório.

Essas escolhas afetam a participação resultante da automação. Tarefas amplas dão mais peso ao planejamento humano, enquanto tarefas estreitas podem enfatizar as etapas concluídas por um agente.

A ponderação pelo tempo da equipe introduz outro julgamento. A alocação histórica de mão de obra pode não refletir quais tarefas são estrategicamente importantes ou quais erros criam o maior risco.

A estrutura também usa IA no processo de medição. A Anthropic afirma que classificações geradas por modelos foram comparadas a avaliações de funcionários familiarizados com o trabalho relevante.

Essa verificação cruzada é útil, mas não elimina toda a circularidade. A empresa está usando Claude para ajudar a classificar quanto Claude contribui dentro da empresa.

A avaliação independente é, portanto, essencial. A Anthropic afirma que planeja incorporar avaliadores externos e dar-lhes acesso comparável ao das equipes internas de risco.

Esse acesso iria além da revisão de demonstrações públicas ou resultados selecionados de benchmarks. Os avaliadores precisariam de visibilidade suficiente para inspecionar definições, amostras, registros e procedimentos de classificação.

A Anthropic anunciou uma parceria de avaliação relacionada com a Accenture. A empresa descreve o acordo como um passo para aproximar avaliadores independentes dos sistemas e dados internos.

O valor desse modelo dependerá da autoridade e da liberdade de divulgação. Um avaliador precisa acessar evidências incômodas, não apenas materiais preparados para exame.

A publicação regular também importa. Um único retrato de agosto estabelece uma linha de base, mas não pode mostrar se o aumento continua, desacelera ou se reverte.

Relatos comparáveis de outros laboratórios acrescentariam mais uma camada de evidências. Sem isso, ninguém pode dizer se a Anthropic é incomumente automatizada ou apenas incomumente transparente.

Os incentivos competitivos complicam essa comparação. Um laboratório pode querer divulgar a aceleração da pesquisa a investidores e recrutas, ao mesmo tempo que limita detalhes que ajudariam rivais.

Os incentivos de segurança podem apontar na direção oposta. Divulgar uma automação rápida pode reforçar argumentos em favor de regulamentação, limites coordenados ou avaliações externas obrigatórias.

A Anthropic está tentando sustentar abertamente ambas as posições. Ela apresenta um desenvolvimento interno mais rápido como evidência de capacidade e como motivo para maior visibilidade pública.

Essa é a inversão central. A empresa que desenvolve sistemas mais rápidos também argumenta que a sociedade precisa de ferramentas melhores para acompanhar essa aceleração.

A tensão não torna a divulgação contraditória. Ela torna a qualidade das medições propostas central para a credibilidade da Anthropic.

Se o índice se tornar reproduzível e auditado de forma independente, poderá ajudar governos a identificar mudanças relevantes antes que surja a autonomia plena. Se continuar sendo autodeclarado, corre o risco de se tornar mais um indicador corporativo de progresso.

A reportagem inicial destaca corretamente a distinção entre liderança e autonomia. Essa distinção deve permanecer visível à medida que o número de destaque circula.

O dado de P&D em IA da Anthropic com Claude é mais útil como medida das mudanças nas fronteiras do fluxo de trabalho. É menos útil como uma contagem regressiva para uma explosão de inteligência.

Uma tendência verificada ainda poderia se tornar um sinal de alerta precoce. O desafio é estabelecer essa verificação antes que a competição estratégica torne a transparência mais difícil.

O Que o Número de 26% Não Prova

O papel crescente do Claude não demonstra que ele possa escolher de forma independente direções valiosas de pesquisa ou validar com segurança suas próprias conclusões.

O risco mais evidente é interpretar demais a palavra “lidera”. Na escala da Anthropic, liderança ainda inclui supervisão, correção e aprovação humanas.

Essas atividades podem conter as partes mais difíceis da pesquisa. Escolher uma questão promissora, reconhecer um resultado enganoso e decidir se as evidências são suficientes continuam sendo julgamentos importantes.

Um agente pode executar a maior parte das etapas visíveis enquanto depende de um humano para a decisão que determina se o trabalho importa. Uma porcentagem baseada na conclusão de tarefas pode subestimar essa dependência.

O índice também cobre o trabalho dentro de uma única empresa. As ferramentas, a documentação, as práticas de equipe e o acesso a modelos da Anthropic diferem dos encontrados em universidades ou outros laboratórios.

O Claude pode ter desempenho especialmente bom em um ambiente projetado em torno do Claude. Essa vantagem diz algo sobre integração vertical, mas menos sobre autonomia geral de pesquisa.

Outra incerteza diz respeito à correlação de erros. Milhares de agentes que usam modelos relacionados podem repetir a mesma premissa, padrão de código ou fragilidade de avaliação.

O paralelismo não garante raciocínio independente. Ele pode reproduzir um ponto cego em muitos fluxos de trabalho mais rapidamente do que uma pequena equipe humana conseguiria.

A Anthropic diz que seus agentes têm identidades persistentes e se comunicam por meio de sistemas compartilhados. Esses recursos favorecem a rastreabilidade e permitem que os agentes examinem as alegações uns dos outros.

No entanto, arquitetura e treinamento compartilhados ainda podem gerar falhas correlacionadas. A revisão entre agentes não equivale à revisão por um modelo independente, especialista humano ou instituição externa.

O monitoramento cria seu próprio problema de medição. Um sistema pode bloquear padrões conhecidos, mas falhas novas podem não corresponder às regras de detecção existentes.

A Anthropic reconhece abertamente essa limitação. A empresa afirma não poder ter certeza de que o monitoramento atual captura todos os comportamentos relevantes em toda a atividade de seus agentes.

A alocação de computação levanta outra questão. A Anthropic mediu quanto da computação de pesquisa apoiou o trabalho de segurança durante uma semana em julho.

A empresa informa que cerca de 6% da computação de pesquisa e desenvolvimento em IA foi destinada à segurança. A parcela chegou a cerca de 12% dentro da computação usada especificamente para pesquisa de IA conduzida por IA.

A Anthropic classifica essas estimativas como conservadoras e adverte que a computação é um indicador imperfeito. O trabalho de segurança pode exigir extensa análise humana sem consumir grandes quantidades de processamento.

Esses números, portanto, não devem se tornar uma pontuação simples de segurança. É melhor tratá-los como sinais operacionais que ganham significado quando acompanhados de forma consistente.

As definições voltarão a importar. Pesquisas de interpretabilidade, ferramentas de monitoramento e avaliações de capacidade podem apoiar a segurança e, ao mesmo tempo, melhorar produtos ou a velocidade de desenvolvimento.

A Anthropic afirma que o trabalho que avançou segurança e capacidades de forma igual foi contabilizado como desenvolvimento de pesquisa, e não como segurança. Outro laboratório poderia escolher uma fronteira mais generosa.

Revisores externos devem testar essas fronteiras. Caso contrário, mudanças de categorização podem parecer mudanças no investimento em segurança, mesmo quando as operações permanecem semelhantes.

O argumento mais amplo da empresa sobre melhoria recursiva também merece cautela. Codificação e experimentação mais rápidas podem acelerar o desenvolvimento sem produzir um sistema autodirigido que projeta seu sucessor.

A pesquisa contém gargalos fora da execução do modelo. Disponibilidade de hardware, dados de treinamento, infraestrutura física, decisões organizacionais e tempo de avaliação podem limitar o progresso.

A aprovação humana não é um detalhe técnico menor. Atualmente, ela é a linha que separa a categoria de liderança relatada pela Anthropic da autonomia plena.

O resultado de 26% se torna mais preocupante apenas se a carga de supervisão cair enquanto a complexidade das tarefas aumenta. Torna-se menos preocupante se melhor monitoramento e auditoria independente crescerem no mesmo ritmo.

É por isso que a interpretação mais precisa continua sendo restrita. O Claude teria assumido responsabilidade por parcelas maiores do fluxo de desenvolvimento da Anthropic, sob controle humano contínuo.

A divulgação fornece evidências de aceleração. Ela não prova autoaperfeiçoamento, julgamento científico independente ou controle confiável em maior escala.

O Papel Maior do Claude Muda a Economia do Desenvolvimento de IA

O efeito imediato é a alavancagem organizacional, pois uma equipe de pesquisa pode iniciar mais engenharia e experimentação sem um crescimento equivalente no número de funcionários.

O desenvolvimento de modelos de fronteira já exige grandes clusters de computação, pesquisadores especializados e ampla infraestrutura de dados. Agentes de IA acrescentam uma camada de trabalho de software sobre esses recursos fixos.

Essa camada pode reduzir o tempo necessário para implementar experimentos, reparar sistemas de avaliação, analisar resultados e preparar documentação técnica.

A vantagem pode se acumular. Modelos melhores auxiliam pesquisadores, esses pesquisadores melhoram modelos posteriores, e os sistemas mais novos se tornam assistentes mais capazes.

O efeito cumulativo não exige autonomia plena. Exige apenas que a assistência reduza tempo de desenvolvimento suficiente para que cada geração chegue mais rápido ou contenha mais ideias testadas.

A mudança relatada pela Anthropic, de menos de 1% para 26%, dá a esse mecanismo um indicador interno concreto. Ainda assim, a medição não revela a melhoria resultante na qualidade dos modelos.

Um laboratório pode concluir mais tarefas sem tomar decisões proporcionalmente melhores. Mais experimentos podem gerar ruído, trabalho repetido ou obrigações adicionais de revisão.

A vantagem empresarial, portanto, depende da eficiência de conversão. As empresas precisam transformar a produção dos agentes em resultados de pesquisa confiáveis, não apenas em contagens maiores de atividade.

Essa exigência favorece organizações com sistemas internos de dados robustos. Os agentes precisam acessar código, histórico experimental, documentação e feedback, respeitando ao mesmo tempo os limites de segurança.

Ela também favorece laboratórios que podem bancar uso intensivo de inferência. Executar milhares de agentes continuamente exige capacidade computacional além do treinamento final de um modelo de fronteira.

Isso conecta a história da Anthropic à corrida mais ampla por infraestrutura. Financiamento, construção de data centers, oferta de chips e disponibilidade de eletricidade determinam até onde os laboratórios podem escalar a pesquisa automatizada.

Essas restrições explicam por que provedores de capital e empresas de infraestrutura continuam centrais para a competição em IA. Uma pesquisa de software mais rápida aumenta a demanda pelos sistemas físicos que a sustentam.

No entanto, infraestrutura sozinha não decide a corrida. Um laboratório incapaz de validar o trabalho dos agentes pode gastar mais computação e, ainda assim, produzir progresso menos confiável.

O modelo organizacional também tende a mudar. Pesquisadores tornam-se diretores de portfólios que contêm experimentos, agentes, avaliadores e sistemas de monitoramento.

O trabalho técnico de nível inicial pode mudar primeiro, porque os agentes atuais conseguem lidar com tarefas de implementação delimitadas. O julgamento de profissionais seniores pode se tornar mais valioso à medida que aumenta o volume de trabalho gerado.

Essa mudança cria um problema de formação. Pesquisadores juniores tradicionalmente desenvolvem julgamento ao realizar o trabalho detalhado que os agentes concluem cada vez mais.

Os laboratórios precisarão de novas formas de ensinar depuração, desenho experimental e análise de falhas. Caso contrário, correm o risco de enfraquecer o futuro grupo de pessoas qualificadas para supervisionar sistemas avançados.

O efeito pode chegar às equipes de software corporativo antes que a pesquisa autônoma se concretize. As empresas já usam agentes de codificação para escrever testes, atualizar dependências e inspecionar repositórios.

A divulgação da Anthropic sugere que a versão de fronteira desse fluxo de trabalho está se expandindo para avaliações de modelos e engenharia de pesquisa. Essas tarefas envolvem maior incerteza do que o desenvolvimento rotineiro de aplicações.

As empresas não devem copiar a porcentagem de destaque como meta de produtividade. Devem identificar quais tarefas os agentes podem executar, qual revisão continua necessária e como os erros são detectados.

Uma métrica operacional útil não é simplesmente a parcela de produção gerada por IA. É a parcela aceita após revisão, a carga de correção e a gravidade dos erros que escapam.

A mesma lógica deve se aplicar aos laboratórios de fronteira. Um índice de automação se torna mais informativo quando acompanhado de evidências sobre confiabilidade, qualidade da pesquisa e tempo de revisão humana.

A estrutura da Anthropic inicia essa conversa, mas não a conclui. Os números atuais descrevem participação e controle, não o valor ou risco completos do trabalho resultante.

Três Sinais Mostrarão se a Mudança É Real

O próximo teste é saber se a Anthropic consegue verificar a tendência, manter o controle humano e estimular divulgações comparáveis de laboratórios concorrentes.

O primeiro sinal é a próxima publicação do índice de automação da Anthropic. Uma atualização consistente deve usar definições estáveis de tarefas e explicar quaisquer mudanças metodológicas.

Se a parcela liderada por IA aumentar enquanto a intervenção humana diminuir, a tese de aceleração se fortalece. Se as definições mudarem substancialmente, as comparações com agosto se tornarão mais fracas.

Os leitores também devem acompanhar a distribuição por trás do número de destaque. A automação concentrada em codificação tem implicações diferentes da automação que abrange planejamento de pesquisa, desenho de avaliações e decisões estratégicas.

O segundo sinal é um acesso significativo de terceiros. A Anthropic afirmou que avaliadores externos receberão visibilidade comparável à das equipes internas de risco.

Uma avaliação crível deve abordar amostragem, limites das tarefas, comportamento dos classificadores, cobertura de monitoramento e divergências entre classificações humanas e do modelo. As conclusões públicas devem incluir limitações.

A verificação independente fortaleceria a alegação da Anthropic de que essas medições podem apoiar a governança. Relatórios restritos ou promocionais deixariam intacta a lacuna central de evidências.

O terceiro sinal é uma resposta de outros laboratórios de fronteira. OpenAI e Google DeepMind poderiam publicar informações comparáveis ou explicar por que a estrutura da Anthropic não se adequa ao seu trabalho.

Números comparáveis mostrariam se a pesquisa conduzida por IA se tornou um modelo operacional para toda a indústria. O silêncio deixaria incerta a posição relativa da Anthropic.

Os reguladores também podem começar a solicitar esses indicadores. Seu interesse transformaria uma divulgação experimental em um possível padrão de prestação de contas para desenvolvedores de IA de fronteira.

O programa original da Bloomberg situou a descoberta da Anthropic em uma discussão mais ampla sobre financiamento e infraestrutura de IA. Esse contexto é importante porque a pesquisa automatizada ainda depende de capital, chips, energia e centros de dados.

Ainda assim, a restrição mais relevante pode passar a ser a verificação, e não a capacidade bruta. Os laboratórios podem lançar mais agentes mais rapidamente do que as instituições conseguem desenvolver práticas confiáveis de supervisão.

Para desenvolvedores, compradores corporativos e trabalhadores do conhecimento, a questão prática já está clara. Quanto trabalho um agente deve realizar antes que uma pessoa precise examinar suas premissas e evidências?

Não trate os 26% da Anthropic como prova de que pesquisadores humanos estão se tornando desnecessários. Trate-os como um alerta de que a supervisão está se tornando uma função central da engenharia.

Acompanhe a próxima atualização de P&D em IA Claude da Anthropic, a independência de seus avaliadores e se os concorrentes publicam números comparáveis. Em conjunto, esses sinais mostrarão se uma supervisão transparente consegue acompanhar o ritmo da descoberta automatizada.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page