top of page

A Autoaperfeiçoamento do Claude da Anthropic Está Acelerando, mas os Humanos Ainda Escolhem o Destino

há 6 dias
16 min de leitura

A Anthropic afirma que o Claude agora lidera 26% de sua pesquisa e desenvolvimento de modelos, apesar de não liderar nada desse trabalho em fevereiro de 2026. Esse forte aumento faz do autoaperfeiçoamento do Claude da Anthropic mais do que um slogan provocativo. A empresa diz que seu modelo consegue concluir grandes tarefas a partir de prompts de alto nível, embora humanos ainda supervisionem o trabalho.

A divulgação leva uma tendência familiar de programação a um território mais consequente. O Claude não está apenas ajudando engenheiros a criar aplicações. Ele está cada vez mais escrevendo infraestrutura, executando experimentos, analisando resultados e revisando mudanças usadas para desenvolver futuros modelos Claude.

A Anthropic chama isso de progresso rumo ao autoaperfeiçoamento recursivo, em que um sistema de IA contribui para construir um sucessor mais capaz. No entanto, suas evidências também expõem a barreira restante. O Claude executa rapidamente trabalhos definidos, enquanto as pessoas ainda decidem quais problemas importam e se os resultados merecem confiança.

Essa distinção coloca a alegação da Anthropic entre duas interpretações concorrentes. Uma descreve um ciclo de desenvolvimento cumulativo que acelera a cada geração de modelo. A outra descreve uma automação avançada operando dentro de uma agenda de pesquisa que os humanos ainda controlam.

O Autoaperfeiçoamento do Claude da Anthropic Agora Alcança a P&D de Modelos

A mudança importante não é que o Claude escreve código. É que o Claude agora lidera partes substanciais do trabalho por trás de seu sucessor.

A Anthropic divulgou o número de 26% em 17 de setembro de 2026. A empresa define “liderar” como concluir a maior parte de uma tarefa a partir de um prompt de alto nível, permanecendo sob supervisão humana. Segundo a empresa, o Claude não liderou nenhum dos trabalhos mensurados de pesquisa e desenvolvimento em fevereiro.

Em agosto, essa participação havia alcançado aproximadamente um quarto. A Anthropic também afirma que cerca de 90% de sua pesquisa e desenvolvimento de modelos agora envolve colaboração com o Claude. Nessa categoria mais ampla, o modelo conclui grandes partes do trabalho sob orientação humana próxima.

Esses dois números medem níveis diferentes de delegação. O número de 90% inclui trabalhos em que uma pessoa permanece estreitamente envolvida. O de 26% abrange tarefas nas quais o Claude assume maior responsabilidade pela execução após receber o objetivo.

A distinção importa porque nenhum dos números significa que o Claude opere de forma independente. O modelo não escolhe os objetivos corporativos da Anthropic, não aprova sua própria implantação nem controla o processo completo de treinamento. Pesquisadores humanos ainda enquadram problemas, alocam recursos, inspecionam resultados e autorizam decisões consequentes.

Ainda assim, a mudança relatada é incomumente rápida. A divulgação inicial afirma que o Claude passou de nenhuma participação de liderança para 26% em seis meses. Essa trajetória, mais do que a porcentagem atual isoladamente, explica a atenção.

A Anthropic divide o desenvolvimento de modelos de fronteira entre engenharia e pesquisa. Engenharia inclui escrever software, manter infraestrutura e supervisionar sistemas de treinamento. Pesquisa inclui selecionar experimentos, interpretar resultados e decidir quais ideias merecem testes adicionais.

O Claude passou a se envolver profundamente em ambas as categorias. Em tarefas de engenharia, a Anthropic afirma que as pessoas fornecem cada vez mais objetivos sem prescrever cada etapa de implementação. Em tarefas de pesquisa, o Claude pode executar experimentos bem definidos e recomendar ações subsequentes.

Um incidente concreto ilustra a diferença entre a conclusão comum de código e a engenharia delegada. Uma atualização rotineira havia começado a derrubar dezenas de milhares de trabalhos de treinamento. Um engenheiro forneceu ao Claude contexto e acesso ao cluster afetado.

O Claude testou configurações de ambiente, isolou uma sinalização obscura de depuração, reproduziu a falha e confirmou uma correção. A Anthropic afirma que a investigação levou cerca de duas horas. A empresa estima que um engenheiro humano normalmente precisaria de dois ou três dias.

Isso não é criação autônoma de modelos. Ainda é significativo porque a infraestrutura de treinamento afeta diretamente a rapidez com que um laboratório pode testar e melhorar modelos. Comprimir dias de depuração em horas dá aos pesquisadores mais oportunidades de executar experimentos e corrigir falhas.

O relato de pesquisa da empresa, portanto, descreve um papel humano mais restrito, não seu desaparecimento. O Claude lida cada vez mais com implementação e experimentação. As pessoas mantêm autoridade sobre direção, avaliação e decisões de lançamento.

Esse limite define a tensão central. A Anthropic apresentou evidências de automação rápida dentro do desenvolvimento de IA, ao mesmo tempo em que documentou o julgamento humano que impede que o processo se torne autodirigido.

Os Números de Programação Mostram Por Que a Anthropic Está Dando o Alarme

A contribuição do Claude se torna mais consequente quando geração de código, revisão e experimentação começam a se reforçar mutuamente.

Em maio de 2026, a Anthropic afirma que o Claude foi autor de mais de 80% do código integrado à sua base de código. Antes de o Claude Code entrar em prévia de pesquisa em fevereiro de 2025, essa participação permanecia em dígitos únicos baixos.

A empresa também relata um grande aumento na produção de engenharia. Durante o segundo trimestre de 2026, seu engenheiro típico integrou diariamente oito vezes mais código do que em 2024. A Anthropic atribui grande parte desse aumento a engenheiros que direcionam e revisam o Claude, em vez de digitar cada alteração.

Linhas de código são uma medida imperfeita de produtividade. Mais código pode criar custos de manutenção, duplicar funções existentes ou esconder um design ruim. A Anthropic reconhece explicitamente que o aumento de oito vezes quase certamente exagera a melhoria genuína de produtividade.

No entanto, o volume de produção é apenas uma parte de seu argumento. A Anthropic afirma que as taxas de intervenção diminuíram nas sessões do Claude Code. Segundo relatos, os engenheiros corrigem, redirecionam ou assumem o controle do modelo com menos frequência do que faziam um ano antes.

Nas tarefas de engenharia mais abertas da Anthropic, a taxa de sucesso relatada do Claude alcançou 76% em maio de 2026. Isso representou um aumento de 50 pontos percentuais em seis meses. Um avaliador baseado em Claude julgou se as sessões concluíam suas tarefas designadas sem precisar de correções.

Essa metodologia merece cautela. Um modelo interno julgando outro modelo não oferece a mesma garantia que uma avaliação independente. A composição das tarefas também pode mudar ao longo do tempo, complicando comparações entre taxas mensais de sucesso.

Ainda assim, a Anthropic relata que o código escrito pelo Claude se aproximou da qualidade do código escrito por humanos dentro da empresa durante 2026. As opiniões dos funcionários não foram unânimes. A empresa afirma que muitos empregados consideravam o código do Claude pior no fim de 2025, mas aproximadamente comparável em meados de 2026.

A revisão automatizada acrescenta outra camada ao ciclo. A Anthropic agora usa o Claude para inspecionar mudanças de código propostas em busca de defeitos e vulnerabilidades de segurança. Uma análise retrospectiva da empresa constatou que tais revisões teriam detectado cerca de um terço dos bugs por trás de incidentes anteriores em produção.

Isso cria um ciclo de desenvolvimento com IA dos dois lados. Uma sessão do Claude escreve ou modifica código. Outra revisa a mudança proposta. Humanos examinam o resultado, decidem se ele pertence à produção e investigam casos em que as verificações automatizadas divergem.

O padrão se estende além da programação. A Anthropic testou modelos em uma tarefa de otimização envolvendo código que treina um pequeno sistema de IA. O objetivo era melhorar a velocidade sem falhar em verificações predeterminadas de correção.

O Claude Opus 4 produziu uma aceleração média de três vezes em maio de 2025, segundo a Anthropic. Um modelo interno chamado Mythos Preview alcançou uma aceleração de aproximadamente 52 vezes em abril de 2026. A empresa afirma que um pesquisador humano qualificado normalmente precisava de quatro a oito horas para alcançar uma melhoria de quatro vezes.

Esses números mostram por que a Anthropic enquadra a tendência como aceleração, e não simples automação. Uma implementação mais rápida permite mais experimentos. Mais experimentos produzem evidências adicionais, que podem orientar o design de modelos e ferramentas posteriores.

Os próprios dados da empresa continuam sendo a principal fonte dessas alegações. Nenhum auditor externo reproduziu seus rótulos internos de tarefas, julgamentos de sucesso ou cálculos de produtividade. Os leitores devem tratar a tendência relatada como evidência significativa, não como uma lei de progresso estabelecida de forma independente.

Mesmo com essa limitação, é difícil descartar a direção. O Claude passou de sugerir trechos para editar repositórios, operar ferramentas, depurar sistemas ativos e executar ciclos experimentais. Cada etapa transfere outra parte do desenvolvimento de IA da execução manual para a delegação supervisionada.

O Verdadeiro Gargalo Está Passando da Execução para o Julgamento

O Claude está reduzindo o custo de realizar pesquisa, mas não eliminou a necessidade de decidir qual pesquisa merece acontecer.

A evidência mais forte da Anthropic diz respeito à execução. Dê ao Claude um objetivo mensurável, acesso a ferramentas relevantes e uma forma de testar resultados, e o modelo pode explorar muitas soluções possíveis. Isso transforma a implementação de pesquisa em um processo iterativo mais rápido.

O problema mais difícil é definir a direção. Pesquisadores precisam escolher questões que ampliem capacidades, melhorem a segurança ou resolvam incertezas importantes. Eles também precisam reconhecer benchmarks enganosos, avaliações contaminadas e soluções que funcionam apenas sob condições restritas.

A Anthropic descreve o discernimento de pesquisa como uma vantagem humana contínua. Isso inclui selecionar problemas valiosos, decidir quais evidências são confiáveis e abandonar abordagens que chegaram a um beco sem saída. Essas escolhas moldam todo o processo de desenvolvimento.

A empresa testou se o Claude consegue recomendar melhores próximos passos durante investigações realistas. Pesquisadores selecionaram 129 momentos em que um humano havia seguido um desvio improdutivo durante trabalhos anteriores. Diferentes modelos Claude então propuseram o que deveria acontecer em seguida.

Um modelo Claude separado comparou essas recomendações com o resultado final. O Opus 4.5 da Anthropic teria superado a escolha humana original em 51% dos casos durante novembro de 2025. O Mythos Preview alcançou 64% em abril de 2026.

O resultado sugere uma melhora no julgamento tático, mas não estabelece liderança independente em pesquisa. A Anthropic selecionou deliberadamente momentos em que a decisão humana original tinha espaço para melhoria. Um modelo com acesso à sessão concluída também serviu como avaliador.

O experimento, portanto, mede se o Claude consegue navegar por pontos de decisão selecionados. Ele não mostra que o Claude consegue definir um programa de pesquisa, reconhecer suas consequências mais amplas ou decidir quando um novo modelo deve ser implantado.

Um projeto separado testou uma autonomia mais ampla em pesquisa de segurança de IA. Múltiplos agentes Claude investigaram se um modelo mais fraco poderia supervisionar um mais forte. Eles geraram hipóteses, executaram experimentos, compartilharam descobertas e ajustaram sua abordagem.

A Anthropic afirma que dois pesquisadores humanos recuperaram cerca de 23% da diferença entre supervisão fraca e forte ao longo de aproximadamente uma semana. Os agentes recuperaram 97% por meio de 800 horas cumulativas de trabalho e recursos computacionais substanciais.

Ainda assim, a empresa identificou restrições importantes. Humanos escolheram a questão e projetaram o sistema de pontuação. O resultado não foi transferido de forma limpa para modelos em escala de produção. Essas ressalvas separam um ciclo experimental impressionante da descoberta científica autônoma.

O mesmo padrão aparece no uso cotidiano do Claude Code. A análise de uso da Anthropic constatou que os usuários tomam cerca de 70% das decisões de planejamento em uma sessão típica. Claude toma cerca de 80% das decisões de execução.

Essa divisão oferece uma descrição mais clara do que “a IA se constrói sozinha”. Em geral, as pessoas decidem o que deve acontecer. Claude decide cada vez mais como executar a instrução, às vezes por meio de longas cadeias de leitura de arquivos, edição de código, testes e execução de comandos.

A expertise de domínio continua importante porque alguém precisa reconhecer um resultado plausível, mas incorreto. Um contador pode orientar um script de conciliação ao compreender as regras contábeis. Um engenheiro de infraestrutura pode identificar se uma correção proposta cria um risco operacional inaceitável.

À medida que a execução se torna mais barata, o julgamento se torna mais valioso. Pesquisadores podem supervisionar mais experimentos, mas também enfrentam mais resultados que exigem avaliação. O gargalo muda de lugar, em vez de desaparecer.

Essa mudança afeta a forma como equipes técnicas organizam o trabalho. Escrever código passa a representar uma parcela menor da função. Especificação, revisão, design de sistemas, verificação e responsabilização ocupam uma parcela maior.

As próprias avaliações de contratação da Anthropic encontraram essa transição. A empresa afirma que engenheiros de performance ainda lidam com decisões difíceis de depuração e design, mesmo quando Claude resolve testes convencionais de programação. Suas conclusões de avaliação mostram que avaliações representativas se tornam mais difíceis quando a IA consegue concluir as partes mecânicas.

O desafio prático é manter a expertise quando as pessoas realizam menos implementação direta. Revisores precisam de entendimento suficiente para detectar erros ocultos. Ainda assim, a delegação constante pode reduzir a experiência prática que desenvolve esse entendimento.

Esse é o lado humano ainda não resolvido do autoaperfeiçoamento do Anthropic Claude. Um modelo mais rápido pode ampliar o que cada pesquisador supervisiona. Também pode tornar os sistemas de pesquisa mais difíceis de serem plenamente compreendidos por qualquer pessoa individualmente.

A Alegação da Anthropic Pressiona Todos os Laboratórios de IA de Fronteira

Se as medições da Anthropic estiverem direcionamente corretas, os laboratórios concorrentes terão de acompanhar tanto a aceleração quanto a transparência em torno dela.

OpenAI, Google DeepMind, Meta e outros desenvolvedores de fronteira usam internamente ferramentas de programação com IA. Seus métodos exatos e níveis de delegação diferem, mas todos enfrentam o mesmo incentivo competitivo. Um laboratório que realiza mais experimentos úteis pode aprimorar modelos mais rapidamente.

A contribuição relatada de Claude dá à Anthropic uma potencial vantagem de retroalimentação. Modelos melhores realizam mais trabalho de engenharia. Esse trabalho aprimora a infraestrutura e a experimentação, o que ajuda a produzir o próximo modelo.

O processo não precisa de autonomia total para importar do ponto de vista competitivo. Pesquisadores humanos podem continuar escolhendo objetivos enquanto a IA multiplica sua capacidade de execução. A Anthropic chama isso de aceleração composta, mesmo sem um ciclo de autoaperfeiçoamento completamente fechado.

Essa dinâmica pressiona concorrentes a implantar agentes de forma mais agressiva. Esperar por confiabilidade perfeita tem um custo de oportunidade quando outra empresa consegue testar mais ideias, reparar a infraestrutura mais rapidamente e reduzir o tempo entre gerações de modelos.

A corrida resultante cria um problema de governança. Cada laboratório controla as evidências internas que mostram quanto do desenvolvimento de modelos foi automatizado. Observadores externos não conseguem comparar facilmente “colaboração”, “liderança”, sucesso de tarefas, qualidade de código ou produtividade de pesquisadores entre empresas.

A Anthropic instou outros desenvolvedores a publicar medições comparáveis. A empresa argumenta que métodos comuns ajudariam o público a entender o quão próximos os laboratórios estão do autoaperfeiçoamento recursivo. Relatórios regulares também poderiam revelar se as curvas de crescimento atuais continuam ou estão se estabilizando.

O anúncio relatado ocorreu enquanto líderes da Anthropic também pediam um desenvolvimento de IA de fronteira mais lento. Essa combinação cria uma contradição inevitável.

A Anthropic está acelerando sua própria pesquisa com Claude enquanto alerta que essa aceleração pode se tornar difícil de controlar. A pressão competitiva ajuda a explicar por que a empresa não simplesmente deixa de usar a tecnologia.

A contenção unilateral poderia deixar um laboratório cauteloso para trás sem desacelerar o campo como um todo. Padrões coordenados poderiam reduzir essa desvantagem, mas exigem acordo entre empresas e governos com interesses econômicos e estratégicos distintos.

A divulgação, portanto, atende a diversos propósitos. Ela informa o público, fortalece o argumento de segurança da Anthropic e divulga as capacidades de Claude. Esses objetivos podem coexistir, mas os leitores devem reconhecer cada um deles.

Os concorrentes também têm motivos para contestar o enquadramento da Anthropic. Uma alta proporção de código escrito por IA não mede diretamente a inteligência do modelo. O volume de código diz pouco sobre se Claude originou uma ideia de pesquisa valiosa ou apenas implementou uma especificação detalhada.

Laboratórios diferentes podem categorizar o trabalho de formas distintas. Uma empresa pode rotular uma sessão de depuração conduzida por agente como liderança de pesquisa. Outra pode contabilizar a mesma tarefa como uma ferramenta de engenharia usada por um pesquisador humano.

Um padrão de medição compartilhado precisaria separar planejamento, execução, verificação e autorização. Também precisaria de auditoria independente. Sem esses controles, as empresas poderiam publicar percentuais impressionantes que continuariam impossíveis de comparar.

A pressão mais ampla vai além dos laboratórios de modelos. Líderes de engenharia empresarial perguntarão se o fluxo de trabalho interno da Anthropic se aplica a eles. Muitos buscarão sistemas semelhantes que conectem agentes de programação a repositórios, testes, ferramentas de implantação e dados operacionais.

A resposta depende da qualidade da verificação. A Anthropic desenvolve modelos e emprega especialistas capazes de revisar falhas incomuns. Uma empresa sem expertise comparável pode automatizar a produção de código mais rapidamente do que aprimora sua capacidade de avaliar esse código.

A produção gerada por IA pode, portanto, ampliar as diferenças entre organizações. Equipes com testes, documentação, observabilidade e práticas de revisão robustos podem delegar com mais segurança. Equipes com bases frágeis correm o risco de produzir erros em maior velocidade.

Esse também é o motivo pelo qual o contexto institucional pesquisável é importante. Um agente precisa de acesso a requisitos, decisões anteriores e restrições técnicas. Uma base de conhecimento de IA mantida pode ajudar as pessoas a inspecionar o raciocínio por trás do trabalho delegado, embora não possa substituir a validação técnica.

Para compradores empresariais, o anúncio da Anthropic não é uma ordem para automatizar tudo. É evidência de que o desenvolvimento assistido por IA está passando de sugestões individuais para fluxos de trabalho supervisionados. A questão competitiva diz respeito a quanta responsabilidade uma organização consegue verificar, e não apenas a quanto ela consegue delegar.

O Que os Números da Anthropic Ainda Não Provam

A Anthropic mostrou uma assistência em rápida expansão, mas não demonstrou que um modelo projete, treine e aprove seu sucessor de forma independente.

A expressão “construindo a si próprio” comprime diversas atividades distintas. Escrever código de aplicação é diferente de selecionar uma arquitetura de modelo. Executar um experimento é diferente de decidir se seu resultado justifica um grande investimento em treinamento.

Claude realiza trabalho significativo em todo esse espectro, segundo a Anthropic. No entanto, as pessoas ainda fornecem objetivos, critérios de avaliação, acesso à infraestrutura e autoridade de lançamento. Esses controles impedem que o processo atual seja classificado como autoaperfeiçoamento recursivo completo.

A qualidade da medição é outra preocupação. A maioria das cifras centrais vem dos sistemas internos da Anthropic. A empresa criou as categorias de tarefas, coletou as sessões e avaliou muitos resultados com juízes baseados em Claude.

Juízes de modelo podem processar grandes conjuntos de dados de forma consistente, mas podem herdar pontos cegos dos sistemas que avaliam. Uma sessão pode parecer bem-sucedida porque os testes foram aprovados, ao mesmo tempo em que introduz problemas de manutenção, segurança ou arquitetura fora do escopo dos testes.

A autoria do código é igualmente ambígua. Claude pode gerar um arquivo inteiro após um planejamento humano extenso. Alternativamente, um pesquisador pode fornecer um objetivo curto enquanto o modelo determina a implementação. Ambos os arquivos são contabilizados como escritos por IA, embora representem níveis diferentes de independência.

O número de produção oito vezes maior também mede código integrado, não valor econômico verificado. Um engenheiro que gera mais código pode resolver mais problemas. O mesmo engenheiro também pode criar mais trabalho de revisão e sistemas maiores que se tornam caros de manter.

Pesquisas independentes oferecem contexto útil sem resolver as alegações internas da Anthropic. Um artigo de trabalho de 2026 examinou 7,8 milhões de commits cocriados com Claude e um painel de 5.838 desenvolvedores. O estudo associou a adoção ao trabalho em mais repositórios e tecnologias.

Seu estudo com desenvolvedores sugere que agentes de programação podem expandir a variedade de tarefas que as pessoas tentam realizar. No entanto, a atividade pública no GitHub não mede a pesquisa interna de modelos da Anthropic nem prova aprimoramento recursivo.

A confiabilidade também varia conforme a tarefa. Problemas estruturados com testes claros favorecem a iteração automatizada. Questões de pesquisa abertas frequentemente não têm uma pontuação objetiva, permitindo que conclusões plausíveis, mas fracas, persistam por mais tempo.

A infraestrutura de computação e física impõe outros limites. Agentes mais rápidos podem propor e executar mais experimentos, mas treinar modelos de fronteira exige chips, energia, capacidade de rede e dados cuidadosamente gerenciados. Inteligência não é o único recurso escasso.

A revisão humana pode se tornar um gargalo à medida que a produção cresce. Se Claude gerar mudanças mais rápido do que especialistas conseguem examiná-las, a Anthropic precisará desacelerar a implantação ou depender mais fortemente de avaliação automatizada.

Isso cria um problema circular de verificação. Claude escreve código, outro Claude o revisa, e sistemas baseados em Claude avaliam se as tarefas foram bem-sucedidas. Especialistas humanos continuam sendo a salvaguarda final, mas sua visibilidade pode diminuir à medida que a cadeia automatizada se alonga.

A segurança eleva os riscos. Um agente com acesso a repositórios, clusters e comandos pode resolver problemas operacionais difíceis. O mesmo acesso aumenta as consequências de raciocínio falho, contexto comprometido ou instruções manipuladas.

Organizações que adotam fluxos de trabalho semelhantes precisam de permissões restritas, logs completos, testes reproduzíveis e caminhos claros de escalonamento. Elas também precisam de pessoas que permaneçam responsáveis por mudanças em produção, independentemente de quem gerou o código.

A própria Anthropic não afirma que Claude cruzou o limiar da autonomia. Seu argumento mais defensável é que a distância está diminuindo. A execução de engenharia se tornou altamente automatizada, enquanto o julgamento de pesquisa mostra uma melhoria inicial, porém limitada.

Essa alegação é importante o suficiente sem exagero. Um sistema não precisa se tornar um cientista independente antes de alterar a velocidade e a economia do desenvolvimento de IA.

Três Sinais Mostrarão se o Ciclo Está Realmente se Fechando

A próxima etapa depende de mudanças mensuráveis na liderança de pesquisa, na validação independente e no controle humano sobre decisões consequentes.

O primeiro sinal é a participação de Claude na liderança de pesquisa e desenvolvimento de modelos. A Anthropic relatou uma alta de zero em fevereiro para 26% em agosto de 2026. Divulgações futuras devem mostrar se essa curva continua, se estabiliza ou se inverte.

Um aumento contínuo fortaleceria o argumento da aceleração composta, especialmente se as tarefas se tornarem menos especificadas. Uma estabilização sugeriria que a implementação melhorou mais rapidamente do que o julgamento de pesquisa. Uma queda poderia indicar mudanças de medição, atribuições mais difíceis ou problemas de confiabilidade.

A definição de liderança deve permanecer estável. Caso contrário, uma porcentagem maior poderia refletir trabalho recategorizado, e não maior independência. A Anthropic deveria publicar exemplos de engenharia, experimentação, interpretação e planejamento estratégico.

O segundo sinal é a replicação independente. Avaliadores externos precisam ter acesso a tarefas representativas, critérios de pontuação e resultados sem receber segredos sensíveis de desenvolvimento de modelos. Testes comparáveis entre laboratórios seriam mais informativos do que porcentagens isoladas de empresas.

A replicação deve examinar a qualidade do código ao longo do tempo, não apenas a conclusão de tarefas. Deve medir defeitos, problemas de segurança, carga de manutenção e a frequência da intervenção humana. As tarefas de pesquisa devem testar se os agentes selecionam direções produtivas antes de conhecer os resultados finais.

Evidências independentes reforçariam ou enfraqueceriam a narrativa da Anthropic. Resultados semelhantes entre diferentes avaliadores e ambientes sustentariam a alegação de uma ampla mudança de capacidade. Grandes discrepâncias mostrariam que fluxos de trabalho internos ou escolhas de avaliação impulsionam boa parte do desempenho relatado.

O terceiro sinal é como a Anthropic lida com a supervisão humana à medida que a produção aumenta. A empresa já identifica a revisão como um possível gargalo. Sua resposta revelará se as pessoas mantêm controle significativo ou se passam cada vez mais a aprovar decisões por meio de resumos automatizados.

Observe mudanças nos requisitos de revisão, controles de acesso, procedimentos de implantação e relatórios de incidentes. Observe também se Claude começa a escolher objetivos de pesquisa, em vez de apenas implementá-los.

Um verdadeiro fechamento do ciclo exigiria mais do que uma porcentagem maior de autoria de código. Claude precisaria propor direções valiosas de pesquisa, elaborar avaliações confiáveis, interpretar evidências ambíguas e melhorar seu sucessor com orientação humana limitada.

Mesmo nesse caso, autorização continua sendo algo distinto de capacidade. Um modelo pode se tornar tecnicamente capaz de conduzir mais pesquisas enquanto a Anthropic deliberadamente preserva a aprovação humana. As escolhas de governança determinarão se a autonomia potencial se torna autonomia operacional.

Para desenvolvedores, a lição imediata é prática. A programação está migrando para especificação, orquestração, testes e revisão. Engenheiros que compreendem sistemas profundamente podem delegar mais, reconhecendo quando a produção confiante de um agente está errada.

Compradores corporativos devem perguntar o que os fornecedores medem quando afirmam realizar trabalho autônomo. Taxas de conclusão, por si só, são insuficientes. Os compradores precisam de evidências sobre supervisão, reversões, defeitos, auditabilidade e responsabilidade após falhas.

Os profissionais do conhecimento enfrentam uma transição semelhante. A IA pode executar mais tarefas, mas as pessoas ainda precisam de contexto confiável e de um registro das decisões importantes. Ferramentas de combinação de conhecimento tornam-se úteis quando ajudam os usuários a rastrear evidências, em vez de apenas gerar outra resposta.

A autoaperfeiçoamento do Claude da Anthropic é, portanto, real em um sentido limitado, mas consequente. Claude já acelera o trabalho de engenharia e experimentação que produz modelos Claude posteriores. A empresa não demonstrou um sistema autônomo construindo seu sucessor de forma independente.

A lacuna entre essas afirmações é onde o próximo capítulo se desenrolará. Acompanhe a porcentagem de liderança, exija validação independente e examine quem ainda toma decisões irreversíveis. Se esses três sinais avançarem juntos, “IA construindo IA” descreverá um sistema operacional, e não uma manchete.

A questão para todas as organizações já não é se a IA pode produzir mais trabalho. É se as pessoas conseguem verificar esse trabalho, preservar a expertise necessária para questioná-lo e permanecer responsáveis à medida que a cadeia automatizada se expande.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page