top of page

L'auto-miglioramento di Anthropic Claude sta accelerando, ma gli esseri umani scelgono ancora la destinazione

18 set
Tempo di lettura: 16 min

Anthropic afferma che Claude ora guida il 26% della ricerca e sviluppo dei suoi modelli, pur non avendo guidato alcuna di queste attività nel febbraio 2026. Questa rapida crescita rende l'auto-miglioramento di Anthropic Claude più di uno slogan provocatorio. L'azienda sostiene che il suo modello possa completare incarichi di ampia portata a partire da prompt di alto livello, sebbene gli esseri umani continuino a supervisionare il lavoro.

Questa rivelazione porta una tendenza nota nella programmazione in un territorio più rilevante. Claude non si limita più ad aiutare gli ingegneri a creare applicazioni. Scrive sempre più spesso infrastrutture, esegue esperimenti, analizza risultati e revisiona modifiche utilizzate per sviluppare i futuri modelli Claude.

Anthropic definisce questo un progresso verso l'auto-miglioramento ricorsivo, in cui un sistema IA contribuisce a costruire un successore più capace. Tuttavia, le sue prove evidenziano anche l'ostacolo rimanente. Claude esegue rapidamente compiti definiti, mentre le persone decidono ancora quali problemi siano importanti e se i risultati meritino fiducia.

Questa distinzione colloca l'affermazione di Anthropic tra due interpretazioni contrapposte. Una descrive un ciclo di sviluppo cumulativo che accelera con ogni generazione di modelli. L'altra descrive un'automazione avanzata che opera all'interno di un programma di ricerca ancora controllato dagli esseri umani.

L'auto-miglioramento di Anthropic Claude ora raggiunge la R&S sui modelli

Il cambiamento importante non è che Claude scrive codice. È che Claude ora guida parti sostanziali del lavoro alla base del suo successore.

Anthropic ha reso pubblico il dato del 26% il 17 settembre 2026. L'azienda definisce “guidare” come il completamento della maggior parte di un compito a partire da un prompt di alto livello, pur restando sotto supervisione umana. Secondo l'azienda, Claude non aveva guidato nessuna delle attività misurate di ricerca e sviluppo a febbraio.

Ad agosto, tale quota aveva raggiunto circa un quarto. Anthropic afferma inoltre che circa il 90% della ricerca e sviluppo dei suoi modelli coinvolge ora una collaborazione con Claude. In questa categoria più ampia, il modello completa ampie porzioni di lavoro sotto una stretta guida umana.

Questi due numeri misurano livelli diversi di delega. Il dato del 90% include attività in cui una persona rimane strettamente coinvolta. Il dato del 26% copre incarichi in cui Claude si assume una maggiore responsabilità dell'esecuzione dopo aver ricevuto l'obiettivo.

La distinzione è importante perché nessuno dei due numeri significa che Claude operi in modo indipendente. Il modello non sceglie gli obiettivi aziendali di Anthropic, non approva la propria distribuzione né controlla l'intero processo di addestramento. I ricercatori umani continuano a definire i problemi, allocare le risorse, esaminare gli esiti e autorizzare le decisioni più rilevanti.

Tuttavia, il cambiamento riportato è insolitamente rapido. La rivelazione iniziale afferma che Claude è passato da nessuna quota di leadership al 26% nell'arco di sei mesi. È questa traiettoria, più che la sola percentuale attuale, a spiegare l'attenzione ricevuta.

Anthropic divide lo sviluppo dei modelli di frontiera tra ingegneria e ricerca. L'ingegneria comprende la scrittura di software, la manutenzione dell'infrastruttura e la supervisione dei sistemi di addestramento. La ricerca comprende la selezione degli esperimenti, l'interpretazione dei risultati e la decisione su quali idee meritino ulteriori verifiche.

Claude è diventato profondamente coinvolto in entrambe le categorie. Nelle attività di ingegneria, Anthropic afferma che le persone forniscono sempre più spesso obiettivi senza prescrivere ogni passaggio dell'implementazione. Nelle attività di ricerca, Claude può eseguire esperimenti ben definiti e raccomandare le azioni successive.

Un episodio concreto illustra la differenza tra il normale completamento del codice e l'ingegneria delegata. Un aggiornamento di routine aveva iniziato a causare l'arresto di decine di migliaia di job di addestramento. Un ingegnere ha fornito a Claude contesto e accesso al cluster interessato.

Claude ha testato le impostazioni dell'ambiente, isolato un oscuro flag di debug, riprodotto il guasto e confermato una correzione. Anthropic afferma che l'indagine è durata circa due ore. L'azienda stima che un ingegnere umano avrebbe normalmente impiegato due o tre giorni.

Non si tratta di creazione autonoma di modelli. Resta comunque significativo perché l'infrastruttura di addestramento influisce direttamente sulla rapidità con cui un laboratorio può testare e migliorare i modelli. Ridurre giorni di debugging a ore offre ai ricercatori più opportunità di eseguire esperimenti e correggere guasti.

Il resoconto di ricerca dell'azienda descrive quindi un ruolo umano più ristretto, non la sua scomparsa. Claude gestisce sempre più l'implementazione e la sperimentazione. Le persone mantengono l'autorità sulla direzione, sulla valutazione e sulle decisioni di rilascio.

Questo confine definisce la tensione centrale. Anthropic ha presentato prove di una rapida automazione nello sviluppo dell'IA, documentando al contempo il giudizio umano che impedisce al processo di diventare autodiretto.

I numeri della programmazione mostrano perché Anthropic lancia l'allarme

Il contributo di Claude diventa più rilevante quando la generazione di codice, la revisione e la sperimentazione iniziano a rafforzarsi a vicenda.

A maggio 2026, Anthropic afferma che Claude ha scritto più dell'80% del codice integrato nella sua base di codice. Prima che Claude Code entrasse nella research preview nel febbraio 2025, tale quota restava nelle basse cifre singole.

L'azienda riporta inoltre un forte aumento della produzione ingegneristica. Nel secondo trimestre del 2026, il suo ingegnere tipico integrava quotidianamente otto volte più codice rispetto al 2024. Anthropic attribuisce gran parte di tale aumento agli ingegneri che dirigono e revisionano Claude anziché digitare ogni modifica.

Le righe di codice sono una misura imperfetta della produttività. Più codice può creare costi di manutenzione, duplicare funzioni esistenti o nascondere una progettazione scadente. Anthropic riconosce esplicitamente che l'aumento di otto volte quasi certamente sovrastima il reale miglioramento della produttività.

Tuttavia, il volume di output è solo una parte della sua tesi. Anthropic afferma che i tassi di intervento sono diminuiti nelle sessioni di Claude Code. Secondo quanto riportato, gli ingegneri correggono, reindirizzano o subentrano al modello meno spesso di quanto facessero un anno prima.

Nelle attività di ingegneria più aperte di Anthropic, il tasso di successo riportato da Claude ha raggiunto il 76% nel maggio 2026. Ciò ha rappresentato un aumento di 50 punti percentuali in sei mesi. Un valutatore basato su Claude ha giudicato se le sessioni avessero completato i compiti assegnati senza necessitare di correzioni.

Questa metodologia richiede cautela. Un modello interno che giudica un altro modello non offre la stessa garanzia di una valutazione indipendente. Anche la composizione delle attività può cambiare nel tempo, complicando i confronti tra i tassi di successo mensili.

Anthropic riporta nondimeno che, nel corso del 2026, il codice scritto da Claude si è avvicinato alla qualità di quello scritto dagli esseri umani all'interno dell'azienda. Le opinioni del personale non erano unanimi. L'azienda afferma che molti dipendenti consideravano il codice di Claude peggiore alla fine del 2025, ma più o meno comparabile entro la metà del 2026.

La revisione automatizzata aggiunge un ulteriore livello al ciclo. Anthropic utilizza ora Claude per ispezionare le modifiche di codice proposte alla ricerca di difetti e vulnerabilità di sicurezza. Un'analisi retrospettiva dell'azienda ha rilevato che tali revisioni avrebbero individuato circa un terzo dei bug alla base di precedenti incidenti in produzione.

Questo crea un ciclo di sviluppo con l'IA su entrambi i lati. Una sessione di Claude scrive o modifica codice. Un'altra revisiona la modifica proposta. Gli esseri umani esaminano il risultato, decidono se debba entrare in produzione e indagano i casi in cui i controlli automatizzati non concordano.

Il modello si estende oltre la programmazione. Anthropic ha testato i modelli su un'attività di ottimizzazione che coinvolgeva codice per addestrare un piccolo sistema IA. L'obiettivo era migliorare la velocità senza fallire controlli di correttezza prestabiliti.

Claude Opus 4 ha prodotto un'accelerazione media di tre volte nel maggio 2025, secondo Anthropic. Un modello interno chiamato Mythos Preview ha raggiunto un'accelerazione di circa 52 volte entro l'aprile 2026. L'azienda afferma che un ricercatore umano esperto impiegava di solito da quattro a otto ore per raggiungere un miglioramento di quattro volte.

Queste cifre mostrano perché Anthropic descrive la tendenza come un'accelerazione anziché una semplice automazione. Un'implementazione più rapida consente più esperimenti. Più esperimenti producono ulteriori evidenze, che possono guidare la progettazione di modelli e strumenti successivi.

I dati dell'azienda restano la fonte principale di queste affermazioni. Nessun revisore esterno ha riprodotto le sue etichette interne delle attività, i giudizi sul successo o i calcoli della produttività. I lettori dovrebbero considerare la tendenza riportata come un'evidenza significativa, non come una legge del progresso stabilita in modo indipendente.

Anche con questa limitazione, è difficile liquidare la direzione intrapresa. Claude è passato dal suggerire frammenti di codice alla modifica di repository, all'uso di strumenti, al debugging di sistemi in funzione e all'esecuzione di cicli sperimentali. Ogni passaggio trasferisce un'altra parte dello sviluppo dell'IA dall'esecuzione manuale alla delega supervisionata.

Il vero collo di bottiglia si sta spostando dall'esecuzione al giudizio

Claude sta riducendo il costo della ricerca, ma non ha eliminato la necessità di decidere quale ricerca meriti di essere svolta.

Le prove più solide di Anthropic riguardano l'esecuzione. Fornendo a Claude un obiettivo misurabile, l'accesso agli strumenti pertinenti e un modo per verificare i risultati, il modello può esplorare molte possibili soluzioni. Ciò trasforma l'implementazione della ricerca in un processo iterativo più rapido.

Il problema più difficile è definire la direzione. I ricercatori devono scegliere domande che facciano progredire le capacità, migliorino la sicurezza o risolvano incertezze importanti. Devono inoltre riconoscere benchmark fuorvianti, valutazioni contaminate e soluzioni che funzionano solo in condizioni ristrette.

Anthropic descrive il giudizio di ricerca come un vantaggio umano persistente. Ciò include la selezione di problemi di valore, la decisione su quali evidenze siano credibili e l'abbandono di approcci giunti a un vicolo cieco. Queste scelte modellano l'intero processo di sviluppo.

L'azienda ha testato se Claude possa raccomandare migliori passaggi successivi durante indagini realistiche. I ricercatori hanno selezionato 129 momenti in cui un essere umano aveva compiuto una deviazione improduttiva nel corso di lavori precedenti. Diversi modelli Claude hanno quindi proposto cosa sarebbe dovuto accadere in seguito.

Un modello Claude separato ha confrontato queste raccomandazioni con l'esito finale. Secondo quanto riportato, Opus 4.5 di Anthropic ha superato la scelta umana originale nel 51% dei casi nel novembre 2025. Mythos Preview ha raggiunto il 64% nell'aprile 2026.

Il risultato suggerisce un miglioramento del giudizio tattico, ma non dimostra una leadership di ricerca indipendente. Anthropic ha deliberatamente selezionato momenti in cui la decisione umana originaria aveva margine di miglioramento. Un modello con accesso alla sessione completata ha inoltre svolto il ruolo di valutatore.

L'esperimento misura quindi se Claude possa orientarsi in punti decisionali selezionati. Non mostra che Claude possa definire un programma di ricerca, riconoscerne le conseguenze più ampie o decidere quando un nuovo modello debba essere distribuito.

Un progetto separato ha testato un'autonomia più ampia nella ricerca sulla sicurezza dell'IA. Più agenti Claude hanno indagato se un modello più debole potesse supervisionarne uno più forte. Hanno generato ipotesi, condotto esperimenti, condiviso risultati e adattato il loro approccio.

Anthropic afferma che due ricercatori umani hanno recuperato circa il 23% del divario tra supervisione debole e forte nell'arco di circa una settimana. Gli agenti ne hanno recuperato il 97% attraverso 800 ore cumulative di lavoro e risorse di calcolo sostanziali.

Tuttavia, l'azienda ha identificato vincoli importanti. Gli esseri umani hanno scelto la domanda e progettato il sistema di valutazione. Il risultato non si è trasferito in modo lineare ai modelli su scala produttiva. Queste cautele separano un impressionante ciclo sperimentale dalla scoperta scientifica autonoma.

Lo stesso schema emerge nell’uso quotidiano di Claude Code. L’analisi d’uso di Anthropic ha rilevato che gli utenti prendono circa il 70% delle decisioni di pianificazione in una sessione tipica. Claude prende circa l’80% delle decisioni di esecuzione.

Questa ripartizione offre una descrizione più chiara rispetto a “l’AI si costruisce da sola”. In genere, sono le persone a decidere cosa deve accadere. Claude decide sempre più spesso come eseguire l’istruzione, talvolta attraverso lunghe catene di letture di file, modifiche al codice, test ed esecuzione di comandi.

L’esperienza di dominio resta importante perché qualcuno deve riconoscere un risultato plausibile ma errato. Un commercialista può dirigere uno script di riconciliazione comprendendo le regole contabili. Un ingegnere dell’infrastruttura può stabilire se una correzione proposta crea un rischio operativo inaccettabile.

Man mano che l’esecuzione diventa meno costosa, il giudizio acquista più valore. I ricercatori possono supervisionare più esperimenti, ma devono anche valutare un numero maggiore di risultati. Il collo di bottiglia si sposta, anziché scomparire.

Questo cambiamento influenza il modo in cui i team tecnici organizzano il lavoro. Scrivere codice diventa una componente più piccola del ruolo. Specifica, revisione, progettazione dei sistemi, verifica e responsabilità occupano una quota maggiore.

Le stesse valutazioni di assunzione di Anthropic hanno incontrato questa transizione. L’azienda afferma che gli ingegneri delle prestazioni gestiscono ancora decisioni complesse di debugging e progettazione, anche quando Claude risolve i test di programmazione convenzionali. I suoi risultati delle valutazioni mostrano che le valutazioni rappresentative diventano più difficili quando l’AI può completare le parti meccaniche.

La sfida pratica consiste nel mantenere le competenze quando le persone svolgono meno implementazione diretta. I revisori devono avere una comprensione sufficiente per individuare errori nascosti. Tuttavia, la delega costante può ridurre l’esperienza pratica che sviluppa tale comprensione.

Questo è il lato umano irrisolto dell’auto-miglioramento di Anthropic Claude. Un modello più veloce può ampliare ciò che ogni ricercatore supervisiona. Può anche rendere i sistemi di ricerca più difficili da comprendere completamente per una singola persona.

L’affermazione di Anthropic mette sotto pressione ogni laboratorio di AI di frontiera

Se le misurazioni di Anthropic sono direzionalmente corrette, i laboratori concorrenti devono eguagliare sia l’accelerazione sia la trasparenza che la circonda.

OpenAI, Google DeepMind, Meta e altri sviluppatori di frontiera utilizzano internamente strumenti di AI per la programmazione. I loro metodi esatti e livelli di delega differiscono, ma tutti affrontano lo stesso incentivo competitivo. Un laboratorio che esegue più esperimenti utili può migliorare i modelli più rapidamente.

Il contributo riportato di Claude offre ad Anthropic un potenziale vantaggio di retroazione. Modelli migliori svolgono più lavoro ingegneristico. Quel lavoro migliora infrastruttura e sperimentazione, contribuendo a produrre il modello successivo.

Il processo non richiede una piena autonomia per avere rilevanza competitiva. I ricercatori umani possono continuare a scegliere gli obiettivi mentre l’AI moltiplica la loro capacità esecutiva. Anthropic definisce questo fenomeno accelerazione composta, anche senza un ciclo di auto-miglioramento completamente chiuso.

Questa dinamica spinge i concorrenti a distribuire agenti in modo più aggressivo. Attendere un’affidabilità perfetta comporta un costo opportunità quando un’altra azienda può testare più idee, riparare più rapidamente l’infrastruttura e ridurre il tempo tra generazioni di modelli.

La corsa che ne deriva crea un problema di governance. Ogni laboratorio controlla le prove interne che mostrano quanto sviluppo dei modelli sia stato automatizzato. Gli esterni non possono facilmente confrontare tra aziende “collaborazione”, “leadership”, successo dei compiti, qualità del codice o produttività dei ricercatori.

Anthropic ha esortato altri sviluppatori a pubblicare misurazioni comparabili. Sostiene che metodi comuni aiuterebbero il pubblico a comprendere quanto i laboratori siano vicini all’auto-miglioramento ricorsivo. Report regolari potrebbero inoltre rivelare se le attuali curve di crescita proseguono o si appiattiscono.

L’annuncio riportato è arrivato mentre i leader di Anthropic chiedevano anche uno sviluppo di frontiera più lento. Questa combinazione crea una contraddizione inevitabile.

Anthropic sta accelerando la propria ricerca con Claude, mentre avverte che l’accelerazione potrebbe diventare difficile da controllare. La pressione competitiva aiuta a spiegare perché l’azienda non smetta semplicemente di usare la tecnologia.

Una moderazione unilaterale potrebbe lasciare indietro un laboratorio prudente senza rallentare il settore nel suo complesso. Standard coordinati potrebbero ridurre questo svantaggio, ma richiedono un accordo tra aziende e governi con interessi economici e strategici diversi.

La divulgazione assolve quindi a diversi scopi. Informa il pubblico, rafforza l’argomentazione di sicurezza di Anthropic e pubblicizza le capacità di Claude. Questi obiettivi possono coesistere, ma i lettori dovrebbero riconoscerli tutti.

Anche i concorrenti hanno ragioni per contestare l’impostazione di Anthropic. Un’alta quota di codice scritto dall’AI non misura direttamente l’intelligenza del modello. Il volume di codice dice poco sul fatto che Claude abbia originato una preziosa idea di ricerca o si sia limitato a implementare una specifica dettagliata.

Laboratori diversi possono classificare il lavoro in modo diverso. Un’azienda potrebbe definire una sessione di debugging guidata da un agente come leadership di ricerca. Un’altra potrebbe conteggiare lo stesso compito come uno strumento ingegneristico usato da un ricercatore umano.

Uno standard di misurazione condiviso dovrebbe separare pianificazione, esecuzione, verifica e autorizzazione. Dovrebbe inoltre prevedere audit indipendenti. Senza questi controlli, le aziende potrebbero pubblicare percentuali impressionanti che restano impossibili da confrontare.

La pressione più ampia si estende oltre i laboratori di modelli. I responsabili dell’ingegneria aziendale si chiederanno se il flusso di lavoro interno di Anthropic sia applicabile anche a loro. Molti perseguiranno sistemi analoghi che collegano agenti di programmazione con repository, test, strumenti di deployment e dati operativi.

La risposta dipende dalla qualità della verifica. Anthropic sviluppa modelli e impiega specialisti in grado di riesaminare guasti insoliti. Un’azienda senza competenze comparabili può automatizzare la produzione di codice più rapidamente di quanto migliori la propria capacità di valutarlo.

L’output generato dall’AI può quindi ampliare le differenze tra organizzazioni. I team con test robusti, documentazione, osservabilità e pratiche di revisione possono delegare in maggiore sicurezza. I team con basi deboli rischiano di produrre errori a una velocità superiore.

Questo è anche il motivo per cui è importante un contesto istituzionale ricercabile. Un agente necessita di accesso a requisiti, decisioni precedenti e vincoli tecnici. Una base di conoscenza AI mantenuta può aiutare le persone a esaminare il ragionamento che circonda il lavoro delegato, anche se non può sostituire la validazione tecnica.

Per gli acquirenti aziendali, l’annuncio di Anthropic non è un ordine di automatizzare tutto. È la prova che lo sviluppo assistito dall’AI sta passando da suggerimenti individuali a flussi di lavoro supervisionati. La questione competitiva riguarda quanta responsabilità un’organizzazione possa verificare, non semplicemente quanto possa delegare.

Cosa i numeri di Anthropic ancora non dimostrano

Anthropic ha mostrato un’assistenza in rapida espansione, ma non ha mostrato un modello che progetti, addestri e approvi in modo indipendente il proprio successore.

L’espressione “si costruisce da solo” comprime diverse attività distinte. Scrivere codice applicativo è diverso dal selezionare un’architettura di modello. Eseguire un esperimento è diverso dal decidere se il suo risultato giustifichi un importante investimento nell’addestramento.

Secondo Anthropic, Claude svolge un lavoro significativo lungo questo spettro. Tuttavia, le persone continuano a fornire obiettivi, criteri di valutazione, accesso all’infrastruttura e autorità di rilascio. Questi controlli impediscono al processo attuale di qualificarsi come auto-miglioramento ricorsivo completo.

Anche la qualità delle misurazioni è motivo di preoccupazione. La maggior parte delle cifre centrali proviene dai sistemi interni di Anthropic. L’azienda ha creato le categorie di attività, raccolto le sessioni e valutato molti risultati con giudici basati su Claude.

I giudici modello possono elaborare grandi dataset con coerenza, ma possono ereditare punti ciechi dai sistemi che valutano. Una sessione può apparire riuscita perché i test sono stati superati, pur introducendo problemi di manutenzione, sicurezza o architettura al di fuori dell’ambito dei test.

Anche la paternità del codice è ambigua. Claude potrebbe generare un intero file dopo un’ampia pianificazione umana. In alternativa, un ricercatore potrebbe fornire un obiettivo breve mentre il modello determina l’implementazione. Entrambi i file vengono conteggiati come scritti dall’AI, benché rappresentino livelli diversi di indipendenza.

La cifra di output otto volte superiore misura inoltre il codice integrato, non il valore economico verificato. Un ingegnere che genera più codice può risolvere più problemi. Lo stesso ingegnere potrebbe anche creare più lavoro di revisione e sistemi più grandi, costosi da mantenere.

La ricerca indipendente offre un contesto utile senza risolvere le affermazioni interne di Anthropic. Un working paper del 2026 ha esaminato 7,8 milioni di commit co-autorizzati da Claude e un panel di 5.838 sviluppatori. Lo studio ha associato l’adozione al lavoro su più repository e tecnologie.

Il suo studio sugli sviluppatori suggerisce che gli agenti di programmazione possano ampliare la gamma di attività che le persone tentano. Tuttavia, l’attività pubblica su GitHub non misura la ricerca interna sui modelli di Anthropic né prova un miglioramento ricorsivo.

L’affidabilità varia anche in base al compito. I problemi strutturati con test chiari favoriscono l’iterazione automatizzata. Le domande di ricerca aperte spesso non hanno un punteggio oggettivo, consentendo a conclusioni plausibili ma deboli di persistere più a lungo.

Il calcolo e l’infrastruttura fisica impongono ulteriori limiti. Agenti più veloci possono proporre ed eseguire più esperimenti, ma l’addestramento di modelli di frontiera richiede chip, energia, capacità di rete e dati gestiti con attenzione. L’intelligenza non è l’unica risorsa scarsa.

La revisione umana può diventare un collo di bottiglia con la crescita dell’output. Se Claude genera modifiche più velocemente di quanto gli specialisti riescano a esaminarle, Anthropic deve rallentare il deployment oppure affidarsi più pesantemente alla valutazione automatizzata.

Questo crea un problema di verifica circolare. Claude scrive codice, un altro Claude lo revisiona e sistemi basati su Claude giudicano se i compiti hanno avuto successo. Gli specialisti umani rimangono l’ultima rete di sicurezza, ma la loro visibilità può diminuire man mano che la catena automatizzata si allunga.

La sicurezza aumenta la posta in gioco. Un agente con accesso a repository, cluster e comandi può risolvere difficili problemi operativi. Lo stesso accesso aumenta le conseguenze di ragionamenti difettosi, contesti compromessi o istruzioni manipolate.

Le organizzazioni che adottano flussi di lavoro simili necessitano di autorizzazioni ristrette, log completi, test riproducibili e chiari percorsi di escalation. Hanno inoltre bisogno di persone che restino responsabili delle modifiche in produzione, indipendentemente da chi abbia generato il codice.

Anthropic stessa non sostiene che Claude abbia superato la soglia dell’autonomia. La sua argomentazione più difendibile è che la distanza si stia riducendo. L’esecuzione ingegneristica è diventata altamente automatizzata, mentre il giudizio di ricerca mostra miglioramenti iniziali ma limitati.

Questa affermazione è abbastanza importante senza esagerazioni. Un sistema non deve diventare uno scienziato indipendente prima di cambiare la velocità e l’economia dello sviluppo dell’AI.

Tre segnali mostreranno se il ciclo si sta davvero chiudendo

La fase successiva dipende da cambiamenti misurabili nella leadership della ricerca, nella validazione indipendente e nel controllo umano sulle decisioni rilevanti.

Il primo segnale è la quota di Claude nella leadership della ricerca e sviluppo dei modelli. Anthropic ha riportato una crescita dallo zero di febbraio al 26% di agosto 2026. Le future divulgazioni dovrebbero mostrare se questa curva continua, si stabilizza o si inverte.

Un aumento continuo rafforzerebbe l’ipotesi dell’accelerazione composta, soprattutto se i compiti diventassero meno specificati. Un plateau suggerirebbe che l’implementazione sia migliorata più rapidamente del giudizio di ricerca. Un calo potrebbe indicare modifiche alla misurazione, assegnazioni più difficili o problemi di affidabilità.

La definizione di leadership deve rimanere stabile. Altrimenti, una percentuale più alta potrebbe riflettere una ricategorizzazione del lavoro anziché una maggiore indipendenza. Anthropic dovrebbe pubblicare esempi che comprendano ingegneria, sperimentazione, interpretazione e pianificazione strategica.

Il secondo segnale è la replica indipendente. I valutatori esterni devono poter accedere a compiti rappresentativi, criteri di valutazione e risultati senza ricevere segreti sensibili sullo sviluppo dei modelli. Test comparabili tra diversi laboratori sarebbero più informativi delle percentuali dichiarate da singole aziende.

La replica dovrebbe esaminare la qualità del codice nel tempo, non soltanto il completamento dei compiti. Dovrebbe misurare difetti, problemi di sicurezza, oneri di manutenzione e frequenza dell'intervento umano. Le attività di ricerca dovrebbero verificare se gli agenti scelgono direzioni produttive prima di conoscere gli esiti finali.

Evidenze indipendenti potrebbero rafforzare o indebolire la tesi di Anthropic. Risultati simili tra diversi valutatori e ambienti sosterrebbero l'affermazione di un ampio cambiamento nelle capacità. Grandi divari mostrerebbero che i flussi di lavoro interni o le scelte di valutazione determinano gran parte delle prestazioni riportate.

Il terzo segnale riguarda il modo in cui Anthropic gestisce la supervisione umana con la crescita dell'output. L'azienda identifica già la revisione come un potenziale collo di bottiglia. La sua risposta rivelerà se le persone manterranno un controllo significativo o se approveranno sempre più decisioni tramite riepiloghi automatizzati.

Osservate i cambiamenti nei requisiti di revisione, nei controlli di accesso, nelle procedure di distribuzione e nella segnalazione degli incidenti. Osservate anche se Claude inizierà a scegliere obiettivi di ricerca anziché limitarsi a implementarli.

Una reale chiusura del ciclo richiederebbe più di una percentuale più alta di paternità del codice. Claude dovrebbe proporre direzioni di ricerca di valore, progettare valutazioni credibili, interpretare evidenze ambigue e migliorare il proprio successore con una guida umana limitata.

Anche allora, l'autorizzazione rimane distinta dalla capacità. Un modello potrebbe diventare tecnicamente in grado di dirigere più ricerca, mentre Anthropic conserva deliberatamente l'approvazione umana. Le scelte di governance determineranno se la potenziale autonomia diventerà autonomia operativa.

Per gli sviluppatori, la lezione immediata è pratica. La programmazione si sta spostando verso la specificazione, l'orchestrazione, i test e la revisione. Gli ingegneri che comprendono a fondo i sistemi possono delegare di più, riconoscendo al contempo quando l'output sicuro di sé di un agente è sbagliato.

Gli acquirenti aziendali dovrebbero chiedere cosa misurano i fornitori quando dichiarano lavoro autonomo. I soli tassi di completamento non sono sufficienti. Gli acquirenti hanno bisogno di evidenze su supervisione, annullamenti, difetti, verificabilità e responsabilità dopo i fallimenti.

I lavoratori della conoscenza affrontano una transizione simile. L'AI può svolgere più attività esecutive, ma le persone hanno ancora bisogno di un contesto affidabile e di una registrazione delle decisioni importanti. Gli strumenti per il knowledge blending diventano utili quando aiutano gli utenti a risalire alle evidenze anziché limitarsi a generare un'altra risposta.

L'auto-miglioramento di Anthropic Claude è dunque reale in un senso limitato ma rilevante. Claude accelera già il lavoro ingegneristico e sperimentale che produce i successivi modelli Claude. L'azienda non ha dimostrato l'esistenza di un sistema autonomo che costruisca indipendentemente il proprio successore.

Il divario tra queste affermazioni è il punto in cui si svilupperà il prossimo capitolo. Monitorate la percentuale di leadership, chiedete una convalida indipendente ed esaminate chi continua a prendere decisioni irreversibili. Se questi tre segnali si muoveranno insieme, “AI che costruisce AI” descriverà un sistema operativo anziché un titolo.

La domanda per ogni organizzazione non è più se l'AI possa produrre più lavoro. È se le persone possano verificare quel lavoro, preservare le competenze necessarie per metterlo in discussione e rimanere responsabili man mano che la catena automatizzata si espande.

 
 

Inizia gratis

Un assistente IA local-first con gestione della conoscenza personale

Per una migliore esperienza con l’IA,

al momento remio supporta solo Windows 10+ (x64) e M-Chip Macs.

Il tuo partner AI al lavoro
Fai di più con remio

Pianifica. Crea. Consegna.
Tutto in un unico posto.

bottom of page