Qwen3.7-Max di Alibaba ha completato una sessione di programmazione autonoma di 35 ore
Alibaba ha rilasciato Qwen3.7-Max dopo che un test di programmazione autonoma durato 35 ore ha trasformato una normale notizia di Google News in una sfida diretta per i team software. Secondo quanto riferito, il modello ha eseguito 1.158 chiamate a strumenti e testato 432 varianti di kernel senza intervento umano. Alibaba afferma che il codice risultante funzionava dieci volte più velocemente dell'implementazione di riferimento.
Il titolo sembra un altro avvertimento sul fatto che l'AI stia arrivando per i posti di lavoro nell'ingegneria. Eppure l'interpretazione più utile va nella direzione opposta. Qwen3.7-Max non ha prodotto un'app usa e getta a partire da un breve prompt. Ha trascorso ore a misurare, eseguire il debug, revisionare e validare codice altamente specializzato.
Questa distinzione mette sotto pressione Anthropic, DeepSeek, Moonshot AI, Zhipu AI e i team software aziendali. La competizione va oltre chi risponde correttamente a una domanda di programmazione. Ora riguarda quale modello riesce a rimanere produttivo all'interno di un flusso di lavoro lungo e soggetto a errori.
Alibaba ha fornito prove impressionanti, ma non ha chiuso la questione. La maggior parte dei numeri sulle prestazioni proviene dall'azienda o da benchmark creati dal team Qwen. I team indipendenti devono riprodurre i risultati prima che gli acquirenti li considerino garanzie operative affidabili.
Cosa ha effettivamente cambiato Qwen3.7-Max di Alibaba
Il cambiamento importante non è che Qwen3.7-Max scriva codice, ma che secondo quanto riferito abbia sostenuto un ciclo ingegneristico misurabile per 35 ore.
Alibaba ha presentato Qwen3.7-Max il 20 maggio 2026, durante il suo summit cloud a Hangzhou. Il modello proprietario punta ai carichi di lavoro agentici, ovvero compiti in cui il software sceglie azioni, richiama strumenti, osserva risultati e rivede il proprio approccio.
Questo focus differisce dal familiare schema del chatbot. Un chatbot riceve spesso un prompt e restituisce una risposta. Un agente deve mantenere il proprio obiettivo mentre affronta errori, informazioni incomplete, stati mutevoli e l'uso ripetuto di strumenti.
Alibaba ha testato questa capacità su un kernel di attention per SGLang, un sistema open source usato per servire modelli linguistici. Un kernel è un programma di basso livello che esegue un calcolo specifico sull'hardware. Piccoli miglioramenti possono incidere sulla velocità e sul costo di ogni richiesta al modello che utilizza quell'operazione.
L'hardware di destinazione era un'istanza cloud dotata di acceleratori T-Head Zhenwu M890 di Alibaba. Secondo l'azienda, Qwen3.7-Max non aveva incontrato quell'architettura di chip durante l'addestramento. Non ha ricevuto documentazione hardware, cronologia delle misurazioni né un'implementazione campione ottimizzata.
Il modello è partito da una versione di riferimento scritta in Triton, un linguaggio di programmazione per lo sviluppo di kernel GPU ad alte prestazioni. Ha quindi compilato alternative, ne ha misurato le prestazioni, identificato gli errori e modificato il codice.
L'esperimento di 35 ore ha coinvolto 432 test sui kernel e 1.158 chiamate a strumenti. Alibaba afferma che l'implementazione finale ha garantito un'accelerazione media di dieci volte rispetto al riferimento iniziale.
Questi dettagli contano più di un singolo punteggio di benchmark. Il modello ha dovuto collegare un obiettivo a una lunga serie di azioni. Ha inoltre dovuto recuperare quando i risultati di compilazione o delle prestazioni contraddicevano le sue scelte precedenti.
Il compito aveva comunque confini favorevoli. Alibaba possedeva il modello, il chip, l'ambiente cloud e gran parte del processo di valutazione. L'azienda poteva progettare la configurazione attorno a un'infrastruttura che conosceva bene, anche se il modello non era stato addestrato su quella specifica architettura.
Tuttavia, la sessione rappresenta un test più impegnativo che chiedere a un modello di completare una funzione isolata. Somiglia al flusso di ottimizzazione di un ingegnere, in cui i progressi dipendono da esperimenti ripetuti piuttosto che da una risposta memorizzata.
Alibaba sta inoltre trasformando questo focus sugli agenti in una strategia commerciale più ampia. Il suo annuncio cloud ha descritto Qwen3.7-Max come un modello creato per operazioni sostenute e multi-step nella programmazione e nel lavoro d'ufficio.
Il modello supporta interfacce compatibili con gli strumenti OpenAI e Anthropic. Alibaba afferma che gli sviluppatori possono collegarlo ad ambienti agentici tra cui Claude Code, OpenClaw, Qwen Code, Hermes Agent e Qoder.
Questa compatibilità riduce l'importanza di una singola applicazione di chat. Le aziende possono testare il modello sottostante all'interno di un harness per agenti esistente, il software circostante che gestisce strumenti, autorizzazioni, contesto ed esecuzione.
Ecco perché la storia è andata oltre la copertura specialistica ed è approdata su Google News. Alibaba non si limita a rivendicare un assistente migliore. Presenta il modello come un lavoratore in grado di restare all'interno di un processo ingegneristico finché non produce un risultato validato.
Perché la sessione di 35 ore mette sotto pressione gli agenti di programmazione
Qwen3.7-Max innalza lo standard competitivo dalla generazione di codice plausibile al mantenimento di uno slancio utile attraverso centinaia di decisioni.
I modelli per la programmazione sono migliorati rapidamente nei test che misurano se un sistema riesca a risolvere un problema software definito. Queste valutazioni rimangono utili, ma comprimono il lavoro ingegneristico in un compito pulito con un traguardo riconoscibile.
Il lavoro di produzione è meno ordinato. I repository contengono dipendenze non documentate, requisiti in conflitto, test intermittenti e decisioni le cui conseguenze emergono molto più tardi. Un modello può scrivere una patch impressionante e lasciare comunque a un umano più lavoro di pulizia di quanto richiedesse il problema originale.
L'esperimento di Alibaba affronta una parte di questa debolezza. La sua affermazione centrale riguarda la resistenza al feedback. Qwen3.7-Max non aveva bisogno che ogni azione avesse successo, perché il ciclo di misurazione gli consentiva di correggere i tentativi falliti.
Questo schema assomiglia più al metodo scientifico che all'autocompletamento. Il modello ha proposto una modifica, condotto un esperimento, esaminato il risultato e generato un altro candidato. Il valore derivava dall'intero ciclo, non da una sola risposta particolarmente brillante.
Alibaba ha segnalato divari significativi tra Qwen3.7-Max e vari concorrenti nello stesso compito sui kernel. L'azienda afferma che GLM-5.1 ha raggiunto un'accelerazione di 7,3 volte, Kimi K2.6 di cinque volte e DeepSeek V4 Pro di 3,3 volte. Qwen3.6-Plus avrebbe raggiunto 1,1 volte.
Questi confronti dovrebbero rimanere provvisori. Alibaba ha selezionato il compito, configurato gli agenti e riportato gli esiti. Modifiche al prompting, ai limiti degli strumenti, alle regole di arresto o all'allocazione di calcolo possono influenzare fortemente una valutazione degli agenti.
Anthropic offre ancora un punto di riferimento cruciale. Su KernelBench L3, Alibaba sostiene che Qwen3.7-Max abbia generato con successo kernel accelerati nel 96 percento dei casi. Claude Opus 4.6 avrebbe raggiunto il 98 percento nel confronto del fornitore.
Il quadro più ampio dei benchmark è misto, non unilaterale. Secondo quanto riferito, Qwen3.7-Max ha ottenuto 80,4 su SWE-bench Verified, rispetto a 80,8 per Claude Opus 4.6 Max e 80,6 per DeepSeek V4 Pro Max.
Alibaba riconosce anche aree in cui Claude ha guidato il suo confronto. Tra queste figuravano NL2Repo, ClawEval e CoWorkBench. Questo rende la competizione meno spettacolare, ma più rilevante per gli acquirenti che scelgono modelli in base a flussi di lavoro specifici.
La pressione ricade quindi su ogni fornitore di modelli che avanzi ampie rivendicazioni sugli agenti. I clienti chiederanno sempre più a lungo quanto un agente resti efficace, con quale frequenza necessiti di soccorso e se il suo lavoro superi una revisione indipendente.
Un punteggio elevato in un benchmark breve non può rispondere a queste domande. Nemmeno una dimostrazione ben rifinita può farlo. Le aziende hanno bisogno di distribuzioni su esecuzioni ripetute, incluse fallimenti, tassi di recupero, tempo di intervento e qualità degli artefatti finali.
Il nuovo standard mette sotto pressione anche gli sviluppatori di piattaforme per agenti. Il modello è solo un componente di un sistema funzionante. Progettazione degli strumenti, gestione del contesto, osservabilità, confini delle autorizzazioni e validatori determinano se un'autonomia prolungata produca progresso o danni prolungati.
Il metodo di addestramento di Alibaba riflette questa visione a livello di sistema. Il team Qwen separa ogni esercizio in un compito, un ambiente di strumenti e un validatore. I ricercatori possono ricombinare questi elementi per scoraggiare strategie che funzionano solo in una configurazione familiare.
Un validatore verifica se il risultato soddisfa l'obiettivo previsto. Questa funzione diventa essenziale durante sessioni lunghe perché un modello sicuro di sé potrebbe altrimenti ottimizzare la metrica sbagliata per ore.
Alibaba afferma che Qwen3.7-Max ha mantenuto risultati più coerenti su OpenClaw, Claude Code e Hermes rispetto al suo predecessore. Se test indipendenti confermeranno questo risultato, ridurrebbe il lavoro necessario quando le organizzazioni cambiano framework per agenti.
Per i responsabili dell'ingegneria, la coerenza può contare più della leadership in classifica. Un modello leggermente più debole che si comporta in modo prevedibile tra gli strumenti può essere più facile da governare di un leader la cui prestazione cambia con ogni harness.
Questo è il messaggio competitivo sotto il titolo di Google News. Alibaba chiede agli acquirenti di valutare i modelli come operatori persistenti integrati nei sistemi, non come generatori isolati in attesa all'interno delle schede del browser.
Il lavoro che Qwen sta assumendo è il ciclo di esperimenti ripetitivi
Lo spostamento più credibile nel breve termine riguarda le iterazioni ingegneristiche ripetitive, mentre gli esseri umani mantengono la responsabilità di obiettivi, vincoli e conseguenze.
L'espressione "taking your job" raggruppa molte attività diverse in un'unica previsione drammatica. L'ingegneria del software include scoperta del prodotto, architettura, implementazione, test, revisione della sicurezza, risposta agli incidenti, negoziazione e manutenzione.
Qwen3.7-Max non ha svolto tutte queste funzioni. Ha affrontato un obiettivo di ottimizzazione circoscritto in un ambiente strumentato. Il suo risultato più forte è derivato dalla ripetizione di un ciclo che le macchine possono eseguire più velocemente e più a lungo delle persone.
L'ottimizzazione dei kernel è un buon esempio. Un ingegnere deve spesso provare molte scelte di implementazione, sottoporle a benchmark, ispezionare i colli di bottiglia e scartare la maggior parte dei tentativi. Il lavoro richiede competenza, ma gran parte del tempo trascorso deriva dalla sperimentazione ripetuta.
Un agente che automatizza queste ripetizioni può ampliare la portata di uno specialista. Un ingegnere può definire l'obiettivo, stabilire test di correttezza, supervisionare l'ambiente e rivedere un processo di ricerca più ampio di quanto una persona potrebbe svolgere manualmente.
Questa configurazione cambia il lavoro senza eliminare la responsabilità. Qualcuno decide ancora cosa significhi "più veloce", quali tolleranze numeriche siano accettabili e se l'ottimizzazione crei problemi di sicurezza o manutenzione.
Anche i fallimenti del modello diventano parte del carico di lavoro ingegneristico. Il codice generato richiede revisione, mentre le lunghe sessioni autonome necessitano di log che spieghino quali file sono cambiati, quali comandi sono stati eseguiti e quali ipotesi hanno guidato il risultato.
È qui che l'interpretazione ottimistica acquisisce una certa credibilità. La ricerca e la misurazione tediose possono passare all'agente, lasciando alle persone più tempo per la progettazione dei sistemi e il giudizio.
Tuttavia, questo vantaggio non è automatico. Le organizzazioni possono usare i guadagni di produttività per migliorare la qualità, tentare lavori più difficili, ridurre il personale o aumentare le aspettative di output. La tecnologia non decide come il management distribuisce i benefici.
Gli sviluppatori dovrebbero inoltre distinguere tra automazione delle attività e sostituzione professionale. Un modello può automatizzare un'attività sostanziale senza comprendere il contesto aziendale che la circonda. I datori di lavoro possono comunque riorganizzare i ruoli se abbastanza attività diventano automatizzabili.
La transizione sarà probabilmente disomogenea. I team che lavorano in repository ben testati otterranno maggiori benefici dagli agenti, perché i validatori possono rilevare rapidamente le regressioni. I sistemi poco documentati offrono un feedback più debole, quindi un agente può produrre modifiche plausibili ma dannose.
Il lavoro sulle infrastrutture specialistiche potrebbe diventare più accessibile. Uno sviluppatore senza anni di esperienza sul kernel potrebbe usare un agente per esplorare opzioni di implementazione, purché un revisore qualificato ne verifichi la correttezza e il comportamento sull'hardware.
Questo non rende l'esperienza irrilevante. Può rendere la revisione degli esperti più preziosa, perché gli agenti generano più potenziali lavori di quanti i team avessero in precedenza il tempo di tentare.
Anche la gestione della conoscenza diventa più importante durante questa transizione. Un agente necessita di accesso a requisiti, decisioni passate, runbook e vincoli se deve operare oltre un benchmark circoscritto.
I team faticano già a rendere questo contesto ricercabile per gli ingegneri umani. Una base di conoscenza tecnica curata può aiutare le persone a verificare ciò che un agente ha usato e a individuare le informazioni mancanti prima dell'esecuzione.
Il lavoro cambia di nuovo quando gli agenti operano su attività d'ufficio. Alibaba afferma che Qwen3.7-Max può coordinare progetti multi-file e flussi di lavoro che coinvolgono strumenti esterni. Queste affermazioni estendono il modello oltre la generazione di codice, verso i processi operativi.
Il rapporto annuale esplicita l'ambizione di Alibaba. I dirigenti dell'azienda prevedono che gli agenti svolgeranno una quota crescente del lavoro digitale e diventeranno un'interfaccia primaria tra persone e software.
Quella visione aziendale va letta come strategia, non come una previsione stabilita in modo indipendente. Alibaba vende modelli, capacità cloud, chip e piattaforme per agenti. Una più ampia adozione degli agenti sostiene direttamente ogni parte di questa attività.
Tuttavia, l'azienda sta costruendo attorno a una tesi coerente. I modelli generano azioni, le azioni consumano risorse cloud e Alibaba fornisce l'infrastruttura sottostante. Qwen funge quindi sia da prodotto sia da motore di domanda per il resto dello stack.
Per gli sviluppatori, la risposta pratica non è competere con la pazienza di un agente. È migliorare le competenze che determinano se il lavoro dell'agente merita di essere rilasciato.
Queste competenze includono la scrittura di requisiti eseguibili, la realizzazione di test significativi, la progettazione di confini di autorizzazione, la revisione delle modifiche generate e il riconoscimento dei casi in cui il modello ha ottimizzato l'obiettivo sbagliato.
Un'esecuzione di 35 ore è impressionante perché poche persone vogliono ripetere un esperimento vincolato per così tanto tempo. Diventa minacciosa solo quando le organizzazioni confondono la persistenza con la piena responsabilità ingegneristica.
Cosa non dimostrano i titoli di Google News
Alibaba ha mostrato un convincente esperimento gestito dall'azienda, non una misura universale dello sviluppo software autonomo.
La maggiore limitazione è la concentrazione delle fonti. Alibaba ha fornito il modello, l'hardware, le condizioni del benchmark, le dichiarazioni sulle prestazioni e molti risultati dei concorrenti. Decoder osserva giustamente che diversi benchmark citati sono stati creati dal team Qwen.
I benchmark interni non sono intrinsecamente invalidi. Gli sviluppatori di modelli spesso creano test perché le valutazioni consolidate non catturano più le nuove capacità. Il rischio deriva dall'uso di tali test come prova generale senza replicazione esterna.
L'esperimento sul kernel manca inoltre dell'incertezza presente in molti ambienti di produzione. Aveva un obiettivo misurabile, codice eseguibile, hardware accessibile e un ciclo di feedback ristretto. Queste condizioni rendono l'iterazione autonoma insolitamente gestibile.
Un requisito di prodotto come "rendere più semplice l'onboarding" non offre un feedback paragonabile. Richiede ricerca sugli utenti, giudizio progettuale, considerazioni legali e scelte tra obiettivi concorrenti.
Una lunga esecuzione può anche amplificare gli errori. Un modello con accesso eccessivo può modificare più file, consumare più risorse, esporre informazioni sensibili o creare dipendenze basate su una premessa errata.
Il numero di chiamate agli strumenti non misura da solo il valore. Un agente che compie 1.158 azioni disciplinate può superare un'esecuzione più breve. Può anche nascondere inefficienze se un altro sistema raggiunge lo stesso risultato con meno operazioni.
I team necessitano quindi di metriche di risultato abbinate a metriche operative. Dovrebbero misurare correttezza, tempo di revisione, frequenza dei rollback, risultati di sicurezza e lo sforzo umano richiesto prima del deployment.
Anche l'affermazione di Alibaba secondo cui Qwen3.7-Max non avrebbe mai visto l'architettura Zhenwu M890 durante l'addestramento è difficile da verificare per gli esterni. I dataset di addestramento dei modelli proprietari di frontiera sono raramente disponibili per un'ispezione completa.
Il modello ha ricevuto un'implementazione di riferimento, e quell'artefatto contiene informazioni sostanziali sul calcolo. Ha quindi iniziato senza documentazione, ma non senza un punto di partenza tecnicamente significativo.
Anche i confronti con i concorrenti richiedono analoga cautela. Il risultato di un agente dipende dal suo harness, dai prompt, dalle interfacce degli strumenti, dall'allocazione del contesto e dalla politica di arresto. Una valutazione neutrale deve fornire a ogni modello una configurazione adatta ai suoi punti di forza.
La stessa preoccupazione vale per la coerenza tra harness diversi. Alibaba afferma che il suo nuovo approccio di addestramento ha ridotto le variazioni di prestazione tra differenti ambienti per agenti. Ricercatori indipendenti dovrebbero ripetere tali test usando repository pubblici e regole di valutazione fisse.
La sicurezza presenta un'altra questione irrisolta. Un agente di coding in esecuzione prolungata può incontrare istruzioni malevole all'interno di repository, documentazione, issue tracker o output degli strumenti. L'autonomia persistente amplia il tempo e la superficie disponibili per la manipolazione.
La progettazione delle autorizzazioni diventa la difesa pratica. I team dovrebbero concedere l'accesso minimo necessario per un'attività, isolare l'esecuzione, conservare log completi e richiedere approvazione prima che le modifiche raggiungano sistemi sensibili.
La revisione umana resta necessaria, ma deve essere sostanziale. Approvare una grande patch dopo aver esaminato un riepilogo non fornisce un controllo significativo. I revisori hanno bisogno di test, diff, provenienza e descrizioni chiare delle incertezze irrisolte.
Alibaba ha riferito di un altro uso interessante di Qwen3.7-Max durante l'addestramento. Secondo quanto riportato, il modello ha monitorato le traiettorie di software engineering alla ricerca di reward hacking, che si verifica quando un modello sfrutta una valutazione anziché risolvere il problema previsto.
Secondo l'azienda, l'agente ha esaminato 13.952 traiettorie nell'arco di 86 ore. Ha creato 13 regole di rilevamento e segnalato 1.618 casi sospetti.
Questa applicazione illustra sia la promessa sia la circolarità della valutazione degli agenti. Un modello può aiutare a identificare la condotta scorretta di un altro, ma i ricercatori devono comunque verificare se i suoi rilevamenti fossero accurati.
I falsi positivi possono rimuovere esempi di addestramento legittimi. I falsi negativi possono premiare scorciatoie che in seguito appaiono come impressionanti prestazioni nei benchmark. L'agente di monitoraggio richiede quindi un proprio processo di audit.
Queste incertezze non cancellano il risultato delle 35 ore. Definiscono ciò che il risultato può dimostrare. È la prova che un modello di frontiera può sostenere un ciclo di ottimizzazione specializzato in condizioni controllate.
Non dimostra che Qwen3.7-Max possa mantenere autonomamente un sistema di produzione sconosciuto, interpretare esigenze ambigue degli stakeholder o assumersi la responsabilità di un deployment fallito.
I lettori che arrivano da Google News dovrebbero resistere a entrambi gli estremi. L'esperimento è più sostanziale di una demo di chatbot messa in scena, ma più circoscritto della sostituzione di un reparto di ingegneria.
Cosa osservare dopo il lancio di Qwen3.7-Max
Tre segnali mostreranno se Alibaba ha realizzato una piattaforma per agenti durevole o una dimostrazione insolitamente favorevole.
Il primo segnale è la replicazione indipendente del risultato sul kernel. I ricercatori necessitano di accesso alla definizione dell'attività, al codice iniziale, ai test di correttezza, alle condizioni di esecuzione, ai prompt, alle politiche degli strumenti e ai criteri di arresto.
Una riproduzione riuscita su hardware non Alibaba rafforzerebbe l'affermazione centrale. Fallimenti ripetuti o una forte dipendenza da infrastrutture private ne restringerebbero la rilevanza.
Lo studio più utile confronterebbe più esecuzioni anziché pubblicare un singolo risultato migliore. I sistemi di agenti possono variare sensibilmente tra un tentativo e l'altro, quindi medie e distribuzioni dei fallimenti contano più di una singola traiettoria riuscita.
Il secondo segnale sono le prestazioni di Qwen3.7-Max all'interno di repository reali per periodi più lunghi. Le aziende dovrebbero comunicare la frequenza degli interventi, le modifiche accettate, quelle annullate, il tempo di revisione e i difetti rilevati dopo il deployment.
Alibaba cita punteggi in benchmark software e per agenti, ma studi di caso pubblici rivelerebbero se queste capacità resistono alle disordinate condizioni organizzative. Un deployment utile dovrebbe ridurre lo sforzo umano complessivo, non limitarsi ad aumentare il codice generato.
Osservate in particolare gli esempi che riguardano la manutenzione. La creazione di un nuovo prototipo consente ampia libertà, mentre la manutenzione di un sistema esistente richiede compatibilità con decisioni passate e vincoli operativi.
Il terzo segnale è la risposta dei fornitori di modelli concorrenti. Anthropic, DeepSeek, Moonshot AI e Zhipu AI hanno ora un incentivo a pubblicare esecuzioni autonome più lunghe con regole di valutazione più chiare.
La concorrenza può migliorare le evidenze se i fornitori divulgano attività riproducibili e casi di fallimento. Può indebolirle se si limitano a far crescere i numeri di runtime e a vantare vittorie in benchmark selezionati autonomamente.
La successiva infrastruttura per agenti di Alibaba offre un altro indizio sulla sua direzione. L'azienda ha introdotto strumenti per tracciare, valutare, coordinare e governare più agenti.
Questo investimento riconosce una verità centrale: la sola intelligenza del modello non crea un lavoratore affidabile. Le organizzazioni hanno bisogno di controlli che rendano visibile ciò che un agente ha fatto e consentano alle persone di intervenire prima che il danno si diffonda.
Qwen3.7-Max resta inoltre proprietario attraverso i servizi ospitati di Alibaba, a differenza di alcune precedenti versioni di Qwen. Questa scelta offre all'azienda un maggiore controllo sul deployment e collega l'utilizzo più strettamente alla sua attività cloud.
Complica anche l'ispezione indipendente. I ricercatori possono valutare output e comportamento, ma non possono esaminare completamente i pesi, il processo di addestramento o le modifiche al serving dietro il modello.
Alibaba affronta un compromesso strategico. L'accesso ospitato può supportare aggiornamenti di sicurezza e operazioni gestite. I pesi aperti possono favorire l'adozione tra gli sviluppatori che necessitano di controllo locale, personalizzazione o una valutazione tecnica più approfondita.
La roadmap più ampia di Qwen rivelerà come l'azienda bilancia questi obiettivi. Alibaba ha continuato a rilasciare alcuni modelli aperti e componenti infrastrutturali, riservando al contempo i suoi sistemi Max più potenti all'accesso ospitato.
Per gli acquirenti enterprise, la domanda immediata è più circoscritta di quale laboratorio domini ogni benchmark. Devono sapere se Qwen3.7-Max svolge il loro lavoro in modo affidabile nel rispetto dei loro requisiti di conformità, dati e revisione.
Un breve progetto pilota dovrebbe usare un elemento reale del backlog con criteri di accettazione misurabili. L'agente dovrebbe operare in un ambiente isolato, con ogni chiamata agli strumenti registrata e le azioni sensibili bloccate.
I team dovrebbero confrontare il tempo totale di completamento con il loro flusso di lavoro attuale. Questo calcolo deve includere preparazione dei prompt, supervisione, revisione del codice, test, correzione e documentazione.
Gli sviluppatori possono condurre un esperimento simile su un'attività interna a basso rischio. Scegliete un lavoro che contenga test ripetitivi ma richieda comunque giudizio. Registrate dove il modello avanza, si blocca o richiede contesto mancante.
L'obiettivo non è dimostrare che un agente possa sostituire qualcuno. È individuare il confine tra delega produttiva e supervisione costosa.
Quel confine si sposterà man mano che i modelli miglioreranno. Differirà inoltre tra repository, organizzazioni e contesti normativi. Nessun titolo di Google News può determinarlo per ogni team.
L’esperimento di Alibaba merita attenzione perché mostra un modello capace di sostenere un vero processo di ottimizzazione per 35 ore. L’aspetto incoraggiante è che l’obiettivo era un lavoro tecnico ripetitivo, non l’intero ruolo che lo circonda.
Il prossimo passo spetta alle persone chiamate a usare questi sistemi. Verificate questa affermazione sul vostro lavoro, misurate il costo complessivo della supervisione e chiedetevi quali decisioni debbano restare umane. Se Qwen3.7-Max amplia con costanza ciò che un singolo ingegnere scrupoloso può realizzare, il lavoro più importante che potrebbe sottrarre sarà forse proprio quello che quell’ingegnere non ha mai voluto ripetere.



