top of page

Google sta automatizzando la generazione di video lunghi e coerenti, ma il vero test inizia dopo la demo

25 set
Tempo di lettura: 13 min

Google ha introdotto quattro sistemi di ricerca connessi per automatizzare la generazione di video lunghi e coerenti, inclusa una dimostrazione della durata di dieci minuti. L'azienda punta a colmare una lacuna persistente nel video generativo: le singole clip possono apparire convincenti, ma personaggi, oggetti e luoghi spesso cambiano nel corso di una sequenza più lunga.

L'annuncio sposta l'attenzione dalla pura qualità dell'immagine. Google ora considera la produzione video un problema di orchestrazione che coinvolge pianificazione, memoria, generazione, valutazione e revisione. La sua ricerca combina Gemini e Veo con agenti specializzati che mantengono una direzione creativa condivisa e tengono traccia di ciò che è accaduto nelle diverse scene.

Questo approccio mette sotto pressione ogni azienda impegnata nei video AI più lunghi, inclusi i team che sviluppano generatori monolitici e strumenti indipendenti di produzione agentica. La domanda non è più se un modello possa creare un'impressionante clip breve. È se un sistema automatizzato possa preservare la realtà interna di una storia facendo avanzare la trama, correggendo gli errori e rispettando la direzione umana.

Google ha trasformato quattro progetti di ricerca in un'unica tesi produttiva

L'affermazione centrale di Google è che i video AI più lunghi richiedono un sistema di produzione gestito, non soltanto un modello con una finestra di output più ampia.

Il 24 settembre 2026, Google Research ha presentato Co-Director, CANVAS, A²RD e VQQA come componenti complementari di un processo produttivo assistito dall'AI. I sistemi affrontano la pianificazione creativa, lo storyboard visivo, la generazione dei segmenti e il controllo qualità.

L'annuncio della ricerca descrive un livello di orchestrazione costruito attorno a Gemini e Veo. Accetta una specifica creativa di alto livello, converte quell'intento in decisioni produttive e valuta i media risultanti attraverso cicli di feedback ripetuti.

Questo differisce da una semplice catena di prompt. Una pipeline lineare potrebbe generare una sceneggiatura, creare immagini, animarle, aggiungere l'audio e assemblare i risultati. Se un'immagine iniziale assegna a un personaggio l'abbigliamento sbagliato, ogni componente successivo può ereditare quell'errore.

Google definisce questo fenomeno un fallimento a cascata. Il difetto finale diventa visibile soltanto dopo diverse fasi, rendendone difficile l'identificazione della causa. Correggerlo può richiedere di riscrivere i prompt, rigenerare gli asset e controllare ogni scena dipendente.

Il co-regista AI video di Google, invece, inquadra la produzione come un problema di ottimizzazione globale. Un orchestratore seleziona una strategia creativa, una struttura narrativa e un trattamento visivo prima che gli agenti specializzati inizino la produzione.

Un multi-armed bandit, un algoritmo che bilancia l'esplorazione di nuove opzioni con il riutilizzo di quelle riuscite, esamina le configurazioni creative disponibili. Le sue decisioni guidano la pre-produzione, la generazione dei keyframe, il movimento, l'audio e la valutazione finale.

Il giudice della post-produzione è un modello linguistico multimodale, il che significa che può valutare diversi tipi di media anziché il solo testo. Assegna un punteggio al risultato assemblato rispetto alle dimensioni creative originali e restituisce un segnale di ricompensa strutturato all'orchestratore.

Questo feedback crea un percorso per rivedere le scelte strategiche invece di limitarsi a riparare la clip finale. L'idea di fondo è importante perché molti difetti video apparenti nascono nella pianificazione. Un generatore non può preservare un costume coerente se la pipeline non ha mai registrato quale costume appartenga a una scena successiva.

Google afferma che il framework si colloca al di sopra dei suoi modelli fondamentali e resta concettualmente indipendente dai modelli. Tuttavia, l'implementazione pubblicata utilizza Gemini e Veo, quindi le sue prove più solide rimangono legate allo stack di Google.

Il sistema eredita inoltre il watermarking SynthID da quei modelli media. Google osserva che le implementazioni in produzione possono aggiungere classificatori all'intero video completato, poiché clip individualmente accettabili possono formare combinazioni problematiche quando vengono montate insieme.

I quattro progetti sono sistemi di ricerca, non un nuovo prodotto consumer annunciato. Co-Director e CANVAS sono programmati per apparizioni in conferenze accademiche, mentre i paper associati forniscono dettagli su architettura e valutazione.

Questa distinzione conta. Google ha assemblato una tesi tecnica credibile, ma non ha annunciato accesso generale, garanzie di servizio, integrazioni nei flussi di lavoro o economia della produzione.

L'automazione della generazione di video lunghi e coerenti cambia il collo di bottiglia

Il nuovo collo di bottiglia è lo stato persistente: il sistema deve ricordare cosa esiste, cosa è cambiato e cosa deve rimanere invariato.

Un generatore di video brevi può fare ampio affidamento sulle informazioni contenute in un singolo prompt e su un intervallo limitato di frame generati. Una narrazione più lunga deve ricordare un personaggio dopo che sono trascorsi più luoghi, cambi d'abito, oggetti ed eventi della storia.

Google descrive i fallimenti che ne derivano come deriva dell'identità, deriva delle caratteristiche e collasso del contenuto. La deriva dell'identità modifica l'aspetto identitario di un personaggio. La deriva delle caratteristiche altera oggetti o luoghi, mentre il collasso del contenuto lascia la storia visivamente attiva ma narrativamente ferma.

CANVAS affronta questi problemi prima della generazione video completa. Il sistema crea storyboard mantenendo rappresentazioni strutturate di personaggi, luoghi, oggetti e dei loro stati in evoluzione.

La sua memoria visiva persistente memorizza ancore che le scene successive possono recuperare. Se una storia ritorna in una sala di museo, il sistema può recuperare l'organizzazione spaziale della sala invece di generare una nuova interpretazione dal solo testo.

Questa memoria separa inoltre il cambiamento deliberato dall'incoerenza accidentale. Un personaggio può cambiare abbigliamento quando la storia lo richiede, ma il sistema deve preservare quel nuovo abbigliamento finché non si verifica un altro cambiamento pianificato.

Il paper su CANVAS riporta miglioramenti del 21,6 percento nella continuità dello sfondo, del 9,6 percento nella coerenza dei personaggi e del 7,6 percento nella coerenza degli oggetti rispetto al suo baseline più forte. Si tratta di risultati riportati dagli autori sui benchmark selezionati dal sistema.

Un benchmark, HardContinuityBench, inserisce deliberatamente lunghi intervalli tra elementi ricorrenti. I personaggi possono cambiare accessori, gli oggetti interattivi possono evolvere e gli ambienti devono restare riconoscibili dopo che la narrazione li ha abbandonati.

Questo design testa qualcosa di più impegnativo della fluidità tra frame adiacenti. Un luogo può sembrare stabile durante un'inquadratura, ma diventare irriconoscibile quando ritorna diverse scene più tardi.

L'esempio della rapina al museo di Google illustra la distinzione. Il baseline Gemini sottostante cambia l'artefatto e la disposizione della stanza. Anche AutoStudio, un baseline agentico separato, perde dettagli del personaggio e dello sfondo tra un taglio e l'altro.

CANVAS utilizza ancore visive archiviate per recuperare il ladro, la gemma e lo spazio espositivo. Google descrive lo storyboard risultante come coerente sia nelle transizioni consecutive sia in quelle non consecutive.

Il confronto sostiene il valore della memoria esplicita, ma rimane un esempio di ricerca controllato. I lettori non possono presumere la stessa affidabilità in ogni genere, stile, movimento di camera o design dei personaggi.

Lo stato persistente solleva anche questioni di governance. I team di produzione devono sapere cosa entra nella memoria, quando un riferimento memorizzato viene aggiornato e come vengono risolte istruzioni in conflitto.

Un'ancora errata può preservare il dettaglio sbagliato con una coerenza insolita. La memoria riduce la deriva casuale, ma può anche rendere persistente un errore iniziale, a meno che il sistema non rilevi e riveda quello stato.

Questa è l'inversione più ampia alla base dell'annuncio. I video più lunghi non richiedono semplicemente la generazione di più frame. Richiedono un modello modificabile del mondo fittizio, con una struttura sufficiente a distinguere la continuità dalla trasformazione intenzionale.

Per i creatori, questo assomiglia più alla documentazione di produzione che al prompting tradizionale. Schede dei personaggi, riferimenti ai luoghi, stati degli oggetti e piani delle inquadrature diventano asset leggibili dalla macchina che guidano ogni fase successiva.

A²RD rende la memoria parte del ciclo di generazione

La dimostrazione di dieci minuti di Google dipende dalla generazione di segmenti gestibili, portando avanti un contesto selezionato.

A²RD, abbreviazione di Agentic Autoregressive Diffusion, traduce sequenze pianificate in video più lunghi. La generazione autoregressiva significa che il sistema produce nuovi segmenti utilizzando informazioni provenienti dall'output precedente.

Il video autoregressivo ingenuo può degradarsi nel tempo. Piccoli errori visivi diventano parte del contesto del segmento successivo, permettendo a mutazioni e cambiamenti di layout di accumularsi man mano che la sequenza cresce.

A²RD utilizza un ciclo retrieve-synthesize-refine-update. Prima di generare un segmento, il sistema recupera informazioni rilevanti da una memoria multimodale contenente contesto visivo e narrativo.

Poi sintetizza un candidato, valuta il risultato, perfeziona il segmento e aggiorna la memoria per le generazioni future. Questo crea punti di controllo in cui il sistema può intervenire prima che un errore si diffonda nel resto della sequenza.

Il sistema passa inoltre dall'estrapolazione all'interpolazione. L'estrapolazione porta la storia in un nuovo territorio, mentre l'interpolazione ricollega la sequenza a personaggi, oggetti o ambienti già stabiliti.

Questa scelta affronta un conflitto fondamentale nella generazione di lunga durata. Un ancoraggio eccessivo può rendere una storia ripetitiva. Troppa novità può distruggere la continuità.

La dimostrazione di Google dura dieci minuti e riprende elementi dopo intervalli sostanziali. L'azienda afferma che A²RD mantiene l'identità dei personaggi, i dettagli dei costumi e la struttura ambientale continuando al contempo la narrazione.

La ricerca su A²RD riporta risultati su video della durata compresa tra uno e dieci minuti. I suoi autori dichiarano miglioramenti fino al 30 percento nella coerenza e al 20 percento nella coerenza narrativa rispetto a baseline selezionati all'avanguardia.

Questi dati sono utili, ma richiedono contesto. “Fino al” identifica il miglior miglioramento riportato, non un guadagno universale in ogni benchmark o scenario.

A²RD introduce inoltre LVBench-C, che contiene 120 scenari testuali che coinvolgono evoluzione dei personaggi, cambiamenti degli oggetti e rivelazioni ambientali. Un asset visivo critico deve scomparire per almeno dieci segmenti prima di riapparire.

Questa regola del divario punta alla memoria a lungo raggio anziché alla fluidità temporale immediata. Verifica se un sistema possa ricordare ciò che conta dopo che molte scene non correlate hanno occupato il suo contesto di generazione.

Altri ricercatori hanno affrontato il problema in modo diverso. MovieDreamer utilizza pianificazione gerarchica con token visivi autoregressivi e rendering a diffusione. InfLVG apprende quale contesto precedente mantenere entro un budget computazionale fisso.

Questi approcci condividono un'importante ipotesi: generare ogni frame trattenendo l'intera cronologia non è né sufficiente né necessariamente efficiente. I sistemi a lunga durata devono organizzare il contesto, recuperare lo stato rilevante e decidere cosa può essere dimenticato.

L'approccio di Google si distingue perché il sistema di memoria opera all'interno di un gruppo più ampio di agenti cooperanti. Storyboarding, generazione e valutazione condividono la responsabilità della continuità invece di assegnare l'intero onere a un solo modello video.

Questa divisione introduce anche overhead. Ogni recupero, critica, rigenerazione e aggiornamento della memoria consuma risorse computazionali. Google non ha pubblicato nell'annuncio un'analisi completa dei costi di produzione o della latenza.

Un output di dieci minuti dimostra quindi che la pipeline può completare una lunga sequenza in condizioni di ricerca. Non stabilisce che uno studio possa iterare rapidamente su molte versioni, personaggi o richieste dei clienti.

Il vero test pratico riguarderà l’editing. I creatori raramente accettano un’intera sequenza lunga così come viene generata. Sostituiscono inquadrature, modificano il ritmo, cambiano i dialoghi e chiedono revisioni che incidono sulle scene precedenti e successive.

Un sistema di memoria pronto per la produzione deve propagare le modifiche intenzionali senza destabilizzare il materiale non coinvolto. La ricerca attuale punta verso questa capacità, ma Google non ha ancora documentato un flusso di lavoro completo per l’editing non lineare.

Il critico video è anche un prompt engineer

VQQA trasforma la valutazione della qualità in un processo di correzione attivo, anche se corregge i prompt anziché modificare direttamente i pixel.

Le metriche video tradizionali possono classificare gli output senza spiegare come migliorarli. Un punteggio basso indica al sistema che qualcosa non ha funzionato, ma non se un palloncino ha il materiale sbagliato o se un musicista ha cambiato strumento.

Video Quality Question Answering, o VQQA, genera domande mirate su un output. Un modello vision-language risponde a tali domande e trasforma le proprie osservazioni in indicazioni in linguaggio naturale.

Google definisce questo feedback un gradiente semantico. Svolge un ruolo simile a un gradiente numerico nell’addestramento dei modelli, ma descrive una direzione correttiva usando il linguaggio.

Il sistema può chiedere se il soggetto previsto appare, se gli attributi appartengono all’oggetto corretto o se i ruoli dei personaggi rimangono stabili durante una transizione. Poi riscrive il prompt e genera un altro candidato.

Questo è importante per capire come funziona la generazione video di Google. VQQA è un ottimizzatore black-box, il che significa che non richiede accesso ai pesi interni del modello video né ai dati di attivazione.

Questo design consente al livello di valutazione di funzionare con generatori diversi. Limita però il tipo di correzione disponibile. VQQA non può riparare direttamente un singolo fotogramma preservando tutti i fotogrammi vicini.

Chiede invece al generatore di campionare un nuovo output a partire da un prompt migliorato. La correzione può risolvere il difetto originale introducendone uno diverso.

Google affronta questo rischio con una selezione globale. Un valutatore separato esamina i candidati dell’intera traiettoria di ottimizzazione e li confronta con la richiesta originale, non modificata.

Il sistema seleziona il miglior candidato complessivo anziché presumere che l’ultima revisione sia superiore. Ciò riduce la probabilità che una correzione locale indebolisca silenziosamente la composizione generale.

Un esempio richiede un palloncino cuboide. Una versione di base genera un cubo rigido senza un materiale da palloncino convincente, mentre il prompt rivisto da VQQA produce un oggetto a forma di scatola con cuciture e una texture riflettente in mylar.

Un altro esempio presenta una pianista donna e un violinista uomo. La versione di base cambia quale persona suona ciascuno strumento dopo uno stacco, mentre la generazione perfezionata mantiene i loro ruoli.

Il paper su VQQA riporta miglioramenti assoluti dell’11,57 percento su T2V-CompBench e dell’8,43 percento su VBench2 rispetto alla generazione non raffinata. Gli autori affermano che i miglioramenti arrivano dopo un numero ridotto di passaggi di raffinamento.

VQQA è convincente perché rende leggibile la critica del modello. Una persona può esaminare le domande generate e capire perché il sistema ha richiesto un altro tentativo.

Tuttavia, il valutatore resta un modello di IA. Può trascurare difetti, interpretare erroneamente l’intento artistico o premiare modifiche che migliorano la conformità ai benchmark indebolendo al contempo l’impatto emotivo.

Il framework rischia anche di convergere verso output facili da valutare per un modello vision-language. Ambiguità, metafore visive, blocking non convenzionale e discontinuità deliberate possono sembrare errori a un critico automatizzato.

La direzione umana rimane quindi necessaria per più del solo prompting iniziale. I creatori devono decidere quando l’incoerenza è significativa, quando una composizione insolita è intenzionale e quando l’ottimizzazione ha eliminato qualcosa di prezioso.

Google afferma di stare esplorando flussi di lavoro human-in-the-loop, ma questa espressione copre diversi possibili modelli di controllo. Un creatore potrebbe approvare ogni storyboard, intervenire solo dopo errori segnalati o modificare direttamente lo stato della memoria.

La differenza determinerà se il sistema sembrerà un assistente di produzione o un processo autonomo che occasionalmente chiede autorizzazione.

I benchmark mostrano progressi, non prontezza per la produzione

I risultati di Google costruiscono un caso di ricerca per l’orchestrazione video agentica, ma l’uso indipendente determinerà se i miglioramenti resistono ai vincoli della produzione reale.

L’annuncio introduce o utilizza diversi benchmark perché la qualità dei contenuti lunghi non può essere ridotta a una sola misurazione. Continuità dei personaggi, stabilità dell’ambiente, avanzamento narrativo, movimento e aderenza al prompt possono fallire indipendentemente.

GenAD-Bench contiene 400 scenari relativi a 50 marchi fittizi, ciascuno con quattro prodotti. Valuta se il sistema Co-Director rispetta i vincoli di marketing senza fare affidamento su marchi protetti da copyright e già noti.

Google riporta un punteggio di qualità massimo di 81,4 su quel benchmark. Il paper su Co-Director afferma che il framework supera alcune baseline selezionate grazie alla ricerca creativa globale e al raffinamento multimodale locale.

HardContinuityBench si concentra sulle scene ricorrenti e sullo stato visivo. LVBench-C esamina proprietà in evoluzione attraverso lunghi intervalli. Le suite esistenti misurano correttezza compositiva, movimento e coerenza da immagine a video.

Nel loro insieme, queste valutazioni sono più informative di un video di highlight. Espongono modalità di errore diverse e rendono i confronti più facili da riprodurre una volta disponibili codice, prompt e configurazioni.

Ciononostante, gran parte delle prove proviene da ricercatori Google che valutano sistemi incentrati su Google. Diversi benchmark sono stati creati insieme ai metodi sottoposti a test.

Questo non invalida i risultati. Significa però che la replica indipendente è importante, soprattutto quando i valutatori includono modelli linguistici o vision-language che potrebbero condividere preferenze con lo stack di produzione.

Gli scenari di test non possono inoltre riprodurre ogni complicazione del filmmaking professionale. I progetti reali includono sceneggiature riviste, risorse con licenza, autorizzazioni per l’uso delle sembianze degli attori, feedback dei clienti, rapporti d’aspetto variabili e requisiti di consegna precisi.

La continuità è soltanto uno standard di produzione. Tempistica dei dialoghi, sound design, interpretazione, grammatica della macchina da presa, autorizzazioni legali, contesto culturale e intenzione editoriale possono determinare se il girato è utilizzabile.

I sistemi Google separano inoltre la sintesi creativa dall’applicazione della coerenza. Questa divisione è tecnicamente utile, ma i team di produzione si interesseranno a quanto controllo sopravvive a ciascun ciclo di ottimizzazione.

Un regista potrebbe voler mantenere un personaggio visivamente riconoscibile modificandone al contempo postura, età, illuminazione ed espressione emotiva. Un sistema di memoria che blocca troppi attributi potrebbe ridurre la gamma espressiva invece di renderla possibile.

Il rischio cresce quando giudici automatizzati selezionano un risultato “migliore”. Un punteggio può favorire la coerenza anche quando un candidato meno coerente racconta la storia in modo più efficace.

L’annuncio quindi non elimina il compromesso creativo. Lo trasferisce negli schemi della memoria, nei prompt dei valutatori, nei fattori di ricompensa e nelle politiche di selezione.

La sicurezza richiede un esame altrettanto rigoroso. SynthID fornisce un segnale di provenienza per i media generati, ma il watermarking non risolve ogni rischio relativo a impersonificazione, stili protetti da copyright, contesto fuorviante o combinazioni narrative dannose.

Google riconosce che clip singolarmente sicure possono creare un significato non sicuro quando vengono assemblate. Il suo suggerimento di classificatori per il video finale riconosce che la sicurezza nei contenuti lunghi è un problema a livello di sequenza.

Lo stesso principio si applica ai contenuti fattuali. Un video esplicativo ben rifinito può mantenere una continuità visiva perfetta pur presentando una narrazione inaccurata. La coerenza tecnica non garantisce la verità.

Le aziende che prendono in considerazione questo approccio dovrebbero separare la qualità dimostrativa dall’affidabilità operativa. Hanno bisogno di tassi di errore, costi di revisione, tempi di consegna, interfacce di controllo e prove che le risorse del brand rimangano corrette nelle esecuzioni ripetute.

Questi dettagli non sono ancora disponibili nell’annuncio. Google ha divulgato un’architettura di ricerca e risultati di benchmark, non un accordo di servizio per la produzione.

Cosa deve dimostrare ora l’AI Video Co-Director di Google

La prossima fase sarà giudicata dalla replica indipendente, dai flussi di lavoro modificabili e dall’economia del raffinamento ripetuto.

Il primo segnale è un accesso tecnico più ampio. I ricercatori hanno bisogno di codice, materiale dei benchmark, prompt e dettagli di configurazione sufficienti per testare i quattro sistemi al di fuori degli esempi preferiti da Google.

Risultati indipendenti rafforzerebbero l’affermazione se riproducessero i miglioramenti di continuità con generatori e generi creativi non familiari. Calo significativi delle prestazioni mostrerebbero che il livello di orchestrazione resta dipendente da modelli o compiti selezionati con cura.

Il secondo segnale è un flusso di lavoro di editing rivolto ai creatori. Un sistema utile deve consentire alle persone di sostituire una singola inquadratura, rivedere lo stato di un oggetto o cambiare un elemento narrativo tardivo senza ricostruire l’intero video.

Un editing locale efficace confermerebbe che la memoria persistente può supportare la produzione anziché soltanto le dimostrazioni. Se piccole revisioni attivano una rigenerazione estesa, il flusso di lavoro rimarrà costoso e imprevedibile.

Il terzo segnale è l’efficienza operativa. La ricerca al momento del test, più agenti, chiamate ai valutatori e generazioni ripetute possono migliorare la qualità spendendo più capacità di calcolo per ogni risultato.

Google non ha fornito informazioni sufficienti per confrontare questa spesa con la correzione manuale o con metodi alternativi per video lunghi. Latenza e numero di rigenerazioni determineranno quali progetti potranno adottare regolarmente questo approccio.

Questi segnali contano oltre il filmmaking. I team di marketing potrebbero usare sistemi long-form per campagne con prodotti ricorrenti. I dipartimenti di formazione potrebbero creare lezioni basate su scenari, mentre gli studi di videogiochi potrebbero prototipare sequenze narrative.

Anche i knowledge worker potrebbero affrontare un onere di verifica maggiore. La produzione automatizzata può generare presentazioni e video esplicativi più coerenti, facendo apparire più credibili affermazioni deboli perché le immagini restano consistenti.

I team avranno bisogno di materiale sorgente tracciabile, punti di revisione e decisioni creative organizzate. Una base di conoscenza personale può contribuire a preservare riferimenti e approvazioni, ma non può sostituire il giudizio editoriale.

Il contributo più ampio di Google è un cambiamento nella definizione del problema. Automatizzare una generazione video coerente in formato lungo significa ora coordinare memoria, pianificazione, sintesi dei media, critica e revisione lungo un’intera narrazione.

È un modello di produzione più solido rispetto al chiedere a un singolo generatore di continuare per più secondi. Crea però anche più componenti che possono fallire, essere in disaccordo o ottimizzare l’obiettivo sbagliato.

I creatori dovrebbero osservare ciò che diventa modificabile, non soltanto ciò che diventa più lungo. Dovrebbero anche chiedersi se la continuità resiste alle proprie risorse, revisioni e standard qualitativi.

La dimostrazione di dieci minuti mostra che il limite massimo si sta spostando. Il test decisivo comincia quando team esterni potranno interrompere il processo, cambiare idea e portare comunque a termine la storia.

 
 

Inizia gratis

Un assistente IA local-first con gestione della conoscenza personale

Per una migliore esperienza con l’IA,

al momento remio supporta solo Windows 10+ (x64) e M-Chip Macs.

Il tuo partner AI al lavoro
Fai di più con remio

Pianifica. Crea. Consegna.
Tutto in un unico posto.

bottom of page