top of page

SAGA riconduce i video AI ai loro generatori e mette in discussione la provenienza basata solo sui watermark

Google News ha portato alla luce un nuovo fronte nella sicurezza dell'AI: SAGA identifica il probabile generatore di un video sintetico, anche quando i dati di provenienza convenzionali non sono disponibili.

Il sistema va oltre la domanda se un filmato sia reale o sintetico. I suoi ricercatori lo hanno progettato per attribuire un video su cinque livelli, tra cui il compito di generazione, la versione del modello, il team di sviluppo e il generatore specifico.

Questa distinzione è importante perché le principali difese odierne dipendono in larga misura dalla collaborazione di creatori di contenuti, piattaforme e fornitori di modelli. Watermark e metadati firmati possono comunicare l'origine, ma questi segnali non sono presenti in ogni video.

SAGA segue una strada diversa. Esamina gli artefatti spaziali e temporali lasciati dal processo di generazione stesso. La ricerca suggerisce che questi artefatti possano funzionare come impronte dei modelli, pur costituendo evidenza statistica e non prove incontestabili.

Il lavoro proviene da ricercatori affiliati all'University of California, Riverside, YouTube e Google DeepMind. È apparso negli atti della 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition.

Il suo vero avversario non è un altro rilevatore. È l'assunto secondo cui la sola etichettatura cooperativa possa stabilire la provenienza in un ambiente mediatico aperto, modificabile e ostile.

Google News porta sotto i riflettori l'attribuzione dei video AI

SAGA trasforma la domanda forense da “È falso?” a “Quale sistema lo ha probabilmente creato?”

I ricercatori descrivono SAGA come un framework di attribuzione della fonte per i video generati dall'AI. Il suo scopo è identificare caratteristiche associate allo strumento, alla famiglia di modelli o al team di sviluppo dietro un filmato sintetico.

Il paper su SAGA, sottoposto a revisione paritaria, presenta cinque livelli di attribuzione. Il primo separa i filmati autentici da quelli sintetici. I livelli restanti classificano il compito di generazione, la versione del modello, il team di sviluppo e il generatore preciso.

Questa gerarchia offre a un investigatore diverse possibili risposte. Un filmato può essere classificato come sintetico senza sostenere una conclusione affidabile a livello di modello. Un altro può contenere prove sufficienti per associarlo a uno specifico generatore.

Questo risultato graduato è più utile che costringere ogni indagine a una singola decisione tra reale e falso. Riflette inoltre il modo in cui funziona la fiducia forense al di fuori di contesti di ricerca controllati.

SAGA utilizza un video transformer, un'architettura neurale che analizza le relazioni tra regioni dell'immagine e fotogrammi successivi. Un encoder visivo indipendente dal dominio estrae innanzitutto caratteristiche spaziali dai singoli fotogrammi.

Un encoder temporale esamina poi come tali caratteristiche cambiano nel corso del filmato. Il sistema cerca schemi ricorrenti in grado di distinguere i filmati prodotti da diverse pipeline generative.

I ricercatori chiamano il loro metodo di interpretabilità Temporal Attention Signatures, o T-Sigs. Queste firme visualizzano quali momenti ricevono attenzione quando il sistema separa un generatore dall'altro.

Le T-Sigs sono importanti perché l'attribuzione della fonte può avere conseguenze serie. Una piattaforma, un investigatore o un giornalista ha bisogno di più dell'etichetta inspiegata di un modello per valutare un filmato contestato.

Il framework utilizza anche l'hard negative mining. Questo metodo di addestramento presenta al sistema esempi difficili da distinguere, costringendolo ad apprendere differenze più ristrette tra classi correlate.

Secondo i ricercatori, SAGA ha eguagliato le prestazioni pienamente supervisionate usando soltanto lo 0,5 percento di dati per classe etichettati con la fonte. Il risultato si applica ai dataset dello studio e non dovrebbe essere considerato una prestazione universale sul campo.

Il minore requisito di etichettatura affronta un ostacolo pratico. I generatori video cambiano rapidamente, mentre raccogliere ed etichettare output rappresentativi di ogni versione richiede tempo e accesso.

Tuttavia, l'efficienza dei dati non elimina la necessità di materiale di riferimento. Un sistema forense ha comunque bisogno di output rappresentativi ed etichette affidabili prima di poter associare schemi a fonti note.

I lettori di Google News potrebbero imbattersi nella storia come in uno strumento che riconduce i video AI “alla loro fonte”. Questa formulazione richiede un'interpretazione attenta.

SAGA non recupera l'account di un creatore, il prompt o il caricamento originale. Attribuisce caratteristiche tecniche a una probabile classe di generatori sulla base di schemi appresi dai dati.

Si tratta comunque di un cambiamento significativo. Conoscere la probabile famiglia di modelli può restringere un'indagine, informare l'applicazione delle policy di una piattaforma o verificare un'affermazione sul modo in cui è stato prodotto un filmato sospetto.

Non può, da solo, identificare chi abbia generato il filmato o perché lo abbia pubblicato. Queste domande richiedono registri degli account, cronologie di caricamento, prove sui dispositivi e il lavoro investigativo tradizionale.

Perché il rilevamento binario dei deepfake non è più sufficiente

Un'etichetta sintetica descrive la condizione di un video, ma l'attribuzione della fonte può rivelare il percorso produttivo che vi sta dietro.

Il rilevamento binario ha dominato il dibattito pubblico sui deepfake. Un rilevatore riceve un file e stima se provenga da una videocamera o da un sistema generativo.

Questo compito rimane utile, ma non risponde a molte domande operative. Gli investigatori spesso devono collegare filmati correlati, identificare una famiglia di modelli ricorrente o determinare se una campagna abbia cambiato strumenti di produzione.

Si considerino diversi video sintetici distribuiti durante un evento di cronaca. Un rilevatore binario potrebbe segnalarli tutti, senza però fornire prove sul fatto che un'unica operazione abbia prodotto l'intero gruppo.

L'attribuzione della fonte potrebbe raggruppare quei file attorno a una firma di generatore condivisa. Questa constatazione non dimostrerebbe una paternità comune, ma offrirebbe agli analisti una pista più solida rispetto a etichette di falso separate.

L'attribuzione conta anche quando qualcuno sostiene che un video contestato provenga da un modello particolare. Una stima a livello di modello può supportare o mettere in discussione tale versione, fatte salve le percentuali di errore note e spiegazioni alternative.

Il problema diventa più urgente man mano che gli errori visivi scompaiono. Mani, testo, movimento degli oggetti e coerenza della scena offrivano un tempo indizi evidenti, ma i generatori continuano a ridurre questi difetti visibili.

L'analisi forense deve quindi esaminare segnali che gli spettatori comuni non riescono a vedere in modo affidabile. Possono includere schemi di frequenza, artefatti residui, relazioni tra fotogrammi o peculiarità introdotte dall'architettura del modello e dalla decodifica.

SAGA si concentra sia sulle prove spaziali sia su quelle temporali. Le prove spaziali compaiono nei singoli fotogrammi, mentre quelle temporali emergono dal modo in cui oggetti e caratteristiche visive evolvono tra i fotogrammi.

L'attribuzione video richiede entrambe. Due generatori possono produrre fotogrammi fissi simili ma gestire in modo diverso movimento, occlusione o transizioni.

Il design a cinque livelli del framework riconosce inoltre che l'attribuzione ha diverse risoluzioni utili. Un investigatore può identificare la più ampia famiglia di modelli di uno sviluppatore anche quando la versione precisa rimane incerta.

Questa flessibilità distingue l'attribuzione forense da un badge di autenticità rivolto ai consumatori. Un badge deve comunicare rapidamente un risultato semplice, mentre un'indagine può preservare più livelli di fiducia.

I team di sicurezza potrebbero applicare questo approccio nell'analisi di operazioni di influenza, campagne di impersonificazione o materiale sintetico usato nelle frodi. Le piattaforme potrebbero anche utilizzarlo per dare priorità alla revisione umana.

Un'azienda che affronta un video contraffatto del proprio dirigente presenta un altro caso concreto. Gli analisti potrebbero prima ispezionare i metadati di provenienza, poi testare watermark noti e infine valutare firme forensi apprese.

Nessun singolo risultato dovrebbe decidere il caso. La concordanza tra metodi indipendenti crea una base d'azione più solida di un singolo punteggio di classificatore.

Questo processo stratificato ricorda la consolidata informatica forense. Gli analisti confrontano struttura dei file, metadati, cronologia dei contenuti, tracce dei dispositivi e prove contestuali prima di raggiungere una conclusione.

L'attribuzione della fonte dei video AI appartiene a questo processo. Non dovrebbe sostituirlo.

Il vantaggio è quindi la profondità investigativa, non la verità automatica. SAGA offre ai difensori un modo per porre una domanda più specifica quando il rilevamento di base fornisce troppo poche informazioni.

Aumenta anche la pressione sugli sviluppatori di generatori. Se le famiglie di modelli lasciano firme distinguibili, i fornitori devono presumere che i loro output possano restare tecnicamente riconoscibili dopo aver lasciato i servizi controllati.

Questa prospettiva può favorire la responsabilità. Può anche generare controversie quando terze parti pubblicano risultati di attribuzione senza una validazione sufficiente o divulgano metodi che gli avversari possono studiare.

La nuova capacità alza lo standard delle prove mentre migliora al contempo le prove disponibili. Un'etichetta sicura di sé diventa meno accettabile quando la decisione riguarda espressione, reputazione o procedimenti legali.

SAGA mette in discussione la provenienza dei video AI basata solo sui watermark

La disputa centrale contrappone segnali di provenienza cooperativi e prove forensi estratte dopo che un video ha già circolato.

La provenienza cooperativa inizia quando un generatore o uno strumento di editing contrassegna un contenuto durante la creazione. Il contrassegno potrebbe essere un watermark invisibile, metadati firmati o un record Content Credentials.

Questi sistemi possono trasportare informazioni preziose. Possono identificare lo strumento coinvolto, registrare le modifiche o collegare una risorsa pubblicata a una fonte firmata.

SynthID di Google segue questa strada. Secondo la panoramica ufficiale di SynthID, il sistema incorpora watermark rilevabili in immagini, audio, testo e video generati dall'AI.

YouTube legge inoltre determinati Content Credentials. Le sue linee guida sulla divulgazione affermano che le credenziali idonee possono indicare che un intero video è stato realizzato con l'AI.

Questo approccio offre un grande vantaggio. Il segnale di provenienza deriva dal flusso di lavoro di creazione o modifica, anziché da un classificatore esterno che ricostruisce in seguito l'origine.

Un record crittografico valido può fornire prove più solide di una supposizione probabilistica. Può anche comunicare una cronologia delle modifiche che l'analisi visiva non può recuperare.

Eppure, la provenienza cooperativa presenta un problema di copertura. Funziona quando gli strumenti implementano standard compatibili, preservano i dati pertinenti e li espongono alle piattaforme a valle.

Non tutti i generatori partecipano. I modelli aperti possono essere eseguiti tramite pipeline modificate, mentre servizi non autorizzati possono ignorare del tutto i requisiti di etichettatura.

I metadati possono inoltre scomparire durante la normale gestione. Ricodifica, registrazione dello schermo, conversione di formato ed elaborazione delle piattaforme possono separare un filmato visibile dal suo manifest originale.

SAGA affronta il lato opposto di questa lacuna. Cerca di inferire l'origine dagli artefatti rimasti nei pixel e nel loro movimento, senza richiedere al generatore originale di inserire un'etichetta.

Questa distinzione rende l'attribuzione forense interessante per contenuti ostili o privi di etichetta. L'investigatore può analizzare un file anche quando il suo creatore rifiuta di collaborare.

Tuttavia, l'inferenza porta con sé la propria debolezza. Le firme apprese possono essere influenzate da compressione, editing, cambiamenti di risoluzione e differenze tra dataset di ricerca e piattaforme pubbliche.

Anche un aggiornamento del modello potrebbe cambiare gli artefatti pertinenti. I sistemi di attribuzione devono stare al passo con generatori che ricevono nuovi dati di addestramento, architetture, decoder e livelli di sicurezza.

La strategia più solida per l'autenticazione dei media combina quindi entrambi gli approcci. Microsoft Research descrive provenienza, watermarking e fingerprinting come metodi di autenticazione complementari.

Questa impostazione evita una falsa contrapposizione. La provenienza firmata può fornire prove dirette quando viene preservata, mentre l'attribuzione forense può esaminare contenuti privi di tali registrazioni.

Un'indagine ideale inizierebbe con verifiche della provenienza. Gli analisti esaminerebbero Content Credentials, informative delle piattaforme e watermark specifici dei fornitori prima di applicare modelli forensi indipendenti.

Se ogni livello indica lo stesso generatore, la fiducia aumenta. Se i segnali sono in conflitto, gli investigatori hanno motivo di rallentare e ricostruire la cronologia del file.

Il conflitto può di per sé rivelare manomissioni. Un record firmato associato a un workflow dovrebbe essere esaminato con attenzione quando i pattern forensi assomigliano coerentemente a un altro generatore.

Tuttavia, nessuno dei due metodi stabilisce l'intento. Un artista, un ricercatore di sicurezza, un propagandista politico e un truffatore potrebbero usare lo stesso sistema di generazione.

L'attribuzione della fonte identifica un percorso tecnico, non una categoria morale. Le piattaforme devono mantenere chiara questa distinzione quando applicano etichette o decisioni di enforcement.

La contrapposizione tra provenienza e inferenza forense è quindi un compromesso tra registrazioni autorevoli ma incomplete e una copertura più ampia ma probabilistica.

SAGA è importante perché rafforza la seconda metà di questa equazione. Non elimina la necessità della prima.

Cosa non dimostrano le impronte digitali dei video AI

Il risultato della ricerca di SAGA supporta una pista forense, non un'identificazione in grado di reggere in tribunale della persona dietro un video.

La maggiore incertezza riguarda la generalizzazione. Un modello può avere buone prestazioni su benchmark selezionati, ma incontrare modelli di compressione, editing e distribuzione diversi nelle implementazioni pubbliche.

Le piattaforme social ricodificano regolarmente i video. Gli utenti ritagliano clip, aggiungono didascalie, modificano i frame rate, sovrappongono loghi, registrano schermi e combinano filmati provenienti da più fonti.

Ogni trasformazione può alterare il segnale disponibile per un classificatore forense. Alcune modifiche possono lasciare intatti gli artefatti del generatore, mentre altre possono indebolirli o oscurarli.

L'articolo pubblicato riporta esperimenti su dataset pubblici e in contesti cross-domain. Si tratta di prove più solide rispetto a test condotti solo sui dati utilizzati per l'addestramento.

Non riproduce ogni condizione che si può incontrare in un'indagine reale. Generatori sconosciuti, modelli personalizzati ed elusione deliberata restano casi difficili.

L'attribuzione a insieme chiuso crea un rischio specifico. Se un sistema deve scegliere tra generatori noti, può assegnare una clip non familiare alla classe nota meno errata.

Uno strumento operativo necessita di una possibilità significativa di rifiuto. Dovrebbe poter segnalare che le prove non supportano l'attribuzione a nessuna delle fonti rappresentate.

La calibrazione della confidenza è importante per lo stesso motivo. Una probabilità grezza prodotta da una rete neurale non corrisponde automaticamente alla probabilità reale che la sua conclusione sia corretta.

Gli investigatori devono validare le soglie rispetto all'ambiente di implementazione. Una redazione che esamina clip social compressi affronta condizioni diverse da quelle di un laboratorio che elabora file originali.

La pressione avversaria aggiunge un'altra complicazione. Quando gli aggressori comprendono quali caratteristiche supportano l'attribuzione, possono cercare di cancellare, imitare o confondere tali segnali.

Potrebbero ricodificare ripetutamente un file, aggiungere rumore, fondere output di più modelli o far passare il risultato attraverso un altro sistema di editing generativo.

Una modifica riuscita non dovrebbe necessariamente migliorare l'aspetto del video. Dovrebbe solo indebolire il legame tra l'output e il suo generatore originale.

I ricercatori possono rispondere con addestramento avversario e dati più ampi, ma ciò produce una competizione continua. Il risultato assomiglia più al rilevamento di malware che a un test permanente di autenticità.

L'attribuzione presenta anche un rischio di governance. Un'etichetta errata sul generatore potrebbe danneggiare un creatore, un fornitore di modelli o un editore se le organizzazioni la presentano senza incertezza.

La presenza di YouTube e Google DeepMind tra le affiliazioni della ricerca rende la trasparenza particolarmente importante. Google gestisce importanti sistemi di generazione, distribuzione, ricerca e pubblicità.

Questa concentrazione non invalida il lavoro. Rafforza però la necessità di replicazione indipendente, benchmark pubblici e una chiara separazione tra le affermazioni della ricerca e l'enforcement delle piattaforme.

Gli autori forniscono un metodo di interpretabilità tramite T-Sigs, che rappresenta un passo utile. Le visualizzazioni dell'attenzione, tuttavia, non spiegano automaticamente la causalità né dimostrano che un modello abbia utilizzato caratteristiche forensi legittime.

Un sistema può concentrarsi su una regione facendo affidamento su artefatti correlati del dataset. I ricercatori devono verificare se le firme persistono tra impostazioni di codifica, soggetti e pipeline di raccolta differenti.

Anche i dataset sottostanti plasmano ciò che il modello apprende. Se gli esempi di un generatore presentano una risoluzione, un watermark o un pattern di editing coerente, un classificatore potrebbe sfruttare questa scorciatoia.

L'hard negative mining può ridurre le scorciatoie più semplici enfatizzando gli esempi ambigui. Restano necessari un'attenta progettazione dei dataset e test esterni.

Un'ulteriore distinzione riguarda l'attribuzione del generatore rispetto all'origine del contenuto. Anche un'etichetta del modello corretta non può rivelare quale account di servizio abbia avviato la generazione.

Non può recuperare il prompt originale, a meno che tali informazioni non esistano altrove. Né può stabilire se il creatore intendesse consapevolmente ingannare qualcuno.

I giornalisti dovrebbero quindi descrivere un risultato come coerente con, associato a o attribuito a un generatore in condizioni testate. Parole come “dimostrato” vanno oltre le prove disponibili.

I team di sicurezza dovrebbero conservare il file completo, registrare i passaggi di elaborazione e confrontare i risultati di più metodi. Dovrebbero inoltre conservare le prove contraddittorie.

Per i lettori che seguono ricerche in rapida evoluzione tramite Google News, questa limitazione è l'aspetto più importante. Uno strumento forense migliore non trasforma un'attribuzione probabilistica in certezza.

SAGA riduce l'ignoto. Non lo cancella.

Tre segnali che determineranno se SAGA conta

Il prossimo test sarà verificare se l'attribuzione della fonte resiste fuori dai benchmark e diventa uno strato di un processo di verifica trasparente.

Il primo segnale è costituito da test indipendenti su video trasformati e avversariali. Ricercatori esterni al team originale devono valutare come cambia l'attribuzione dopo ritaglio, compressione, registrazione dello schermo, interpolazione dei frame ed editing generativo.

I risultati su modelli sconosciuti conteranno più di tutto. Un sistema utile deve distinguere un “generatore mai visto” da una corrispondenza errata ma sicura con una fonte familiare.

Prestazioni solide in tali condizioni rafforzerebbero l'affermazione di SAGA secondo cui gli artefatti dei generatori forniscono prove forensi durevoli. Grandi perdite di accuratezza ne limiterebbero il ruolo a indagini controllate.

Il secondo segnale è l'integrazione con i sistemi di provenienza anziché la competizione con essi. Google ha già descritto l'espansione degli strumenti per identificare i media generati dall'AI e la sperimentazione di workflow di rilevamento più rapidi.

Il suo aggiornamento sull'identificazione dei media del maggio 2026 ha presentato etichette, SynthID, Content Credentials e rilevamento come componenti di una strategia più ampia.

Un'implementazione pratica dovrebbe mostrare separatamente ciascun livello di prova. Gli utenti devono sapere se una conclusione deriva da metadati firmati, da un watermark rilevato o da un'attribuzione statistica.

Riassumere questi segnali in un'unica etichetta nasconderebbe differenze significative di affidabilità. Una credenziale verificata non equivale alla stima della famiglia di modelli di un classificatore.

Un'integrazione trasparente rafforzerebbe il valore della ricerca. Un'etichetta di piattaforma priva di spiegazioni indebolirebbe la fiducia, anche se il modello sottostante avesse buone prestazioni.

Il terzo segnale è se sviluppatori e piattaforme pubblicheranno dettagli di valutazione per l'uso nell'enforcement. Ciò include tassi di errore, comportamento di rifiuto, generatori supportati e prestazioni dopo trasformazioni comuni.

Le organizzazioni dovrebbero inoltre definire una procedura di ricorso. I creatori hanno bisogno di un modo per contestare etichette con conseguenze rilevanti, specialmente quando un sistema valuta media modificati o ibridi.

I contenuti ibridi rappresentano un test immediato per le politiche. Un video può combinare riprese con fotocamera, effetti visivi convenzionali, inserti generati ed editing assistito dall'AI.

Definire sintetico l'intero file può celare più di quanto riveli. Strumenti granulari dovrebbero identificare quali porzioni supportano un'attribuzione e dove la confidenza diminuisce.

Questo problema è in linea con l'attenzione di SAGA alle prove temporali. I sistemi futuri potrebbero localizzare le firme del generatore in segmenti specifici invece di assegnare un'unica fonte a un intero file.

Tale localizzazione aiuterebbe le redazioni ad analizzare clip manipolate che contengono materiale autentico. Ridurrebbe inoltre la pressione a forzare media complessi in categorie binarie.

I lettori dovrebbero osservare come YouTube gestisce questa distinzione. La piattaforma si trova all'intersezione tra creazione AI, distribuzione dei contenuti, divulgazione della provenienza e ricerca sui modelli.

Un'implementazione su quella piattaforma offrirebbe scala, ma la scala aumenta il costo degli errori. Anche un tasso di errore ridotto può colpire molti creatori quando applicato a una piattaforma importante.

Le organizzazioni giornalistiche affrontano una versione più piccola ma urgente della stessa decisione. Hanno bisogno di verifiche più rapide durante elezioni, guerre, disastri e incidenti di sicurezza in evoluzione.

SAGA può contribuire con un indizio tecnico all'interno di tale workflow. Dovrebbe affiancarsi a interviste alle fonti, ricerche inverse, geolocalizzazione, ispezione dei metadati e analisi fotogramma per fotogramma.

I team di sicurezza aziendale hanno un altro motivo per seguire questo lavoro. I video sintetici di dirigenti compaiono sempre più spesso in scenari di impersonificazione, ingegneria sociale e prove fabbricate.

Una stima della famiglia di modelli potrebbe collegare più tentativi o identificare cambiamenti nel processo di produzione di un aggressore. Queste informazioni possono migliorare il raggruppamento degli incidenti senza stabilire un'identità.

I team che gestiscono queste indagini necessitano di registri ricercabili di file, risultati, fonti e prove contraddittorie. Una base di conoscenza AI strutturata può preservare tale contesto tra analisti e casi.

La ricerca crea inoltre pressione per un linguaggio standard di valutazione. “Fonte” può significare un generatore, una versione di modello, un team di sviluppo, un account di servizio, un creatore o il caricamento originale.

SAGA affronta diversi significati legati al generatore. La comunicazione pubblica deve specificare quale di essi è supportato da un risultato.

La copertura di Google News probabilmente attirerà maggiore attenzione sulla promessa allettante di ricondurre un video alla sua fonte. La storia duratura è più circoscritta e più rilevante.

I ricercatori stanno costruendo strumenti in grado di inferire la genealogia produttiva di un video sintetico quando manca una provenienza esplicita. Questi strumenti stanno diventando più interpretabili e meno dipendenti da grandi quantità di dati etichettati.

I loro limiti restano altrettanto importanti. Le impronte forensi possono cambiare, sparire, sovrapporsi o trarre in inganno quando le condizioni differiscono dal benchmark.

La domanda giusta non è se SAGA sostituirà i watermark. È se test indipendenti dimostreranno che entrambi i metodi possono rafforzarsi a vicenda senza nascondere l'incertezza.

Osservate le valutazioni su generatori mai visti, etichette delle prove trasparenti e tassi di errore di implementazione pubblicati. Questi tre segnali mostreranno se SAGA diventerà uno strato forense pratico o rimarrà un promettente risultato di ricerca.

 
 

Inizia gratis

Un assistente IA local-first con gestione della conoscenza personale

Per una migliore esperienza con l’IA,

al momento remio supporta solo Windows 10+ (x64) e M-Chip Macs.

​Aggiungi una barra di ricerca al tuo cervello

Basta chiedere a remio

Ricorda tutto

Non organizzare nulla

bottom of page