top of page

Le prove di distillazione tra OpenAI e DeepSeek complicano l’ultimo scontro nelle notizie tecnologiche

15 ago
Tempo di lettura: 14 min

OpenAI e DeepSeek si trovano di fronte a un nuovo segnale di conflitto dopo che alcuni ricercatori hanno verificato se il comportamento dei modelli possa rivelare relazioni di addestramento nascoste. Lo studio aggiunge prove empiriche a notizie tecnologiche finora dominate da log aziendali, accuse politiche e affermazioni architetturali non verificabili.

L’articolo di ricerca del 19 giugno non dimostra che OpenAI abbia copiato DeepSeek, né che DeepSeek abbia copiato OpenAI. Introduce invece un metodo di audit comportamentale e rileva possibili connessioni tra GPT-OSS di OpenAI, DeepSeek-R1, QwQ di Alibaba e o1 di OpenAI.

Questa distinzione è importante perché Washington ha definito la distillazione non autorizzata da parte di laboratori cinesi come un potenziale furto tecnologico. La Cina ha respinto tali accuse, mentre i laboratori americani hanno raramente divulgato ogni modello che ha fornito dati sintetici per il loro addestramento.

La nuova ricerca mette in discussione entrambe le parti. Sostiene l’idea che la distillazione possa lasciare tracce rilevabili, ma suggerisce anche che le moderne famiglie di modelli formino una catena intrecciata, anziché una semplice relazione tra insegnante americano e studente cinese.

Un test comportamentale aggiunge prove oltre il traffico API

Il cambiamento immediato è metodologico: i ricercatori affermano ora di poter cercare un modello insegnante nel comportamento di uno studente.

Lo studio sul rilevamento della distillazione è stato condotto da ricercatori affiliati all’University of California, Berkeley, alla University of Southern California e a OpenAI. Descrive una tecnica chiamata inferenza di appartenenza basata su riferimento.

L’inferenza di appartenenza verifica se determinato materiale sia probabilmente comparso durante l’addestramento. Il nuovo metodo adatta questa idea per chiedersi se un modello abbia appreso dagli output di un altro.

Un confronto diretto tra due modelli completati produce in genere risultati ambigui. Modelli addestrati su dati internet simili possono condividere fatti, formulazioni, schemi di ragionamento e strategie per i benchmark senza copiarsi direttamente.

I ricercatori affrontano questa ambiguità aggiungendo un checkpoint precedente della stessa famiglia dello studente. Misurano se il modello più recente sia diventato più allineato a un potenziale insegnante rispetto a quanto lo fosse il suo predecessore.

Supponiamo che un revisore voglia esaminare un modello QwQ più recente. Il revisore confronta la sua preferenza per gli output di DeepSeek-R1 con le preferenze di un checkpoint QwQ precedente.

Uno spostamento maggiore verso DeepSeek-R1 può indicare che gli output di DeepSeek abbiano influenzato il modello QwQ più recente. Il modello di riferimento funge da linea di base, aiutando a rimuovere le somiglianze già esistenti nella famiglia QwQ.

Questo confronto relativo è il principale contributo dell’articolo. Alternative comuni, tra cui la sovrapposizione lessicale e la probabilità grezza degli output, hanno ottenuto risultati scarsi in diversi esperimenti controllati.

I ricercatori hanno creato 24 modelli studenti usando combinazioni di quattro studenti di base, tre insegnanti e due raccolte di prompt. Hanno mantenuto 19 casi nei quali la distillazione migliorava l’utilità misurata dello studente.

Il loro metodo basato su riferimento ha identificato l’insegnante corretto con accuratezza quasi perfetta in tutti i casi controllati mantenuti. Ha inoltre recuperato DeepSeek-R1 come insegnante noto per sei dei sette modelli distillati del mondo reale sottoposti al test.

Questi risultati dimostrano che il rilevamento comportamentale può funzionare in condizioni selezionate. Non dimostrano un’accuratezza universale per ogni pipeline di addestramento di frontiera.

Il contesto più solido prevede un insegnante, un’unica fase finale di supervised fine-tuning, tracce di ragionamento accessibili e un checkpoint precedente adeguato. I modelli commerciali spesso violano varie di queste ipotesi.

Anche così, l’approccio cambia le prove disponibili per gli investigatori. Finora, i principali laboratori si sono basati soprattutto su registri degli account, collegamenti di pagamento, indirizzi IP e schemi di query insoliti.

Anthropic afferma che questi segnali l’hanno aiutata a identificare campagne coordinate che coinvolgevano DeepSeek, Moonshot AI e MiniMax. La sua divulgazione del 23 febbraio ha sostenuto che vi fossero oltre 16 milioni di scambi con Claude attraverso circa 24.000 account fraudolenti.

L’audit comportamentale parte dall’estremità opposta. Invece di osservare come vengono raccolti i dati di addestramento, cerca un segnale residuo nel modello risultante.

Questo approccio potrebbe aiutare i revisori a esaminare modelli open-weight dopo la pubblicazione. Potrebbe anche sostenere indagini quando un fornitore API non dispone di log di accesso completi o non ha mai osservato il traffico originale.

Per i lettori che seguono le notizie tecnologiche, questo è lo sviluppo centrale. La disputa ora include un test sperimentale a livello di modello, non soltanto dichiarazioni contrapposte di laboratori e governi.

Le prove di distillazione di OpenAI creano un’inversione scomoda

Il risultato politicamente più sensibile dello studio non è la scoperta relativa a DeepSeek, bensì il suo segnale incerto sui modelli GPT-OSS di OpenAI.

I ricercatori hanno esaminato GPT-OSS-20B e GPT-OSS-120B rispetto a potenziali insegnanti che includevano DeepSeek-R1, QwQ, o1 di OpenAI e modelli Claude e Llama. DeepSeek-R1 e QwQ-32B-Preview si sono classificati ai primi posti nella loro analisi.

Questa classifica solleva la possibilità che GPT-OSS abbia appreso dalla stessa linea di ragionamento associata a DeepSeek-R1, QwQ e o1. Non dimostra un trasferimento diretto da DeepSeek a OpenAI.

Le prove sono più deboli rispetto ai risultati controllati dell’articolo. GPT-OSS non dispone di un checkpoint precedente adeguato della stessa famiglia, quindi i ricercatori hanno usato GPT-2 XL come riferimento.

GPT-2 XL è separato da GPT-OSS da anni di ricerca e da sostanziali cambiamenti architetturali. L’articolo avverte esplicitamente che questo divario temporale e tecnico rende il riferimento inaffidabile.

Gli autori etichettano quindi come altamente incerta la loro interpretazione di GPT-OSS. La presentano come una questione aperta che richiede migliori modelli di riferimento e ulteriori analisi.

Questa cautela dovrebbe guidare ogni discussione sulle prove di distillazione di OpenAI. Una posizione elevata tra candidati selezionati non è un registro completo dell’addestramento, e un insegnante omesso può distorcere l’attribuzione.

C’è un’altra complicazione. DeepSeek-R1 e QwQ potrebbero a loro volta contenere segnali ereditati da modelli OpenAI, incluso o1.

Il test separato sui glifi dello studio esamina un comportamento Unicode insolito associato a o1 e o3. Gli studenti controllati distillati da o1 hanno mostrato differenze maggiori tra rappresentazioni Unicode e ASCII rispetto alla maggior parte dei modelli di controllo.

DeepSeek-R1 ha mostrato un segnale Unicode sostanziale nell’analisi a risposta aperta. Gli autori affermano che ciò suggerisce una possibile influenza in stile o1, senza tuttavia arrivare a un’attribuzione definitiva.

GPT-OSS ha inoltre mostrato un pattern Unicode statisticamente rilevabile tra i modelli di riferimento testati. L’articolo afferma che questo risultato potrebbe collocarlo nella stessa più ampia linea o1, DeepSeek-R1 e QwQ.

Questo crea una catena anziché una netta inversione. GPT-OSS potrebbe somigliare a DeepSeek perché entrambi i sistemi hanno ereditato comportamenti da o1, perché GPT-OSS ha appreso da DeepSeek oppure perché più fasi hanno combinato questi percorsi.

La riscrittura aggiunge un’ulteriore incertezza. Un modello può generare una risposta, mentre un altro la riscrive prima che entri nel set di addestramento dello studente.

Un rilevatore potrebbe identificare il generatore originale, il riscrittore, entrambi i sistemi o nessuno dei due. L’articolo non risolve ancora questo scenario.

Il risultato mette comunque sotto pressione il lato americano dell’argomento politico. I funzionari statunitensi hanno spesso descritto la conoscenza di frontiera come un flusso che si muove soprattutto dai fornitori americani verso i concorrenti cinesi.

Un potenziale segnale che attraversa GPT-OSS complica questa narrazione direzionale. Suggerisce che l’influenza possa circolare attraverso dataset pubblici, soluzioni di benchmark, tracce di ragionamento e diverse generazioni di dati sintetici.

Ciò non rende equivalenti tutte le forme di distillazione. L’uso autorizzato di output aperti differisce dall’accesso fraudolento attraverso account coordinati, così come la distillazione interna differisce dall’estrazione da un concorrente.

Tuttavia, la sola ascendenza tecnica non può determinare se un trasferimento fosse autorizzato. Le prove comportamentali devono essere combinate con termini di licenza, registri di accesso, divulgazioni sull’addestramento e legislazione applicabile.

Le nuove prove di distillazione di OpenAI creano quindi un’inversione limitata ma significativa. I laboratori americani che cercano standard di attribuzione devono accettare che tali standard possano essere applicati anche ai modelli americani.

La distillazione dei modelli DeepSeek rimane un’accusa seria

La possibile connessione con GPT-OSS non cancella le prove sostanziali secondo cui laboratori cinesi hanno interrogato modelli americani per ottenere output legati all’addestramento.

Le conclusioni di Anthropic sulla distillazione descrivono prove a livello di infrastruttura, anziché somiglianze comportamentali. L’azienda afferma di aver collegato attività coordinate a DeepSeek, Moonshot e MiniMax con un elevato grado di certezza.

Secondo Anthropic, le campagne hanno utilizzato account fraudolenti e servizi proxy per eludere restrizioni regionali e difese della piattaforma. I prompt ripetuti prendevano di mira ragionamento, programmazione, uso di strumenti, controllo del computer e altre capacità di valore.

Anthropic ha attribuito oltre 150.000 scambi a DeepSeek. Afferma che traffico sincronizzato, metodi di pagamento condivisi e pattern identici indicassero un bilanciamento del carico tra account.

L’azienda ha attribuito oltre 3,4 milioni di interazioni con Claude a Moonshot. La sua ricostruzione descriveva centinaia di account fraudolenti diretti a ragionamento, programmazione, visione, analisi dei dati e operazioni al computer.

Restano affermazioni dell’azienda, sebbene Anthropic sostenga che partner del settore abbiano corroborato alcuni indicatori infrastrutturali. I ricercatori esterni non possono ispezionare in modo indipendente tutti i dati rilevanti sugli account.

Lo studio comportamentale aggiunge un diverso tipo di sostegno alle preoccupazioni sulla distillazione dei modelli DeepSeek. Il suo test basato su riferimento ha collocato o1 e QwQ-32B-Preview vicino ai primi posti nell’esame di DeepSeek-R1.

La diagnostica Unicode ha inoltre identificato in DeepSeek-R1 un segnale in stile o1. Il divario riportato era statisticamente distinguibile da zero su 100 sonde.

Tuttavia, gli autori definiscono il risultato preliminare. La loro validazione controllata copre un processo di addestramento semplificato, mentre DeepSeek-R1 probabilmente riflette diverse fonti di dati, fasi di addestramento e metodi di reinforcement.

Un’impronta comportamentale non può nemmeno rivelare se l’accesso abbia violato un contratto. Identifica una possibile relazione tecnica, non le circostanze legali che la circondano.

Questo confine è importante perché la distillazione della conoscenza è di per sé una pratica standard. Un laboratorio può usare il proprio modello più grande per addestrarne una versione più piccola, oppure utilizzare output consentiti dalla licenza di un altro modello.

La disputa riguarda la distillazione avversaria, ovvero l’estrazione su larga scala di capacità attraverso accessi non autorizzati o ingannevoli. La condotta contestata include account falsi, reti proxy nascoste e raccolta mirata progettata per l’addestramento dei modelli.

Un’analisi politica di giugno sostiene che tali campagne creino una vulnerabilità strategica per i fornitori statunitensi di IA. Riconosce inoltre notevoli problemi di misurazione.

Gli analisti non possono isolare facilmente quanta capacità un modello abbia ottenuto da dati distillati. Per farlo sarebbero necessarie esecuzioni di addestramento comparabili, con e senza il materiale sospetto.

Tali esecuzioni richiederebbero inoltre l’accesso a checkpoint di base privati, dati di addestramento proprietari e output raccolti dall’insegnante. I ricercatori esterni raramente possiedono tutti e tre.

I pattern dei benchmark offrono, da soli, prove deboli. I modelli cinesi possono avvicinarsi ai sistemi americani nella programmazione e nella matematica perché queste competenze si trasferiscono bene tramite distillazione.

Lo stesso schema potrebbe emergere perché gli sviluppatori cinesi danno priorità a compiti tecnici commercialmente utili. Risultati simili nei benchmark non permettono di distinguere tra queste spiegazioni.

Il caso QwQ illustrato nel paper evidenzia sia le potenzialità sia i rischi dell’inferenza. DeepSeek-R1 si è classificato al primo posto quando i ricercatori hanno confrontato QwQ-32B con il suo riferimento QwQ-32B-Preview.

La cronologia pubblica sostiene questa possibilità. QwQ-32B-Preview è apparso nel novembre 2024, DeepSeek-R1 è seguito nel gennaio 2025 e QwQ-32B è arrivato nel marzo 2025.

La tempistica rende possibile la relazione proposta, ma non ne costituisce una prova. Alibaba potrebbe aver utilizzato dataset sovrapposti, output pubblici di DeepSeek, metodi interni o diversi insegnanti.

La distillazione dei modelli DeepSeek dovrebbe quindi restare un’accusa specifica supportata da più tipi di evidenza. Non dovrebbe trasformarsi in una spiegazione universale della qualità dei modelli cinesi.

Questa distinzione protegge le indagini legittime. Sopravvalutare prove deboli offre alle aziende accusate un facile motivo per liquidare registri infrastrutturali e violazioni di accesso più solidi.

Il caso politico di Washington ora affronta un audit tecnico

Il vero avversario in questa battaglia non è OpenAI contro DeepSeek, ma la certezza politica contro un’attribuzione tecnica incompleta.

L’amministrazione Trump ha distinto la distillazione legittima dall’estrazione industriale occulta. Questa linea sostiene lo sviluppo di modelli aperti preservando al contempo una base per sanzioni e restrizioni commerciali.

Un resoconto politico del 24 luglio ha riferito che funzionari hanno accusato Moonshot di aver distillato il modello Claude Fable di Anthropic. I funzionari hanno descritto il normale lavoro di efficienza come legittimo, ma l’estrazione occulta come inaccettabile.

Il 27 luglio la Cina ha risposto accusando gli Stati Uniti di “egemonismo dell’IA”. Il suo ministero del commercio ha minacciato contromisure contro azioni che avessero causato danni sostanziali agli interessi cinesi.

La risposta cinese è seguita agli avvertimenti su possibili sanzioni, indagini e restrizioni nella Entity List. Moonshot ha negato di aver ottenuto le prestazioni di Kimi K3 tramite distillazione.

Moonshot ha attribuito i propri progressi a cambiamenti architetturali originali. Questa affermazione non è stata verificata indipendentemente attraverso l’accesso al suo processo di addestramento completo.

I funzionari statunitensi affrontano un problema analogo di trasparenza. I laboratori americani pubblicano rapporti tecnici, ma tali documenti raramente elencano ogni modello esterno utilizzato per valutazione, classificazione, riscrittura o dati sintetici.

Il nuovo metodo di rilevamento può spingere tutti gli sviluppatori verso registri più chiari. Gli auditor potrebbero confrontare l’ascendenza dichiarata di un modello con le evidenze comportamentali e indagare le discrepanze rilevanti.

Tuttavia, i responsabili politici non dovrebbero trattare il punteggio di un rilevatore come un verdetto. L’accuratezza del paper diminuisce quando il vero insegnante manca dal gruppo dei candidati o la calibrazione incontra un insegnante sconosciuto.

Nella cross-validation controllata, l’accuratezza ha raggiunto l’82,9 per cento nella generalizzazione su studenti non osservati. È scesa al 60,5 per cento nella generalizzazione su insegnanti non osservati.

Questa differenza è cruciale per le indagini reali. Un auditor raramente conosce ogni possibile insegnante, e la fonte più importante potrebbe essere un checkpoint privato o non rilasciato.

Il metodo ha inoltre rilevato gli insegnanti di ragionamento più affidabilmente di un insegnante Llama non orientato al ragionamento. Un’impronta debole potrebbe produrre un falso negativo anche quando la distillazione si è verificata.

Al contrario, lignaggi intrecciati possono produrre classifiche fuorvianti. Se l’insegnante A ha influenzato l’insegnante B, uno studente addestrato su B può conservare comportamenti che ricordano A.

Nessun rilevatore a livello di modello risponde oggi da solo alla questione legale. Non può stabilire se gli output provengano da un’API a pagamento, da un dataset aperto, da una partnership autorizzata o da account fraudolenti coordinati.

Un caso di applicazione difendibile richiede diversi livelli di prova. Gli investigatori dovrebbero combinare log dei provider, registri finanziari, infrastruttura degli account, comportamento dei modelli, cronologie di rilascio e dichiarazioni sull’addestramento.

I governi hanno inoltre bisogno di una definizione stabile di estrazione proibita. Definire “furto” ogni addestramento su testo generato da modelli implicherebbe pratiche comuni in tutto il settore.

Una definizione più ristretta può concentrarsi su inganno, elusione dei controlli di accesso, scala rilevante e acquisizione mirata di capacità. Questi fattori sono più facili da distinguere dalla normale valutazione o dalla generazione consentita di dati sintetici.

Questo quadro ridurrebbe anche le supposizioni basate sulla nazionalità. Non si dovrebbe presumere che un modello cinese sia copiato perché ottiene buone prestazioni, né un modello americano dovrebbe ricevere immunità automatica.

Il dibattito sulle notizie tecnologiche diventa più credibile quando gli standard probatori si applicano simmetricamente. Questa simmetria sarà importante se gli audit comportamentali continueranno a rilevare influenze transfrontaliere in entrambe le direzioni.

Ciò che il metodo di rilevamento non può ancora dimostrare

La ricerca offre un segnale utile per gli audit, ma i suoi risultati in ambiente aperto restano troppo incerti per un’accusa definitiva contro qualsiasi laboratorio.

La prima limitazione del paper è l’assunzione di un unico insegnante. I modelli frontier contemporanei possono utilizzare diversi sistemi per generare soluzioni, valutare risposte, riscrivere testi e creare dati di preferenza.

Uno studente addestrato tramite questa pipeline ha più insegnanti con ruoli diversi. Il metodo attuale presume che al massimo un insegnante candidato abbia fornito il segnale rilevante della fase finale.

La seconda limitazione è l’attenzione al fine-tuning supervisionato. Lo sviluppo frontier include anche pre-addestramento, reinforcement learning, rejection sampling, feedback generato da strumenti e ottimizzazione delle preferenze umane.

Un modello potrebbe assorbire il comportamento di un altro sistema durante una qualunque di queste fasi. La traccia risultante potrebbe apparire diversa dalla firma del fine-tuning controllato.

La terza limitazione riguarda i riferimenti. Una forte attribuzione richiede un checkpoint precedente che corrisponda strettamente alla famiglia e allo stato di addestramento dello studente.

QwQ offre un plausibile modello di anteprima precedente, rendendo il suo risultato più facile da interpretare. GPT-OSS non dispone di un checkpoint pubblico equivalente, costringendo i ricercatori a usare GPT-2 XL.

Questa discrepanza indebolisce l’affermazione centrale su GPT-OSS. È il motivo principale per cui gli autori descrivono la connessione proposta come altamente incerta.

Il quarto problema riguarda gli insegnanti mancanti. Un rilevatore può classificare soltanto i candidati che esamina, anche quando la vera fonte è assente.

Il candidato più forte potrebbe semplicemente essere l’opzione meno errata. I test in ambiente aperto cercano di affrontare questo problema con soglie, ma la calibrazione resta sensibile al tipo di insegnante.

Il quinto problema riguarda i dati pubblici condivisi. I modelli possono diventare comportamentalmente simili dopo essere stati addestrati sulle stesse soluzioni di benchmark, repository di codice, paper accademici o dataset sintetici.

Alcuni dataset pubblicano apertamente output di sistemi di ragionamento identificati. L’addestramento su tali registri può creare una dipendenza tecnica senza alcuna estrazione diretta tramite API.

La sesta limitazione è l’offuscamento intenzionale. Gli sviluppatori possono parafrasare gli output, combinare insegnanti, filtrare marcatori stilistici o addestrarsi contro i rilevatori una volta note le tecniche di audit.

Un’impronta visibile può incoraggiarne la rimozione. Questa dinamica appare già nelle ricerche che esaminano se i watermark sopravvivano all’addestramento dei modelli a valle.

La settima preoccupazione riguarda l’indipendenza istituzionale. Un autore del paper dichiara un’affiliazione con OpenAI e la ricerca ha ricevuto sostegno che ha coinvolto OpenAI, Ai2 e Apple.

Ciò non invalida il metodo o i risultati. Rende però particolarmente importante una replica indipendente quando le conclusioni entrano in controversie geopolitiche che coinvolgono OpenAI.

I ricercatori dovrebbero riprodurre i test con nuovi insiemi di prompt, riferimenti alternativi, gruppi di candidati più ampi e modelli con ground truth nascosta. Dovrebbero inoltre testare dataset con più insegnanti e output riscritti.

Le aziende possono contribuire pubblicando checkpoint intermedi e dichiarazioni più complete sulla provenienza dei dati. Un registro di provenienza documenta quali modelli e dataset hanno influenzato ciascuna fase di addestramento.

Tali registri consentirebbero agli auditor di confrontare le dipendenze dichiarate con il comportamento misurato. Distinguerrebbero inoltre la normale distillazione interna dall’estrazione non dichiarata da concorrenti.

Gli acquirenti aziendali hanno una ragione pratica per interessarsene. L’ascendenza non documentata di un modello può creare rischi di licenza, sicurezza, supply chain e conformità normativa.

Un’azienda che distribuisce un modello per la programmazione o l’analisi sensibile ha bisogno di più dei punteggi di benchmark. Deve comprendere come il modello sia stato addestrato e se l’accesso a monte possa attivare restrizioni.

I team che valutano queste affermazioni dovrebbero conservare materiale fonte, date e rapporti tecnici in un sistema ricercabile. Una base di conoscenza sull’IA strutturata aiuta a separare le prove primarie dai commenti ripetuti.

La conclusione corretta è prudente. L’audit comportamentale sta diventando fattibile, ma un segnale fattibile non è ancora uno standard forense.

Tre segnali decideranno cosa accadrà dopo

La prossima fase dipende dalla replica, dalle prove per l’applicazione delle norme e dalle divulgazioni volontarie sulla provenienza dei modelli.

Il primo segnale è la replica indipendente del metodo basato sui riferimenti. I ricercatori devono riprodurne l’accuratezza controllata e testarne le modalità di fallimento su famiglie di modelli sconosciute.

Una replica riuscita dovrebbe includere addestramento con più insegnanti, output riscritti, candidati nascosti e diversi checkpoint di riferimento. Risultati coerenti rafforzerebbero il rilevamento comportamentale come strumento pratico di audit.

L’impossibilità di riprodurre la classifica di GPT-OSS indebolirebbe il ribaltamento principale. Non invaliderebbe i risultati più controllati del metodo che coinvolgono studenti distillati noti.

Il secondo segnale è qualsiasi azione di applicazione sostenuta da prove dettagliate. I funzionari statunitensi hanno discusso indagini, sanzioni e restrizioni commerciali contro sviluppatori cinesi accusati di estrazione occulta.

Un’azione credibile dovrebbe identificare la condotta proibita, la scala, la via di accesso e il collegamento con un modello risultante. Affermazioni generiche sulla qualità nei benchmark non soddisferanno questo standard.

I registri dei provider potrebbero fornire le prove più solide. Pagamenti coordinati, infrastrutture condivise, prompt ripetuti mirati a specifiche capacità ed elusione deliberata sosterrebbero un caso di distillazione avversaria.

L’analisi comportamentale potrebbe quindi collegare tale attività di raccolta a un modello rilasciato. La combinazione sarebbe più forte di entrambe le forme di prova considerate singolarmente.

Il terzo segnale è se OpenAI, DeepSeek, Moonshot, Anthropic e Alibaba riveleranno maggiori dettagli sui dati sintetici di addestramento. Una provenienza dettagliata trasformerebbe le attuali mappe speculative dei lignaggi in affermazioni verificabili.

Gli sviluppatori non devono pubblicare ogni dataset privato. Possono comunque identificare le principali famiglie di insegnanti esterni, le fonti di output autorizzate e le fasi in cui i dati sintetici sono entrati nell’addestramento.

La risposta di OpenAI merita particolare attenzione perché il paper cita GPT-OSS. Una spiegazione tecnica dei suoi modelli di riferimento e dei dati sintetici esterni potrebbe chiarire l’ambiguo segnale DeepSeek e QwQ.

DeepSeek può rispondere nello stesso modo. Maggiori dettagli sulle fonti di post-addestramento di R1 aiuterebbero a verificare se il comportamento rilevato in stile o1 rifletta una distillazione diretta o un lignaggio più indiretto.

Il silenzio non dimostrerà una condotta impropria. Manterrà responsabili politici, acquirenti e ricercatori dipendenti da indizi comportamentali e infrastrutturali incompleti.

Questa controversia nelle notizie tecnologiche si sta quindi avviando verso una contesa sulle prove. Da un lato vi sono log dei provider e affermazioni di sicurezza, dall’altro innovazione tecnica e prove pubbliche insufficienti.

Il nuovo studio non proclama un vincitore. Mostra che la genealogia dei modelli può lasciare tracce misurabili, comprese tracce che complicano la narrazione preferita da entrambi i Paesi.

I lettori dovrebbero prestare attenzione ad audit replicati, violazioni di accesso documentate e divulgazioni specifiche sulla provenienza. Questi segnali riveleranno se la diagnostica forense dei modelli potrà maturare prima che le rivendicazioni politiche si irrigidiscano in politiche permanenti.

 
 

Inizia gratis

Un assistente IA local-first con gestione della conoscenza personale

Per una migliore esperienza con l’IA,

al momento remio supporta solo Windows 10+ (x64) e M-Chip Macs.

Il tuo partner AI al lavoro
Fai di più con remio

Pianifica. Crea. Consegna.
Tutto in un unico posto.

bottom of page