top of page

I modelli Anthropic e Google affrontano un test di pelicanmaxxing, e la teoria dei benchmark crolla

27 lug
Tempo di lettura: 14 min

I modelli di Anthropic e Google hanno appena affrontato un test su 1.008 immagini, progettato per rilevare se i laboratori di IA ottimizzino segretamente per un celebre prompt. Il confronto tra Anthropic e Google non ha trovato prove convincenti che Claude, Gemini o altri cinque modelli concorrenti abbiano ricevuto un addestramento speciale sui pellicani. Il risultato, però, solleva un problema più rilevante. Se non è possibile distinguere l'ottimizzazione mirata dai miglioramenti generalizzati delle capacità, resta difficile fidarsi dei popolari benchmark IA.

Il ricercatore Dylan Castillo ha testato sette modelli usando variazioni della sfida informale di Simon Willison: “Genera un SVG di un pellicano che va in bicicletta”. L'esperimento ha combinato otto animali con sei veicoli, producendo 48 prompt. Ogni modello ha risposto tre volte a ciascun prompt.

Lo studio risultante respinge la spiegazione più divertente dei risultati in miglioramento. Probabilmente i laboratori di IA non stanno riempiendo gli addestramenti di pellicani in bicicletta. Mostra però anche perché valutare Anthropic, Google, OpenAI e i loro rivali richieda più che ripetere un test riconoscibile.

Un benchmark nato come battuta diventa un esperimento controllato

Castillo ha trasformato una battuta ricorrente di internet in un test strutturato dell'ottimizzazione specifica per benchmark.

Willison usa da diversi anni il prompt del pellicano per valutare le principali release di modelli linguistici. Un SVG, o grafica vettoriale scalabile, descrive un'immagine tramite forme e coordinate basate su testo. Generarne uno richiede programmazione, ragionamento spaziale, riconoscimento degli oggetti e composizione visiva in una sola risposta.

Questa combinazione ha reso il prompt sorprendentemente utile. Un modello debole spesso produce markup non valido, ruote difettose, arti fuori posto o un uccello che non assomiglia a un pellicano. Un modello più forte può restituire un'immagine renderizzata correttamente e preservare la relazione richiesta.

Il prompt è diventato anche insolitamente visibile. Willison ha raccolto più di 100 post sotto il suo tag pelican benchmark. I suoi risultati compaiono spesso nelle discussioni pubbliche sui nuovi modelli.

La visibilità crea un problema di incentivi. Quando gli sviluppatori sanno che un prompt riconoscibile accompagnerà ogni release, possono ottimizzarlo. Benchmaxxing significa regolare un sistema affinché ottenga buoni risultati su un benchmark pubblico senza creare miglioramenti altrettanto ampi altrove.

Pelicanmaxxing è la versione comica di questa preoccupazione. Un laboratorio potrebbe inserire esempi di pellicani e biciclette nei dati di addestramento, aggiungere attività simili durante il post-addestramento o premiare output che corrispondano a composizioni familiari. L'immagine risultante apparirebbe impressionante, pur rivelando poco sull'abilità generale.

Castillo ha progettato un esperimento in grado di esporre questo schema. Il suo studio controllato includeva pellicani, fenicotteri, aironi, lontre, procioni, antilopi, balene e gatti. I veicoli includevano biciclette, monocicli, skateboard, scooter, aerei e barche.

Ha testato GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 e DeepSeek V4 Pro. Lo studio ha usato tre generazioni per ogni combinazione modello-prompt, con una temperatura di 1.0.

Il calcolo produce 1.008 immagini: 48 prompt, moltiplicati per tre campioni, moltiplicati per sette modelli. Solo 11 generazioni hanno richiesto un altro tentativo perché la risposta originale non conteneva un SVG utilizzabile.

La pipeline di valutazione aveva tre fasi. Prima, ha renderizzato ogni SVG come immagine PNG. Secondo, GPT-5.6 Luna ha valutato da uno a cinque la coerenza tra animale, veicolo e azione.

Terzo, Gemini 3.1 Flash-Lite ha estratto le caratteristiche visibili. Tra queste figuravano l'animale riconosciuto, il veicolo, la direzione verso cui era rivolto e gli elementi ricorrenti della scena. Castillo ha poi usato Claude Fable 5 per assistere nell'analisi statistica.

Questa configurazione è importante perché un singolo pellicano attraente non può dimostrare il gaming di un benchmark. L'esperimento chiede invece se ogni modello ottenga risultati insolitamente buoni con i pellicani, le biciclette o la loro combinazione esatta.

Questa distinzione trasforma un aneddoto in un'ipotesi verificabile. Se fosse avvenuto un addestramento mirato, il celebre prompt dovrebbe superare prompt strettamente correlati dopo aver considerato i diversi livelli di difficoltà.

I risultati di Anthropic e Google non mostrano alcun vantaggio per il pellicano

Né Claude né Gemini hanno mostrato l'ampio schema atteso da un pelicanmaxxing deliberato.

I risultati più semplici hanno subito contraddetto la teoria. I pellicani si sono classificati sesti tra gli otto animali quando i punteggi sono stati aggregati tra i modelli. Gatti, balene, procioni, aironi e antilopi hanno ricevuto valutazioni più alte per l'animale.

Le biciclette hanno ottenuto risultati ancora peggiori. Si sono classificate quinte su sei veicoli, appena davanti agli aerei. Il giudice ha rilevato un componente della bicicletta mancante o scollegato in circa due terzi delle immagini con biciclette.

Queste classifiche, da sole, non possono risolvere la questione. Un pellicano è più difficile da rappresentare di un gatto, mentre una bicicletta richiede due ruote, un telaio collegato, manubrio, pedali e sella. Un addestramento speciale potrebbe migliorare un soggetto difficile senza portarlo al primo posto.

Castillo ha quindi applicato una regressione a effetti fissi, un modello statistico che separa le differenze consistenti tra gruppi dall'effetto specifico oggetto d'indagine. Il modello ha tenuto conto della difficoltà intrinseca di ogni combinazione animale-veicolo.

Ha quindi stimato tre effetti per ciascun laboratorio. Uno misurava le prestazioni su tutti i prompt con pellicani. Un altro misurava le prestazioni su tutti i prompt con biciclette. L'ultimo isolava l'esatta combinazione pellicano-bicicletta.

La stima relativa ai pellicani per ogni laboratorio è ricaduta tra meno 0,11 e più 0,14 punti del giudice. Nessuna si è avvicinata alla significatività statistica e il più basso p-value riportato era 0,25.

Nessun laboratorio ha prodotto un incremento statisticamente significativo per la combinazione esatta. GLM-5.2 ha registrato la maggiore stima positiva, pari a 0,35 punti, ma il suo p-value era 0,12. Il risultato resta compatibile con il caso.

La celebre combinazione si è classificata al 42° posto tra tutte le 48 combinazioni prima degli aggiustamenti per la difficoltà. Un prompt oggetto di un'ampia preparazione speciale non dovrebbe normalmente collocarsi vicino al fondo della sua griglia di confronto.

I risultati relativi alle biciclette hanno prodotto un'apparente eccezione. Gemini 3.5 Flash ha mostrato un effetto bicicletta di 0,27 punti, con un p-value di 0,022. Considerato isolatamente, il valore supera la soglia convenzionale di 0,05.

Tuttavia, lo studio ha eseguito 21 test statistici correlati. Con una soglia di 0,05, la variazione casuale produrrebbe in media circa un apparente risultato positivo. L'effetto di Gemini era proprio quell'unico risultato.

Non ha inoltre superato una correzione di Bonferroni, che abbassa la soglia di significatività quando i ricercatori testano molte ipotesi. La soglia corretta era approssimativamente 0,002, molto al di sotto del risultato di 0,022 di Gemini.

Questo rende il contrasto tra Anthropic e Google meno drammatico di quanto suggerisca una formulazione favorevole alle parole chiave. Claude non ha rivelato un vantaggio specifico per i pellicani. Il risultato isolato di Gemini sulle biciclette non resiste a una correzione standard per confronti multipli.

Anche OpenAI, xAI, Qwen, Z.ai e DeepSeek non sono riusciti a produrre la firma attesa. Alcuni modelli hanno disegnato immagini migliori nel complesso, ma la qualità generale non dimostra un'ottimizzazione ristretta.

Questa conclusione dovrebbe moderare le affermazioni basate sull'ispezione visiva. Un output rifinito può riflettere una programmazione migliore, una composizione più efficace o una maggiore aderenza alle istruzioni. Non rivela automaticamente materiale di benchmark memorizzato.

Castillo ha inoltre pubblicato il repository dell'esperimento, consentendo ai lettori di ispezionare la pipeline e i risultati sottostanti. Questa trasparenza conferisce allo studio più valore di una galleria selezionata di generazioni riuscite.

La conclusione resta appropriatamente circoscritta. L'esperimento ha trovato poche prove di un evidente pelicanmaxxing tra questi modelli in queste condizioni. Non ha dimostrato che nessun laboratorio abbia mai addestrato i propri modelli su esempi correlati.

Le immagini familiari non dimostrano la memorizzazione

I pattern visivi ripetuti sembrano sospetti, ma la griglia di confronto mostra che molti derivano da convenzioni di disegno ordinarie.

Tutte e 21 le immagini pellicano-bicicletta erano rivolte verso destra. Nessun'altra combinazione ha raggiunto una concordanza direzionale completa. Considerato isolatamente, il risultato sembra un forte segnale di composizione memorizzata.

Il dataset più ampio ne cambia il significato. Il sessanta per cento di tutte le 1.008 immagini era rivolto verso destra. Le biciclette erano rivolte verso destra nell'81 per cento dei campioni, mentre gli scooter raggiungevano l'83 per cento.

Anche i pellicani erano rivolti verso destra nel 78 per cento delle loro immagini. Le antilopi raggiungevano lo stesso tasso e gli aironi il 77 per cento. Questi soggetti favoriscono naturalmente una vista laterale, perché le pose frontali nascondono le caratteristiche distintive.

Una bicicletta è più facile da riconoscere quando entrambe le ruote restano visibili. Un pellicano trae vantaggio da un profilo laterale che ne mostra il lungo becco e la sacca golare. Combinare entrambe le preferenze rende poco sorprendente la coerenza direzionale.

Diverse altre combinazioni hanno quasi raggiunto l'unanimità. Antilopi sugli scooter e pellicani sugli scooter erano rivolti nella stessa direzione in 20 campioni su 21. Gli aironi sulle biciclette lo erano in 19 campioni su 21.

Gli oggetti di scena ricorrenti raccontano una storia simile. Ogni immagine di un fenicottero su una barca conteneva un sole. Le sciarpe apparivano nel 38 per cento delle immagini di lontre in aereo, mentre i cestini apparivano nel 38 per cento delle immagini di gatti in bicicletta.

Le scene pellicano-bicicletta contenevano elementi ricorrenti, ma non a livelli unicamente sorprendenti. I modelli sembrano attingere ad associazioni visive comuni in molti prompt, non soltanto in quello famoso.

Questa distinzione è centrale nel dibattito sui benchmark di Anthropic e Google. I modelli generativi possono convergere su composizioni simili senza recuperare uno specifico esempio di addestramento. Le loro distribuzioni apprese favoriscono disposizioni, colori, pose ed elementi decorativi familiari.

I dati di addestramento contano comunque. Innumerevoli illustrazioni collocano personaggi in movimento di profilo, spesso diretti da sinistra a destra o da destra a sinistra. I modelli possono assorbire queste regolarità senza memorizzare una singola immagine identificabile.

Vale anche il contrario. Un modello può riprodurre pattern influenzati dall'addestramento senza restituire una copia esatta. La somiglianza degli output esiste lungo uno spettro e una piccola griglia di immagini non può collocare ogni risultato al suo interno.

Questa incertezza spiega perché la somiglianza visiva fornisca, da sola, prove deboli. Un sole, una sciarpa, un cestino o un uccello rivolto verso destra potrebbero indicare una convenzione appresa. Potrebbero anche indicare un gruppo più ristretto di esempi ripetuti.

Un'affermazione più forte richiederebbe test aggiuntivi. I ricercatori potrebbero variare formulazione, composizione, direzione, stile artistico e formato di output. Potrebbero anche confrontare le probabilità interne dei modelli o cercare esempi simili nei corpora di addestramento noti.

I modelli chiusi impediscono alla maggior parte dei ricercatori esterni di esaminare questi segnali più profondi. Il pubblico può testarne il comportamento, ma non può ispezionare le miscele complete di addestramento e le ricette di post-addestramento di Anthropic o Google.

Questo divario informativo conferisce ai benchmark informali un'influenza insolita. Gli utenti possono eseguire lo stesso prompt e confrontare subito gli output visibili. Non possono invece determinare facilmente perché un sistema abbia ottenuto risultati migliori.

L'esperimento sui pellicani migliora la situazione ampliando l'insieme di confronto. Mostra come alternative controllate possano mettere in discussione una narrativa convincente prima che questa diventi un fatto accettato.

La vera possibilità è SVGmaxxing

Lo studio indebolisce la teoria ristretta del pellicano, pur lasciando del tutto plausibile un'ampia ottimizzazione degli SVG.

SVGmaxxing significa migliorare la generazione di grafica vettoriale su molti soggetti, invece di puntare a un singolo prompt famoso. Un modello addestrato in questo modo dovrebbe ottenere risultati migliori nell’intera griglia di Castillo. Un miglioramento del genere indicherebbe una reale capacità generale.

Questo è il punto cieco più importante dell’esperimento. Il suo impianto statistico rileva un pellicano, una bicicletta o un effetto combinato insolito all’interno di ciascun laboratorio. Non può identificare un addestramento che migliori contemporaneamente tutte e 48 le combinazioni.

Castillo osserva che Google DeepMind ha discusso apertamente del lavoro volto a migliorare la generazione di SVG. Questo rende più credibile una spiegazione basata su un’ottimizzazione generale rispetto a magazzini segreti pieni di esempi di pellicani.

L’addestramento generale sugli SVG non equivale automaticamente a manipolare i benchmark. La grafica vettoriale ha impieghi pratici in icone, diagrammi, grafici, risorse per interfacce, materiali didattici e illustrazioni modificabili. Prestazioni migliori potrebbero servire molti compiti reali.

Il confine dipende dalla generalizzazione. Addestrare un modello a generare grafiche valide e modificabili per richieste diverse sviluppa una capacità utile. Addestrarlo su una famiglia ristretta di prompt di valutazione previsti crea un punteggio fuorviante.

Gli osservatori esterni raramente sanno dove si collochi un laboratorio fra queste due posizioni. La documentazione pubblica dei modelli descrive di solito risultati di valutazione generali, mentre le miscele dettagliate di dati e i segnali di reinforcement restano privati.

Il confronto tra Anthropic e Google illustra chiaramente questa ambiguità. Claude e Gemini possono differire nella qualità complessiva degli SVG senza che nessuno dei due abbia ricevuto addestramento specifico sui pellicani. Tali differenze potrebbero riflettere capacità di coding, ragionamento spaziale o lavoro mirato sulla grafica.

Anche un miglioramento generale può essere ottimizzato per le dimostrazioni. I laboratori sanno quali capacità producono post sui social d’impatto. Un SVG nitido crea un confronto immediato prima-dopo, più facile da condividere di un sottile miglioramento nel ragionamento.

Questo incentivo non invalida la capacità. Significa però che i lettori dovrebbero distinguere l’utilità del prodotto dallo spettacolo del giorno del lancio. Un modello può produrre una bicicletta impressionante e fallire su compiti meno fotogenici.

Gli sviluppatori dovrebbero quindi testare i modelli grafici sui propri flussi di lavoro reali. Un team di prodotto potrebbe aver bisogno di icone riutilizzabili con dimensioni coerenti. Un ricercatore potrebbe aver bisogno di diagrammi accurati con relazioni etichettate.

Questi requisiti sono diversi dal disegnare animali stravaganti. Markup valido, modificabilità, accessibilità, accuratezza delle coordinate e coerenza stilistica possono contare più del fascino visivo.

Lo stesso principio si applica oltre la generazione di SVG. Gli agenti di coding possono eccellere in compiti software pubblici, ma avere difficoltà nel repository privato di un’azienda. I modelli di ragionamento possono ottenere buoni punteggi su domande accademiche, ma gestire male prove lavorative incomplete.

I team hanno bisogno di valutazioni costruite attorno a lavori rappresentativi e casi di test nascosti. Hanno anche bisogno di registri che mostrino quali prompt, fonti e output hanno informato una decisione.

Una knowledge base AI ricercabile può conservare questi artefatti di valutazione insieme alle osservazioni umane. Questo archivio diventa prezioso quando un aggiornamento del modello ne modifica il comportamento.

La lezione più ampia non è che i benchmark pubblici siano inutili. Forniscono punti di riferimento condivisi e rendono visibili le regressioni. Tuttavia, il loro valore diminuisce man mano che laboratori e utenti si ottimizzano attorno a essi.

Un benchmark famoso diventa gradualmente parte dell’ambiente che misura. I ricercatori ne discutono, gli sviluppatori lo vedono e gli esempi generati circolano online. I futuri dataset di addestramento possono quindi assorbire tali discussioni e output.

Questo ciclo di feedback rende difficile evitare la contaminazione. Anche senza manipolazione deliberata, un test noto può diventare statisticamente meno indipendente dai sistemi che affronta.

Pelicanmaxxing è divertente perché la posta in gioco sembra banale. Il meccanismo che lo sostiene non lo è. Una contaminazione simile può influire sulle valutazioni di coding, matematica, sicurezza, fattualità e agenti usate in decisioni d’acquisto importanti.

Un solo giudice LLM non può chiudere il caso

I risultati sono informativi, ma la dimensione del campione e il metodo di valutazione lasciano spazio a effetti minori ed errori di misurazione.

Ogni punteggio proveniva da GPT-5.6 Luna, che giudicava un’immagine alla volta. Castillo non ha misurato quanto coerentemente il giudice valuterebbe presentazioni ripetute della stessa immagine.

Un giudice inaffidabile aggiunge rumore a ogni stima. Una preferenza stilistica potrebbe inoltre favorire una famiglia di modelli. Luna appartiene alla stessa famiglia più ampia di GPT-5.6 Terra, uno dei sistemi testati.

I confronti all’interno di ciascun modello nello studio riducono questa preoccupazione. Se Luna apprezzasse semplicemente lo stile di Terra, dovrebbe alzare l’intera griglia di Terra. L’analisi si concentra sul fatto che celle specifiche superino le prestazioni abituali di quel modello.

Tuttavia, il comportamento del giudice può interagire con il contenuto. Luna potrebbe riconoscere alcuni animali più affidabilmente di altri. Potrebbe premiare una pulizia visiva essenziale trascurando errori anatomici.

La valutazione umana offrirebbe un ulteriore controllo. Più valutatori indipendenti potrebbero esaminare l’identità degli animali, la struttura dei veicoli, la coerenza dell’azione e la qualità complessiva. I punteggi di accordo rivelerebbero quali giudizi restano soggettivi.

Sarebbe utile anche un secondo giudice indipendente basato su un modello. Famiglie di giudici diverse potrebbero valutare le stesse immagini renderizzate secondo rubriche identiche. Grandi disaccordi identificherebbero conclusioni fragili.

Il budget ha limitato l’esperimento a tre campioni per cella e un solo passaggio di giudizio. Castillo riferisce che l’intera esecuzione ha usato circa 80 dollari in crediti API. Gli intervalli di confidenza risultanti avevano in media un’ampiezza di circa più o meno 0,6 punti del giudice.

Questi intervalli sono abbastanza ampi da nascondere modesti miglioramenti specifici del benchmark. Un laboratorio potrebbe ricevere un piccolo vantaggio che questo esperimento non ha la potenza statistica per rilevare.

Lo studio ha inoltre rigenerato gli output non validi finché ogni prompt non ha prodotto un SVG utilizzabile. Si sono verificati solo 11 tentativi aggiuntivi, quindi questa scelta ha probabilmente avuto un’influenza limitata. Tuttavia, il comportamento nei tentativi aggiuntivi elimina alcune differenze di affidabilità dai punteggi finali delle immagini.

Una valutazione in produzione potrebbe contare la prima risposta. Gli utenti tengono conto del fatto che un modello rispetti il formato richiesto senza correzioni. I fallimenti di rendering possono contare quanto la qualità visiva nei flussi di lavoro automatizzati.

L’uso di “plane” ha creato un altro problema noto. Alcuni modelli hanno interpretato la parola come una superficie geometrica piatta anziché come un aeromobile. L’estrattore di caratteristiche non ha trovato alcun veicolo in 25 delle 168 immagini di aerei.

Il venti per cento delle immagini di aerei ha ricevuto un punteggio del veicolo pari a uno o due. Le biciclette hanno raggiunto il cinque per cento, mentre barche, scooter e skateboard non hanno ricevuto punteggi così bassi.

Questo errore di formulazione non cancella il risultato centrale. Tutti i modelli hanno ricevuto gli stessi prompt e la regressione ha tenuto conto della difficoltà delle combinazioni. Mostra però come un singolo termine ambiguo possa distorcere un benchmark.

L’accesso ai modelli tramite OpenRouter aggiunge un’altra considerazione. L’esperimento riflette le versioni dei modelli e il comportamento di routing disponibili durante quell’esecuzione. I fornitori possono aggiornare i sistemi senza offrire ai ricercatori esterni visibilità completa su ogni cambiamento.

La ricerca dovrebbe quindi essere considerata un solido test iniziale, non un verdetto permanente. Il suo disegno accurato rende significativa l’assenza di un grande effetto. Non può escludere ogni sforzo di ottimizzazione più piccolo o precedente.

Questa prudente impostazione si applica anche all’articolo di fonte che ha reso popolare il risultato. Willison ha definito il lavoro di Castillo più diligente dei suoi precedenti controlli sommari nel suo commento di luglio. Non lo ha presentato come prova che la manipolazione dei benchmark non avvenga mai.

I lettori dovrebbero resistere alla tentazione di trasformare “nessuna prova chiara qui” in “i laboratori sono scagionati”. L’assenza di rilevamento dipende dai prompt, dai campioni, dal giudice, dal modello statistico e dalla potenza disponibile.

La conclusione migliore è metodologica. Le affermazioni sulla manipolazione dei benchmark richiedono confronti controllati, dati aperti, più valutatori e incertezza esplicita. I soli screenshot non possono sostenere questo peso.

Cosa dovrebbero osservare Anthropic, Google e gli acquirenti di modelli

Le prossime prove utili arriveranno dalla replica, da test SVG più ampi e dai cambiamenti di comportamento tra una release e l’altra.

In primo luogo, i ricercatori dovrebbero replicare lo studio con più campioni e giudici indipendenti. Un’esecuzione più ampia restringerebbe gli intervalli di confidenza e rivelerebbe se i piccoli effetti persistono nelle valutazioni ripetute.

I valutatori umani dovrebbero esaminare un sottoinsieme rappresentativo seguendo una rubrica scritta. Almeno un giudice di un’altra famiglia di modelli dovrebbe valutare l’intero dataset. L’accordo tra metodi rafforzerebbe il risultato.

Se gli effetti del pellicano, della bicicletta e della loro combinazione restano vicini allo zero, la teoria ristretta del pelicanmaxxing diventa più debole. Se un effetto compare ripetutamente per un laboratorio, gli investigatori avrebbero un obiettivo più chiaro.

In secondo luogo, i test futuri dovrebbero ampliare il compito oltre i cartoni animati di animali e veicoli. I modelli potrebbero generare diagrammi tecnici, icone per interfacce, mappe, processi etichettati, figure geometriche e famiglie coerenti di risorse.

Questi prompt verificherebbero se un migliore output SVG si trasferisce a lavori utili. Separerebbero inoltre l’addestramento generale sulla grafica dall’ottimizzazione attorno a una famiglia di prompt visivamente familiare.

I ricercatori dovrebbero misurare più dell’aspetto. Validità al primo tentativo, modificabilità, etichette di accessibilità, dimensioni richieste, conteggi degli oggetti e accuratezza spaziale meritano tutti punteggi indipendenti.

Questo spingerebbe Anthropic e Google a chiarire cosa migliorano i loro modelli tra una release e l’altra. Un modello che ottiene risultati migliori in molti compiti SVG nascosti offre prove più solide di una capacità generale.

In terzo luogo, gli osservatori dovrebbero seguire le discontinuità attorno ai lanci principali. Guadagni improvvisi su un prompt famoso meritano il confronto con compiti nascosti adiacenti eseguiti nelle stesse condizioni.

L’archivio di Simon Willison offre una utile storia pubblica, ma le valutazioni future necessitano anche di set di prompt non pubblicati. I test nascosti riducono l’ottimizzazione diretta e la contaminazione accidentale.

Gli acquirenti di modelli possono applicare lo stesso approccio senza costruire uno studio da mille immagini. Partite da una dimostrazione pubblica che sembra impressionante. Poi create diverse variazioni controllate che preservino la capacità di fondo.

Modificate entità, formati, vincoli e formulazione. Eseguite un numero sufficiente di campioni per verificare se le prestazioni resistono alle normali variazioni. Conservate i primi tentativi oltre agli output corretti.

Per una decisione di approvvigionamento tra Anthropic e Google, il modello vincente dovrebbe riuscire in compiti privati rappresentativi, non in una sola famosa sfida pubblica. Gli acquirenti dovrebbero inoltre ripetere i test dopo gli aggiornamenti del modello.

Lo studio sul pellicano offre un modello pratico. Definite la scorciatoia sospettata, costruite alternative vicine, controllate la difficoltà e pubblicate i fallimenti accanto ai successi. Poi dichiarate cosa il disegno non può rilevare.

Questo standard conta perché le valutazioni dell’AI influenzano sempre più piani di ingegneria, selezione dei fornitori e automazione del lavoro. Un punteggio di benchmark può comprimere un comportamento complicato in un unico numero facilmente vendibile.

Nessun singolo numero può descrivere pienamente un modello. Gli esperimenti controllati possono comunque mostrare quando una storia convincente supera le prove disponibili.

La risposta immediata è rassicurante e incompleta. Castillo non ha trovato segnali forti che sette modelli leader abbiano ricevuto un vantaggio speciale per i pellicani in sella a biciclette. Il risultato isolato di Google sulle biciclette scompare dopo la correzione per test multipli.

La sfida più ampia resta irrisolta. L’ottimizzazione generale, i test contaminati, le scelte di addestramento nascoste e i giudici soggettivi possono ancora confondere il progresso autentico con la strategia di valutazione.

Prima di fidarti della prossima dimostrazione virale di un modello, costruisci una piccola griglia di confronto attorno ad essa. Chiediti se la capacità dichiarata resiste al variare di soggetti, formati e vincoli. Il test del pellicano di Anthropic Google dimostra che un prompt sciocco può rivelare un serio problema di valutazione, a condizione che qualcuno verifichi la storia invece di limitarvisi a ripeterla.

 
 

Inizia gratis

Un assistente IA local-first con gestione della conoscenza personale

Per una migliore esperienza con l’IA,

al momento remio supporta solo Windows 10+ (x64) e M-Chip Macs.

Il tuo partner AI al lavoro
Fai di più con remio

Pianifica. Crea. Consegna.
Tutto in un unico posto.

bottom of page