top of page

I manoscritti matematici di OpenAI invadono il settore e i matematici reagiscono

19 ore fa
Tempo di lettura: 13 min

OpenAI ha pubblicato più di 700 manoscritti matematici il 6 ottobre, creando una crisi di verifica insieme alla sua più grande affermazione finora sulla ricerca generata dall'IA.

I manoscritti matematici di OpenAI coprono centinaia di risultati correlati nella teoria dei numeri, nella geometria, nella topologia, nell'informatica e in altri campi. Provengono da un modello interno non ancora rilasciato, testato su circa 4.000 problemi aperti.

OpenAI ha presentato la raccolta come un contributo alla conoscenza umana. Molti matematici hanno invece visto un laboratorio privato trasferire un enorme onere di revisione su una comunità di ricerca pubblica.

Quel conflitto conta più del semplice numero di manoscritti. I ricercatori devono ora stabilire quali argomentazioni siano corrette, quali risultati siano originali e quali articoli meritino attenzione. Devono svolgere questo lavoro proteggendo al contempo i propri progetti, studenti e percorsi professionali.

La pubblicazione è inoltre arrivata nel mezzo di controversie irrisolte sulla matematica generata dall'IA. I precedenti annunci di OpenAI avevano già sollevato interrogativi sull'attribuzione, sul lavoro umano non pubblicato e sulla differenza tra produrre una dimostrazione e creare comprensione.

Un blog di matematica gestito dalla comunità, Proofs and Prompts, ha raccolto più di 100 reazioni nel giro di pochi giorni. Le risposte spaziavano dall'entusiasmo al dolore, alla rabbia e all'ansia professionale.

Il dissenso centrale non riguarda semplicemente gli esseri umani contro le macchine. Riguarda il modello di OpenAI basato sulla produzione di risultati ad alto volume, contrapposto alla matematica come processo più lento di spiegazione, critica, insegnamento e proprietà condivisa.

I manoscritti matematici di OpenAI sono arrivati prima del loro sistema di revisione

OpenAI non ha pubblicato una singola dimostrazione celebrata da far esaminare agli specialisti. Ha diffuso un'intera agenda di ricerca in una sola volta.

L'azienda ha inizialmente pubblicato 722 manoscritti organizzati in 372 famiglie di risultati. Una famiglia può includere un risultato principale, argomentazioni complementari, conseguenze e dimostrazioni alternative.

L'attuale repository pubblico elenca 719 manoscritti nelle stesse 372 famiglie. Questa variazione mostra che la raccolta è già in fase di revisione.

OpenAI afferma che gli articoli e i materiali di supporto sono stati prodotti da un modello frontier interno non ancora rilasciato. L'azienda ha valutato quel modello dopo che i suoi test matematici consolidati erano diventati troppo facili.

Durante la valutazione sono stati proposti circa 4.000 problemi. OpenAI afferma che un risultato medio ha consumato una capacità di calcolo paragonabile a tre ore di ragionamento di ChatGPT Pro.

Queste cifre descrivono una capacità produttiva straordinaria. Non dimostrano che ogni manoscritto sia corretto, nuovo, leggibile o importante.

OpenAI riconosce esplicitamente che la raccolta contiene lavori in diverse fasi di verifica. Avverte inoltre che alcuni risultati privi di formalizzazione potrebbero contenere problemi.

La formalizzazione traduce un'argomentazione in un linguaggio che il software di verifica delle dimostrazioni può controllare riga per riga. OpenAI ha utilizzato Lean, un linguaggio di programmazione e assistente per dimostrazioni progettato a tale scopo.

Secondo il repository, circa il 42 percento dei suoi risultati di primo livello è stato formalizzato. Si tratta di una quota rilevante, ma lascia la maggior parte dei risultati principali al di fuori di quella categoria di verifica.

Persino un controllo Lean riuscito risponde solo a una parte della domanda di ricerca. Può convalidare l'argomentazione logica codificata, assumendo che le definizioni e l'enunciato formale catturino il teorema previsto.

Non stabilisce automaticamente novità, rilevanza, corretta attribuzione o una presentazione utile. Questi giudizi dipendono ancora dalla conoscenza umana della letteratura.

Il repository include anche dieci sintesi abbreviate del ragionamento. Coprono risultati selezionati relativi a temi quali l'esponente di irrazionalità di pi e la moltiplicazione di matrici.

Dieci sintesi non possono fornire una mappa intellettuale per centinaia di famiglie di risultati. I ricercatori si trovano ancora davanti a un catalogo sconosciuto, la cui importanza varia notevolmente tra le diverse specializzazioni.

Nel suo comunicato di rilascio, OpenAI ha affermato di voler far progredire la conoscenza umana attraverso questo lavoro. Ha inoltre promesso protocolli di revisione, istruzioni per le citazioni e ulteriori formalizzazioni.

L'azienda ha dichiarato che le future pubblicazioni miglioreranno citazioni, esposizione e presentazione. Questo impegno riconosce implicitamente le debolezze del pacchetto attuale.

OpenAI ha anche consultato un gruppo consultivo indipendente presso l'Institute for Advanced Study. Tuttavia, la consultazione non ha impedito ai ricercatori di descrivere il processo di pubblicazione come travolgente.

La scala ha creato immediatamente la tensione centrale. Un modello può generare risultati candidati più rapidamente di quanto gli esperti pertinenti possano leggerli, contestualizzarli e spiegarli.

La pubblicazione è quindi diventata solo il primo passo. La questione irrisolta è chi debba sostenere il costo di tutto ciò che segue.

L'onere della verifica è stato trasferito ai matematici

La pubblicazione trasforma l'attenzione degli esperti nella risorsa scarsa, mentre OpenAI mantiene il controllo sul modello che ha creato l'offerta.

Un articolo convenzionale entra in un sistema costruito attorno ad autori identificabili, comunità disciplinari, seminari e revisione tra pari. Questi meccanismi sono imperfetti, ma distribuiscono la responsabilità.

Gli autori di solito spiegano i propri metodi, rispondono alle obiezioni, rivedono i passaggi poco chiari e difendono le proprie affermazioni davanti a pubblici competenti. I lettori possono chiedere perché un determinato lemma sia importante o come sia emersa un'idea.

I manoscritti matematici di OpenAI interrompono quella relazione. L'autore dichiarato è di fatto l'azienda, mentre il modello rimane indisponibile ai ricercatori esterni.

Un matematico che scopre un'argomentazione opaca non può interrogare il sistema che l'ha generata. I dipendenti di OpenAI potrebbero fornire chiarimenti, ma non possono ricostruire ogni percorso di ragionamento interno.

Questo problema diventa più grave su larga scala. Un articolo difficile può richiedere settimane o mesi di lettura concentrata, anche quando è scritto da specialisti umani.

Centinaia di articoli creano un problema di selezione ancora prima che inizi la verifica. I ricercatori devono decidere quali affermazioni siano abbastanza credibili da giustificare il loro tempo limitato.

Alcuni manoscritti riguardano questioni che hanno plasmato intere carriere. Gli specialisti non possono semplicemente ignorare una soluzione dichiarata quando proposte di finanziamento, tesi di dottorato e pubblicazioni future dipendono dal risultato.

Questo crea incentivi asimmetrici. OpenAI trae vantaggio quando un risultato supera l'esame critico, mentre i ricercatori indipendenti assorbono gran parte del costo di individuare gli errori.

Enrico Fatighenti ha sostenuto che una proposta umana scritta male potrebbe essere respinta rapidamente. Il lavoro generato dall'IA, al contrario, può spingere gli esperti a ricostruirne il significato a causa della capacità percepita del modello.

Tristan Humbert ha descritto di essersi imbattuto in materiale che riteneva illeggibile sul problema al centro della sua tesi di dottorato. Ha anche dovuto riconsiderare i suoi piani di ricerca post-dottorato.

Queste reazioni rivelano una conseguenza pratica della ricerca automatizzata. La verifica non è gratuita solo perché generare manoscritti diventa poco costoso.

Il collo di bottiglia si sposta dalla produzione del testo alla costruzione della fiducia. Questa transizione è già visibile nel software, dove generare codice è più facile che revisionarlo, proteggerlo e mantenerlo.

La matematica impone uno standard ancora più elevato. Un articolo deve collegare un risultato formale alla teoria esistente, alle citazioni pertinenti e a una catena di idee comprensibile.

OpenAI afferma che registrerà le revisioni e conserverà le versioni precedenti. Questo è utile per la verificabilità, soprattutto quando i manoscritti scompaiono o cambiano.

La cronologia delle versioni non può sostituire un'interazione accademica responsabile. I ricercatori hanno ancora bisogno di qualcuno capace di rispondere a domande dettagliate su intenzione, dipendenze e lavori correlati.

Le risposte della comunità mostrano che questo onere è distribuito in modo diseguale. Gli specialisti più vicini a un risultato dichiarato avvertono la maggiore pressione a indagarlo.

La loro ricompensa rimane incerta. Confermare il lavoro di OpenAI potrebbe rafforzare l'affermazione dell'azienda, mentre correggerlo potrebbe ottenere meno riconoscimento dell'annuncio originale.

Esiste anche un problema di selezione. Gli esperti potrebbero dare priorità alle affermazioni spettacolari, mentre risultati validi ma meno appariscenti ricevono poca attenzione.

La raccolta potrebbe quindi contenere sia matematica importante sia errori che restano inesaminati. Il volume rende questi esiti più difficili da distinguere.

Per questo il numero di manoscritti è una misura debole del progresso scientifico. Un risultato utilizzabile richiede verifica, contesto, spiegazione e una comunità in grado di ereditarlo.

L'abbondanza di dimostrazioni si scontra con la comprensione matematica

OpenAI ha creato un'abbondanza di dimostrazioni, ma i matematici si chiedono se l'abbondanza produca conoscenza o semplicemente più oggetti da elaborare.

Diverse reazioni hanno interpretato la pubblicazione come prova di un autentico cambiamento nelle capacità. Roman Sauer ha riconosciuto una tecnica da lui sviluppata comparire nelle soluzioni a due problemi molto diversi.

Ha definito le applicazioni profondamente creative e ha detto di esserne rimasto sbalordito. Questa reazione contrasta con qualsiasi semplice affermazione secondo cui i manoscritti sarebbero solo imitazione automatizzata.

Secondo quanto riportato, Ben Green ha trovato risultati che toccano gran parte dell'agenda alla base di un importante finanziamento alla ricerca. Ha descritto alcuni aspetti della raccolta come sconvolgenti.

Alvaro Lozano-Robledo ha evidenziato i progressi del modello verso l'Ipotesi di Riemann, preservando al contempo una distinzione importante. Un risultato quasi-Riemann sarebbe significativo, ma non risolverebbe la congettura originale.

Questa distinzione conta in tutto il catalogo. Un manoscritto può risolvere un caso speciale, migliorare una stima o dimostrare un teorema condizionale senza risolvere il celebre problema principale.

I titoli possono comprimere queste differenze nell'espressione “problemi aperti risolti”. I ricercatori non possono farlo.

L'interpretazione positiva più forte è che l'IA possa ora esplorare le possibilità matematiche a una scala non disponibile per i singoli studiosi. Può testare approcci, combinare tecniche e produrre argomentazioni candidate tra diverse specializzazioni.

Questa capacità potrebbe aiutare i matematici a trovare connessioni che altrimenti non vedrebbero. Potrebbe anche esporre problemi trascurati a nuovi metodi.

Danny Calegari ha descritto motivi per celebrare la collaborazione tra esseri umani e IA. In un progetto, Claude di Anthropic ha scritto il codice per un'animazione matematica con una colonna sonora musicale.

Constantin Kogler ha espresso entusiasmo per il lavoro con modelli avanzati e per l'incontro con nuove idee su richiesta. Per i ricercatori che vi hanno accesso, l'esperienza può assomigliare a un ambiente creativo ampliato.

L'interpretazione scettica inizia dove termina la generazione. Stephen Wolfram ha osservato che produrre un numero enorme di teoremi non identifica quali di essi le persone riterranno preziosi.

L'importanza matematica dipende in parte dal gusto. I ricercatori scelgono le questioni perché le risposte illuminano strutture, connettono campi o creano nuovi problemi produttivi.

Un modello ottimizzato per risolvere congetture disponibili eredita un'agenda di ricerca creata dagli esseri umani. Il suo successo può quindi misurare la capacità di ricerca senza stabilire un giudizio matematico indipendente.

Johannes Schmitt ha offerto un'interpretazione correlata. OpenAI potrebbe aver utilizzato i problemi aperti principalmente perché valutazioni più semplici non mettevano più alla prova i suoi modelli frontier.

Secondo questa prospettiva, gli articoli sono prodotti dello sviluppo dei modelli prima di essere contributi a una comunità accademica. Gli incentivi di queste attività differiscono.

Un laboratorio vuole benchmark difficili, progressi misurabili e prove di ragionamento generale. I matematici vogliono spiegazioni che i colleghi possano esaminare, insegnare e sviluppare.

Il risultato può essere tecnicamente impressionante senza riuscire a sostenere queste funzioni sociali. Questo è il conflitto più profondo dietro i manoscritti matematici di OpenAI.

Secondo quanto riferito, Terence Tao ha visto idee ingegnose che potrebbero diventare fruttuose dopo essere state assimilate dai ricercatori. Era però anche frustrato dall'assenza di persone capaci di presentare e insegnare il lavoro.

Ian Agol ha paragonato la sfida alla risposta al lavoro di Grigori Perelman sulla congettura di Poincaré. I gruppi di ricerca hanno trascorso anni ad ampliare e chiarire i concisi articoli di Perelman.

Quel confronto storico ha dei limiti. Perelman era un autore umano con un programma intellettuale coerente, non un sistema che produce centinaia di manoscritti.

Tuttavia, mostra che pubblicazione e comprensione collettiva non sono mai state la stessa cosa. L'AI aumenta la distanza tra le due, cambiando la scala.

La domanda non è più se i modelli possano produrre matematica dall'aspetto serio. La domanda più urgente è se le istituzioni possano trasformare il loro output in conoscenza duratura.

La reazione negativa riguarda carriere, riconoscimenti e controllo

Molti matematici non stanno rifiutando l'automazione in sé. Stanno rifiutando un modello di rilascio che può ridefinire le carriere senza condividere l'autorità.

Hugo Duminil-Copin ha scritto che si aspettava che le macchine prima o poi superassero i ricercatori sotto alcuni aspetti. Non si aspettava che così tanti problemi importanti venissero affrontati in un unico annuncio.

La sua reazione ha colto l'asimmetria emotiva dell'evento. Un laboratorio ha vissuto il rilascio come una dimostrazione, mentre i ricercatori lo hanno percepito come un cambiamento improvviso nelle loro vite.

Matt Zaremsky ha paragonato anni di attenti progressi a uno scavo archeologico. Nella sua analogia, una ricca azienda è arrivata, ha usato esplosivi, ha consegnato lo scheletro e se n'è andata.

La lamentela non era che lo scheletro completo fosse privo di valore. Era che il processo aveva cancellato la lenta scoperta che conferiva al lavoro significato professionale e intellettuale.

Tasmin Chu ha fatto una distinzione simile. Sapere se un'affermazione è vera è diverso dall'avere il tempo di riflettere personalmente sul problema.

Per molti ricercatori, quel ragionamento non è lavoro accessorio. È l'attività che li ha attratti verso la matematica.

Gli studenti di dottorato affrontano una versione più acuta del conflitto. Le loro credenziali dipendono dalla produzione di lavoro originale in un periodo limitato.

Un manoscritto generato dall'AI può arrivare senza preavviso alla stessa domanda. Persino un'affermazione errata può costringere uno studente a reindirizzare i propri sforzi finché gli specialisti non la risolvono.

L'assunzione di postdoc aggrava l'incertezza. I candidati devono descrivere piani di ricerca futuri, ma un grande modello privato può improvvisamente pubblicare affermazioni sull'intera agenda che propongono.

I ricercatori senior hanno reputazione e reti che li aiutano ad adattarsi. I matematici a inizio carriera hanno meno protezioni e potrebbero essere giudicati prima che il nuovo lavoro venga convalidato.

Il riconoscimento crea un'altra linea di frattura. I manoscritti attingono alla matematica pubblicata, a congetture esistenti e a tecniche sviluppate in decenni di ricerca umana.

OpenAI fornisce informazioni sulle citazioni, ma una corretta attribuzione richiede più della generazione di una bibliografia. Gli specialisti devono stabilire quali idee siano davvero nuove e quali riformulino argomentazioni già note.

La precedente controversia su Navier-Stokes ha intensificato questa preoccupazione. I ricercatori hanno sostenuto che il lavoro di OpenAI intersecasse ricerca umana non pubblicata e hanno sollevato questioni di priorità.

L'attuale rilascio non dimostra comportamenti scorretti nei singoli manoscritti. Spiega però perché i matematici abbiano affrontato il catalogo con fiducia limitata.

Henry Wilton ha criticato l'assenza di autori umani nominati e di informazioni dettagliate sui tassi di fallimento. Per lui, la presentazione suggeriva che la matematica non fosse più trattata come un'impresa umana.

OpenAI dichiara che sono stati tentati circa 4.000 problemi. Descrive inoltre come i manoscritti siano stati aggregati in famiglie di risultati.

Questi numeri lasciano comunque aperte questioni importanti. I lettori non possono ricostruire facilmente i criteri di selezione, gli approcci falliti, gli output scartati o le decisioni umane alla base della pubblicazione.

Questa opacità influenza il modo in cui il successo dovrebbe essere interpretato. Un modello che produce centinaia di risultati promettenti da migliaia di tentativi è impressionante, ma il solo rapporto dice poco.

I ricercatori devono sapere come sono stati scelti i problemi e come sono stati filtrati gli output. Hanno inoltre bisogno di verifiche indipendenti di correttezza e originalità.

La critica più netta riguarda il controllo dell'agenda. Martin Bridson ha messo in guardia dal permettere ai laboratori di AI di determinare quali risultati meritino l'attenzione della comunità.

Non si tratta di un rischio teorico. I ricercatori stanno già reindirizzando il loro tempo verso la lettura, la verifica e la spiegazione di lavori generati privatamente.

Quell'attenzione può sottrarre spazio a domande scelte per valore intellettuale, educativo o sociale. Può inoltre favorire campi con benchmark che i modelli possono affrontare nel modo più efficiente.

OpenAI afferma di voler finanziare workshop, conferenze e programmi speciali dedicati alla comprensione dei principali risultati generati dall'AI. Un sostegno simile potrebbe ridurre parte del carico.

Il finanziamento rafforza però anche l'influenza dell'azienda sulla risposta. La stessa istituzione produce gli articoli, controlla il modello e finanzia gli sforzi per interpretarli.

La questione di fondo è la governance. Chi sceglie i problemi, convalida le affermazioni, assegna il riconoscimento e decide quando un risultato è pronto per l'attenzione pubblica?

Senza un controllo condiviso, l'abbondanza di dimostrazioni può trasformarsi in dipendenza. I matematici ottengono accesso agli output, ma perdono influenza sulle condizioni che plasmano il loro campo.

Cosa deve accadere prima che questo rilascio conti come un punto di svolta matematico

Tre segnali determineranno se la raccolta diventerà ricerca duratura oppure una dimostrazione enorme e instabile.

Il primo segnale è la verifica indipendente. Gli specialisti devono confermare risultati rappresentativi di primo piano senza affidarsi esclusivamente alla valutazione interna di OpenAI.

Le formalizzazioni Lean possono sostenere questo processo. Tuttavia, i revisori devono anche confermare che gli enunciati formali corrispondano alle affermazioni matematiche che i lettori ritengono siano state dimostrate.

OpenAI dovrebbe continuare a pubblicare artefatti formali e cronologie delle correzioni. Gruppi esterni dovrebbero riprodurre le verifiche usando configurazioni trasparenti e dipendenze documentate.

Il ritiro o la revisione di diversi manoscritti non invaliderebbe l'intera raccolta. Il lavoro scientifico cambia durante la revisione.

Un alto tasso di correzione indebolirebbe comunque le affermazioni sull'affidabilità della ricerca autonoma. Un basso tasso in campi diversi le rafforzerebbe significativamente.

Il secondo segnale è se i matematici possano ereditare le idee. Ciò significa tenere conferenze, scrivere esposizioni più chiare, identificare tecniche riutilizzabili e produrre ricerche successive.

Una dimostrazione corretta che nessuno sa spiegare resta difficile da integrare in una disciplina viva. Può risolvere una proposizione senza creare un programma di ricerca produttivo.

Proofs and Prompts offre una prima testimonianza di questo processo di assimilazione. Le reazioni raccolte includono entusiasmo tecnico, critiche specifiche ai problemi e riflessioni sulle conseguenze professionali.

La panoramica delle reazioni mostra inoltre perché la copertura pubblica debba evitare di ridurre la risposta alla paura. I ricercatori divergono sia sulla qualità sia sul significato del lavoro.

Osservate seminari e articoli di rassegna indipendenti incentrati su particolari famiglie di risultati. Tali prodotti mostrerebbero che la comunità può trasformare i manoscritti in comprensione condivisa.

L'assenza di tale lavoro suggerirebbe che la produzione ha superato l'assimilazione. Gli articoli potrebbero restare tecnicamente interessanti, ma culturalmente distaccati.

Il terzo segnale è la politica di rilascio del modello di OpenAI. L'azienda afferma di lavorare per rilasciare in modo responsabile il sistema che ha generato i risultati.

L'accesso consentirebbe ai ricercatori di testare nuovi problemi, ispezionare i modelli di fallimento e confrontare l'uso collaborativo con la generazione autonoma in batch.

Un accesso limitato manterrebbe lo squilibrio attuale. OpenAI resterebbe il produttore principale, mentre università e ricercatori indipendenti fungerebbero da revisori a valle.

Un rilascio utilizzabile deve includere anche dettagli metodologici sufficienti per una valutazione significativa. Una sola interfaccia brandizzata non garantirebbe la riproducibilità scientifica.

Qui la concorrenza sarà importante. Anthropic, Google DeepMind e progetti specialistici di dimostrazione automatica di teoremi stanno anch'essi sviluppando sistemi per la matematica avanzata.

Modelli di rilascio diversi potrebbero spingere OpenAI a offrire un accesso migliore, una provenienza più solida o pratiche di pubblicazione più responsabili. Potrebbero anche aumentare il problema del volume.

L'analisi esterna confronta la matematica con lo sviluppo software, dove l'AI è passata rapidamente dall'assistenza alla produzione autonoma.

Il confronto è utile, ma il successo matematico non può essere misurato soltanto dall'output. Un teorema non ha un test di distribuzione equivalente all'esecuzione di un programma in produzione.

Il suo valore si sviluppa attraverso verifica delle dimostrazioni, interpretazione, citazione, insegnamento e ulteriori scoperte. Questi processi richiedono tempo anche quando l'argomento è corretto.

I lettori dovrebbero quindi resistere a due conclusioni premature. Il rilascio non dimostra che centinaia di problemi celebri siano stati risolti definitivamente.

Non può nemmeno essere liquidato come testo privo di significato semplicemente perché ai matematici non piace la sua presentazione. Diversi esperti hanno identificato risultati e tecniche che sembrano davvero significativi.

I manoscritti matematici di OpenAI rappresentano un esperimento nella pubblicazione automatizzata della ricerca tanto quanto un esperimento nel ragionamento matematico. Il modello ha generato gli articoli, ma le istituzioni devono decidere cosa accadrà dopo.

Per gli sviluppatori e i knowledge worker, la lezione va oltre la matematica. Una generazione a basso costo rende revisione, provenienza e giudizio contestuale più preziosi, non meno.

Per le università, il compito immediato è proteggere i ricercatori a inizio carriera creando al contempo capacità di verifica indipendente. Aspettare che ogni affermazione venga definita lascerà gli studenti esposti.

Per OpenAI, lo standard ora va oltre la produzione di un altro catalogo. Deve dimostrare che i ricercatori possano esaminare, mettere in discussione, comprendere e sviluppare il lavoro senza diventare custodi non retribuiti.

I prossimi mesi dovrebbero rispondere a una domanda concreta: questi manoscritti creeranno nuove comunità di ricerca, o lasceranno gli esperti a smistare una coda di output?

Quella risposta definirà se il 6 ottobre segnerà una nuova forma di collaborazione matematica o l'inizio di una crisi dell'attenzione.

 
 

Inizia gratis

Un assistente IA local-first con gestione della conoscenza personale

Per una migliore esperienza con l’IA,

al momento remio supporta solo Windows 10+ (x64) e M-Chip Macs.

Il tuo partner AI al lavoro
Fai di più con remio

Pianifica. Crea. Consegna.
Tutto in un unico posto.

bottom of page