Generare un risultato costa poche ore di calcolo, controllarlo richiede lettori esperti. Il rilascio mostra dove si sposta il costo quando la produzione diventa quasi gratuita.
Il 6 ottobre OpenAI ha pubblicato nel repository GitHub openai/math i risultati di un modello interno, ancora inedito: 722 manoscritti raggruppati in 372 famiglie. Una famiglia riunisce il teorema principale, le sue conseguenze e le dimostrazioni alternative. Il catalogo, con licenza Apache 2.0, è ordinato per disciplina e affianca ai testi un registro delle dimostrazioni formalizzate in Lean, il linguaggio con cui un calcolatore controlla ogni passaggio logico.
Secondo il README del repository, come lo riassume Unite.AI, quasi tutti i risultati escono da un’unica procedura applicata a circa 4.000 problemi, con una media di tre ore di «ChatGPT Pro thinking» per risultato. Scott Aaronson, informatico teorico, parla invece di circa 8.000 problemi tentati: le due cifre divergono, e il tasso di successo oscilla fra il 5 % che stima lui e un valore inferiore al 10 % (372 famiglie su 4.000). Dieci riassunti del ragionamento del modello completano il repository.

L’elenco dei risultati annunciati ha convinto anche osservatori prudenti. Aaronson cita la congettura dei giochi unici di Khot, con certificato Lean, l’uguaglianza fra spazio logaritmico deterministico e probabilistico (L = BPL), la trasformata di Fourier e la moltiplicazione di interi in meno di n log n operazioni, e un esponente 9/4 per la moltiplicazione di matrici. Per lui il 6 ottobre è stato «sicuramente uno dei giorni più importanti nella storia della matematica», e ciascun risultato avrebbe potuto essere il risultato dell’anno nel proprio settore.
Alex Kontorovich, della Rutgers University, ha scritto su X che una dimostrazione simile, se firmata da una persona, varrebbe «una Medaglia Fields immediata», come riporta OfficeChai. Lo stesso Aaronson precisa però che la maggior parte delle dimostrazioni attende ancora lettori umani: i testi sono lunghi, le notazioni difficili e le citazioni a volte confuse.
Lean controlla che la dimostrazione discenda dall’enunciato formalizzato. Che l’enunciato formalizzato coincida con il teorema annunciato nel titolo resta una verifica di lettura. Aaronson ritiene improbabile uno sfruttamento di falle nel kernel di Lean, e le formalizzazioni coprono una parte soltanto del catalogo: il README stesso avverte che i risultati privi di formalizzazione possono contenere errori, e OpenAI promette correzioni rapide, nuove versioni e uno storico accessibile.
Un’analisi del catalogo pubblicata da explainx.ai, condotta sui testi del repository e priva di compilazione del codice, osserva che su otto risultati di punta sette rimandano a una voce Lean. Per la moltiplicazione di interi la voce manca, e per la trasformata di Fourier l’enunciato formale risulta più debole del titolo. Sono segnalazioni da riscontrare sul codice, e indicano dove si concentra il lavoro dei revisori: lo scarto fra ciò che il titolo promette e ciò che la macchina ha controllato.
Il 29 settembre l’Advisory Group on Mathematics and Artificial Intelligence dell’Institute for Advanced Study aveva diffuso le proprie raccomandazioni, dopo oltre 600 risposte della comunità matematica. Il gruppo prende le distanze dalla pratica di annunciare molti risultati privi di dettagli e chiede ai laboratori di smettere di sperimentare problemi avanzati su modelli proprietari. Tra le indicazioni: depositare i risultati in archivi indipendenti dai laboratori, riportare per ciascuno modello, prompt, riassunto del ragionamento, tempo e costo di calcolo stimato, formalizzare dove possibile e accompagnare i rilasci di massa con i problemi simili che il modello ha mancato.
OpenAI dichiara di aver consultato il gruppo e di averne seguito i consigli. Pubblica su un repository proprio, con dieci riassunti di ragionamento e statistiche sui problemi tentati, valuta archivi ospitati dalla comunità e promette di finanziare workshop e conferenze sulla comprensione dei risultati prodotti dall’IA. Secondo Aaronson, il gruppo ha commentato il rilascio osservando che capire il lavoro è solo l’inizio del processo.
Il 7 ottobre il gruppo comunicazione dell’Association for Human Mathematics ha diffuso una dichiarazione, ripresa dal blog di Terence Tao. Il testo sostiene che i matematici hanno ricevuto un lavoro arrivato per iniziativa dell’azienda, che OpenAI ha trascurato la premessa del documento del 29 settembre e che la società, impegnata in cause per presunto plagio e violazione del diritto d’autore, cerca legittimità nel gruppo consultivo. Per l’associazione il rilascio di oltre 700 file in un colpo è «una dimostrazione di potere» anziché di ricerca, e invita i matematici a interrompere le collaborazioni con OpenAI.
La dichiarazione riguarda il metodo di pubblicazione e lascia aperta la questione scientifica. Convivono così due letture: risultati che, se confermati, ridisegnano interi settori, e un formato di rilascio che scarica sulla comunità il costo di leggerli.
Il dato utile oltre la matematica è il rapporto fra produzione e controllo. Tre ore di calcolo bastano a generare un manoscritto, mentre capirne uno richiede ricercatori con anni di formazione specifica. In matematica esiste un verificatore formale che copre una parte del lavoro. Nelle imprese il codice dispone dei test automatici, che coprono i casi previsti, e documenti come istruttorie, bilanci o relazioni di conformità hanno raramente un equivalente.
Per chi affida lavoro intellettuale a un agente conviene quindi misurare due grandezze: quanti prodotti l’agente genera al giorno, e quanti ne riesce a controllare nello stesso tempo un revisore competente. Da lì discendono tre scelte pratiche: dove inserire un verificatore automatico, quali output richiedono sempre una firma umana e quale quota di errore residuo il processo può assorbire.
Aaronson ritiene che il modello possa raggiungere i clienti paganti di ChatGPT entro un paio di mesi, secondo la valutazione di sicurezza di OpenAI, e riferisce che i laboratori stanno verificando se i modelli riescono a violare protocolli crittografici. Se altri campi seguiranno la stessa strada, la domanda si sposterà da chi produce i risultati a chi ha l’infrastruttura per verificarli: archivi indipendenti, formalizzazioni, revisori retribuiti. Il 6 ottobre ha mostrato quanto velocemente si possa produrre. Il tempo necessario a controllare resta ancora da misurare.
Autore
Pablo Liuzzi
Founder, Synthos Logic