OpenAI GPT-5.6 e ARC-AGI-3
Alberto Romero è rimasto impressionato del 7,8% di successi di GPT-5.6 nel test ARC-AGI-3. Questi test nascono per vedere se gli LLM riescono a risolvere problemi pensati apposta per essere facili da risolvere per gli umani ma non per le IA. Bisogna innanzitutto riconoscere che – sperando che le aziende non barino e non inseriscano delle clausole speciali per risolvere quegli specifici problemi – il progresso c’è stato eccome: sia ARC-AGI-1 che ARC-AGI-2 sono ormai inutili perché anche le IA sfiorano il 100% di successo. Ma con ARC-AGI-3 il record precedente era 1,5% di Opus 4.8, e GPT-5.5 aveva raggiunto lo 0,43%. Ma il vero punto pare essere che GPT-5.6 pare essere bravo nell’orientarsi in situazioni sconosciute: qualcosa che noi facciamo sempre senza nemmeno pensarci su, come quando prendiamo un oggetto mai visto e intuiamo come si deve usare, ma non era mai stato notato in un’IA.
Se effettivamente questo è il caso, confermo che siamo di fronte a un salto quantico: non so se possiamo già parlare di intelligenza artificiale generale (AGI, appunto), ma siamo sicuramente sulla buona strada. Però non ne sono molto convinto, vorrei prima vedere all’opera questi modelli. Poi vabbè, il costo per ottenere quel punteggio si stima essere intorno al 20000 dollari, ma quelle sono quisquilie!


La prima enciclica di papa Leone XIV è stata presentata come basata sull’intelligenza artificiale. In realtà non è affatto così: l’IA è sicuramente presente in molti punti, ma il vero scopo dell’enciclica è quello di aggiornare il mondo sullo stato della dottrina sociale nella Chiesa. D’altra parte non è un caso che Prevost abbia scelto come nome quello del suo predecessore che scrisse la Rerum Novarum.

Un’ultima curiosità: il quadrato qui a fianco (l’immagine è dall’articolo di Lee Sallows pubblicato sulla rivista Abacus) è alfamagico in latino. Però mi sa che Sallows abbia barato: almeno per le mie conoscenze di latino il numero 97 non si dice “septem et nonaginta” ma “nonaginta septem”…