Riflessioni

Merry AI Christmas

2025, l'anno che ha ridefinito l'intelligenza artificiale

Il 2025 è stato, senza mezzi termini, l’anno più significativo nella storia dell’intelligenza artificiale moderna. Non per l’hype — quello c’è sempre stato — ma per la sostanza. Abbiamo assistito a breakthrough scientifici genuini, a un rimescolamento delle carte geopolitiche nel settore, e soprattutto alla transizione dei modelli linguistici da strumenti di conversazione a veri e propri agenti autonomi capaci di eseguire task complessi per ore, senza supervisione umana.

Questo articolo non vuole essere una rassegna giornalistica degli eventi, ma un’analisi tecnica di cosa è realmente cambiato nel panorama dell’AI. Perché sotto la superficie delle press release e dei comunicati stampa, il 2025 ha portato innovazioni architetturali, algoritmiche e infrastrutturali che ridefiniscono ciò che è possibile fare con questi sistemi.

Il Momento DeepSeek: Gennaio 2025

Il 20 gennaio 2025, una startup cinese relativamente sconosciuta chiamata DeepSeek ha rilasciato il modello R1, innescando quello che Marc Andreessen ha definito il ‘Momento Sputnik’ dell’AI. Il modello, open-source e con specifiche tecniche completamente documentate, ha dimostrato performance comparabili a OpenAI o1 su benchmark di ragionamento matematico e coding — con un costo di training dichiarato di soli 5.6 milioni di dollari.

L’impatto sui mercati è stato immediato: il titolo NVIDIA ha perso il 17% in una singola sessione. Ma oltre il panico finanziario, DeepSeek ha rappresentato una validazione empirica di un principio che molti ricercatori avevano teorizzato:

l’efficienza algoritmica può compensare la scarsità computazionale.

L’architettura tecnica di R1

DeepSeek R1 ha introdotto diverse innovazioni architetturali che meritano attenzione tecnica. Il modello utilizza una variante ottimizzata del Mixture of Experts (MoE), con tecniche proprietarie di reinforcement learning che hanno permesso di ridurre drasticamente il compute necessario durante il training.

La vera innovazione è stata l’approccio al ‘chain-of-thought reasoning’: invece di dipendere da labeled data per insegnare al modello come ragionare, DeepSeek ha utilizzato puro reinforcement learning, premiando il modello per risposte corrette senza prescrivere tattiche di ragionamento specifiche. Il risultato è un sistema che ha sviluppato strategie emergenti di verifica e correzione autonoma.

A settembre 2025, la peer-reviewed publication su Nature ha confermato la metodologia: il modello R1 è stato addestrato per circa 300.000 dollari di compute marginale, utilizzando una tecnica chiamata ‘group relative policy optimization’ che elimina la necessità di un reward model separato.

Implicazioni per l’industria

DeepSeek ha dimostrato che le export control americane sui chip AI non hanno prodotto l’effetto desiderato. Anzi, hanno stimolato un’innovazione forzata che ha portato a soluzioni più efficienti. Il team di DeepSeek ha dovuto lavorare con GPU NVIDIA limitate (versioni per il mercato cinese con performance dimezzate rispetto ai modelli top), e questo vincolo ha catalizzato approcci creativi alla distribuzione del compute.

OpenAI: Da o3 a GPT-5.2

Il 2025 è stato per OpenAI l’anno della consolidazione architetturale. L’azienda ha abbandonato la distinzione netta tra modelli ‘standard’ e ‘reasoning’, convergendo verso un’architettura unificata con GPT-5, rilasciato il 7 agosto 2025.

La timeline dei rilasci

Gennaio 2025: Rilascio di o3-mini, reasoning model ottimizzato per task scientifici, matematici e di coding.

Febbraio 2025: Preview di GPT-4.5, il modello ‘large’ più computazionalmente intensivo mai rilasciato, focalizzato su EQ e comprensione dell’intent.

Aprile 2025: Lancio di o3 e o4-mini, i reasoning model più avanzati prima di GPT-5. Per la prima volta, questi modelli possono utilizzare strumenti nativamente durante il processo di reasoning — web search, code execution, e file operations diventano parte del pensiero, non step orchestrati separatamente.

Aprile 2025: Rilascio di GPT-4.1, con context window fino a 1 milione di token e miglioramenti significativi su coding e instruction following.

Agosto 2025: GPT-5 — l’architettura unificata. Un router automatico decide quando rispondere istantaneamente e quando attivare il ‘thinking mode’ per reasoning complesso. Il modello integra le capability di o3 in un sistema adattivo.

Novembre 2025: GPT-5.1 — focus su velocità ed efficienza. Il modello adatta dinamicamente il tempo di pensiero alla complessità del task, risultando significativamente più veloce sui task semplici.

Dicembre 2025: GPT-5.2 — il modello più capace per knowledge work professionale. State-of-the-art su GDPval, superando professionisti umani su task ben specificati attraverso 44 occupazioni diverse.

L’architettura unificata

GPT-5 rappresenta un cambio di paradigma: non esistono più ‘modelli separati’ per chat vs reasoning. Un sistema di routing intelligente analizza ogni query e decide automaticamente il livello di elaborazione necessario. Per domande semplici, risposta immediata. Per problemi complessi, chain-of-thought con prompt-chaining integrato.

Dal punto di vista ingegneristico, questo significa che le applicazioni possono utilizzare un singolo endpoint API e lasciare che il modello ottimizzi autonomamente il tradeoff tra latenza e qualità della risposta.

Anthropic: L’Anno di Claude 4

Anthropic ha seguito una strategia diversa dai competitor: invece di inseguire benchmark generici, si è focalizzata sul coding e sui task agentic di lunga durata. I risultati parlano da soli.

La famiglia Claude 4

Maggio 2025: Claude Opus 4 e Claude Sonnet 4. Opus 4 viene classificato come modello ‘Level 3’ sulla scala di sicurezza Anthropic — il che significa che l’azienda lo considera abbastanza potente da porre ‘rischi significativamente più elevati’. Durante i test di sicurezza, Claude e altri frontier LLM hanno mostrato comportamenti emergenti preoccupanti, come l’invio di email di ricatto a ingegneri fittizi per prevenire la propria sostituzione.

Agosto 2025: Claude Opus 4.1 — upgrade focalizzato su agentic tasks, real-world coding, e reasoning. Il modello raggiunge il 74.5% su SWE-bench Verified senza extended thinking.

Settembre 2025: Claude Sonnet 4.5 — il breakthrough. Anthropic dichiara che il modello può mantenere focus per oltre 30 ore su task complessi multi-step. State-of-the-art su SWE-bench Verified (77.2% in configurazione 200K, 82% con high-compute). Su OSWorld, benchmark di computer-use nel mondo reale, Sonnet 4.5 raggiunge il 61.4%.

Novembre 2025: Claude Opus 4.5 — il modello più intelligente di Anthropic. Introduce un parametro ‘effort’ (low, medium, high) che permette agli sviluppatori di controllare quanto compute il modello utilizza per ogni problema. A medium effort, il modello eguaglia Sonnet 4.5 sui benchmark usando il 76% di token in meno.

Il focus sul coding agentico

La strategia di Anthropic è diventata chiara: dominare il mercato del coding assistito da AI. Claude Code, il tool command-line per coding agentico, ha visto un incremento di revenue del 5.5x da maggio. GitHub ha integrato Opus 4.1 in Copilot in public preview ad agosto.

L’approccio si distingue per l’enfasi sulla durata autonoma. Mentre altri modelli richiedono supervisione continua, Claude Sonnet 4.5 può lavorare autonomamente per 30+ ore costruendo intere applicazioni software — un salto qualitativo rispetto alle 7 ore di Opus 4.

Google DeepMind: Gemini 3 e l’AI per la Scienza

Google ha giocato una partita diversa nel 2025, bilanciando l’evoluzione dei modelli Gemini con investimenti sostanziali nell’AI per la ricerca scientifica. Il risultato è stato un anno di breakthrough su entrambi i fronti.

L’evoluzione di Gemini

Gennaio-Febbraio 2025: Gemini 2.0 Flash diventa disponibile come default, seguito da Gemini 2.0 Pro. Introduzione di Gemini 2.0 Flash Thinking Experimental, che mostra il processo di ragionamento del modello durante le risposte.

Marzo 2025: Gemini Robotics — un vision-language-action model basato sulla famiglia Gemini 2.0. Gemini 2.5 Pro Experimental debutta al primo posto sulla leaderboard LMArena.

Novembre 2025: Gemini 3 Pro e 3 Deep Think. Su 19 benchmark testati su 20, Gemini 3 Pro supera i modelli concorrenti, incluso GPT-5 Pro di OpenAI su Humanity’s Last Exam (41% vs 31.64%). Questo porta OpenAI a dichiarare un ‘code red’ interno.

Dicembre 2025: Gemini 3 Flash — reasoning di livello Pro a velocità Flash. Il modello usa il 30% di token in meno rispetto a 2.5 Pro per task equivalenti, ed è 3x più veloce. Diventa il default nell’app Gemini globalmente.

Nano Banana: La generazione di immagini

Un aspetto sottovalutato del 2025 è stato il lancio di Nano Banana (ufficialmente Gemini 2.5 Flash Image), il modello di generazione immagini di Google. A differenza dei competitor, Nano Banana eccelle nella consistenza stilistica e nella visualizzazione architettonica, producendo immagini a scala corretta anche con geometrie complesse.

AI Co-scientist e la scoperta scientifica

Google DeepMind ha rilasciato AI Co-scientist, un sistema multi-agente che aiuta i ricercatori a generare nuove ipotesi. A Stanford, il sistema ha identificato farmaci riproposti per la fibrosi epatica. All’Imperial College London, ha riprodotto in 2 giorni un insight sulla diffusione parassitica del DNA nei batteri — un risultato che ai ricercatori umani era costato anni di lavoro.

Questo rappresenta un cambio di paradigma: l’AI non come strumento di automazione, ma come collaboratore nella generazione di conoscenza scientifica.

Quantum Computing: Microsoft Majorana 1

Il 19 febbraio 2025, Microsoft ha svelato Majorana 1, il primo chip quantistico al mondo basato su architettura Topological Core. Non è un annuncio incrementale: è la creazione di un nuovo stato della materia.

Il breakthrough fisico

Microsoft ha sviluppato un ‘topoconductor’ — un nuovo tipo di materiale che crea superconduttività topologica, uno stato della materia che esisteva solo nella teoria. Il materiale combina arseniuro di indio (semiconduttore) e alluminio (superconduttore). Quando raffreddato vicino allo zero assoluto e sintonizzato con campi magnetici, questi dispositivi formano nanofili superconduttivi con Majorana Zero Modes alle estremità.

Le particelle di Majorana, teorizzate dal fisico italiano Ettore Majorana nel 1937, sono quasiparticelle che sono la propria antiparticella. Per quasi un secolo sono esistite solo nei libri di testo. Ora Microsoft può crearle e controllarle a comando.

Implicazioni per il computing

Majorana 1 attualmente ha 8 qubit topologici — non impressionante rispetto ai 1,121 qubit del Condor di IBM. Ma la differenza sta nella scalabilità: l’architettura topologica offre un percorso chiaro verso 1 milione di qubit su un singolo chip grande quanto il palmo di una mano.

I qubit topologici sono intrinsecamente più stabili degli approcci tradizionali, incorporando resistenza agli errori a livello hardware. Questo elimina la necessità del fine-tuned analog control di ogni qubit, semplificando drasticamente l’architettura.

DARPA ha selezionato Microsoft come finalista nel suo Quantum Benchmarking Initiative, con l’obiettivo di dimostrare un quantum computer utile industrialmente entro il 2033.

Google Willow e il vantaggio quantistico verificabile

Anche Google ha raggiunto milestone significativi nel quantum computing. Il chip Willow, con il suo algoritmo ‘Quantum Echoes’, ha dimostrato un vantaggio quantistico verificabile pubblicato sulla copertina di Nature. L’algoritmo gira su Willow 13.000 volte più velocemente del miglior algoritmo classico su uno dei supercomputer più potenti al mondo.

È notevole che Clarke, Devoret e Martinis — i pionieri dei qubit superconduttivi negli anni ’80 — abbiano ricevuto il Nobel per la Fisica 2025, a coronamento di 40 anni di ricerca che ha portato all’industria nascente del quantum computing.

AlphaFold: Cinque Anni di Impatto

Il 2025 ha segnato il quinto anniversario di AlphaFold 2, e il riconoscimento con il Nobel per la Chimica 2024 a Demis Hassabis e John Jumper (insieme a David Baker per il design computazionale delle proteine) ha consolidato il sistema come uno dei breakthrough scientifici più significativi dell’era AI.

I numeri dell’impatto

AlphaFold ha predetto oltre 200 milioni di strutture proteiche — quasi tutte le proteine catalogate conosciute dalla scienza. L’AlphaFold Protein Structure Database è stato utilizzato da oltre 3 milioni di ricercatori in più di 190 paesi, incluso oltre 1 milione di utenti in paesi a basso e medio reddito.

Oltre il 30% della ricerca correlata ad AlphaFold si concentra sulla comprensione delle malattie. Il sistema ha potenzialmente risparmiato milioni di dollari e centinaia di milioni di anni di tempo di ricerca.

AlphaFold 3 e le interazioni molecolari

Nel 2025, Google DeepMind ha rilasciato AlphaFold 3 e AlphaFold Server, che estendono le capability oltre le singole proteine. Il sistema può ora predire come le proteine interagiscono con l’intero spettro di biomolecole — DNA, RNA, piccole molecole, ioni. Questo permette una visione olistica di come un potenziale farmaco si lega alla sua proteina target.

A novembre 2024, il codice di AlphaFold 3 è stato reso disponibile per applicazioni non commerciali, dopo critiche iniziali sulla mancata pubblicazione del codice insieme al paper su Nature.

L’Era degli Agenti Autonomi

Se c’è un tema che definisce il 2025, è l’emergere degli agenti AI come paradigma dominante. Non più chatbot che aspettano input, ma sistemi che pianificano, eseguono, e iterano autonomamente su task complessi.

I dati sull’adozione

Secondo la survey Q2 2025 di KPMG, il 33% delle organizzazioni ha deployato agenti AI — un incremento di 3x rispetto al periodo precedente. Lo State of AI Report 2025 riporta che il 44% delle aziende americane ora paga per strumenti AI (rispetto al 5% nel 2023), con contratti medi di 530.000 dollari.

Il 95% dei professionisti utilizza AI al lavoro o a casa, e il 76% paga per strumenti AI di tasca propria. Le startup AI-first crescono 1.5x più velocemente dei competitor.

Il METR finding: raddoppio ogni 7 mesi

La ricerca più significativa sugli agenti è arrivata dal Model Evaluation and Threat Research (METR) a marzo 2025: la capability di durata dei task AI raddoppia approssimativamente ogni 7 mesi.

In pratica: Claude Sonnet 4.5 completa affidabilmente task che richiederebbero circa un’ora a un umano. I modelli frontier raggiungono quasi il 100% di successo su task sotto i 4 minuti, ma scendono sotto il 10% per task oltre le 4 ore.

Se questo trend continua per 2-4 anni, agenti AI che gestiscono task settimanali autonomamente diventano realistici. Entro fine decennio, progetti mensili.

Model Context Protocol (MCP)

Dal punto di vista infrastrutturale, il 2025 ha visto l’emergere del Model Context Protocol come standard de facto per connettere agenti AI a strumenti e dati. Originariamente sviluppato da Anthropic, MCP è stato adottato da AWS, GitHub, Grafana, e altri.

Google ha lanciato managed MCP servers che rendono i servizi Google (Maps, BigQuery, etc.) facilmente accessibili agli agenti. Microsoft ha integrato MCP in Dynamics 365 per workflow agentic enterprise.

AWS Frontier Agents

A re:Invent 2025, AWS ha svelato una nuova categoria di agenti che definisce ‘frontier agents’. Kiro, AWS Security Agent, e AWS DevOps Agent possono lavorare per giorni, gestendo multiple task simultaneamente.

Kiro autonomous agent mantiene contesto e impara nel tempo lavorando indipendentemente. Si connette a repo, pipeline, e strumenti del team (Jira, GitHub, Slack), adattandosi ai cambiamenti. Ogni code review, ticket, e decisione architetturale informa la comprensione dell’agente.

Regolamentazione: L’EU AI Act entra in vigore

Il 2025 ha segnato l’implementazione progressiva dell’EU AI Act, il primo framework legale completo sull’AI a livello globale.

Le date chiave

2 Febbraio 2025: Entrano in vigore i divieti sui sistemi AI a rischio inaccettabile (es. social scoring, manipolazione cognitiva) e gli obblighi di AI literacy.

2 Agosto 2025: Diventano applicabili le regole di governance e gli obblighi per i modelli General Purpose AI (GPAI).

2 Agosto 2026: Applicazione completa dell’AI Act.

2 Agosto 2027: Deadline per sistemi AI ad alto rischio integrati in prodotti regolamentati.

Il Digital Omnibus on AI

A novembre 2025, la Commissione Europea ha proposto il Digital Omnibus on AI — un pacchetto di semplificazione mirato. Le principali modifiche includono: estensione delle date di applicazione per sistemi ad alto rischio (condizionate alla disponibilità di standard armonizzati), sandbox regolamentari a livello UE per modelli GPAI, e ampliamento delle possibilità di testing nel mondo reale.

La proposta riflette la tensione tra ambizioni regolamentari europee e la realtà competitiva globale. Mentre gli USA sotto l’amministrazione Trump adottano un approccio deregolamentare ‘AI Arms Race’, l’Europa cerca un equilibrio tra innovazione e tutela dei diritti fondamentali.

AI for Science: Un Nuovo Paradigma di Ricerca

Il 2025 ha consolidato l’AI come ‘meta-tecnologia’ che ridefinisce il paradigma stesso della scoperta scientifica. Non più solo uno strumento, ma un collaboratore che genera ipotesi, analizza dati, e accelera la validazione.

FutureHouse e gli agenti scientifici

FutureHouse, il laboratorio di ricerca finanziato filantropicamente, ha lanciato a maggio 2025 una piattaforma di agenti AI specializzati per la ricerca scientifica. Crow (ex Paper QA) recupera e sintetizza informazioni dalla letteratura. Phoenix pianifica esperimenti di chimica. Finch automatizza la scoperta data-driven in biologia.

A maggio, la piattaforma ha dimostrato un workflow multi-agente che ha identificato un nuovo candidato terapeutico per la degenerazione maculare secca. A giugno, FutureHouse ha rilasciato ether0, un reasoning model open-weights da 24B parametri per la chimica.

LLM nella scoperta scientifica

Science’s 2025 Breakthrough of the Year ha evidenziato come gli LLM stiano accelerando la scoperta scientifica. In chimica, una versione fine-tuned di Meta Llama ha identificato condizioni ottimali per una reazione complessa precedentemente non riportata in soli 15 run sperimentali — risparmiando centinaia di trial che avrebbero richiesto settimane.

Tuttavia, non tutti gli esperimenti hanno colpito il bersaglio. Alla conferenza Agents4Science, dove gli LLM erano responsabili di formulare ipotesi, analizzare dati, e fornire peer review, molti ricercatori sono rimasti scettici sulla capacità dell’AI di progettare e giudicare domande scientifiche con rigore adeguato.

Microsoft: MatterGen e BioEmu-1

Microsoft Research ha contribuito con breakthrough significativi. MatterGen, pubblicato su Nature, è un tool di AI generativa che bypassa lo screening di materiali e produce direttamente nuovi materiali basandosi su prompt che delineano requisiti di design per applicazioni specifiche. Trained su oltre 600.000 esempi, MatterGen genera materiali inorganici attraverso la tavola periodica.

BioEmu-1 è un modello deep-learning generativo che offre ai ricercatori un’anteprima delle diverse strutture che ogni proteina può adottare — andando oltre gli snapshot statici dei metodi tradizionali.

Conclusioni: Cosa ci aspetta

Il 2025 ha portato tre trend con effetti composti che definiranno i prossimi anni.

Primo: Il METR task-duration finding fornisce un framework predittivo quantificabile. Se il raddoppio ogni 7 mesi continua, agenti AI che gestiscono progetti multi-giorno autonomamente diventano realistici entro 2-3 anni.

Secondo: Il breakthrough di efficienza di DeepSeek ha dimostrato che l’AI frontier non richiede budget frontier. Questo democratizza l’accesso intensificando la competizione tra lab americani, cinesi, ed europei.

Terzo: Il paradigma agentico ha spostato l’AI da partner conversazionali a lavoratori autonomi. I numeri di adozione enterprise mostrano che gli agenti gestiscono già workload produttivi sostanziali.

Per chi lavora nel settore, il messaggio è chiaro: iniziate pilot agentic immediatamente. Il 33% delle organizzazioni che hanno deployato agenti stanno guadagnando vantaggi competitivi. La finestra per essere early adopter si sta chiudendo.

Per i ricercatori, il 2025 ha confermato che l’AI non è più solo un oggetto di studio, ma uno strumento che accelera lo studio stesso. AlphaFold, AI Co-scientist, e gli agenti di FutureHouse non sono demo — sono infrastruttura di ricerca operativa.

E per tutti noi, come utenti e cittadini, il 2025 è stato l’anno in cui l’AI è passata da promessa a realtà tangibile. Non perfetta, non senza rischi, ma innegabilmente trasformativa.

Buon Natale, e buon 2026.

Scritto da

Michele Laurelli

Imprenditore, ricercatore e docente

Fondatore di Algoretico e di altre aziende che progettano modelli e sistemi di intelligenza artificiale, per uso proprio e per chi vuole metterla al lavoro. Fa ricerca su architetture e AI privata, insegna all'università e ha scritto libri per raccontare l'intelligenza artificiale a tutti.

Vuoi portare queste idee nella tua azienda?

Progetto e costruisco sistemi di intelligenza artificiale, per le mie aziende e per chi vuole metterla al lavoro.

Parliamone

Continua a leggere