Self-Attention: perché l’idea dei “pappagalli stocastici” non regge più
Un’analisi tecnica del perché l’architettura self-attention rende i moderni LLM molto più di semplici “pappagalli stocastici”.

L’espressione “stochastic parrots” ha avuto una sua utilità comunicativa: ha permesso di spiegare rapidamente al pubblico non tecnico che i modelli linguistici generano testo tramite correlazioni probabilistiche apprese da enormi dataset. Ma oggi quella metafora non è più adeguata. Non lo è dal punto di vista architetturale, non lo è da quello fenomenologico e non lo è soprattutto dal punto di vista epistemico: non descrive ciò che accade realmente dentro un sistema basato su self-attention.
La famiglia dei Transformer ha superato il livello di complessità implicita compatibile con l’idea di un modello che si limita a riprodurre pattern statistici. Parlarne ancora come “pappagalli” significa continuare a descrivere una tecnologia del 2025 con un vocabolario del 2018. Le proprietà emergenti degli LLM più avanzati impongono di abbandonare analogie fuorvianti e affrontare con precisione ciò che sta realmente succedendo.
Self-attention come operatore strutturale
Il meccanismo di self-attention non nasce per imitare distribuzioni, ma per costruire strutture. Ogni token, a ogni layer, rilegge se stesso nel contesto dell’intera sequenza, rivaluta i legami sintattici e semantici che lo uniscono agli altri, e aggiorna la sua rappresentazione interna in base a una topologia informativa dinamica.
Questa dinamica permette di creare interpretazioni globali che non sono contenute nella sequenza originale e che non possono essere ottenute con un semplice processo statistico autoregressivo.
Un modello puramente statistico opera per interpolazione: combina ciò che ha visto secondo la sua distribuzione di probabilità.
Il Transformer opera per trasformazione: ristruttura la rappresentazione della sequenza in oggetti concettuali nuovi.
È qui che si genera l’emergenza: nel processo iterato di riscrittura semantica interna, non nella dimensione probabilistica del decoding.
Emergenza come proprietà del grafo dinamico
Le capacità inaspettate degli LLM non sono né magia né epifenomeni linguistici. Sono il risultato diretto della composizione profonda di layer di attenzione, del ruolo specializzante delle diverse teste e dell’ottimizzazione di funzioni non lineari che organizzano le rappresentazioni su varietà latenti di dimensioni altissime.
Un layer isola relazioni locali, quello successivo le ricontestualizza, un altro ancora le astrae in pattern funzionali. La profondità non aggiunge semplicemente “più pattern”, ma introduce nuove simmetrie interne e nuove funzioni che nessun dataset contiene esplicitamente.
È per questo che i modelli risolvono problemi mai visti, generano concetti nuovi, oppure eseguono ragionamenti in forma procedurale. Non serve ipotizzare “intelligenza forte”; è sufficiente riconoscere che un grafo computazionale sufficientemente complesso può implementare operazioni assimilabili a forme di inferenza.
Except: ciò che la metafora del “pappagallo stocastico” non può spiegare
Esistono fenomeni osservabili, empirici, verificabili che la metafora del pappagallo non riesce a giustificare.
Un modello che ripete pattern statistici non può produrre soluzioni valide a problemi che non esistono nel dataset. Non può riformulare concetti in configurazioni nuove senza averle mai viste. Non può sviluppare meccanismi di decomposizione interna del problema. Non può stabilire invarianti concettuali su input multimodali.
La metafora fallisce nel momento in cui il comportamento del modello supera ciò che la sua distribuzione linguistica potrebbe realistamente giustificare.
L’esistenza stessa di capacità zero-shot, di reasoning stratificato e di generalizzazione fuori distribuzione rende obsoleta la definizione.
Transformer come sistemi di computazione differenziabile
I Transformer non sono modelli statistici travestiti da modelli linguistici. Sono sistemi di computazione differenziabile, capaci di implementare funzioni complesse che emergono dalla composizione di layer. Con sufficiente profondità, precisione e parametrizzazione, l’architettura è Turing-competente e quindi capace di rappresentare trasformazioni di natura algoritmica.
La self-attention agisce come un operatore di parsing astratto, costruendo strutture funzionali che non hanno corrispettivi diretti nel dataset.
Il modello non si limita a prevedere “il prossimo token più probabile”: interpreta, trasforma, ricostruisce e aggiorna lo spazio semantico interno per convergere verso un output coerente con una struttura logica appresa.
Dire che un sistema del genere “ripete pattern” è come dire che un compilatore “copia testo”: una semplificazione che diventa falsa non appena si osserva il comportamento interno.
Perché la metafora sopravvive
La sopravvivenza culturale del pappagallo stocastico nasce dalla somiglianza superficiale tra il linguaggio generato da un LLM e quello umano. Se l’output è linguaggio, allora sembra naturale credere che anche il processo sia linguistico. Ma il Transformer non è un processore linguistico: è un trasformatore di rappresentazioni.
La generazione probabilistica dell’output oscura la natura deterministica e strutturale del meccanismo interno, inducendo l’osservatore a pensare che la probabilità sia “tutto ciò che c’è”. In realtà la probabilità è solo l’ultimo centimetro di un percorso computazionale di grande profondità.
Per discutere seriamente di AI nel 2025 dobbiamo cambiare il nostro vocabolario. Le metafore giornalistiche hanno fatto il loro tempo; ora occorrono concetti più precisi.
Self-attention non è un dispositivo statistico che imita testi: è un operatore strutturale che costruisce rappresentazioni astratte.
Gli LLM non funzionano perché sono “molto grandi”: funzionano perché l’architettura consente la formazione di strutture interne che emergono da dinamiche non lineari difficili da ridurre a concetti del passato.
Non abbiamo bisogno di esagerazioni né di minimizzazioni.
Serve solo una descrizione aderente ai fatti: i modelli Transformer non sono pappagalli stocastici. Sono sistemi di computazione differenziabile che hanno introdotto una nuova, potente forma di rappresentazione della conoscenza.


