Talent-Conditioned Transformer: dare una personalità cognitiva all'intelligenza artificiale
In Algoretico abbiamo sviluppato un framework che fa qualcosa che nessun Transformer fa oggi: sviluppare una personalità cognitiva che evolve con l'esperienza.

C’è un’assunzione che diamo per scontata ogni volta che parliamo di intelligenza artificiale generativa: tutti i modelli sono identici tra loro. Due copie di GPT-5, di Claude, di LLaMA, di qualsiasi modello esistente, messe davanti allo stesso input, produrranno esattamente lo stesso output. Non hanno una storia. Non hanno sviluppato preferenze nel tempo. Non hanno maturato intuizioni diverse in base alle esperienze che hanno attraversato. Sono, dal punto di vista computazionale, intercambiabili.
Questa non è una semplificazione giornalistica. È una proprietà strutturale dell’architettura Transformer, il motore che alimenta praticamente tutta l’AI moderna dal 2017 a oggi. Dal paper originale “Attention Is All You Need” sono passati quasi nove anni, e in questo periodo il Transformer è stato esteso, modificato, ottimizzato e reinventato in decine di modi diversi: attenzione sparsa, mixture of experts, LoRA, prompt tuning, hypernetwork, adapter layers. Ma tutte queste varianti, nessuna esclusa, condividono un assunto fondamentale: il modello è il modello. La sua identità computazionale è fissa. Può essere adattato a un compito, ma non evolve come entità.
Noi pensiamo che questo sia un limite architetturale significativo. E abbiamo costruito un framework per superarlo.
Il problema: perché l’identità computazionale conta
Per capire perché questo limite sia rilevante, conviene fare un passo indietro e pensare a come funziona l’apprendimento negli esseri umani.
Un medico che esce dalla facoltà di medicina ha una base di conoscenze condivisa con tutti i suoi colleghi di corso. Ma dopo vent’anni di pratica, due medici che hanno seguito percorsi diversi ragionano in modi profondamente diversi. Un cardiologo che ha passato la carriera a trattare pazienti diabetici ha sviluppato un’intuizione clinica specifica: non sa solo cose diverse dal suo collega che ha lavorato in cardiochirurgia pediatrica, ma pensa in modo diverso. I suoi pattern di ragionamento, le sue euristiche diagnostiche, il modo in cui pesa le evidenze — tutto questo si è modellato sulla sua storia professionale.
Non è solo questione di conoscenze accumulate. È questione di struttura cognitiva: il modo in cui l’esperienza passata plasma il modo in cui elaboriamo le informazioni future.
Nell’AI attuale, questa dimensione non esiste. Quando adattiamo un modello a un nuovo compito con LoRA o con il fine-tuning, gli stiamo insegnando cosa fare su quel compito specifico. Ma non stiamo cambiando il suo modo di ragionare. Non stiamo costruendo una storia cognitiva. E soprattutto, quando passiamo al compito successivo, tutto quello che il modello ha “imparato” sul compito precedente viene tipicamente perso o, peggio, interferisce con il nuovo apprendimento — un fenomeno noto come catastrophic forgetting.
Il risultato è che ogni adattamento è un evento isolato. Il modello non impara a imparare. Non migliora come learner attraverso l’esperienza. Non sviluppa preferenze strutturali che lo rendono progressivamente più efficiente nell’affrontare certi tipi di problemi.
La proposta: un talento per ogni modello
Il Talent-Conditioned Transformer, o TCT, è un framework che abbiamo sviluppato in Algoretico per affrontare esattamente questo problema. L’idea centrale è concettualmente semplice, anche se l’implementazione tecnica è tutt’altro che banale.
A ogni modello Transformer viene associato un vettore — un oggetto matematico di dimensione fissa, tipicamente 64 o 128 numeri — che chiamiamo talent prior, o semplicemente talento. Questo vettore non contiene conoscenze. Non è un database di fatti, non memorizza risposte, non è un prompt nascosto. È qualcosa di più fondamentale: un insieme di preferenze strutturali che influenzano il modo in cui il modello elabora le informazioni.
Il talento agisce come un filtro cognitivo persistente. Determina quali circuiti interni del modello vengono attivati con più forza, quali percorsi computazionali vengono favoriti, come le risorse interne vengono allocate tra sotto-problemi diversi. Due modelli con lo stesso addestramento di base ma con talenti diversi, messi davanti allo stesso input, seguiranno percorsi computazionali diversi — non perché hanno conoscenze diverse, ma perché hanno stili di elaborazione diversi.
La differenza cruciale rispetto a tutti i metodi di adattamento esistenti è una sola parola: persistenza.
Quando un modello dotato di talento affronta un nuovo compito, il talento non viene cancellato e ricreato da zero. Evolve. Si aggiorna lentamente, su una scala temporale molto più lenta rispetto all’apprendimento del compito specifico, incorporando l’esperienza strutturale accumulata nei compiti precedenti. Un modello che ha prima imparato a classificare il sentimento di recensioni cinematografiche e poi ha affrontato compiti di inferenza logica svilupperà un talento diverso da uno che ha seguito il percorso inverso. La sequenza di esperienze modella il profilo cognitivo del modello, esattamente come succede con gli esseri umani.
Questa non è un’analogia poetica. È una proprietà misurabile del sistema, e i nostri esperimenti lo dimostrano.
Come funziona: tre meccanismi, un unico vettore
Il talento non è un semplice modificatore lineare. Agisce sul modello attraverso tre meccanismi distinti ma coordinati, tutti controllati dallo stesso vettore. Questo è un punto architetturale importante: la coerenza del sistema deriva dal fatto che un unico oggetto matematico governa simultaneamente tre livelli diversi di modulazione.
Modulazione delle attivazioni (FiLM)
Il primo meccanismo è ispirato a una tecnica proveniente dalla computer vision, chiamata Feature-wise Linear Modulation. In ogni strato del Transformer, dopo che le attivazioni sono state calcolate normalmente, il talento genera due set di parametri — uno di scala e uno di spostamento — che vengono applicati a quelle attivazioni.
L’analogia più intuitiva è quella di un equalizzatore audio. Quando si ascolta musica, l’equalizzatore non cambia la registrazione: enfatizza certe frequenze e ne attenua altre, adattando il suono all’ambiente o alle preferenze dell’ascoltatore. Allo stesso modo, il FiLM condizionato dal talento non cambia i pesi del modello: modula il segnale che passa attraverso il modello, enfatizzando certi pattern computazionali e attenuandone altri.
In pratica, un modello con un talento orientato al ragionamento logico potrebbe amplificare le attivazioni associate all’elaborazione di strutture sintattiche complesse, mentre un modello con un talento orientato alla comprensione emotiva del testo potrebbe enfatizzare i pattern legati alla semantica lessicale.
Instradamento condizionato degli esperti
Il secondo meccanismo interviene a un livello più strutturale. In alcuni strati del Transformer, il blocco di elaborazione standard viene sostituito da un gruppo di sotto-reti specializzate — i cosiddetti esperti. Ogni esperto è una piccola rete neurale indipendente, e per ogni input il modello ne attiva solo un sottoinsieme (tipicamente due su quattro).
Nei sistemi mixture-of-experts tradizionali, la scelta di quali esperti attivare dipende esclusivamente dall’input corrente. Nel TCT, il talento interviene nel processo di selezione, spostando le probabilità di attivazione a favore di certi esperti piuttosto che altri. Questo significa che due modelli con talenti diversi, anche davanti allo stesso input, attiveranno combinazioni diverse di esperti — e quindi processeranno l’informazione attraverso circuiti fisicamente diversi della rete.
L’effetto è una specializzazione implicita: il modello non solo impara cosa fare, ma impara anche quali dei suoi strumenti interni sono più adatti al tipo di problemi che ha affrontato nella sua storia.
Generazione adattiva dei parametri
Il terzo meccanismo è il più potente e anche il più costoso computazionalmente. Una piccola rete neurale ausiliaria — una hypernetwork — prende il talento come input e genera delle modifiche ai pesi delle matrici di attenzione del modello principale.
Questo è qualitativamente diverso dai primi due meccanismi. Il FiLM modula le attivazioni (il segnale che passa attraverso la rete). L’instradamento degli esperti seleziona quali percorsi computazionali attivare. La hypernetwork va oltre: riconfigura fisicamente parti del modello stesso. I pesi dell’attenzione — il cuore del meccanismo che dà il nome al Transformer — vengono modificati in funzione del talento, rendendo l’attenzione stessa dipendente dalla storia cognitiva del modello.
Le modifiche generate dalla hypernetwork sono a basso rango, il che significa che sono efficienti in termini di parametri e non richiedono di riaddestrare l’intero modello. Ma il loro effetto è profondo: cambiano letteralmente il modo in cui il modello decide cosa è importante in un input.
L’ottimizzazione a due livelli
C’è un ultimo pezzo architetturale che tiene insieme il tutto: il modo in cui il talento viene aggiornato.
Il TCT utilizza un’ottimizzazione bi-livello. Il livello interno è l’addestramento classico: il modello impara a risolvere il compito corrente, aggiornando i parametri specifici del task (la testa di classificazione, i parametri del FiLM, ecc.) ad ogni batch di dati. Il livello esterno opera su una scala temporale più lenta: ogni cento passi di addestramento, il talento viene aggiornato sulla base della sua performance su un set di validazione separato.
Questa separazione temporale è fondamentale. Il livello interno risponde alla domanda “come risolvo questo compito?”. Il livello esterno risponde alla domanda “come dovrei cambiare il mio profilo cognitivo alla luce di quello che sto imparando?”. La lentezza dell’aggiornamento esterno è intenzionale: impedisce al talento di diventare un semplice riflesso del compito corrente e lo costringe a catturare pattern strutturali che trascendono i singoli compiti.
I risultati: cosa abbiamo misurato
La teoria è una cosa. La domanda che conta è: funziona?
Abbiamo testato il TCT su cinque compiti linguistici diversi, scelti per coprire uno spettro ampio di capacità: analisi del sentimento (SST-2), inferenza in linguaggio naturale (MNLI), riconoscimento di parafrasi (QQP), classificazione di argomenti (AG News) e misurazione della similarità semantica tra frasi (STS-B). Lo abbiamo confrontato con i metodi di adattamento più usati nella ricerca attuale: fine-tuning completo, LoRA, prompt tuning, e un task embedding con la stessa dimensionalità del talento ma senza persistenza.
Compiti singoli
Sul singolo compito, il TCT ottiene risultati competitivi con LoRA e prompt tuning. Su alcuni task li supera, su altri si allinea, su nessuno è significativamente peggiore. Questo risultato è importante ma non sorprendente: il TCT non è progettato per eccellere in isolamento. La sua ragion d’essere emerge quando i compiti si accumulano.
Adattamento sequenziale
Qui sta il risultato centrale del lavoro. Abbiamo sottoposto i modelli a sequenze ordinate di tutti e cinque i compiti — prima il sentimento, poi la classificazione, poi l’inferenza, e così via — e abbiamo misurato due cose: il forward transfer (quanto l’esperienza sui compiti precedenti aiuta il compito corrente) e il backward transfer (quanto l’apprendimento di un nuovo compito degrada le prestazioni sui compiti precedenti).
I metodi tradizionali mostrano un pattern prevedibile: man mano che si aggiungono compiti, le prestazioni sui compiti precedenti calano (backward transfer negativo) e l’aiuto dei compiti precedenti per quelli futuri è minimo o nullo. LoRA, che resetta i suoi parametri per ogni compito, non ha memoria. Il fine-tuning completo, che non resetta nulla, accumula interferenza.
Il TCT mostra un comportamento qualitativamente diverso. Il forward transfer è positivo e cresce con il numero di compiti: il modello diventa progressivamente migliore nell’adattarsi a nuovi compiti, perché il talento ha accumulato informazione strutturale utile. Il backward transfer è significativamente meno negativo rispetto a tutti i baselines: il talento protegge le competenze precedenti perché le ha codificate non come conoscenze specifiche (che vengono sovrascritte) ma come preferenze strutturali (che persistono).
In termini pratici: il TCT impara a imparare.
Studio di ablazione
Per capire quali componenti del sistema sono effettivamente responsabili dei risultati, abbiamo condotto uno studio di ablazione sistematico, disattivando una componente alla volta.
I risultati mostrano che tutti e tre i meccanismi di condizionamento contribuiscono positivamente, ma il FiLM e l’instradamento degli esperti hanno l’impatto maggiore. La hypernetwork aggiunge un miglioramento incrementale, il che è ragionevole dato che è anche il componente più costoso.
Il dato più rivelatore, però, riguarda la persistenza. Quando il talento viene resettato prima di ogni nuovo compito — rendendolo di fatto equivalente a un task embedding standard — il vantaggio del TCT scompare quasi interamente. Questo conferma che il valore del framework non sta nei singoli meccanismi di condizionamento, ma nella loro combinazione con un vettore che evolve nel tempo.
L’evoluzione del talento
Forse il risultato più affascinante è anche il più visivo. Abbiamo tracciato la traiettoria del vettore-talento nel tempo, proiettandolo in due dimensioni, per modelli esposti a sequenze diverse di compiti.
Quello che emerge è che modelli con storie diverse sviluppano traiettorie distinte e interpretabili. Non è rumore: i cluster che si formano nello spazio del talento corrispondono a famiglie di compiti con caratteristiche simili. Un modello che ha iniziato con compiti di ragionamento logico e poi è passato a compiti di comprensione emotiva segue una traiettoria diversa da uno che ha fatto il percorso inverso, e le due traiettorie convergono verso regioni diverse dello spazio cognitivo.
Il talento, in altre parole, è un oggetto matematicamente misurabile che cattura qualcosa di analogo a quello che nella psicologia cognitiva si chiamerebbe “profilo di expertise”.
Cosa significa, in concreto
Il TCT non è un prodotto. Non è un chatbot migliore, non è un modello più grande, non è un’app. È un framework architetturale — un modo diverso di pensare a cosa dovrebbe essere un modello di AI.
Le implicazioni pratiche, tuttavia, sono concrete.
La prima è la personalizzazione profonda. Oggi, quando un’azienda vuole un’AI adattata alle proprie esigenze, ha due opzioni: il fine-tuning (costoso, rigido, soggetto a forgetting) o il retrieval-augmented generation (che non cambia il ragionamento del modello, solo le informazioni a cui ha accesso). Il TCT offre una terza via: un modello che sviluppa un profilo cognitivo calibrato sull’ecosistema specifico dell’azienda, attraverso l’esposizione progressiva ai suoi dati e ai suoi compiti. Non un modello che sa cose diverse, ma un modello che ragiona in modo diverso.
La seconda è l’efficienza. Invece di mantenere decine di modelli specializzati per applicazioni diverse, un’organizzazione potrebbe mantenere un singolo modello base con talenti diversi per contesti diversi. Il talento è un vettore di 64 numeri: occupa pochi byte di memoria. Il risparmio computazionale rispetto al mantenere modelli separati è enorme.
La terza è scientifica. Il TCT fornisce uno strumento per studiare come le AI sviluppano competenze nel tempo. La traiettoria del talento è una finestra quantitativa sulla storia cognitiva del modello. Questo apre connessioni con le scienze cognitive, la psicologia dell’apprendimento, e lo studio delle differenze individuali nell’expertise umana — connessioni che finora non avevano una base tecnica su cui appoggiarsi.
Il contesto: perché adesso
L’idea che un modello debba avere una qualche forma di identità persistente non è interamente nuova. La meta-learning, il continual learning, e i modelli con memoria esterna sono linee di ricerca attive da anni. Ma il TCT si differenzia per un aspetto specifico: non cerca di dare al modello una memoria di cosa ha imparato, ma una memoria di come ha imparato. La distinzione è sottile ma profonda.
Un sistema di continual learning cerca di non dimenticare i fatti appresi nei compiti precedenti. Il TCT non si preoccupa dei fatti: si preoccupa delle strategie. Il talento non ricorda che “le recensioni negative contengono spesso parole come terribile”: ricorda che il modello ha imparato a essere bravo a distinguere sfumature emotive nel testo, e usa questa informazione strutturale per affrontare meglio i compiti futuri.
È la differenza tra ricordare le risposte e ricordare come si ragiona. Entrambe le cose sono utili, ma nella ricerca attuale l’attenzione è quasi esclusivamente sulla prima.
Dove siamo e dove andiamo
Il paper che descrive il TCT è disponibile come preprint su OpenReview, TechRxiv (IEEE), e Zenodo. Stiamo preparando la submission a Transactions on Machine Learning Research (TMLR), una rivista peer-reviewed fondata da Hugo Larochelle, Kyunghyun Cho e Raia Hadsell, tra i nomi più rispettati nel campo.
Il lavoro è stato sviluppato interamente in Algoretico, a Milano. Non in un laboratorio universitario, non in un centro di ricerca con centinaia di GPU, non in una big tech. In una software firm italiana indipendente che dal 2018 costruisce AI su misura per i propri clienti. Crediamo che questa origine sia rilevante: il TCT è nato da un’esigenza pratica — la frustrazione di dover ricominciare da zero ogni volta che adattavamo un modello a un nuovo contesto — e la soluzione che proponiamo riflette questa concretezza.
Il framework è nelle sue fasi iniziali. I risultati sperimentali sono promettenti ma condotti su scala limitata (modelli piccoli, compiti di NLP). La strada verso l’applicazione su modelli di frontiera è lunga. Ma la direzione ci sembra chiara: il futuro dell’AI non è solo modelli più grandi o metodi di adattamento più efficienti. È modelli che sviluppano un’individualità computazionale attraverso la loro storia. Modelli che, come i professionisti umani, diventano progressivamente migliori non perché sanno più cose, ma perché hanno imparato a pensare in modo più efficace.
Il TCT è un primo passo in questa direzione.
Il paper completo è disponibile su:
- OpenReview: openreview.net/forum?id=YFvj0besR4


