AI al lavoro

I motori generativi decidono chi sei, diglielo tu

Le deduzioni dei modelli possono fare molti danni alle identità personali e a quella di aziende e prodotti.

Il meccanismo che cambia le carte

Da qualche settimana lavoro con un dato che mi ha fatto allargare le priorità. I training crawler hanno raggiunto il 49,9% di tutto il traffico AI sui siti secondo Cloudflare Radar, e Applebot è cresciuto del 124% in un singolo mese. È già metà di quello che arriva oggi.

Google-Agent è il nuovo fetcher user-triggered di Google: le richieste avviate dall’utente non seguono la stessa logica dei crawler autonomi, e il robots.txt in questa categoria non si applica necessariamente. Chiunque gestisca infrastruttura AIO deve aggiornare il proprio modello mentale sul robots.txt.

Il nodo è come i modelli costruiscono la rappresentazione di un’entità. La loro logica non è quella di un database relazionale: costruiscono connessioni per prossimità, mica per verità. Se un prodotto e un competitor compaiono spesso negli stessi contesti, il modello può associarli. Se la documentazione del 2021 è più linkata di quella del 2024, può pesare di più nella sintesi. Se una fonte è l’unica disponibile su una feature specifica, tende a diventare dominante anche quando è vecchia o incompleta.

Un sistema generativo legge una pagina diversamente da come la vede un browser, estraendo il contenuto grezzo e passandolo al modello. In quel passaggio, elementi invisibili all’utente come commenti nel codice, attributi di accessibilità e metadati nascosti diventano visibili al modello e, se costruiti ad hoc, possono influenzarlo o essere sfruttati. È una superficie di attacco documentata, non ipotetica.

Perché la SEO fa da fondamenta, ma non da tetto

La SEO tradizionale è ancora necessaria, perché senza posizionamento organico solido i motori generativi non trovano il materiale da cui sintetizzare. Ma Googlebot e i motori generativi cercano cose diverse. Googlebot indicizza pagine e le ordina per rilevanza rispetto a query testuali. I motori generativi cercano identità semantica dichiarata: chi è questo soggetto, cosa fa, con chi è collegato, come vuole essere rappresentato, quali fonti su di lui sono affidabili (secondo il bot stesso) e come si ricollegano tra loro.

Lavorando su questi casi, gli errori che trovo sono abbastanza sistematici. Entità non disambiguate, con un SaaS confuso con un competitor perché nessuno dei due ha dichiarato le differenze in un formato che i modelli riconoscono come prioritario. Relazioni costruite per co-occorrenza, con fondatori attribuiti a prodotti sbagliati e partnership mai avvenute dedotte da menzioni vicine nello stesso articolo. Feature obsolete che pesano quanto quelle attuali perché la documentazione vecchia accumula più backlink di quella nuova. Nessuno di questi errori è stravagante: seguono la logica di un sistema che non conosce la realtà, ma solo i dati disponibili e la loro convergenza.

Esistono architetture tecniche per comunicare l’identità ai modelli, alcune già in uso e altre ancora in fase di definizione nel settore. Nel mio lavoro le implemento da tempo, spesso su standard che il mercato sta ancora discutendo, usando il Metaprompting Strategico per analizzare come i modelli leggono e rappresentano un’entità, e orientare l’infrastruttura di conseguenza. Per molti prodotti tech italiani questa infrastruttura è ancora assente o embrionale. Il mercato si è concentrato su ciò che Google ha reso misurabile per anni, mentre i motori generativi usano metriche diverse.

Standard in competizione e bot che mentono

Chi lavora su questo fronte incontra un problema ulteriore: il territorio non è solo nuovo, è instabile. Gli standard non sono unificati, le big tech spingono ognuna nella propria direzione, e il panorama cambia ogni mese.

Google ad esempio sta sperimentando web-bot-auth, un draft IETF che usa firme crittografiche per autenticare i bot invece di affidarsi alle stringhe User-Agent, facilmente spoofabili. AWS ha già annunciato supporto sperimentale, altri operatori si stanno muovendo nella stessa direzione. È un protocollo da monitorare, non ancora da implementare in produzione, ma potrebbe cambiare il modo in cui si gestisce l’accesso dei bot a livello server. Non tutti i bot aspettano gli standard. Secondo analisi di traffico pubblicate da Cloudflare e altri operatori, alcuni crawler sono stati osservati usare stringhe che imitano browser mobile o aggirare blocchi dichiarati nel robots.txt. Il robots.txt è un segnale legale, non un controllo tecnico, e l’enforcement reale richiede un layer diverso.

A2A di Google e MCP di Anthropic, entrambi in governance alla Linux Foundation, si stanno affermando come riferimenti per l’infrastruttura agentica, ma il quadro resta frammentato e in evoluzione. Chi lavora su AIO e GEO non implementa una volta e ha finito, mantiene aggiornata un’infrastruttura che si muove sotto i piedi, settimana dopo settimana. E lo so, bisogna avere continuamente le mani in pasta e ripassare spesso le pagine web che si predispongono.

È questo il costo reale dell’essere pionieri. La maggior parte del mercato aspetta che si consolidi qualcosa. Ma quando si consolida, il terreno è già occupato da chi ha costruito prima, con entità dichiarate, relazioni strutturate, infrastrutture che i modelli sanno già leggere.

Chi non sa ancora cosa dicono le AI del proprio prodotto, come lo descrivono e se le relazioni sono corrette, lascia che a decidere siano altri. E spesso non sono umani.

Scritto da

Gabriele Gobbo

Divulgatore

Gabriele Gobbo è divulgatore, consulente e docente. Collabora con istituzioni universitarie, strutture formative e master dedicati alla comunicazione digitale e all’impatto dell’AI nella società. È autore di Digitalogia (cultura digitale) e di Sinfonia Artificiale (Protocollo delle 3C per dirigere l’AI con regia umana). È cofondatore e Vicepresidente del Digital Security Festival e conduce il programma televisivo FvgTech. Nei suoi interventi sui media e durante le conferenze analizza metodi, rischi e processi decisionali per mantenere l’essere umano al centro della tecnologia.

Vuoi portare queste idee nella tua azienda?

Progetto e costruisco sistemi di intelligenza artificiale, per le mie aziende e per chi vuole metterla al lavoro.

Parliamone

Continua a leggere

AI al lavoro

AI e Digital Forensics

La digital forensics integra sempre più l’intelligenza artificiale per automatizzare l’analisi di grandi volumi di dati, migliorando rapidità ed efficacia delle indagini su testi, audio, immagini, video, malware e dispositivi IoT.

Luca Mercatanti3 min