Information gain e il March 2026 Core Update: scrivere contenuti che l'AI non comprime

Information gain e il March 2026 Core Update: scrivere contenuti che l'AI non comprime

C'è un test impietoso per capire se un contenuto ha valore: chiedi a un LLM di riassumerlo. Se lo comprime in una riga senza perdere nulla, quel contenuto era una commodity, informazione già presente mille volte nel suo addestramento, e tu hai solo aggiunto rumore. Se invece il riassunto perde qualcosa di essenziale, un dato di prima mano, un numero che non c'è altrove, un'osservazione che nasce dall'esperienza diretta, allora quel contenuto ha information gain, e l'AI non può comprimerlo perché non lo possiede. Dopo il March 2026 Core Update di Google, andato in onda dal 27 marzo all'8 aprile, questa distinzione è diventata il differenziatore che separa un contenuto tecnico che gli assistant citano da uno che riassumono e dimenticano. Attenzione, però, a una cosa che dirò subito per onestà: Google ha definito quell'update "a regular update" e non ha dichiarato nulla sull'information gain come segnale; la lettura "premia l'originalità" è un'inferenza degli analisti, non una parola ufficiale, e va citata come tale. Detto questo, l'information gain resta il concetto con il backing più solido per capire perché il contenuto generico viene penalizzato. Vediamo cos'è, cosa dicono davvero i dati, e come si scrive un pezzo che porta informazione che altrove non c'è.

Cos'è l'information gain, e perché l'AI comprime tutto il resto

L'information gain ha una base concreta: un brevetto di Google, lo US 12,013,887 B2 intitolato "Contextual estimation of link information gain", concesso a giugno 2024. L'idea è misurare il valore informativo aggiuntivo che un documento porta oltre a ciò che l'utente ha già visto: non la qualità assoluta della pagina, ma il suo valore marginale rispetto al corpus che la circonda. Tecnicamente lavora su embedding semantici, confrontando le frasi per assegnare uno score di unicità, il che significa una cosa importante: parafrasare un articolo esistente sostituendo i sinonimi non aumenta l'information gain, perché gli embedding restano simili.

Da qui si capisce perché un LLM comprime tanto facilmente il contenuto generico. Un pezzo che ripete cose già scritte mille volte è, per definizione, già dentro l'addestramento del modello: l'AI lo riconosce, lo sintetizza e lo restituisce in una riga, perché non gli stai dando niente che non avesse già. Quello che l'AI non può comprimere è ciò che non possiede: un benchmark che hai misurato tu, un caso che hai vissuto tu, un dato di prima mano che esiste solo nel tuo articolo. È la ragione strutturale per cui l'esperienza diretta è il bene più prezioso in un mondo di contenuti AI-generated: è l'unica cosa che il modello non può aver già visto.

Se un LLM può riassumere il tuo articolo senza perdere nulla, non hai scritto un articolo, hai scritto un duplicato di qualcosa che esisteva già. L'information gain è esattamente ciò che va perso nel riassunto: se non si perde niente, non c'era niente.

Cosa ha detto, e cosa NON ha detto, Google sul March 2026 Core Update

Qui serve precisione, perché è esattamente dove le content farm inventano. I fatti verificati sono pochi e netti: il rollout è durato dal 27 marzo all'8 aprile 2026, circa dodici giorni, e Google l'ha descritto come un aggiornamento ordinario, senza dichiararne gli obiettivi. Un fattore confondente è che uno spam update è girato il 24-25 marzo, sovrapponendosi e inquinando molte attribuzioni degli analisti. Tutto ciò che leggi del tipo "Google ha elevato l'information gain a segnale dominante" è speculazione di terzi, non comunicazione ufficiale, e ripeterlo come fatto è il genere di imprecisione che demolisce la credibilità di chi scrive.

Il riferimento ufficiale solido, invece, è un altro: la posizione di Google secondo cui ciò che conta è "la qualità del contenuto, non come è stato prodotto". L'AI-generated non è vietato; il bersaglio delle penalizzazioni è il contenuto AI senza supervisione umana e senza valore aggiunto. È una distinzione che cambia tutto: non si tratta di non usare l'AI, si tratta di non pubblicare commodity, da chiunque o qualunque cosa sia stata scritta.

Se gestisci un sito tecnico o aziendale e vuoi capire perché i tuoi contenuti non vengono citati e cosa li renderebbe distintivi, nel mio profilo professionale trovi l'esperienza concreta su SEO tecnica e ottimizzazione per i motori di risposta, applicata sul campo da molti anni.

L'evidenza dai dati: cosa viene davvero citato dagli assistant

Lasciando le speculazioni e guardando gli studi con metodologia, emergono alcune evidenze utili, da citare con i loro caveat. Sulla lunghezza, Ahrefs ha misurato una correlazione tra numero di parole e probabilità di citazione nelle AI Overview pari a 0,04, cioè praticamente nulla, con oltre la metà delle pagine citate sotto le mille parole: l'information gain non è lunghezza, e gonfiare un articolo non aiuta. Sulla struttura, lo studio di Semrush sui fattori di citazione (correlazionale, non causale, è il caveat obbligatorio) trova associazioni positive con la chiarezza answer-first (intorno al +33%), con i segnali E-E-A-T (intorno al +31%) e con il formato a domanda e risposta. E sul filone accademico, il paper fondativo sulla Generative Engine Optimization indica che citare fonti, aggiungere statistiche e inserire citazioni autorevoli sono tra i metodi più efficaci, con un boost aggregato dell'ordine del 40%.

Quel 40%, però, va maneggiato con onestà, ed è qui che mi distinguo dalle content farm che lo sbandierano: è una stima puntuale single-run, senza intervalli di confidenza pubblicati, ottenuta in uno scenario controllato a singolo attore. La ricerca successiva lo ridimensiona: un benchmark presentato a NeurIPS nel 2025 trova che, in uno scenario multi-attore dove tutti adottano le stesse tecniche, l'effetto medio crolla vicino a zero, e altri lavori mostrano che le metriche di visibilità negli engine generativi sono instabili tra un campionamento e l'altro. Tradotto: citare fonti e portare statistiche aiuta, ma come ordine di grandezza in condizioni controllate, non come promessa di "+40% di visibilità". Chi te lo vende come garanzia sta ignorando la metà critica della letteratura. Va anche detto che, sempre secondo i dati Ahrefs, la quota di pagine citate nelle AI Overview che compaiono anche nella top 10 organica è scesa da circa il 76% di metà 2025 al 37,9% di inizio 2026, in parte per una migliore rilevazione delle citazioni: il legame tra ranking classico e citazione AI si è allentato, e questo apre uno spazio proprio per i contenuti ad alto valore informativo che prima il dominio dei grandi brand schiacciava.

Come si struttura un pezzo ad alto information gain

Dalla teoria alle pratiche concrete, quelle che applico a ogni articolo. La prima è la specificità radicale: ogni frase dovrebbe contenere almeno un dato verificabile, una versione, un numero, una data, un riferimento normativo, uno strumento preciso. "Lo stack girava su un server con Nginx 1.24, PHP-FPM 8.2 e MySQL 8.0" batte "uno stack moderno", perché il primo è informazione che il modello non ha e il secondo è aria. La seconda è la struttura answer-first: almeno un titolo formulato come una domanda reale che l'utente si porrebbe, con sotto una risposta auto-contenuta di due o tre frasi, estraibile come citazione. La terza è citare fonti primarie con link, perché è uno dei comportamenti più correlati alla citazione e perché è ciò che rende verificabile quello che scrivi. La quarta, la più difficile da replicare e quindi la più preziosa, è portare dati di prima mano: un benchmark che hai eseguito, un caso che hai gestito, una misura che hai preso. Perché si capisca: questo articolo stesso prova a rispettare queste regole, citando un brevetto specifico, distinguendo i fatti verificati dalle speculazioni e dichiarando i caveat dei numeri.

A monte di tutto questo c'è una condizione tecnica: per essere citato devi prima essere accessibile agli agenti, il che significa non bloccare i crawler giusti e, dove utile, servire il contenuto in forme che le macchine consumano bene, un tema che ho affrontato parlando di content negotiation per servire markdown agli agenti e di come governare l'accesso dei crawler AI con gli strumenti Cloudflare. La migliore informazione del mondo non viene citata se l'agente non può leggerla.

Il rovescio della medaglia: AI senza valore aggiunto uguale Lowest

Vale la pena chiudere il cerchio sul lato negativo, perché è esplicito e recente. Le linee guida per i valutatori della qualità di Google, nell'edizione di settembre 2025, stabiliscono che i contenuti generati con AI senza valore aggiunto ricevono il rating più basso, Lowest. Non è l'uso dell'AI a essere punito, è la produzione di commodity su scala senza originalità, effort o competenza umana. Questo definisce con precisione il confine: l'AI è uno strumento legittimo, anche potente, ma il valore lo aggiunge l'umano che porta ciò che il modello non ha. Un articolo dove l'AI ha solo riconfezionato cose note è esattamente il tipo di contenuto che questo rating colpisce; un articolo dove l'AI ha aiutato a strutturare un'esperienza diretta e dei dati originali è un altro paio di maniche.

L'asimmetria che premia la competenza, non la dimensione del brand

C'è un dettaglio nel paper fondativo sulla GEO che merita di essere conosciuto, perché ribalta una rassegnazione diffusa tra chi non è un grande brand. Lo studio rileva che le tecniche di information gain (citare fonti, portare statistiche, struttura autorevole) sono particolarmente efficaci per i siti che non sono già dominanti nel ranking, mentre i grandi marchi, che dominano per autorità di dominio, ne beneficiano meno. L'asimmetria, in altre parole, favorisce la competenza più della dimensione: un piccolo sito tecnico con informazione di prima mano ha, su questo asse, un'arma che il colosso generalista non ha, perché il colosso vince sul brand ma non necessariamente sull'originalità del singolo contenuto.

Questo è coerente con il dato Ahrefs sull'allentamento del legame tra top 10 organica e citazione AI: se la citazione non è più appannaggio quasi esclusivo di chi sta in cima ai risultati classici, si apre uno spazio per chi porta valore informativo reale anche senza l'autorità di dominio di un grande editore. Per un consulente, uno specialista, una PMI con competenza verticale, è una notizia importante: il terreno dell'information gain è uno dei pochi dove la profondità batte la scala. Non significa che il brand non conti, conta eccome; significa che su un singolo contenuto ad alto valore informativo il piccolo competente può essere citato dove il grande generico viene ignorato. È esattamente la strategia che ha senso per chi non può competere sull'autorità di dominio ma può competere, e vincere, sulla qualità e l'unicità di ciò che sa.

L'AI scriverà i contenuti al posto nostro?

No, e la ragione è la stessa che attraversa tutto l'articolo. L'AI comprime e ricombina ciò che già esiste, e su quel terreno, la commodity, è imbattibile e ti rende inutile. Ma non può generare l'esperienza diretta, il dato di prima mano, l'osservazione che nasce dall'aver fatto davvero una cosa, perché quella informazione non è nel suo addestramento finché qualcuno, un umano, non la produce. Il futuro dei contenuti non è "scritti dall'AI" contro "scritti dagli umani", è commodity contro valore di prima mano: la prima la fa meglio la macchina e non vale niente, il secondo lo fa solo chi ha qualcosa da dire e vale tutto. Il moat, in un mondo di contenuti generati, è precisamente ciò che sai e che non è ancora stato scritto.

Tirando le somme, l'information gain non è un trucco di ottimizzazione, è la descrizione di cosa rende un contenuto degno di esistere in un'epoca in cui produrre testo costa zero. Dopo il March 2026 Core Update, di cui Google non ha dichiarato gli obiettivi e su cui ogni certezza altrui va presa con le pinze, il dato che regge è che la commodity vale sempre meno e l'informazione di prima mano sempre di più, perché è l'unica che l'AI non può comprimere via. Si scrive con specificità radicale, si struttura per la risposta immediata, si citano fonti primarie e si portano dati propri, e si tratta l'AI per quello che è, uno strumento che amplifica chi ha qualcosa di originale da dire e smaschera chi non ce l'ha. I numeri sulla GEO aiutano a orientarsi, ma vanno citati con i loro caveat, perché vendere garanzie che la ricerca non conferma è esattamente il tipo di contenuto a basso valore che si vuole evitare. Se gestisci un sito che produce contenuti tecnici e vuoi capire perché non vengono citati e come renderli distintivi, contattami per una consulenza diretta: nella mia esperienza, la differenza tra un contenuto che l'AI comprime e uno che cita sta tutta in quanta informazione di prima mano sei disposto a metterci.

Ultima modifica: