Cloudflare blocca i crawler AI di default su tutti i piani, anche il tuo
Cloudflare fa da intermediario per oltre il 20 per cento dei domini del web, quindi quando cambia un default lo fa su una fetta enorme di internet in un colpo solo. È esattamente ciò che è accaduto il 15 settembre 2026, con quello che l'azienda ha chiamato il suo secondo "Content Independence Day". La prima edizione, del luglio 2025, aveva introdotto il blocco opzionale dei bot AI e valeva solo per i domini nuovi che venivano onboardati; questa seconda edizione, annunciata il 1 luglio 2026 ed entrata in vigore il 15 settembre, estende il blocco di default dei crawler AI di training e di tipo agent a una platea molto più larga, e soprattutto la applica anche ai siti free-plan già esistenti. Faccio SEO tecnica sul campo da quasi vent'anni e leggo i log dei crawler AI quotidianamente, quindi ho un consiglio prima di tutto il resto: se hai un sito dietro Cloudflare, non dare per scontato che la tua configurazione sia quella di ieri, perché con ogni probabilità qualcosa è cambiato senza che tu abbia toccato nulla.
Il 15 settembre 2026 cosa è cambiato per il mio sito su Cloudflare?
In una frase: sulle pagine che contengono pubblicità, i crawler AI di training e quelli di tipo agent sono ora bloccati di default, mentre i crawler di search restano ammessi. Il punto che cambia tutto rispetto al 2025 è chi eredita questo default. Non solo i nuovi clienti e i nuovi siti aggiunti da clienti esistenti, ma tutti i clienti sul piano gratuito già attivi. I clienti paganti che avevano già una configurazione esplicita la mantengono, e questo è importante: se avevi impostato a mano le tue regole su un piano a pagamento, non è cambiato niente. Ma i milioni di siti sul free tier che non avevano mai toccato queste impostazioni, e sono la stragrande maggioranza, hanno ricevuto il nuovo comportamento.
Per capire perché Cloudflare abbia deciso un cambio così invasivo bisogna guardare il dato che lo ha motivato, ed è un dato che uso spesso quando spiego a un cliente perché il vecchio patto tra chi pubblica e chi indicizza si è rotto. La metrica si chiama crawl-to-referral ratio e misura quante volte un crawler preleva contenuto per ogni visita che rimanda al sito. Per la ricerca tradizionale di Google era intorno a 14 a 1, un rapporto che aveva senso: prendo le tue pagine, ti mando visitatori. Per i crawler di training AI il rapporto misurato da Cloudflare a metà 2025 era di circa 1.700 a 1 per OpenAI e di circa 73.000 a 1 per Anthropic. Non è uno sbilanciamento, è la fine della reciprocità: il contenuto viene prelevato per rispondere all'utente dentro l'app del modello, e il sito sorgente non vede quasi mai un ritorno. È questo squilibrio che Cloudflare cita per giustificare il passaggio da un opt-in silenzioso a un blocco di default, e per un publisher che vive di traffico è la ragione per cui il tema non è più ideologico ma economico.
C'è poi una sottigliezza procedurale che vale la pena capire, perché è la fonte di gran parte della confusione. Dal 1 luglio 2026 i tre controlli, Search, Agent e Training, erano già disponibili a tutti, free tier incluso. In quel momento sono stati offerti, non applicati: nessuno si è visto cambiare il sito il 1 luglio. Il cambio effettivo è scattato il 15 settembre, e per conservare le proprie impostazioni bisognava registrare esplicitamente la scelta nelle Security settings prima di quella data. Il default per chi non ha agito è lo stato bloccato. In altre parole, il silenzio è stato interpretato come consenso al blocco, ed è il motivo per cui molti gestori di siti scopriranno il cambiamento a posteriori, guardando le metriche o i log.
Se gestisci un sito con contenuti che vuoi restino visibili agli assistenti AI, o al contrario contenuti che non vuoi assolutamente finiscano nei dataset di addestramento, questa è una decisione di configurazione che non conviene lasciare al default. Nel mio hub dedicato all'AI per aziende affronto il tema di come si governa l'accesso dei sistemi AI ai contenuti aziendali senza sacrificare la visibilità legittima.
Chi è colpito, e la trappola che quasi nessuno sta guardando
La distinzione tra le tre categorie di crawler non è pedanteria: è la chiave per non fare danni. Un training crawler come GPTBot, ClaudeBot o Google-Extended raccoglie contenuto per addestrare modelli, e per questo non rimanda quasi nessun traffico al sito. Un search crawler come OAI-SearchBot, Claude-SearchBot o PerplexityBot recupera contenuto in tempo reale per rispondere a una query dell'utente, e può portarti visite e citazioni. Un crawler di tipo agent, come ChatGPT-User o Claude-User, agisce su richiesta esplicita di un utente. Bloccare il primo gruppo ha senso se non vuoi alimentare i modelli; bloccare il secondo significa rendere il tuo sito invisibile a ChatGPT Search, Perplexity e alle risposte generative, il che per molte attività è l'esatto contrario di quello che serve.
Qui arriva la trappola più insidiosa, e riguarda i crawler multi-purpose. Cloudflare applica a un crawler che fa più cose la regola più restrittiva tra quelle che lo toccano. E l'azienda nomina esplicitamente Googlebot, Applebot e Bingbot come crawler che verrebbero bloccati dai clienti che scelgono di bloccare il Training. Tradotto: una scelta apparentemente prudente come "blocca l'addestramento AI" può portarsi via, come effetto collaterale, l'indicizzazione classica di Google, con un impatto SEO potenzialmente devastante. La confusione tra Googlebot (che serve la ricerca) e Google-Extended (che riguarda solo l'uso AI) è un errore che vedo commettere di continuo, e questo default lo rende più pericoloso perché lo automatizza.
Il blocco è applicato a livello di rete, a monte del tuo server di origine. Non compare nel tuo
robots.txte non lascia traccia nella configurazione che vedi: l'unico posto dove diventa visibile sono i log del server. Se non li guardi, non te ne accorgi.
La checklist di verifiche da fare adesso
La scadenza del 15 settembre è passata, quindi il quadro non è più "preparati prima", è "verifica cosa ti è successo e correggi". Ecco le verifiche in ordine di priorità, quelle che eseguo quando controllo lo stato di un sito dietro Cloudflare dopo questo cambio.
- Controlla il piano e lo stato dei controlli AI. Nella dashboard, sezione di sicurezza e AI Crawl Control, verifica come sono impostati i tre interruttori Search, Agent e Training. Se sei su free plan e non li hai mai toccati, con ogni probabilità Training e Agent sono ora su blocco per le pagine monetizzate.
- Leggi i log del server, non solo la dashboard. Poiché il blocco agisce a livello di rete e non passa dal
robots.txt, i log di origine sono la fonte di verità su quali user-agent stanno effettivamente arrivando e quali no. Cerca un calo improvviso di richieste da OAI-SearchBot, PerplexityBot, Claude-SearchBot dopo il 15 settembre: sarebbe il segnale che stai bloccando la visibilità AI legittima. - Decidi per obiettivo, non per paura. Se vivi di traffico e citazioni, ammetti i search e agent crawler e valuta se bloccare solo il training. Se il tuo contenuto è un asset proprietario che non vuoi nei modelli, blocca il training ma verifica di non aver intaccato i mixed-use come Googlebot. La regola d'oro è che non esiste una risposta buona per tutti: esiste la risposta coerente con il tuo modello di business.
- Verifica l'impatto sulla SEO classica. Controlla in Search Console che l'indicizzazione di Google non abbia subito contraccolpi. Se hai bloccato "Training" senza distinguere, e Googlebot è finito sotto la regola restrittiva, te ne accorgi qui prima che nel posizionamento.
- Valuta il modello di compensazione. Cloudflare ha sostituito Pay Per Crawl con Pay Per Use, che paga il publisher quando l'AI usa effettivamente il contenuto in una risposta, non a ogni fetch. Per un publisher con volumi significativi è una leva da considerare invece del blocco secco.
Ho descritto il funzionamento del managed robots.txt e la logica di blocco per i siti monetizzati in governare i crawler AI da publisher italiano, e la distinzione tra le categorie di segnale in AI Crawl Control e Content Signals: questo pezzo è l'aggiornamento su cosa è diventato default a settembre, quei due spiegano il meccanismo sottostante che ora è attivo su molti più siti. La documentazione operativa sui controlli vive nella dashboard AI Crawl Control di Cloudflare, mentre il razionale della prima edizione è nell'annuncio Content Independence Day.
Il framework decisionale per una PMI italiana
Nella pratica, i casi che incontro si riducono a tre profili, e per ciascuno la scelta corretta è diversa. Il primo è il publisher con monetizzazione pubblicitaria: qui il blocco del training ha una logica economica, perché il rapporto tra quante volte un crawler AI preleva il contenuto e quante visite rimanda è diventato assurdamente sbilanciato, e Cloudflare lo ha misurato in ordini di grandezza che rendono insostenibile il vecchio patto. Per questo profilo, bloccare il training e valutare Pay Per Use è ragionevole, ma tenendo aperti i search bot per non perdere le citazioni.
Il secondo è l'ecommerce o l'azienda con ambizioni di visibilità sugli assistenti: qui bloccare in blocco sarebbe un autogol, perché vuoi che ChatGPT e Perplexity trovino e citino il tuo catalogo o i tuoi servizi. La configurazione giusta ammette i search e agent crawler e blocca semmai solo il training, con l'attenzione ai mixed-use di cui sopra. Il terzo è il SaaS o il sito con documentazione tecnica pubblica: qui spesso vuoi essere raggiungibile dai coding agent e dagli assistenti, perché la scopribilità della tua documentazione è parte del prodotto, e un blocco indiscriminato ti taglia fuori proprio dal pubblico che conta.
Il default di Cloudflare è una scelta ragionevole per il caso medio, ma il tuo sito non è il caso medio. La domanda non è "gli AI crawler sono buoni o cattivi", è "quali di questi tre gruppi mi porta valore e quali mi porta solo costo", e la risposta cambia da attività ad attività.
C'è anche una dimensione di conformità che vale la pena nominare con onestà, senza gonfiarla. Applicare controlli espliciti sull'accesso dei crawler AI, quando il tuo sito contiene dati personali o materiale che non vuoi finisca in un modello, è un argomento tecnico difendibile in una valutazione di adeguatezza delle misure. Non è, allo stato, un obbligo normativo: nessuna norma qualifica oggi il blocco dei crawler AI come requisito di legge. Presentarlo come tale sarebbe scorretto; presentarlo come una misura tecnica sensata e documentabile è invece perfettamente legittimo, e in un eventuale contenzioso o audit poter mostrare una scelta consapevole e datata vale più di un default subìto senza saperlo.
Cosa fare della notizia, una volta spento il clamore
Il cambio del 15 settembre non è, in sé, né una buona né una cattiva notizia: è un default che è stato spostato su una scala enorme, e la sola cosa sbagliata che puoi fare è non sapere da che parte ti ha lasciato. La maggior parte dei gestori di siti scoprirà il cambiamento tra qualche settimana o mese, guardando un calo di citazioni AI o, peggio, un contraccolpo di indicizzazione, e a quel punto dovrà fare a ritroso il lavoro di diagnosi che oggi si fa in mezz'ora sui log e sulla dashboard. Se hai un sito dietro Cloudflare e non hai la certezza di come sono impostati i tuoi controlli sui crawler, o se il tuo obiettivo è restare citabile dagli assistenti AI senza però regalare il contenuto ai dataset di training, puoi usare il modulo di preventivo gratuito: poche domande, e ti dico se la verifica rientra nel mio ambito o se ti conviene un'altra figura.
La lezione più generale, quella che resterà quando anche questo "Content Independence Day" sarà archiviato, è che la governance dell'accesso dei crawler AI è passata da tema di nicchia per publisher a decisione di configurazione che riguarda chiunque abbia un sito, perché ora è un default attivo e non più una casella da spuntare volontariamente. Chi tratta la scelta per obiettivo, distinguendo training da search da agent e guardando i log invece della dashboard, mantiene il controllo di cosa entra e cosa esce dal proprio sito. Chi lascia decidere al default scoprirà, come sempre accade, che il default è stato scelto per il caso medio, e che il caso medio non è quasi mai il proprio. Vale la pena spendere quella mezz'ora adesso, mentre il calo è ancora un rischio ipotetico e non una riga rossa in un grafico di traffico da spiegare a fine trimestre.