SERRA – Strategia e lancio digitale

Bloccare gli AI crawler non basta: il campo di gioco resta asimmetrico

Scritto da
Anita Innocenti
Sono una copywriter appassionata di search marketing. Scrivo testi pensati per farsi trovare, ma soprattutto per farsi scegliere. Le parole sono il mio strumento per trasformare ricerche in risultati.
✦ Fatti trovare

Le regole del digitale stanno cambiando.

O sei visibile o sei fuori. Noi ti aiutiamo a raggiungere i clienti giusti — quando ti stanno cercando.

Contattaci ora

Il divario tra publisher e web aperto è netto, ma il blocco dichiarato non è effettivo

I dati HasData del 9 ottobre mostrano che oltre la metà dei domini citati nelle ricerche conversazionali blocca almeno un crawler AI, contro il 15% del campione generale: i publisher si difendono cinque volte più del web aperto. Il blocco però non equivale a enforcement, e proteggere i contenuti può ridurre il traffico senza fermare i bot.

Lo scorso luglio, in dieci ricerche condotte su Google AI Mode, la modalità di ricerca conversazionale di Google, 52 domini citati rientravano in un campione di 10.894 siti: più della metà blocca almeno un crawler AI nel robots.txt, contro il 15% del campione generale. È il dato di apertura dell’indice di blocco dei crawler AI pubblicato da HasData il 9 ottobre. Sembra una questione tecnica, ma non lo è: racconta una frattura tra chi produce contenuti e chi li distribuisce.

Prima di entrare nei numeri, due definizioni rapide. Un crawler AI è un programma automatico che scorre le pagine web per addestrare modelli come ChatGPT o Gemini, oppure per alimentare risposte sintetiche. Il robots.txt è il file con cui un sito dichiara quali crawler possono passare. Il problema è che dichiarare un divieto non equivale a farlo rispettare.

La rivolta silenziosa dei publisher

Il divario tra editori e resto del web è netto. Nei dati di luglio 2026, i publisher bloccano i crawler AI circa cinque volte più del web aperto: per GPTBot, il crawler di OpenAI, il tasso di blocco è del 50,5% tra i publisher contro il 7,9% dell’intero web. Non è una differenza isolata: il divario resta per ogni singolo bot.

Parte di questa tendenza è diventata impostazione automatica. Secondo l’annuncio di Cloudflare, per tutti i nuovi domini che si registrano le categorie di crawler AI “Training” e “Agent” saranno bloccate per impostazione predefinita sulle pagine che mostrano annunci. Il peso di questa scelta si vede nei numeri: il perimetro associato al blocco copre l’8,5% del top web e il 13,6% dei publisher.

Non è una reazione improvvisa. Già alla fine del 2023, secondo i dati del Reuters Institute, il 48% dei siti di notizie più utilizzati in dieci paesi bloccava i crawler di OpenAI, mentre il 24% bloccava il crawler AI di Google per Gemini. La direzione era già segnata; i dati di luglio 2026 mostrano che si è consolidata.

Il paradosso del traffico

Se il blocco fosse una difesa efficace, i numeri dovrebbero mostrare un muro. Invece mostrano una falla. Il 39,5% dei siti che disabilitano GPTBot nel robots.txt continuano a servire GPTBot con un codice 200 quando bussa alla porta. In pratica, quattro siti su dieci dicono “non entrare” ma poi aprono la pagina.

E il dubbio si sposta sul prezzo della protezione. Uno studio pubblicato su arXiv adotta un approccio differenza-nelle-differenze e osserva che bloccare i bot di IA generativa può essere associato a una riduzione del traffico totale verso i grandi editori rispetto a non bloccarli. Tradotto: proteggere i contenuti può avere un costo in termini di visite, senza necessariamente fermare i crawler.

Qui sta il paradosso. I publisher bloccano per proteggere il valore dei contenuti, ma se una quota di bot passa comunque e il traffico si riduce, il blocco rischia di essere un costo senza una vera contropartita di controllo.

Il vantaggio nascosto di Google

Se il blocco riduce il traffico senza proteggere davvero i contenuti, chi ne trae vantaggio? La risposta si trova guardando a chi ancora riesce a vedere quasi tutto. Secondo i dati di Cloudflare, Googlebot vede una quantità di contenuti Internet significativamente maggiore rispetto ai suoi concorrenti più vicini.

Il controllo, intanto, resta distribuito in modo non uniforme. L’adozione di llms.txt, il file pensato per dare istruzioni dirette ai modelli linguistici, è ferma al 7,4% nel campione complessivo di 10.894 domini. Significa che la stragrande maggioranza dei siti non ha ancora uno strumento esplicito per dire ai modelli cosa leggere e cosa no. Il risultato è un’asimmetria: Google vede più contenuti degli altri, mentre la maggior parte dei publisher non ha un controllo fine su ciò che viene effettivamente letto.

Per chi fa impresa online, il punto non è se bloccare o non bloccare in astratto. Ogni blocco va misurato contro la perdita di traffico e la sua reale efficacia tecnica. Il campo di gioco è sempre più asimmetrico, e la partita si sposta su chi controlla davvero l’accesso ai contenuti.

L'autore

Anita Innocenti

Sono una copywriter appassionata di search marketing. Scrivo testi pensati per farsi trovare, ma soprattutto per farsi scegliere. Le parole sono il mio strumento per trasformare ricerche in risultati.

Ricevi i migliori aggiornamenti su SEO

Già +6.200 professionisti iscritti · una mail a settimana, zero spam
✦ Iniziamo

Mercato, richieste e concorrenti. Scopri le potenzialità del tuo business. Dati alla mano.

Qui è dove ha inizio il tuo lancio digitale.