Le regole del digitale stanno cambiando.
O sei visibile o sei fuori. Noi ti aiutiamo a raggiungere i clienti giusti — quando ti stanno cercando.
Contattaci oraIl confronto senza distinzione tra maiuscole e minuscole giustifica il salto di versione major
La release v2.0 di ai.robots.txt introduce il confronto case-insensitive degli user-agent, un cambiamento definito significativo al punto da giustificare il salto di versione major. Conta perché un solo carattere maiuscolo errato può annullare il blocco di un crawler AI. Resta il dubbio che una blocklist comunitaria, con 5.000 siti contro oltre un milione di clienti Cloudflare, basti a reggere la corsa.
Non c’è un nuovo bot celebre da bloccare. Non c’è un annuncio roboante. Lo scorso 3 ottobre, glyn ha pubblicato la release v2.0 di ai.robots.txt, e la novità che ha giustificato il salto di versione è un dettaglio di parsing: i nomi degli agenti vengono ora risolti senza distinguere tra maiuscole e minuscole quando il file viene alimentato da knownagents.com. Sembra roba da sviluppatori. In realtà è quel dettaglio a decidere, in millisecondi, se un crawler resta fuori dal sito — o entra.
Un match case-insensitive che vale una major release
Il comunicato della release è lapidario: il confronto senza distinzione di maiuscole è «un cambiamento significativo di comportamento», tanto da giustificare il salto al numero di versione major. Il merito è della pull request #285 di SamHartleyFixes, che interviene su come ai.robots.txt importa gli agenti da knownagents.com. Accanto a questo, la v2.0 aggiunge il bot KeenableBot tramite la pull request #294 di Hitesh-XS, e nuove voci nelle FAQ dedicate al lavoro e all’uso militare, tramite la PR #289 di dunn. Il solo nome nuovo, insomma, è KeenableBot: non certo un protagonista del dibattito pubblico.
Perché allora una major release, etichetta che di solito accompagna stravolgimenti? Perché il robots.txt ha una regola: il confronto degli user-agent non dovrebbe dipendere dalle maiuscole. Se un crawler si presenta come “GptBot” invece di “GPTBot” e il tuo file non lo riconosce, il blocco salta. Chi gestisce un sito sa che i bot non sempre rispettano le convenzioni. Un confronto case-insensitive non è una formalità: è la differenza tra una regola che funziona e una che lascia passare chi cambia una lettera. Ma perché un dettaglio del genere merita tanta attenzione? La risposta sta in tre anni di numeri.
Da zero a 578 mila siti: la storia che rendeva inevitabile la v2.0
Riavvolgiamo il nastro. Nell’agosto 2023 il numero di siti che includevano regole per GPTBot nei file robots.txt passò da zero a quasi 125 mila in poche settimane. Il dato è documentato da Paul Calvano, che ha analizzato la diffusione dei bot AI nei robots.txt. A novembre dello stesso anno, GPTBot era già citato su 578 mila siti. In poco più di tre mesi, più di mezzo milione di domini aveva scelto di nominare esplicitamente il bot nei propri file di accesso.
Il fenomeno non si è fermato. A luglio 2025, i bot AI erano in cima alla lista degli user-agent più citati nei robots.txt dei siti popolari. E quasi il 21% dei primi 1.000 siti bloccava GPTBot: uno su cinque, tra i domini più visitati del web, aveva deciso di tenere fuori il crawler di ChatGPT. Numeri che raccontano una corsa: se a metà 2025 il problema era già così esteso, una blocklist mantenuta dalla community non poteva più permettersi di fallire per una maiuscola sbagliata.
Ma se la blocklist funziona, perché il problema non è risolto? Perché il vero scontro non è su chi bloccare, ma su chi ha il controllo delle regole di accesso.
Known Agents o Cloudflare: cosa cambia per chi ha un sito
La risposta breve è: per ora, nessuno dei due ha vinto. Ma due attori si contendono il ruolo di arbitro delle regole di accesso. Da una parte c’è Known Agents, la piattaforma che alimenta ai.robots.txt. È nata nel 2023 come Dark Visitors, un progetto collaterale che documentava gli otto bot AI allora conosciuti sul web. Oggi, come si legge su knownagents.com, più di 5.000 siti web utilizzano la piattaforma. Un numero rispettabile, ma lontano dalla scala di un colosso.
Dall’altra parte c’è Cloudflare. L’azienda offre ai propri clienti la possibilità di farsi creare e gestire un file robots.txt con le voci appropriate per impedire ai crawler di accedere al sito per l’addestramento AI. Lo scrive la stessa Cloudflare nel proprio blog: il blocco dei crawler AI è utilizzato da oltre un milione di clienti. Il confronto è impietoso: 5 mila siti da una parte, più di un milione dall’altra.
La differenza non è solo di numeri. Known Agents nasce dalla community, documenta i bot e alimenta una blocklist aperta; Cloudflare integra il blocco in un’infrastruttura che già gestisce il traffico di milioni di domini. La v2.0 di ai.robots.txt, secondo quanto descritto da Cloudflare, migliora l’affidabilità con cui gli user-agent dei crawler vengono confrontati e bloccati. Anche un gigante dell’infrastruttura, insomma, beneficia di un progetto comunitario. E qui sta il punto: secondo ai.robots.txt, i crawler per l’addestramento dell’IA rompono il tradizionale accordo “crawl in cambio di traffico” che i crawler di ricerca rispettavano. Google indicizza e in cambio manda visitatori. Un bot AI estrae testo e non restituisce nulla. Per questo il blocco non è più una scelta tecnica: è una posizione.
Da qui in avanti, il discrimine non sarà più quale strumento usare, ma quanto velocemente si aggiornano le regole prima che nasca il prossimo crawler. Per chi fa impresa online, la v2.0 di ai.robots.txt non dice “aggiorna il tuo file”. Dice che il confine tra contenuti aperti e addestramento AI dipende da regole che cambiano alla stessa velocità con cui nascono nuovi bot. La variabile vera non è più bloccare o non bloccare, ma quanto rapidamente riesci a mantenere il controllo prima che il prossimo user-agent impari a bypassarlo.
