Un crawler AI è un bot che visita i siti per conto di un'azienda di intelligenza artificiale. Può farlo per tre motivi diversi: raccogliere testi per addestrare un modello, indicizzare pagine per un motore di ricerca AI, oppure aprire una pagina in tempo reale perché un utente l'ha chiesto in chat. Decidere quali far entrare dipende da quale dei tre si vuole permettere.
Abbiamo contato i bot che hanno visitato visilay.com tra il 31 agosto e il 27 settembre 2026, su circa 199.000 righe di log. I bot di OpenAI (GPTBot, OAI-SearchBot e ChatGPT-User insieme) hanno fatto 4.773 richieste. Googlebot 1.355.
Le richieste in un mese sul nostro sito
| User agent | Azienda | Richieste (31 ago - 27 set 2026) |
|---|---|---|
| Claude-User | Anthropic | 9.340 |
| GPTBot | OpenAI | 2.689 |
| bingbot | Microsoft | 2.281 |
| Applebot | Apple | 1.567 |
| ClaudeBot | Anthropic | 1.540 |
| Googlebot | 1.355 | |
| Meta-ExternalAgent | Meta | 1.353 |
| OAI-SearchBot | OpenAI | 1.250 |
| ChatGPT-User | OpenAI | 834 |
| GoogleOther | 617 | |
| Amazonbot | Amazon | 107 |
| PerplexityBot | Perplexity | 100 |
| Perplexity-User | Perplexity | 58 |
| Bytespider | ByteDance | 57 |
| CCBot | Common Crawl | 32 |
| Claude-SearchBot | Anthropic | 30 |
| MistralAI-User | Mistral | 29 |
| DuckAssistBot | DuckDuckGo | 24 |
Tre avvertenze per leggere la tabella:
- Claude-User è gonfiato da noi. Usiamo Claude ogni giorno per lavorare sul sito, quindi buona parte di quelle richieste sono nostre. Non va letto come interesse esterno.
- ChatGPT-User ha visitato 70 URL diversi, ma 402 richieste su 834 sono sulla home page. È il comportamento tipico di un assistente che verifica chi siamo prima di rispondere a una domanda.
- Richieste non vuol dire visite umane. Nello stesso periodo le visite con referrer chatgpt.com, cioè persone che hanno cliccato un link in una risposta, sono state 18.
Il dato di fondo è coerente con quello che misura Cloudflare. Nel rapporto di luglio 2026 i crawler per l'addestramento sono il 52% del traffico di bot AI, contro il 22% della primavera 2025. Un anno prima Cloudflare aveva calcolato che Anthropic faceva circa 70.900 richieste per ogni visita rimandata al sito. Il rapporto tra quanto i bot prendono e quanto restituiscono in traffico è molto sbilanciato.
I tre tipi di crawler AI
Crawler di addestramento
Scaricano pagine per addestrare i modelli. Bloccarli non toglie il sito dalle risposte di oggi, ma riduce quanto i modelli futuri sapranno di te.
- GPTBot (OpenAI): bloccarlo equivale all'opt-out dall'addestramento (documentazione).
- ClaudeBot (Anthropic).
- Google-Extended: non è un crawler separato ma un token del robots.txt. Controlla l'uso dei contenuti per addestrare e ancorare Gemini, e secondo Google "does not impact a site's inclusion in Google Search".
- CCBot (Common Crawl), Meta-ExternalAgent, Bytespider, Amazonbot.
Crawler di ricerca AI
Indicizzano le pagine per mostrarle nelle risposte con ricerca web. Bloccarli toglie il sito da quelle risposte.
- OAI-SearchBot (OpenAI): se lo blocchi, il sito non compare nei riassunti di ChatGPT search. OpenAI può mostrare al massimo link e titolo se la pagina arriva da un fornitore di ricerca terzo.
- PerplexityBot: indicizza per la ricerca, non per l'addestramento, e rispetta robots.txt (documentazione).
- Claude-SearchBot (Anthropic).
- bingbot: non è un crawler AI, ma alimenta Copilot e, secondo test indipendenti, parte dei risultati di ChatGPT.
Agenti avviati dall'utente
Aprono una pagina perché una persona l'ha chiesto in quel momento, per esempio incollando un link in chat o chiedendo di confrontare fornitori.
- ChatGPT-User: per OpenAI "robots.txt rules may not apply".
- Perplexity-User: "generally ignores robots.txt".
- Claude-User, MistralAI-User, DuckAssistBot.
- Google-Agent: aggiunto alla documentazione Google il 20 marzo 2026 per gli agenti Google che navigano e agiscono su richiesta dell'utente.
Cosa succede se li blocchi
| Se blocchi | Effetto |
|---|---|
| GPTBot, ClaudeBot, CCBot | I modelli futuri vengono addestrati senza i tuoi testi. Nessun effetto immediato sulle risposte con ricerca |
| Google-Extended | Nessun effetto sulla ricerca Google. Limita l'uso dei contenuti per Gemini |
| OAI-SearchBot | Il sito esce dalle risposte di ChatGPT search |
| PerplexityBot | Il sito esce dalle risposte di Perplexity |
| ChatGPT-User, Perplexity-User | Spesso nessuno via robots.txt, perché non sempre lo rispettano. Via firewall blocchi anche clienti reali che usano un assistente |
| Googlebot | Il sito esce da Google, AI Overview e AI Mode comprese |
L'ultima riga va detta chiaramente: non esiste un modo per restare nella ricerca Google e uscire dalle AI Overview bloccando un bot. Da giugno 2026 Search Console ha un'impostazione per escludere il sito dalle funzioni AI, a livello di dominio. Ne parliamo in impatto delle AI Overviews sulla SEO.
Cosa consigliamo a un sito aziendale
Per un'azienda B2B o un e-commerce che vuole farsi trovare, la scelta di default è:
- far entrare i crawler di ricerca AI (OAI-SearchBot, PerplexityBot, Claude-SearchBot) e bingbot;
- far entrare gli agenti avviati dall'utente, perché sono potenziali clienti che stanno facendo una domanda su di te;
- decidere caso per caso sui crawler di addestramento. Per un'azienda che vuole essere conosciuta dai modelli ha senso lasciarli entrare. Per un editore che vive di contenuti originali, meno.
Un robots.txt di esempio che blocca solo l'addestramento di OpenAI e lascia tutto il resto:
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: *
Allow: /
La sintassi completa è nella guida al robots.txt.
Firewall e protezioni anti-bot
Molti siti bloccano i crawler AI senza saperlo, perché il firewall o il CDN li tratta come traffico sospetto. È il caso più frequente che troviamo negli audit: robots.txt aperto, ma richieste respinte con errore 403.
Per distinguere gli agenti veri da quelli che si spacciano per loro esistono due strumenti:
- liste di IP pubblicate. OpenAI e Perplexity pubblicano gli indirizzi dei loro bot in formato JSON;
- firme delle richieste (Web Bot Auth). Cloudflare ha introdotto i "signed agents" ad agosto 2025. L'agente di ChatGPT firma le richieste con l'intestazione
Signature-Agent: "https://chatgpt.com".
Se usi Cloudflare, controlla le regole sui bot AI. Da luglio 2025 Cloudflare blocca per impostazione predefinita i crawler AI sui nuovi domini, e chi ha attivato il sito dopo quella data può averli fuori senza saperlo.
Come leggere i propri log
- Scarica i log di accesso dal pannello dell'hosting. Su cPanel sono in "Accessi grezzi".
- Cerca gli user agent della tabella qui sopra. Anche un semplice
grep -c "GPTBot" access.logdà un primo numero. - Controlla i codici di risposta. Se un bot che vuoi far entrare riceve molti 403 o 429, lo sta bloccando qualcosa.
- Guarda quali pagine visitano. Se OAI-SearchBot visita solo la home, le pagine interne sono difficili da raggiungere.
- Confronta con il traffico umano da AI nel canale AI Assistant di GA4, come spiegato in visibilità AI.
Lo user agent si può falsificare. Per un'analisi seria conviene verificare gli IP contro le liste ufficiali.
Approfondimento consigliato: SEO per agenti AI: come rendere il sito usabile da browser e agenti.
Domande frequenti
È un bot che visita i siti per conto di un'azienda di intelligenza artificiale. Può raccogliere testi per l'addestramento, come GPTBot, indicizzare pagine per le risposte con ricerca, come OAI-SearchBot, o aprire pagine in tempo reale su richiesta di un utente, come ChatGPT-User.
No. GPTBot serve all'addestramento. Per le risposte con ricerca web ChatGPT usa OAI-SearchBot: bloccando quello il sito esce dai riassunti di ChatGPT search.
Non con il robots.txt, perché AI Overview e AI Mode usano Googlebot. Search Console offre da giugno 2026 un'impostazione per escludere il sito dalle funzioni AI, valida per tutto il dominio.
Perché scaricano molte pagine e mandano pochi visitatori. Cloudflare ha calcolato nel 2025 che Anthropic faceva circa 70.900 richieste per ogni visita rimandata a un sito. Sul nostro sito, in quattro settimane, i bot di OpenAI hanno fatto 4.773 richieste e ChatGPT ha mandato 18 visite.