Un motore di ricerca è due cose messe insieme: un archivio di pagine web e un programma che decide quali mostrare a chi fa una domanda. Tra l'archivio e la risposta ci sono cinque passaggi. Quasi tutte le spiegazioni che trovi in italiano ne raccontano tre.
Scansione, indicizzazione, ranking: è lo schema di Wikipedia, di Mailchimp e della risposta generata che Google stesso piazza sopra i risultati quando cerchi "come funzionano i motori di ricerca". Non è sbagliato, è incompleto in due punti. Tra la scansione e l'indice c'è il rendering, che è il motivo per cui molti siti moderni vengono letti a metà. E sopra il ranking, da un paio d'anni, c'è un livello che scrive una risposta invece di elencare dei link.
I numeri che inquadrano la scala del problema. L'indice di Google copre "centinaia di miliardi di pagine web" e pesa "ben oltre 100.000.000 di gigabyte", secondo la documentazione pubblica di Google. In Italia quel motore raccoglie l'89,18% delle ricerche, contro il 4,83% di Bing e il 4,07% di Yahoo (StatCounter, agosto 2026). E l'83,1% delle persone dai sei anni in su ha usato internet nei tre mesi precedenti l'intervista (Istat, Cittadini e ICT 2025). Capire come lavora Google vuol dire capire quasi tutto il traffico di ricerca italiano.
Le cinque fasi, in ordine
Questa tabella è la mappa del resto dell'articolo. La terza colonna è quella che interessa a chi ha un sito: dice cosa può rompersi in ciascun passaggio.
| Fase | Cosa fa il motore | Cosa la blocca |
|---|---|---|
| 1. Scoperta e scansione | Trova gli URL e ne scarica il contenuto con un crawler | robots.txt, errori server, pagine raggiungibili solo da un modulo di ricerca interno |
| 2. Rendering | Esegue il JavaScript con un'istanza di Chromium e ottiene l'HTML finale | Contenuti che compaiono solo dopo un clic, risorse bloccate, coda di rendering lunga |
| 3. Indicizzazione e selezione | Analizza testo, immagini e video, sceglie la versione canonica, archivia | noindex, duplicazioni, pagine troppo simili tra loro, qualità bassa |
| 4. Ranking | Interpreta la query e ordina le pagine idonee | Intento di ricerca diverso da quello che la pagina soddisfa |
| 5. Generazione della risposta | Scrive un riassunto citando alcune fonti indicizzate | nosnippet, data-nosnippet, max-snippet, pagina non indicizzata |
1. Scoperta e scansione
Il crawler di Google si chiama Googlebot ed è "il nome generico di due tipi di web crawler": Googlebot Smartphone e Googlebot Desktop. Il primo simula un telefono, il secondo un computer, e per la Ricerca conta soprattutto il primo.
Googlebot scopre gli indirizzi in tre modi, che la documentazione elenca senza gerarchie: ripassando pagine che conosce già, seguendo un link che da una pagina nota porta a una nuova, oppure leggendo una sitemap che gli hai inviato. Prima di scaricare qualsiasi cosa legge il file robots.txt, che dice quali parti del sito può visitare.
Quanto scansiona dipende da due variabili. La prima è il limite di capacità: Google misura quanto in fretta il tuo server risponde e riduce le richieste se rallenta, perché "il tempo e le risorse che Google può dedicare alla scansione di un singolo sito sono limitati". La seconda è la domanda di scansione, che cresce con le dimensioni del sito, la frequenza di aggiornamento e la qualità delle pagine.
Google indica anche quando vale la pena preoccuparsene, e le soglie sono più alte di quanto si racconti in giro: sopra il milione di pagine univoche che cambiano ogni settimana, oppure sopra le diecimila pagine univoche che cambiano ogni giorno (guida alla gestione del crawl budget). Sotto quelle cifre, il crawl budget non è il tuo problema. Nei siti aziendali italiani che analizziamo il collo di bottiglia sta quasi sempre nelle due fasi successive.
2. Rendering, il passaggio che quasi nessuno racconta
Nessuna delle pagine italiane che oggi si posizionano per questa ricerca nomina il rendering. È il buco più grosso, perché è il punto in cui un sito costruito in React o in Vue può sparire dai risultati pur essendo perfettamente visibile nel browser.
Google lo descrive così: "Googlebot accoda tutte le pagine con un codice di stato HTTP 200 per il rendering", e poi "un'istanza di Chromium headless esegue il rendering della pagina e il codice JavaScript". Le due parole che contano sono accoda e quando le risorse lo consentono. Una pagina può restare in quella coda per pochi secondi o "per un periodo più lungo" (Nozioni di base sulla SEO per JavaScript).
La conseguenza pratica: se il testo della tua pagina prodotto arriva da una chiamata JavaScript, Google lo vede in un secondo momento, e finché non lo vede quella pagina viene valutata su quello che c'era nell'HTML iniziale. È spesso un titolo e un menu. Tutto il lavoro di SEO tecnica su un sito moderno gira attorno a questo scarto.
3. Indicizzazione: scansionato non vuol dire indicizzato
Dopo il rendering Google analizza testo, immagini e file video, e decide se la pagina merita un posto nell'indice. Questo è il passaggio che le guide divulgative saltano, perché rompe l'idea rassicurante che basti pubblicare.
La frase che Google ripete nella sua guida approfondita al funzionamento della Ricerca è netta: "Google non garantisce che eseguirà la scansione della tua pagina, che la indicizzerà o la pubblicherà, anche se segue le Nozioni di base sulla Ricerca Google". Non è una clausola di stile. Nella stessa fase Google raggruppa le pagine con contenuti simili e sceglie "quella più rappresentativa del gruppo": è il meccanismo che decide quale URL canonico compare e quale resta fuori, e il motivo per cui i contenuti duplicati costano posizioni anche quando nessuno ha copiato niente.
Quanto pesa il filtro, su scala del web? Ahrefs ha misurato il proprio indice di circa 14 miliardi di pagine e ha trovato che il 96,55% non riceve traffico da Google, e un altro 1,94% ne riceve tra una e dieci visite al mese (studio Ahrefs, 2023). Il campione è statunitense e sbilanciato verso la parte migliore del web, come ammettono gli stessi autori, quindi la percentuale va letta come ordine di grandezza e non come dato italiano. L'ordine di grandezza però è quello: pubblicare una pagina e vederla nell'indice sono due eventi diversi.
I due strumenti che servono qui sono il tag noindex, per tenere fuori quello che non deve entrare, e il rapporto Indicizzazione delle pagine di Google Search Console, che elenca per ogni URL escluso il motivo dell'esclusione. È la prima schermata che apriamo quando un cliente dice che il sito "non si vede su Google".
4. Ranking: cosa succede dopo l'invio della query
Quando qualcuno preme invio, Google non cerca nel web: cerca nel proprio indice, che è la copia ordinata del web fatta nelle tre fasi precedenti. Poi ordina le pagine idonee usando segnali di pertinenza, qualità, lingua, posizione e dispositivo. La lista completa non è pubblica, ma le famiglie di segnali sono documentate e le abbiamo raccolte nella guida ai fattori di ranking.
Il segnale che conta più di tutti gli altri messi insieme è anche il meno tecnico: l'intento di ricerca. Google mostra il tipo di pagina che i suoi utenti aprono e tengono aperta. Se per la tua keyword la prima pagina è fatta di guide, una scheda prodotto non entra, per quanto sia ottimizzata. È anche il motivo per cui la stessa parola restituisce risultati diversi in due paesi: la SERP italiana per queste ricerche è popolata da glossari di brand tecnologici, quella statunitense da agenzie SEO.
5. Il livello generativo: quando il motore risponde invece di elencare
Sopra i dieci link blu è comparso un quinto passaggio. Google lo chiama AI Overview e, nella versione conversazionale, AI Mode. Funziona con una tecnica che Google chiama fan-out delle query, cioè "l'invio di più ricerche correlate in modo simultaneo su più argomenti secondari", e poi scrive un riassunto citando le pagine che ha trovato.
La parte che sorprende chi lavora nel settore è che non c'è niente di nuovo da implementare. Google è esplicito: "non sono previsti requisiti aggiuntivi per la visualizzazione in AI Overview o in AI Mode" (documentazione sulle funzionalità AI). Serve essere indicizzati e idonei a comparire nella Ricerca. Il quinto passaggio pesca dallo stesso indice dei primi quattro, quindi tutto quello che hai letto sopra vale identico.
Cambia invece chi bussa alla porta. Oltre a Googlebot oggi passano crawler diversi, con permessi separati:
- Google-Extended governa se i contenuti scansionati possono addestrare le prossime generazioni di Gemini e alimentare il grounding nelle app Gemini. Google precisa che "non influisce sull'inclusione di un sito nella Ricerca Google né sul ranking".
- OAI-SearchBot è il crawler che OpenAI usa "per mostrare i siti web nei risultati di ricerca nelle funzioni di ricerca di ChatGPT". Chi lo blocca esce da quelle risposte.
- GPTBot raccoglie contenuti per l'addestramento dei modelli, ed è una scelta separata dalla precedente.
- ChatGPT-User si attiva quando è una persona a chiedere a ChatGPT di aprire un indirizzo, quindi non fa scansione automatica.
Chi mette una riga sbrigativa nel robots.txt per "bloccare le AI" rischia di uscire dalle risposte di ChatGPT restando comunque dentro l'addestramento, o viceversa. Le regole stanno nella documentazione di Google sui crawler comuni e in quella di OpenAI sui bot, e non coincidono. Come si entra in quelle risposte lo abbiamo trattato nella guida per apparire nelle risposte di ChatGPT.
Quanto è già arrivato in Italia: il nostro test su cinque query
Il 17 settembre 2026 abbiamo interrogato cinque ricerche italiane sul funzionamento dei motori, su Google Italia, desktop, senza personalizzazione, con lo scraping SERP di DataForSEO. Volevamo sapere una cosa sola: quante di queste pagine dei risultati mettono già una risposta generata sopra il primo link organico.
| Query | Risposta generata in cima | Riquadro "altre domande" | Primo risultato organico |
|---|---|---|---|
| come funzionano i motori di ricerca | Sì | Sì | mailchimp.com |
| cos'è un motore di ricerca | Sì | Sì | it.wikipedia.org |
| differenza tra browser e motore di ricerca | Sì | Sì | simonelongato.it |
| come funziona googlebot | Sì | Sì | developers.google.com |
| come indicizzare un sito su google | No | Sì | aranzulla.it |
Quattro query su cinque hanno una risposta scritta dal motore sopra il primo risultato. L'unica senza è quella operativa, "come indicizzare un sito su google", dove chi cerca vuole fare una cosa e non capirla. È una distinzione che torna spesso: il livello generativo si prende le domande di definizione e lascia i clic alle domande di esecuzione. Sulle ricerche a zero clic il ragionamento è lo stesso.
Il dettaglio più istruttivo però sta nelle fonti citate. Per "cos'è un motore di ricerca" la risposta generata da Google cita un glossario Lenovo e due video brevi su YouTube. La documentazione di Google Search Central, che su questo argomento è la fonte primaria, non compare. Il motore non sceglie la fonte più autorevole: sceglie quella che risponde in modo più diretto ed è indicizzata bene. Chi scrive contenuti tecnici in italiano ha qui un'apertura enorme, e quasi nessuno la sta usando.
Motore di ricerca e browser non sono la stessa cosa
È la domanda che Google mostra nel riquadro "altre domande" in tutte e cinque le ricerche del test, quindi vale la pena chiuderla in due righe. Il browser è il programma installato sul dispositivo: Chrome, Safari, Firefox, Edge. Serve ad aprire le pagine e a trasformare il codice in testo e immagini. Il motore di ricerca è un servizio che vive su un sito, e serve a trovare quali pagine aprire.
Usi sempre un browser per arrivare a un motore di ricerca. Non ti serve un motore di ricerca se conosci già l'indirizzo. La confusione nasce dal fatto che Chrome si apre su Google e che entrambi portano lo stesso nome commerciale.
Quali motori contano davvero in Italia
La domanda ricorrente è se abbia senso ottimizzare per qualcosa che non sia Google. I numeri italiani rispondono da soli.
| Motore | Quota in Italia |
|---|---|
| 89,18% | |
| Bing | 4,83% |
| Yahoo! | 4,07% |
| DuckDuckGo | 0,79% |
| Yandex | 0,48% |
| Ecosia | 0,45% |
Google vale quasi nove ricerche su dieci. Bing e Yahoo insieme non arrivano a nove punti, e Yahoo eredita buona parte dei risultati proprio da Bing, il che riduce ancora la varietà reale. Se hai tempo e budget per un solo motore, la scelta è fatta. Gli altri motori di ricerca restano interessanti per ragioni diverse dalla quota, per esempio la privacy o i mercati esteri.
Cosa cambia per chi ha un sito
Le cinque fasi si leggono anche al contrario, come una scaletta di diagnosi. Quando un sito non porta contatti, il problema sta in uno di quei cinque punti e conviene controllarli in ordine, perché aggiustare il quarto senza aver risolto il primo non produce niente.
- Le pagine sono raggiungibili da un link interno e non escluse dal robots.txt?
- Il contenuto è nell'HTML o arriva dopo, via JavaScript?
- Search Console dice che sono indicizzate, o le elenca tra le escluse?
- Il tipo di pagina corrisponde a quello che occupa la prima pagina per quella ricerca?
- Il testo risponde alla domanda in modo abbastanza diretto da essere citabile da una risposta generata?
Il quarto punto è quello che sposta i numeri più di tutti, e l'esempio più chiaro che possiamo mostrare è pubblico. Su Macropix, produttore milanese di schermi a LED, la keyword "monitor pubblicitario" è passata da posizione 88 a posizione 2, e oggi il dominio tiene il 25,55% di share of voice sul cluster ledwall davanti ad amazon.it, fermo al 18,08% (Semrush, luglio 2026). Non è stato un intervento tecnico: è stata una pagina costruita sul tipo di risposta che quella ricerca chiedeva. Il percorso completo sta nel caso sulla SEO per l'industria manifatturiera, e gli altri progetti nella pagina dei progetti.
Se la diagnosi dei cinque punti la vuoi fatta sul tuo sito invece che a mano, è il lavoro con cui apriamo ogni progetto SEO; la parte che riguarda il quinto livello, cioè la visibilità dentro le risposte generate, la trattiamo nel servizio dedicato alla SEO per i motori AI.
Domande frequenti
Il browser è il programma installato sul dispositivo, per esempio Chrome, Safari, Firefox o Edge, e serve ad aprire le pagine web. Il motore di ricerca è un servizio che vive su un sito e serve a trovare quali pagine aprire. Usi sempre un browser per arrivare a un motore di ricerca, mentre non ti serve un motore di ricerca se conosci già l'indirizzo del sito.
Secondo StatCounter, ad agosto 2026 in Italia Google raccoglie l'89,18% delle ricerche, Bing il 4,83%, Yahoo! il 4,07%, DuckDuckGo lo 0,79%, Yandex lo 0,48% ed Ecosia lo 0,45%. Yahoo eredita buona parte dei risultati da Bing, quindi la varietà reale è ancora minore di quella che suggeriscono le quote.
Non esiste un tempo garantito. Google scrive esplicitamente che non garantisce che eseguirà la scansione di una pagina, che la indicizzerà o che la pubblicherà. Dopo la scansione la pagina entra in una coda di rendering, dove può restare pochi secondi o un periodo più lungo. Lo strumento Controllo URL di Google Search Console mostra lo stato reale di quella pagina e permette di richiedere l'indicizzazione.
Le cause più comuni, in ordine di frequenza: la pagina è esclusa dal file robots.txt, contiene un tag noindex, non è raggiungibile da nessun link interno, mostra il contenuto solo dopo l'esecuzione del JavaScript, oppure viene considerata duplicata di un'altra e sostituita dalla versione canonica. Il rapporto Indicizzazione delle pagine di Search Console indica il motivo esatto per ciascun URL escluso.
Non li hanno sostituiti: li hanno affiancati con un livello in più. Le risposte generate di Google pescano dallo stesso indice della Ricerca e Google dichiara che non servono requisiti aggiuntivi per comparirvi. ChatGPT usa invece un proprio crawler, OAI-SearchBot, e i siti che lo bloccano escono dalle sue risposte di ricerca. Nel nostro test del 17 settembre 2026 su cinque query italiane, quattro SERP mostravano una risposta generata sopra i risultati organici, che però erano ancora tutti al loro posto.
Una cosa che nel settore si dice poco. Le cinque fasi non descrivono soltanto Google: il paragrafo che fa entrare una pagina in una risposta generata è lo stesso che la fa citare da ChatGPT e da Perplexity, perché tutti e tre cercano un testo che risponda senza preamboli e che stia in piedi da solo, fuori dal contesto della pagina. Chi in azienda sa spiegare bene una cosa tecnica ha quindi un vantaggio che nessuno strumento di ottimizzazione riesce a replicare, e la prima pagina italiana su questa ricerca dimostra che la concorrenza è fatta di glossari scritti da chi quella cosa non la fa.