Vai al contenuto

Indicizzazione Google: cos'è e perché una pagina resta fuori dall'indice

Autore: Matteo Pellegrini

L'indicizzazione è la fase in cui Google analizza una pagina che ha già scaricato e decide se archiviarne le informazioni nel proprio indice, il database da cui pesca i risultati quando qualcuno cerca.

Quasi tutti i problemi che in azienda vengono chiamati «di indicizzazione» appartengono a un'altra fase. O la pagina non è mai stata scaricata, oppure è già nell'indice e Google ha comunque deciso di non mostrarla. Le due situazioni si riconoscono da Search Console e si risolvono in modi opposti, quindi conviene separarle prima di mettere mano al sito.

Scansione, indicizzazione e pubblicazione non sono la stessa cosa

La documentazione di Google Search Central descrive tre fasi e avverte che «non tutte le pagine riescono a superarle». Prima la scansione, cioè il download di testi, immagini e video da parte di Googlebot. Poi l'indicizzazione, cioè l'analisi di quei contenuti e l'archiviazione nell'Indice Google. Infine la pubblicazione, cioè la scelta di quali pagine mostrare per una query specifica.

Nella fase di indicizzazione Google fa anche una cosa che quasi nessuno si aspetta: raggruppa le pagine con contenuti simili trovate sul web e ne elegge una come canonica. Le altre restano nel cluster come versioni alternative. Se hai tre URL che dicono la stessa cosa, non è detto che venga scelto quello che ti interessa.

FaseCosa fa GoogleDove si controllaCosa la blocca
ScansioneScarica testo, immagini e video con GooglebotStatistiche di scansione, strumento Controllo URLRegole robots.txt, errori del server, pagine dietro login
IndicizzazioneAnalizza i contenuti, sceglie la pagina canonica, archivia nell'Indice GoogleReport Indicizzazione delle pagineMeta tag noindex, qualità bassa, duplicazione
PubblicazioneDecide quali pagine mostrare per una queryReport Rendimento, impressioniScarsa pertinenza, qualità bassa, regole del meta tag robots

Il rendering merita una riga a parte. Durante la scansione Google esegue il JavaScript che trova, usando una versione recente di Chrome. Se i contenuti principali di una pagina compaiono solo dopo l'esecuzione degli script, quella pagina dipende da un passaggio in più rispetto a una pagina servita in HTML.

Indicizzata non vuol dire che la vedrai nei risultati

Questa è la frase della documentazione ufficiale che in Italia non cita quasi nessuno: «Search Console potrebbe indicare che una pagina è indicizzata, tuttavia non la vedi nei risultati di ricerca». Google elenca tre cause: i contenuti non sono pertinenti alle query degli utenti, la qualità è bassa, oppure una regola del meta tag robots ne impedisce la pubblicazione.

Nello stesso documento c'è la premessa che dovrebbe chiudere parecchie discussioni: Google non garantisce che eseguirà la scansione di una pagina, che la indicizzerà o che la pubblicherà, nemmeno se rispetta le Nozioni di base sulla Ricerca. L'indicizzazione è una decisione del motore, non un diritto che si acquisisce pubblicando.

Cosa dicono davvero gli stati di Search Console

Il report Indicizzazione delle pagine usa etichette che sembrano sinonimi e non lo sono. Due in particolare vengono confuse in continuazione, e portano a interventi opposti.

Stato nel reportCosa è successoPrima mossa
Rilevata, ma attualmente non indicizzataGoogle conosce l'URL ma non lo ha ancora scaricato. Di solito ha provato e ha rimandato la scansione perché sembrava sovraccaricare il sitoGuardare i tempi di risposta del server, non il contenuto della pagina
Sottoposta a scansione: attualmente non indicizzataLa pagina è stata scaricata e Google ha deciso di non archiviarla. In futuro potrebbe indicizzarlaLavorare sul contenuto. Google precisa che non serve reinviare l'URL
Indicizzata ma bloccata da robots.txtIl blocco impedisce la scansione, non l'ingresso nell'indice: l'URL è entrato grazie ai link che puntano lì da altri sitiTogliere il blocco dal file robots.txt e mettere un noindex sulla pagina
Pagina duplicata senza URL canonico selezionato dall'utenteGoogle ha scelto un'altra pagina come canonica e non pubblica questaDichiarare la canonica o differenziare davvero il contenuto

Un limite del report da conoscere prima di costruirci sopra un audit: l'elenco degli URL di esempio si ferma a 1.000 elementi, e Google precisa che non è garantito che vengano mostrati tutti gli URL con un certo stato nemmeno quando sono meno di 1.000. Su un ecommerce da 40.000 pagine quel report è un campione, non un inventario.

Come si chiede l'indicizzazione, e cosa non la accelera

Per pochi URL si usa lo strumento Controllo URL, che richiede un account con accesso completo alla proprietà. Per molti URL si invia una sitemap. Nella pagina dedicata Google indica un'attesa che va «da alcuni giorni ad alcune settimane» e aggiunge due cose che conviene riportare per intero: esiste una quota per l'invio di singoli URL, e richiedere una nuova scansione più volte per lo stesso URL non velocizza i tempi.

È l'abitudine più diffusa e la più inutile. Chi reinvia lo stesso indirizzo ogni mattina per due settimane consuma quota senza spostare niente.

IndexNow esiste, ma Google non c'è

IndexNow è un protocollo aperto che notifica ai motori l'aggiunta, l'aggiornamento o la cancellazione di un URL. Funziona, è gratuito e si attiva da quasi tutti i CMS. La documentazione ufficiale elenca gli endpoint dei motori partecipanti: l'endpoint globale IndexNow, Amazon, Bing, Naver, Seznam.cz, Yandex e Yep. Google non è in quell'elenco.

Vale la pena dirlo perché in giro si legge il contrario. Chi installa IndexNow sperando di farsi indicizzare più in fretta su Google sta ottimizzando per gli altri motori, cosa che ha senso ma è un'altra cosa. Per la cronaca: il protocollo accetta fino a 10.000 URL per singola richiesta POST, e la chiave di verifica deve stare fra 8 e 128 caratteri.

Il crawl budget riguarda pochi siti, e Google dice quali

Nella guida sul budget di scansione Google scrive a chi è destinata, ed è un elenco corto: siti oltre un milione di pagine univoche con contenuti che cambiano circa una volta a settimana, siti oltre 10.000 pagine univoche con contenuti che cambiano ogni giorno, e siti con una porzione consistente di URL classificati come «Rilevata, ma attualmente non indicizzata». Fuori da questi tre casi la guida dice di non leggerla.

Due meccanismi restano utili da conoscere anche sotto quelle soglie. Il limite di capacità di scansione scende quando il server risponde con errori 5xx o con un HTTP 429, e risale quando i tempi di risposta restano stabili: un hosting che va in affanno si paga in scansioni perse. E supportare l'HTTP 304 (Not Modified) dice a Google di riusare la versione in cache quando la pagina non è cambiata, risparmiando banda da entrambe le parti.

Quando il problema non è tecnico

Capita spesso di essere chiamati per un problema di indicizzazione e di trovare tutte le pagine regolarmente nell'indice. Il caso Macropix, produttore milanese di schermi LED, è quello che usiamo più volentieri: sulla keyword «monitor pubblicitario» la pagina è passata da posizione 88 a posizione 2. La posizione 88 è la nona pagina di Google, cioè zero traffico, ma l'URL era indicizzato da anni. A spostarlo non è stata una riga nel file robots.txt, è stata una pagina scritta su un argomento su cui l'azienda aveva davvero qualcosa da dire.

Oggi su quel gruppo di keyword macropix.it ha il 25,55% di share of voice e sta davanti ad amazon.it, fermo al 18,08% (Semrush, luglio 2026). È il motivo per cui in un progetto SEO la diagnosi tecnica viene prima, ma quasi mai è la parte che sposta i numeri.

Essere nell'indice e essere citati non sono più la stessa cosa

Per vent'anni «stare nell'indice» e «essere raggiungibile da chi cerca» sono coincisi. Con le risposte generate dai motori AI le due condizioni si stanno separando: una pagina può stare nell'indice di Google e non venire mai ripresa in una risposta, e un contenuto può essere citato da un assistente che pesca da fonti che l'indice classico tratta come secondarie. Chi controlla solo lo stato di indicizzazione sta guardando il semaforo di una strada sola, e il traffico ha iniziato a passare anche altrove.

Domande frequenti sull'indicizzazione

Quanto tempo ci mette Google a indicizzare una pagina nuova?

La documentazione di Google indica un'attesa che va da alcuni giorni ad alcune settimane dopo la richiesta di scansione. Non c'è alcuna garanzia: Google scrive che non assicura di eseguire la scansione di una pagina, di indicizzarla o di pubblicarla.

Che differenza c'è fra indicizzazione e posizionamento?

L'indicizzazione dice che la pagina è archiviata nell'Indice Google. Il posizionamento riguarda il posto che occupa quando qualcuno cerca. Una pagina può essere indicizzata da anni e stare in nona pagina, dove il traffico è zero.

Reinviare più volte lo stesso URL accelera l'indicizzazione?

No. Google scrive esplicitamente che richiedere una nuova scansione più volte per lo stesso URL non velocizza i tempi, e che per l'invio di singoli URL con lo strumento Controllo URL esiste una quota.

Il file robots.txt basta a tenere una pagina fuori da Google?

No. Il blocco impedisce la scansione ma non l'ingresso nell'indice: se altri siti linkano quell'indirizzo, Google può indicizzarlo usando le informazioni della pagina che lo linka. Per escluderlo davvero va tolto il blocco e messo un noindex.

IndexNow serve a farsi indicizzare su Google?

No. Gli endpoint elencati dalla documentazione IndexNow sono quello globale del protocollo, Amazon, Bing, Naver, Seznam.cz, Yandex e Yep. Google non partecipa, quindi IndexNow non accelera l'indicizzazione sulla Ricerca Google.

Matteo Pellegrini

Matteo Pellegrini

Sono un business developer e in Visilay mi occupo di sviluppare strategie SEO, Google Ads e CRO basate sui dati. Amo i musei storici, pratico Karate da quando ho memoria e il weekend mi piace visitare i borghi italiani in cerca di cibo nostrano.