Un PDF è un documento che Google scarica, apre, legge e indicizza come qualsiasi pagina: nei risultati compare con un suo URL, un suo titolo e un suo snippet. La SEO per i PDF è l'insieme delle scelte che decidono se quel file arriva in prima pagina, se resta invisibile o se conviene toglierlo dall'indice.
Le guide italiane sull'argomento ripetono da anni la stessa lista di consigli: nome file con i trattini, metadati compilati, testo selezionabile. Nessuna dice quanto spesso i PDF si posizionano davvero in Italia, e nessuna si è accorta che ChatGPT apre quei file e ne cita i numeri. Qui sotto trovi entrambe le misure, fatte il 26 settembre 2026.
Quanti PDF ci sono davvero in prima pagina in Italia
Abbiamo estratto le prime pagine di sei query italiane con DataForSEO (Google.it, desktop, localizzazione Italia, 26 settembre 2026) e contato quanti risultati organici sono file con estensione .pdf. Su 54 risultati, 15 sono PDF: il 27,8%.
| Query (Italia, desktop, 26 settembre 2026) | Risultati organici | Di cui file .pdf | Posizione del primo PDF |
|---|---|---|---|
| scheda tecnica pompa di calore | 9 | 5 | 1 |
| manuale uso e manutenzione carrello elevatore | 9 | 3 | 1 |
| seo pdf | 9 | 3 | 1 |
| ottimizzazione seo pdf | 9 | 3 | 3 |
| dichiarazione di prestazione dop marcatura ce | 9 | 1 | 4 |
| bando contributi imprese 2026 | 9 | 0 | nessuno |
| Totale | 54 | 15 (27,8%) |
Il caso più netto è "scheda tecnica pompa di calore": i primi quattro risultati organici sono tutti PDF, nell'ordine Immergas, Fujitsu, Daikin ed Edilizia Namirial, con un quinto file di Caleffi in sesta posizione. Nessuna pagina HTML compare prima del quinto posto. Sull'estremo opposto, "bando contributi imprese 2026" non ha un solo PDF in prima pagina: lì rispondono i portali di Assolombarda, Regione Lombardia e Confesercenti, che quei bandi li riscrivono in pagina.
La differenza non è il formato. È chi ha fatto il lavoro. Dove qualcuno ha scritto una pagina che risponde, la pagina vince. Dove l'unico documento che contiene i dati di targa è il file del produttore, si posiziona il file. È lo stesso schema che vediamo nei progetti industriali: nel caso Macropix, delle nove keyword che portano più contatti nessuna contiene il nome dell'azienda, e la più pesante ("ledwall") vale 4.400 ricerche al mese. Se non ci arrivi tu con una pagina, ci arriva il PDF di qualcun altro.
Cosa fa Google con un PDF
La documentazione di Google sui tipi di file indicizzabili mette il PDF tra i formati codificati supportati e dice che «Google can index the content of most text-based files and certain encoded document formats». Un PDF quindi non è penalizzato in partenza: viene trattato come un documento con un suo contenuto testuale.
Le differenze rispetto a una pagina HTML sono altre e sono quattro.
- Il testo deve esistere come testo. Una scansione salvata in PDF è una immagine dentro un contenitore: senza un passaggio di OCR non c'è niente da indicizzare.
- Il PDF non può portare dati strutturati. I formati che Google documenta per i dati strutturati sono JSON-LD, Microdata e RDFa, e vivono tutti nell'HTML. Un file che si posiziona non avrà mai un rich result, e nessuno schema markup lo aiuterà.
- Il titolo mostrato in SERP arriva dalle proprietà del documento, non da un tag. Se il campo Titolo è vuoto, Google prende quello che trova: spesso il nome del file di esportazione, tipo "Microsoft Word - bozza_def2".
- I link dentro un PDF funzionano come link. Il PDF del GDPR raccoglie circa 77.000 link da 823 domini referenti e il PDF della guida introduttiva alla SEO di Google 3.370 link da 754 domini, secondo l'analisi di Ahrefs (indice Ahrefs, dato globale, non italiano).
Quei due numeri spiegano perché un PDF citabile è un asset e non un problema: un documento che gli altri linkano porta autorità al dominio anche se non è una pagina. Il resto delle regole di scansione vale identico, compresa la sitemap, dove gli URL dei PDF si possono elencare come qualsiasi altro URL.
ChatGPT apre i PDF e ne cita i numeri
Questa è la parte che in italiano non ha scritto nessuno. Il 26 settembre 2026 abbiamo posto a ChatGPT con ricerca web attiva, in italiano e con localizzazione Italia, una domanda da manuale tecnico: qual è il COP di una pompa di calore Daikin Altherma 3 M da 8 kW.
La risposta è arrivata come tabella di sei valori, da 4,80 a 7 °C esterni con mandata a 35 °C fino a 1,74 a meno 7 °C con mandata a 55 °C, con il riferimento alla norma UNI EN 14511. Le fonti citate erano tre, tutte su daikin.it: due PDF e una pagina HTML. Uno dei due PDF è la scheda tecnica del monoblocco, l'altro una dichiarazione del costruttore firmata e datata 9 aprile 2026, da cui il modello ha estratto un secondo valore di COP (4,51) segnalando che si riferisce a condizioni diverse.
Due terzi delle fonti erano file PDF. Non pagine che parlano di un PDF: i file, aperti e letti dentro. La documentazione OpenAI sui crawler elenca quattro user agent (OAI-SearchBot, OAI-AdsBot, GPTBot e ChatGPT-User) e non dichiara quali formati di file vengono scaricati e processati, quindi l'unico modo di saperlo è misurarlo query per query, come abbiamo fatto qui e come descriviamo nella guida su come fare SEO per ChatGPT.
La conseguenza operativa è scomoda per chi ha sempre detto di mettere tutto in HTML: in un settore tecnico, la tabella dentro la scheda prodotto è esattamente la parte che viene letta e riportata. Se quella tabella è un'immagine scansionata, il modello non la vede e cita il concorrente che ha esportato il testo.
Le sei cose che decidono se un PDF si posiziona
In ordine di impatto, dalla più pesante alla meno.
1. Testo selezionabile, non immagine
Apri il file e prova a selezionare una riga con il mouse. Se non succede niente, per Google quel documento è vuoto. Succede a tutti i cataloghi impaginati in grafica ed esportati come immagine, e a ogni scansione di un documento cartaceo. Si risolve esportando dal file sorgente invece che dallo scanner, oppure passando un OCR (Acrobat, ocrmypdf, Tesseract).
2. Il campo Titolo nelle proprietà del documento
È il title tag del PDF. In Acrobat sta in File, Proprietà, Descrizione; in LibreOffice e Word in Proprietà del documento. Compila Titolo e Oggetto con la frase che una persona cercherebbe, non con il codice interno dell'articolo. "Pompa di calore aria-acqua 8 kW, scheda tecnica e curve COP" funziona. "DEP-0043 rev.4" no.
3. Il nome del file e la cartella in cui sta
L'URL di un PDF è il suo nome file, e resta visibile nello snippet. Parole separate da trattini, niente spazi codificati in %20, niente date di revisione nel nome se prevedi di aggiornarlo: ogni rinomina è un URL nuovo che perde tutto quello che aveva accumulato. Tienili in una cartella dedicata, tipo /documenti/, così sono isolabili con una regola sola quando serve.
4. La struttura dei titoli dentro il documento
Gli stili Titolo 1, Titolo 2 e Titolo 3 del programma di scrittura diventano tag strutturali nel PDF esportato. Un documento formattato a mano con il grassetto e il corpo 18 è, dal punto di vista della struttura, un blocco unico di testo. La differenza si vede quando Google deve capire di cosa parla la pagina 14 di 60.
5. Alt text sulle immagini e peso del file
Le immagini dentro un PDF accettano testo alternativo esattamente come quelle in pagina, e valgono le stesse regole che usiamo per l'alt text e per l'ottimizzazione delle immagini. Sul peso, il criterio è l'utente: un catalogo da 40 MB scaricato in fiera con la rete mobile non lo apre nessuno, e il tempo di scaricamento entra nell'esperienza della pagina come in qualsiasi altro file servito dal tuo dominio.
6. I link in entrata e in uscita
Un PDF isolato, raggiungibile solo da un pulsante "Scarica" in fondo a una pagina, resta ai margini del sito. Trattalo come una risorsa vera: linkalo dal testo delle pagine pertinenti con la stessa logica dei link interni, e mettici dentro i link verso le pagine del sito che completano il documento. Chi apre una scheda tecnica scaricata due anni prima deve poter tornare al configuratore aggiornato.
Quando conviene togliere un PDF dall'indice
Tre situazioni ricorrenti: il PDF che replica parola per parola una pagina esistente e le toglie clic, il listino vecchio che continua a comparire al posto di quello nuovo, la modulistica che intercetta ricerche informative e le porta su un foglio da compilare.
Il robots.txt non risolve nessuno dei tre: blocca la scansione, non l'indicizzazione, e un URL bloccato può restare in SERP senza snippet. Per un file non HTML il noindex si dichiara nell'header della risposta, con X-Robots-Tag. Google documenta le due regole così:
# Apache
<Files ~ "\.pdf$">
Header set X-Robots-Tag "noindex, nofollow"
</Files>
# NGINX
location ~* \.pdf$ {
add_header X-Robots-Tag "noindex, nofollow";
}
Se invece il PDF deve restare scaricabile ma non deve competere con la pagina HTML che dice le stesse cose, la strada è il canonical dichiarato nell'header HTTP, che Google descrive nella guida sul consolidamento degli URL duplicati. La sintassi è quella della RFC 5988 e vuole un URL assoluto:
Link: <https://www.esempio.it/documenti/white-paper.pdf>; rel="canonical"
Vale la pena ricordare che il canonical resta un suggerimento e non un comando, con i PDF come con le pagine: la logica è la stessa descritta nella guida sull'URL canonical.
PDF o pagina HTML: come si decide
Il criterio che usiamo sui progetti B2B è semplice: il PDF è il formato di chi deve portarsi via il documento, la pagina è il formato di chi deve trovarlo. Un capitolato che il progettista allega alla pratica, una scheda che il tecnico stampa e porta in cantiere, un bilancio che qualcuno archivia: sono file, e vanno pubblicati come file. Una guida, un confronto tra prodotti, una risposta a una domanda: sono pagine.
Quando entrambe le cose servono, l'impostazione che regge è la pagina HTML che contiene i dati in testo e il PDF collegato in fondo, con la stessa versione dei numeri. Costa mezz'ora in più a documento e risolve in anticipo la duplicazione, il problema dei dati strutturati e l'aggiornamento: quando il listino cambia, cambi la pagina e sostituisci il file allo stesso URL. È il tipo di scelta che viene fuori in un audit SEO su un sito industriale, dove spesso metà dei contenuti utili è chiusa in una cartella di allegati.
Dal 28 giugno 2025 un PDF illeggibile è anche un problema di conformità
L'European Accessibility Act, direttiva 2019/882 recepita in Italia con il decreto legislativo 82/2022, si applica dal 28 giugno 2025 e riguarda anche gli operatori economici privati, non solo la pubblica amministrazione. AgID, designata come autorità di vigilanza, include esplicitamente i «documenti elettronici (come i PDF accessibili)» tra gli oggetti coperti dalle sue linee guida sull'accessibilità dei servizi.
La parte interessante è che gli interventi coincidono. Testo reale al posto della scansione, ordine di lettura corretto, tag di intestazione, testo alternativo sulle figure, lingua del documento dichiarata: è la stessa lista che rende un file leggibile da Googlebot e citabile da un modello linguistico. Chi ha già sistemato i PDF per l'accessibilità ha fatto quasi tutto il lavoro SEO, e viceversa. Gli obblighi e i confini di chi rientra nella norma li abbiamo raccolti nella guida sull'accessibilità web.
Come verificare se un PDF sta portando qualcosa
Il controllo veloce è l'operatore site con il tipo di file: site:tuodominio.it filetype:pdf mostra quanti file il motore tiene in indice. Il numero è approssimativo, ma se ne escono 400 quando ne hai pubblicati 30 hai un problema di duplicati generati dal CMS.
Il dato vero sta in Google Search Console: gli URL dei PDF compaiono nel rapporto Prestazioni come qualsiasi altra pagina, con clic, impressioni e query. Filtra le pagine per "pdf" e guarda due cose: quali file prendono impressioni su query che una tua pagina dovrebbe intercettare (lì il PDF ti sta cannibalizzando) e quali prendono clic su query che nessuna tua pagina copre (lì il PDF ti sta dicendo quale pagina scrivere). In GA4 il PDF non genera pageview, quindi il download va tracciato come evento sulla pagina che lo ospita, altrimenti il file sparisce dai report.
Su un sito industriale questo esercizio richiede un pomeriggio e di solito produce una lista di cinque o sei pagine da scrivere. Se preferisci farlo fare a qualcuno, è parte di quello che facciamo nei progetti di consulenza SEO, e nei casi che pubblichiamo trovi i numeri di partenza e di arrivo.
Domande frequenti
Una cosa che nel settore si dice poco
Un PDF che si posiziona bene è quasi sempre il sintomo di una pagina che nessuno ha scritto. Vale per te e vale per i tuoi concorrenti: se in prima pagina su una query commerciale ci sono quattro schede tecniche di produttori, quella query è scoperta, e chi arriva con una pagina fatta bene la prende. È la lettura opposta a quella corrente, che guarda il proprio PDF e si chiede come ottimizzarlo. La domanda più redditizia è l'altra: quali PDF, anche altrui, stanno occupando un posto che dovrebbe essere di una pagina tua.