Come configurare il robots.txt
Il tuo file robots.txt controlla quali parti del tuo sito possono accedere ai crawler dei motori di ricerca. Un robots.txt configurato male può bloccare l'indicizzazione di pagine importanti o sprecare il crawl budget su URL di scarso valore. Questa guida ti insegna come configurarlo correttamente, testarlo ed evitare le insidie comuni che danneggiano la SEO.
Guida passo dopo passo
Comprendere le basi del robots.txt
Robots.txt è un file di testo semplice nella root del tuo sito (example.com/robots.txt) che usa direttive per guidare i crawler. Le due direttive principali sono User-agent (a quale crawler si applica la regola) e Disallow (quali percorsi bloccare). Un robots.txt vuoto o mancante significa che tutti i crawler possono accedere a tutto.
Identificare cosa bloccare
Blocca gli URL che sprecano il crawl budget senza fornire valore SEO: pagine admin, risultati di ricerca interni, aree di login, pagine carrello e checkout, versioni stampabili e URL di filtri pieni di parametri. Non bloccare mai file CSS, JavaScript o immagini necessari ai motori di ricerca per rendere correttamente le tue pagine.
Scrivere le regole del tuo robots.txt
Inizia con User-agent: * per applicare le regole a tutti i crawler. Usa Disallow per i percorsi da bloccare e Allow per creare eccezioni all'interno di directory bloccate. Ricorda che le regole sono case-sensitive e usano il path matching con caratteri jolly (*) e indicatori di fine URL ($).
Aggiungi il riferimento alla tua Sitemap
Includi una direttiva Sitemap che punti alla tua sitemap XML: Sitemap: https://example.com/sitemap.xml. Questo aiuta i motori di ricerca a scoprire la tua sitemap anche se non l'hanno trovata tramite altri mezzi. Puoi elencare più sitemap se il tuo sito utilizza file di indice delle sitemap.
Esegui un test prima del rilascio
Utilizza il Tester robots.txt di Google Search Console per verificare le tue regole prima di andare online. Testa URL specifici per confermare che le pagine importanti siano accessibili e che le pagine bloccate restituiscano il risultato atteso. Una singola regola fuori posto può bloccare accidentalmente l'intero sito.
Monitora l'attività di scansione
Dopo il rilascio, monitora il report Statistiche di scansione in Google Search Console per verificare che i pattern di scansione corrispondano alle tue intenzioni. Controlla che gli URL bloccati non appaiano nei risultati di ricerca e che le pagine importanti vengano scansionate con la frequenza appropriata.
Consigli pro
- Il file robots.txt blocca la scansione, ma non l'indicizzazione. Se una pagina bloccata ha dei backlink esterni, Google potrebbe comunque indicizzare l'URL (semplicemente senza contenuti). Usa i meta tag noindex per impedire l'indicizzazione.
- Usa il carattere $ di fine stringa per bloccare tipi di file specifici: Disallow: /*.pdf$ blocca tutti i PDF senza influenzare altri URL che contengono '.pdf' nel percorso.
- Mantieni il tuo robots.txt semplice. Regole complesse con molte eccezioni sono difficili da mantenere e facili da rompere. Se noti che il tuo robots.txt supera le 20-30 righe, valuta l'uso dei tag noindex.
Errori comuni da evitare
Bloccare file CSS e JavaScript
Google deve eseguire il rendering delle tue pagine per valutarle correttamente. Bloccare file CSS o JS impedisce il rendering, il che significa che Google vede una pagina rotta. Non bloccare mai le risorse necessarie per il rendering della pagina.
Usare robots.txt per nascondere contenuti sensibili
Il file robots.txt è accessibile pubblicamente: chiunque può leggerlo. Usarlo per nascondere pannelli di amministrazione o directory private ne rivela l'esistenza. Usa l'autenticazione e il noindex per contenuti veramente privati.
Bloccare accidentalmente l'intero sito
Un singolo 'Disallow: /' sotto 'User-agent: *' blocca ogni crawler dall'intero sito. Questo può accadere durante lo sviluppo o la migrazione. Controlla sempre che non ci siano regole generali attive per errore in produzione.
Come Keyword Kick semplifica il processo
- Generatore interattivo di robots.txt con modelli preimpostati per le piattaforme CMS più diffuse
- Controlli di audit del sito che segnalano problemi nel robots.txt, incluse risorse importanti bloccate
- Analisi della crawlability che mostra quali pagine sono bloccate e se tale azione è intenzionale
Domande frequenti
Il file robots.txt è obbligatorio per la SEO?
No, non è obbligatorio. Senza un file robots.txt, i motori di ricerca scansioneranno tutto ciò che riescono a trovare. Ne hai bisogno solo se desideri bloccare sezioni specifiche dai crawler o se il tuo sito è abbastanza grande da dover gestire il budget di scansione.
Il file robots.txt impedisce alle pagine di apparire nei risultati di ricerca?
Non in modo affidabile. Il file robots.txt impedisce la scansione, ma Google potrebbe comunque indicizzare l'URL se trova link che puntano ad esso. Il risultato indicizzato mostrerà l'URL e il titolo ma nessuna descrizione. Usa un meta tag noindex per impedire completamente la comparsa nella ricerca.
Quanto spesso i motori di ricerca controllano il file robots.txt?
Google solitamente memorizza nella cache il tuo robots.txt fino a 24 ore. Le modifiche potrebbero non avere effetto immediato. Se hai bisogno che Google lo riacquisisca urgentemente, puoi utilizzare il Tester robots.txt in Search Console per richiederne l'aggiornamento.
Guide correlate
Pronto a mettere in pratica queste strategie? Keyword Kick ti offre gli strumenti per implementare tutto ciò che hai imparato.
Inizia gratis