Tecnico

Cos'è un file robots.txt, e ne hai davvero bisogno?

Un piccolo file di testo alla radice del tuo sito stabilisce silenziosamente le regole di base per ogni motore di ricerca che lo visita.

Cos'è

robots.txt è un file di testo semplice che si trova esattamente alla radice di un sito web (a un indirizzo come tuodominio.com/robots.txt) e dà istruzioni ai crawler dei motori di ricerca, i programmi automatici che visitano i siti per leggerne e indicizzarne le pagine. Di solito dice cose come "sei libero di scansionare tutto questo sito" oppure elenca sezioni specifiche che non dovrebbero essere scansionate, come un'area di amministrazione interna o una pagina di risultati di ricerca interna che non ha bisogno di comparire su Google.

È un insieme di richieste educate, non una barriera di sicurezza: i crawler ben educati (come quelli di Google e Bing) lo rispettano, ma non impedisce davvero a nessuno di accedere direttamente a una pagina se ne ha già l'indirizzo.

Perché è importante

Senza un file robots.txt, la maggior parte dei crawler presumerà semplicemente di poter scansionare liberamente tutto il sito, il che spesso va bene per un piccolo sito senza nulla da escludere. Ma la sua assenza significa anche che non hai alcuna voce in capitolo sulla questione: se mai ci fosse una sezione che non vuoi far scansionare (uno strumento interno, un'area di staging lasciata accidentalmente pubblica, contenuti duplicati generati dalla ricerca interna del sito), non c'è alcun file predisposto per dirlo.

I motori di ricerca controllano anche questo file come una delle prime cose che fanno quando scoprono un nuovo sito, ed è comunemente usato per indirizzare i crawler verso la tua sitemap, rendendo le tue altre pagine più facili da trovare e indicizzare più rapidamente.

Come risolverlo

  1. Crea un file di testo semplice chiamato esattamente robots.txt (tutto minuscolo).
  2. Come minimo, includi User-agent: * seguito da Allow: / per consentire esplicitamente a tutti i crawler di accedere a tutto il tuo sito.
  3. Se ci sono sezioni specifiche che non vuoi vengano indicizzate, aggiungi una riga come Disallow: /admin/ per ognuna di esse.
  4. Aggiungi una riga che punti alla tua sitemap, ad esempio Sitemap: https://tuodominio.com/sitemap.xml, così i crawler possono trovare più velocemente le tue altre pagine.
  5. Carica il file nella cartella principale del tuo sito (non dentro alcuna sottocartella) in modo che sia raggiungibile all'indirizzo tuodominio.com/robots.txt: la maggior parte dei website builder ha un campo di impostazioni dedicato per questo invece di richiedere il caricamento di un file.
  6. Visita quell'indirizzo in un browser in seguito per confermare che il file si carichi e mostri le tue regole come testo semplice.

Verifica se il tuo sito ha questo problema

Launch Readiness analizza il tuo sito alla ricerca di questo e altri ~50 problemi prima del lancio, in pochi secondi — gratis, senza registrazione.

Avvia un'analisi gratuita