Cos'è
robots.txt è un file di testo semplice che si trova esattamente alla radice di un sito web (a un indirizzo come tuodominio.com/robots.txt) e dà istruzioni ai crawler dei motori di ricerca, i programmi automatici che visitano i siti per leggerne e indicizzarne le pagine. Di solito dice cose come "sei libero di scansionare tutto questo sito" oppure elenca sezioni specifiche che non dovrebbero essere scansionate, come un'area di amministrazione interna o una pagina di risultati di ricerca interna che non ha bisogno di comparire su Google.
È un insieme di richieste educate, non una barriera di sicurezza: i crawler ben educati (come quelli di Google e Bing) lo rispettano, ma non impedisce davvero a nessuno di accedere direttamente a una pagina se ne ha già l'indirizzo.
Perché è importante
Senza un file robots.txt, la maggior parte dei crawler presumerà semplicemente di poter scansionare liberamente tutto il sito, il che spesso va bene per un piccolo sito senza nulla da escludere. Ma la sua assenza significa anche che non hai alcuna voce in capitolo sulla questione: se mai ci fosse una sezione che non vuoi far scansionare (uno strumento interno, un'area di staging lasciata accidentalmente pubblica, contenuti duplicati generati dalla ricerca interna del sito), non c'è alcun file predisposto per dirlo.
I motori di ricerca controllano anche questo file come una delle prime cose che fanno quando scoprono un nuovo sito, ed è comunemente usato per indirizzare i crawler verso la tua sitemap, rendendo le tue altre pagine più facili da trovare e indicizzare più rapidamente.
Come risolverlo
- Crea un file di testo semplice chiamato esattamente
robots.txt(tutto minuscolo). - Come minimo, includi
User-agent: *seguito daAllow: /per consentire esplicitamente a tutti i crawler di accedere a tutto il tuo sito. - Se ci sono sezioni specifiche che non vuoi vengano indicizzate, aggiungi una riga come
Disallow: /admin/per ognuna di esse. - Aggiungi una riga che punti alla tua sitemap, ad esempio
Sitemap: https://tuodominio.com/sitemap.xml, così i crawler possono trovare più velocemente le tue altre pagine. - Carica il file nella cartella principale del tuo sito (non dentro alcuna sottocartella) in modo che sia raggiungibile all'indirizzo
tuodominio.com/robots.txt: la maggior parte dei website builder ha un campo di impostazioni dedicato per questo invece di richiedere il caricamento di un file. - Visita quell'indirizzo in un browser in seguito per confermare che il file si carichi e mostri le tue regole come testo semplice.