Técnico

O que é um ficheiro robots.txt, e precisas de um?

Um pequeno ficheiro de texto na raiz do teu site define discretamente as regras base para todos os motores de busca que o visitam.

O que é

robots.txt é um ficheiro de texto simples que fica mesmo na raiz de um site (num endereço como oteudominio.com/robots.txt) e dá instruções aos crawlers dos motores de busca — os programas automáticos que visitam sites para ler e indexar as suas páginas. Normalmente diz coisas como "és bem-vindo a rastrear todo este site" ou lista secções específicas que não devem ser rastreadas, como uma área de administração interna ou uma página de resultados de pesquisa interna que não precisa de aparecer no Google.

É mais um conjunto de pedidos educados do que uma barreira de segurança — crawlers bem comportados (como os do Google e do Bing) respeitam-no, mas isso não impede ninguém de aceder diretamente a uma página se já tiver o endereço.

Por que importa

Sem um ficheiro robots.txt, a maioria dos crawlers assume simplesmente que pode rastrear tudo no site, o que muitas vezes é perfeitamente aceitável para um site pequeno sem nada a excluir. Mas a sua ausência também significa que não tens qualquer palavra a dizer no assunto — se alguma vez houver uma secção que não queiras rastreada (uma ferramenta interna, uma área de testes deixada pública por engano, conteúdo duplicado gerado pela pesquisa do próprio site), não existe nenhum ficheiro para o indicar.

Os motores de busca também verificam este ficheiro logo nos primeiros passos ao descobrir um novo site, e é frequentemente usado para apontar os crawlers para o teu sitemap, ajudando as tuas outras páginas a serem encontradas e indexadas mais depressa.

Como corrigir

  1. Cria um ficheiro de texto simples com o nome exato robots.txt (tudo em minúsculas).
  2. No mínimo, inclui User-agent: * seguido de Allow: / para permitir explicitamente que todos os crawlers acedam a todo o teu site.
  3. Se houver secções específicas que não queiras indexadas, adiciona uma linha como Disallow: /admin/ para cada uma.
  4. Adiciona uma linha a apontar para o teu sitemap, por exemplo Sitemap: https://oteudominio.com/sitemap.xml, para que os crawlers encontrem as tuas outras páginas mais depressa.
  5. Carrega o ficheiro na pasta raiz do teu site (não dentro de nenhuma subpasta) para que fique acessível em oteudominio.com/robots.txt — a maioria dos construtores de sites tem um campo de definições dedicado a isto, em vez de exigir o carregamento de um ficheiro.
  6. Visita esse endereço num navegador depois para confirmar que o ficheiro carrega e mostra as tuas regras como texto simples.

Veja se o seu próprio site tem este problema

O Launch Readiness analisa o seu site em busca deste e de mais ~50 problemas antes do lançamento, em segundos — grátis, sem registo.

Fazer uma análise grátis