Technique

Qu'est-ce qu'un fichier robots.txt, et en as-tu besoin ?

Un petit fichier texte à la racine de ton site fixe discrètement les règles du jeu pour chaque moteur de recherche qui le visite.

Ce que c'est

robots.txt est un fichier texte brut qui se trouve à la racine même d'un site web (à une adresse du type tondomaine.com/robots.txt) et donne des instructions aux robots des moteurs de recherche — les programmes automatisés qui visitent les sites pour lire et indexer leurs pages. Il dit généralement des choses comme "vous pouvez explorer tout ce site" ou liste des sections spécifiques à ne pas explorer, comme une zone d'administration interne ou une page de résultats de recherche interne qui n'a pas besoin d'apparaître sur Google.

C'est un ensemble de demandes polies plutôt qu'une barrière de sécurité — les robots bien élevés (comme ceux de Google et Bing) le respectent, mais il n'empêche en réalité personne d'accéder directement à une page si cette personne en a déjà l'adresse.

Pourquoi c'est important

Sans fichier robots.txt, la plupart des robots supposeront simplement qu'ils sont libres de tout explorer sur le site, ce qui est souvent très bien pour un petit site n'ayant rien à exclure. Mais son absence signifie aussi que tu n'as aucun mot à dire sur la question — s'il existe un jour une section que tu ne veux pas voir explorée (un outil interne, un environnement de test resté public par erreur, du contenu dupliqué généré par la recherche interne du site), aucun fichier n'est là pour le préciser.

Les moteurs de recherche vérifient aussi ce fichier parmi les premières choses qu'ils font en découvrant un nouveau site, et il sert couramment à indiquer aux robots où se trouve ton sitemap, ce qui permet de trouver et d'indexer tes autres pages plus rapidement.

Comment le corriger

  1. Crée un fichier texte brut nommé exactement robots.txt (tout en minuscules).
  2. Inclus au minimum User-agent: * suivi de Allow: / pour autoriser explicitement tous les robots à accéder à tout ton site.
  3. S'il y a des sections spécifiques que tu ne veux pas voir indexées, ajoute une ligne comme Disallow: /admin/ pour chacune.
  4. Ajoute une ligne pointant vers ton sitemap, par exemple Sitemap: https://tondomaine.com/sitemap.xml, pour que les robots trouvent tes autres pages plus vite.
  5. Mets le fichier en ligne à la racine de ton site (pas dans un sous-dossier) pour qu'il soit accessible à tondomaine.com/robots.txt — la plupart des créateurs de site ont un champ de réglage dédié pour cela plutôt que d'exiger l'envoi d'un fichier.
  6. Visite ensuite cette adresse dans un navigateur pour confirmer que le fichier se charge et affiche tes règles en texte brut.

Vérifiez si votre propre site a ce problème

Launch Readiness analyse votre site pour détecter ce problème et ~50 autres avant le lancement, en quelques secondes — gratuit, sans inscription.

Lancer une analyse gratuite