Technisch

Wat is een robots.txt-bestand, en heb je er echt een nodig?

Een piepklein tekstbestand aan de basis van je site bepaalt stilletjes de grondregels voor elke zoekmachine die langskomt.

Wat het is

robots.txt is een platte tekstbestand dat helemaal aan de basis van een website staat (op een adres als jouwdomein.nl/robots.txt) en instructies geeft aan crawlers van zoekmachines — de geautomatiseerde programma's die websites bezoeken om hun pagina's te lezen en te indexeren. Meestal staat er iets in als "je mag deze hele site crawlen" of worden specifieke secties genoemd die niet gecrawld mogen worden, zoals een intern beheergedeelte of een zoekresultatenpagina die niet in Google hoeft te verschijnen.

Het is een set beleefde verzoeken, geen beveiligingsbarrière — nette crawlers (zoals die van Google en Bing) respecteren het, maar het houdt niemand echt tegen om een pagina rechtstreeks te bezoeken als ze het adres al hebben.

Waarom het belangrijk is

Zonder robots.txt-bestand gaan de meeste crawlers er gewoon van uit dat ze alles op de site vrij mogen crawlen, wat voor een kleine site zonder iets om uit te sluiten vaak prima is. Maar het ontbreken ervan betekent ook dat je helemaal geen zeggenschap hebt — mocht er ooit een sectie zijn die je niet gecrawld wilt hebben (een intern hulpmiddel, een staging-omgeving die per ongeluk openbaar bleef, dubbele content gegenereerd door de zoekfunctie van de site), dan is er geen bestand aanwezig om dat aan te geven.

Zoekmachines controleren dit bestand ook als een van de eerste dingen die ze doen bij het ontdekken van een nieuwe site, en het wordt vaak gebruikt om crawlers naar je sitemap te wijzen, zodat je andere pagina's sneller gevonden en geïndexeerd worden.

Hoe je het oplost

  1. Maak een platte tekstbestand met precies de naam robots.txt (helemaal in kleine letters).
  2. Voeg op zijn minst User-agent: * toe, gevolgd door Allow: /, om alle crawlers expliciet toegang te geven tot je hele site.
  3. Zijn er specifieke secties die je niet geïndexeerd wilt hebben, voeg dan voor elke sectie een regel toe zoals Disallow: /admin/.
  4. Voeg een regel toe die naar je sitemap verwijst, bijvoorbeeld Sitemap: https://jouwdomein.nl/sitemap.xml, zodat crawlers je andere pagina's sneller kunnen vinden.
  5. Upload het bestand naar de hoofdmap van je site (niet in een submap) zodat het bereikbaar is op jouwdomein.nl/robots.txt — de meeste websitebouwers hebben hiervoor een speciaal instellingenveld in plaats van dat je een bestand moet uploaden.
  6. Bezoek dat adres daarna in een browser om te bevestigen dat het bestand laadt en je regels als platte tekst toont.

Controleer of jouw eigen website dit probleem heeft

Launch Readiness scant je website in enkele seconden op dit en ~50 andere problemen vóór de lancering — gratis, zonder registratie.

Start een gratis controle