21 augustus 2026

robots.txt-fouten die je onzichtbaar maken

Staging-regels die mee naar productie gaan. Dat is de fout die ik het vaakst tegenkom. Daarna een sitemap-regel die 404 geeft.

Vorige maand nog: Disallow: / van staging, per ongeluk mee naar productie. Twee dagen onzichtbaar voor nette crawlers. Search Console zei “uitgesloten”. De site “werkte” prima in Chrome. Dat is het verraderlijke: jij ziet hem, Googlebot niet.

Disallow: /wp-admin is fine. Disallow: /wp- kan berichten, media of de sitemap meenemen. Te breed, te laat gezien. Hetzelfde met /api als je HTML daarachter hangt, of een wildcard die /blog meeneemt omdat iemand /b wou blokkeren.

Het bestand hoort op https://jouwdomein.nl/robots.txt te staan. Geen 3xx naar een andere host. Een Sitemap:-regel met een XML die 200 geeft. CSS en JS die de pagina rendert niet blokkeren, anders denkt Google dat je site kapot is. AI-bots (GPTBot, ClaudeBot, PerplexityBot) bewust ja of nee, niet via een groep die toevallig te ruim is.

Dit is geen eenmalige klus. Elke deploy. Vijf seconden. Open het bestand, zoek naar Disallow: /, check de sitemap-regel. Scheelt je een weekend uitleggen waarom het verkeer weg is. En bewaar staging-regels in een apart bestand dat nooit mee naar live gaat.

Ik kijk ook of www of http een tweede robots.txt serveert. Eén 301 naar de canonieke is prima. Twee verschillende bestanden is hoe een bot de verkeerde regels krijgt. En als er een CDN voor staat: die moet het bestand doorgeven, niet een eigen 200 met een lege body. Dat heb ik zien staan. De site “werkte”. De crawler las niks.

Wil je dit meteen op jouw site zien?

Eerste rapport gratis. Daarna auto-scan, PDF in je mail en alerts als een score zakt.

Gratis rapport starten
Start gratis