21 août 2026

Les erreurs robots.txt qui te rendent invisible

Des règles de staging qui partent en production. C’est l’erreur que je vois le plus. Ensuite une ligne Sitemap qui fait 404.

Le mois dernier encore : Disallow: / du staging, parti par accident en production. Deux jours invisible pour les crawlers polis. Search Console disait « exclu ». Le site « marchait » très bien dans Chrome. C’est le piège : toi tu le vois, Googlebot non.

Disallow: /wp-admin va. Disallow: /wp- peut emporter les articles, les médias ou le sitemap. Trop large, vu trop tard. Pareil avec /api s’il y a du HTML derrière, ou un joker qui emporte /blog parce que quelqu’un voulait bloquer /b.

Le fichier va sur https://tondomaine.fr/robots.txt. Pas de 3xx vers un autre hôte. Une ligne Sitemap: dont le XML répond 200. Ne bloque pas le CSS et le JS dont la page a besoin pour s’afficher, sinon Google croit que le site est cassé. Les bots IA (GPTBot, ClaudeBot, PerplexityBot) en oui ou non conscient, pas via un groupe trop large par hasard.

Ce n’est pas un job unique. Chaque déploiement. Cinq secondes. Ouvre le fichier, cherche Disallow: /, vérifie la ligne sitemap. Ça t’épargne un week-end à expliquer pourquoi le trafic est parti. Et garde les règles de staging dans un fichier qui ne part jamais en live.

Je regarde aussi si www ou http sert un second robots.txt. Un 301 vers le canonique, ça va. Deux fichiers différents, c’est comme ça qu’un bot prend les mauvaises règles. Et s’il y a un CDN devant : il doit laisser passer le fichier, pas répondre 200 avec un body vide. Je l’ai vu. Le site « marchait ». Le crawler ne lisait rien.

Vous voulez voir ça tout de suite sur votre site ?

Premier rapport gratuit. Ensuite auto-scan, PDF dans votre mail et alertes si un score baisse.

Lancer un rapport gratuit
Essai gratuit