ItsMyIp

Testez le robots.txt d'un site

Qui a le droit d'explorer vos pages ? Le verdict robot par robot — moteurs de recherche, crawlers IA, bots d'aperçu — avec la règle exacte qui s'applique.

01À quoi sert ce testeur ?

Le fichier robots.txt dit aux robots ce qu'ils peuvent explorer. Une règle mal écrite et c'est tout le site qui disparaît de Google — ou, de plus en plus souvent, des réponses de ChatGPT, Claude et Perplexity : beaucoup de sites bloquent les crawlers IA sans le savoir, via une règle générique ou un réglage de pare-feu recopié. Cet outil lit le fichier en direct et rend le verdict robot par robot, avec la règle exacte qui s'applique.

La subtilité vient des priorités : chaque robot choisit le groupe User-agent le plus spécifique qui le concerne, puis la règle la plus longue l'emporte, Allow gagnant à égalité. Un Disallow: / sous User-agent: * ne bloque donc PAS Googlebot si un groupe User-agent: Googlebot existe plus haut. Complétez avec notre audit de page, qui vérifie aussi robots.txt et sitemap.

02Comprendre les directives

User-agent
Ouvre un groupe de règles pour un robot (User-agent: Googlebot) ou tous (User-agent: *). Un robot n'obéit qu'à un seul groupe : le plus spécifique pour lui.
Disallow
Interdit les chemins commençant par ce préfixe. Disallow: / bloque tout ; une valeur vide n'interdit rien.
Allow
Ré-autorise un chemin à l'intérieur d'une zone interdite (Allow: /blog sous Disallow: /). À longueur égale, Allow l'emporte sur Disallow.
* et $
* remplace n'importe quelle suite de caractères, $ ancre la fin (Disallow: /*.pdf$ bloque les PDF seulement).
Sitemap
Déclare l'URL du sitemap XML — la seule directive lue hors de tout groupe, par tous les robots.
Crawl-delay
Espacement des requêtes demandé à certains robots. Ignoré par Google ; Bing le respecte.

03Bloquer ou autoriser les robots IA ?

Bloquer GPTBot, ClaudeBot ou Google-Extended protège vos contenus de l'entraînement des modèles — mais retire aussi vos pages des réponses des assistants IA, une part croissante de la découverte des sites. Notez la différence entre les robots d'entraînement (GPTBot, ClaudeBot) et ceux de recherche ou d'action utilisateur (OAI-SearchBot, ChatGPT-User, Claude-User) : on peut bloquer les premiers et autoriser les seconds.

Quel que soit votre choix, faites-le consciemment : vérifiez ici ce que votre fichier dit réellement, et gardez à l'esprit que robots.txt est une convention, pas une barrière — un robot mal élevé peut l'ignorer. Pour un blocage réel, il faut agir au niveau du serveur ou du pare-feu (règles WAF, blocage d'AS).

04Questions fréquentes

Pas de robots.txt : est-ce un problème ?

Non. Sans robots.txt (réponse 404), tous les robots considèrent que tout est autorisé — c'est un choix parfaitement valide pour un site entièrement public. Le fichier devient utile quand vous voulez exclure des zones (admin, recherche interne, paniers), déclarer votre sitemap, ou contrôler les robots IA. En revanche, un robots.txt qui répond en erreur 5xx est un vrai problème : Google suspend l'exploration du site.

robots.txt empêche-t-il une page d'apparaître dans Google ?

Pas exactement : il empêche l'exploration, pas l'indexation. Une page bloquée par robots.txt peut quand même apparaître dans les résultats (sans description) si d'autres sites la lient. Pour exclure une page de l'index, il faut une balise meta robots noindex — et donc, paradoxalement, autoriser le robot à visiter la page pour qu'il la voie.

Quelle différence entre GPTBot, OAI-SearchBot et ChatGPT-User ?

Trois usages distincts chez OpenAI : GPTBot collecte pour l'entraînement des futurs modèles ; OAI-SearchBot indexe pour la recherche intégrée de ChatGPT ; ChatGPT-User visite une page à la demande d'un utilisateur (quand il colle votre URL dans la conversation). On peut bloquer l'entraînement tout en restant visible dans la recherche : Disallow pour GPTBot, Allow pour les deux autres. Anthropic a la même granularité avec ClaudeBot et Claude-User.

Mon robots.txt bloque une page, mais elle est déjà dans Google. Que faire ?

Le blocage robots.txt n'enlève rien de l'index — il empêche même Google de revenir voir la balise noindex que vous auriez ajoutée. La séquence correcte : débloquer le chemin dans robots.txt, ajouter noindex à la page, attendre la désindexation, puis rebloquer si nécessaire. Pour une urgence, l'outil de suppression de la Search Console retire l'URL en quelques heures (temporairement).

Les règles sont-elles sensibles à la casse ?

Les chemins, oui : Disallow: /Admin ne bloque pas /admin. Les noms de robots, non : user-agent: googlebot et User-agent: Googlebot sont équivalents. Attention aussi à l'encodage des URL : les règles s'appliquent au chemin tel qu'il apparaît dans les requêtes, paramètres compris si vous les mentionnez.

05Autres outils