Tous les outils

Testeur de robots.txt

Saisissez un domaine et un chemin, et voyez si un robot a le droit de le récupérer, avec la règle qui a tranché et le fichier entier dont elle vient.

Le site, le chemin et le robot à tester
example.com ou https://example.com. Nous ajoutons /robots.txt, donc tout chemin collé ici est ignoré.
La barre oblique initiale est ajoutée si vous l'omettez.
Choisissez-en un dans la liste ou saisissez le nom de n'importe quel robot.

Nous récupérons robots.txt depuis notre serveur et rien d'autre. Le chemin que vous testez n'est jamais demandé.

Aller chercher le fichier sur l'autre site peut prendre quelques secondes.

Comment un robot tranche

Un robot ne s'arrête pas à la première ligne qui correspond. Il compare toutes les règles de son groupe et retient celle dont le motif de chemin est le plus long, si bien que Allow /blog/public l'emporte sur Disallow /blog pour une URL qui commence par les deux. Quand deux motifs correspondants ont exactement la même longueur, Allow l'emporte.

Un robot lit exactement un groupe. Il prend le groupe dont l'agent utilisateur le nomme le plus précisément, se rabat sur le groupe nommé par un astérisque, et ne suit rien du tout si aucun des deux n'est là. Les règles des autres groupes lui sont invisibles, et c'est pourquoi une règle qui semble juste se trouve souvent dans un groupe que le robot ne lit jamais.

Pourquoi cette page existe

Google a retiré le testeur de robots.txt de la Search Console, et ce qui l'a remplacé en dit beaucoup moins, seulement si une URL est bloquée, sur une propriété validée, sans nommer la règle. Le plus souvent la question n'est pas de savoir si un chemin est bloqué mais quelle ligne l'a bloqué, et sur un site tenu par quelqu'un d'autre.

Une règle de robots.txt empêche un robot de récupérer une URL. Elle ne la retire pas des résultats de recherche et ne cache la page à personne qui en connaît l'adresse. Ce qui doit rester privé demande une authentification, et ce qui doit rester hors des résultats demande une balise noindex sur une page qu'un robot a encore le droit de lire.

Questions sur robots.txt

Tout est autorisé. Un robot qui reçoit un 404 pour robots.txt considère le site comme dépourvu de toute restriction. Une erreur serveur est différente, car tant que robots.txt reste illisible un robot s'abstient complètement.

Google a retiré le testeur de robots.txt qui se trouvait dans la Search Console. L'inspection d'URL dit toujours si une URL est bloquée, mais seulement sur une propriété que vous avez validée, et sans nommer la règle qui a tranché. Cette page fonctionne sur n'importe quel site public et montre la règle.

Oui. Un astérisque remplace n'importe quelle suite de caractères et un dollar ancre le motif à la fin de l'URL, si bien que Disallow /*.pdf$ bloque tous les PDF. Ce sont des extensions de la norme d'origine, prises en charge par les principaux robots.

Non. Une URL interdite peut rester indexée si d'autres pages y renvoient, car le blocage empêche l'exploration et non l'inscription. Utilisez une balise meta noindex ou un en-tête HTTP sur une page qui doit rester hors des résultats, et laissez-la explorable pour que la balise puisse être lue.

Signalez le bug, pas sa description

Session Replay capture la page, la console, le journal réseau et les détails du navigateur dans un seul lien, si bien que la personne suivante a tout sous les yeux.