Testeur de robots.txt
Saisissez un domaine et un chemin, et voyez si un robot a le droit de le récupérer, avec la règle qui a tranché et le fichier entier dont elle vient.
Comment un robot tranche
Un robot ne s'arrête pas à la première ligne qui correspond. Il compare toutes les règles de son groupe et retient celle dont le motif de chemin est le plus long, si bien que Allow /blog/public l'emporte sur Disallow /blog pour une URL qui commence par les deux. Quand deux motifs correspondants ont exactement la même longueur, Allow l'emporte.
Un robot lit exactement un groupe. Il prend le groupe dont l'agent utilisateur le nomme le plus précisément, se rabat sur le groupe nommé par un astérisque, et ne suit rien du tout si aucun des deux n'est là. Les règles des autres groupes lui sont invisibles, et c'est pourquoi une règle qui semble juste se trouve souvent dans un groupe que le robot ne lit jamais.
Pourquoi cette page existe
Google a retiré le testeur de robots.txt de la Search Console, et ce qui l'a remplacé en dit beaucoup moins, seulement si une URL est bloquée, sur une propriété validée, sans nommer la règle. Le plus souvent la question n'est pas de savoir si un chemin est bloqué mais quelle ligne l'a bloqué, et sur un site tenu par quelqu'un d'autre.
Une règle de robots.txt empêche un robot de récupérer une URL. Elle ne la retire pas des résultats de recherche et ne cache la page à personne qui en connaît l'adresse. Ce qui doit rester privé demande une authentification, et ce qui doit rester hors des résultats demande une balise noindex sur une page qu'un robot a encore le droit de lire.
Questions sur robots.txt
Signalez le bug, pas sa description
Session Replay capture la page, la console, le journal réseau et les détails du navigateur dans un seul lien, si bien que la personne suivante a tout sous les yeux.