Todas las herramientas

Probador de robots.txt

Escribe un dominio y una ruta y comprueba si un rastreador puede pedirla, con la regla que lo decidió y el archivo entero del que sale.

El sitio, la ruta y el rastreador que se prueban
example.com o https://example.com. Añadimos /robots.txt, así que cualquier ruta que pegues aquí se ignora.
Se añade la barra inicial si la omites.
Elige uno de la lista o escribe el nombre de cualquier rastreador.

Pedimos robots.txt desde nuestro servidor y nada más. La ruta que pruebas nunca se solicita.

Pedir el archivo al otro sitio puede tardar unos segundos.

Cómo decide un rastreador

Un rastreador no se detiene en la primera línea que coincide. Compara todas las reglas de su grupo y toma la del patrón de ruta más largo, de modo que Allow /blog/public gana a Disallow /blog en una URL que empieza por ambos. Cuando dos patrones coincidentes miden exactamente lo mismo, gana Allow.

Un rastreador lee exactamente un grupo. Toma el grupo cuyo agente de usuario lo nombra con más precisión, recurre al grupo nombrado con un asterisco y no sigue nada si no hay ninguno de los dos. Las reglas de los demás grupos le son invisibles, y por eso una regla que parece correcta suele estar en un grupo que el rastreador nunca lee.

Por qué existe esta página

Google retiró el probador de robots.txt de Search Console, y lo que lo sustituyó informa de mucho menos, solo de si una URL está bloqueada, en una propiedad verificada y sin nombrar la regla. Casi siempre la pregunta no es si una ruta está bloqueada sino qué línea la bloqueó, y en un sitio que lleva otra persona.

Una regla de robots.txt impide que un rastreador pida una URL. No la retira de los resultados de búsqueda ni oculta la página a quien conozca la dirección. Lo que deba seguir siendo privado necesita autenticación, y lo que deba quedar fuera de los resultados necesita una etiqueta noindex en una página que el rastreador aún pueda leer.

Preguntas sobre robots.txt

Todo está permitido. Un rastreador que recibe un 404 al pedir robots.txt trata el sitio como si no tuviera ninguna restricción. Un error del servidor es distinto, porque mientras robots.txt no se pueda leer un rastreador se abstiene por completo.

Google retiró el probador de robots.txt que había en Search Console. La inspección de URL sigue diciendo si una URL está bloqueada, pero solo en una propiedad verificada, y no muestra la regla que lo decidió. Esta página funciona en cualquier sitio público y muestra la regla.

Sí. Un asterisco representa cualquier serie de caracteres y un dólar ancla el patrón al final de la URL, de modo que Disallow /*.pdf$ bloquea todos los PDF. Ambos son extensiones del estándar original y los rastreadores principales las admiten.

No. Una URL bloqueada puede seguir indexándose si otras páginas enlazan a ella, porque el bloqueo impide el rastreo y no el listado. Usa una etiqueta meta noindex o una cabecera HTTP en una página que deba quedar fuera de los resultados, y déjala rastreable para que la etiqueta pueda leerse.

Informa del fallo, no de una descripción

Session Replay captura la página, la consola, el registro de red y los datos del navegador en un solo enlace, así la siguiente persona ya lo tiene todo delante.