Todas as ferramentas

Testador de robots.txt

Escreva um domínio e um caminho e veja se um rastreador o pode ir buscar, com a regra que decidiu e o ficheiro inteiro de onde ela vem.

O site, o caminho e o rastreador a testar
example.com ou https://example.com. Nós acrescentamos /robots.txt, por isso qualquer caminho colado aqui é ignorado.
A barra inicial é acrescentada se a omitir.
Escolha um da lista ou escreva o nome de qualquer rastreador.

Vamos buscar o robots.txt a partir do nosso servidor e mais nada. O caminho que testa nunca é pedido.

Ir buscar o ficheiro ao outro site pode demorar alguns segundos.

Como um rastreador decide

Um rastreador não para na primeira linha que corresponde. Compara todas as regras do seu grupo e escolhe a do padrão de caminho mais longo, pelo que Allow /blog/public ganha a Disallow /blog num URL que começa por ambos. Quando dois padrões correspondentes têm exatamente o mesmo comprimento, ganha Allow.

Um rastreador lê exatamente um grupo. Escolhe o grupo cujo agente de utilizador o nomeia com mais precisão, recorre ao grupo indicado com um asterisco e não segue nada se não houver nenhum dos dois. As regras dos outros grupos são invisíveis para ele, e é por isso que uma regra que parece certa está muitas vezes num grupo que o rastreador nunca lê.

Porque existe esta página

A Google retirou o testador de robots.txt da Search Console, e o que o substituiu diz muito menos, apenas se um URL está bloqueado, numa propriedade verificada, sem nomear a regra. Quase sempre a pergunta não é se um caminho está bloqueado mas que linha o bloqueou, e num site gerido por outra pessoa.

Uma regra no robots.txt impede um rastreador de ir buscar um URL. Não o retira dos resultados de pesquisa nem esconde a página de quem saiba o endereço. O que tiver de ficar privado precisa de autenticação, e o que tiver de ficar fora dos resultados precisa de uma tag noindex numa página que um rastreador ainda possa ler.

Perguntas sobre robots.txt

Tudo é permitido. Um rastreador que recebe um 404 ao pedir robots.txt trata o site como não tendo qualquer restrição. Um erro de servidor é diferente, porque enquanto o robots.txt não puder ser lido um rastreador abstém-se por completo.

A Google retirou o testador de robots.txt que existia na Search Console. A inspeção de URL continua a dizer se um URL está bloqueado, mas apenas numa propriedade verificada, e não mostra a regra que decidiu. Esta página funciona em qualquer site público e mostra a regra.

Sim. Um asterisco representa qualquer sequência de caracteres e um cifrão ancora o padrão ao fim do URL, pelo que Disallow /*.pdf$ bloqueia todos os PDF. Ambos são extensões da norma original e os principais rastreadores suportam-nas.

Não. Um URL bloqueado pode continuar indexado se outras páginas lhe apontarem, porque o bloqueio impede o rastreio e não a listagem. Use uma meta tag noindex ou um cabeçalho HTTP numa página que deva ficar fora dos resultados, e deixe-a rastreável para que a tag possa ser lida.

Comunique o erro, não uma descrição dele

O Session Replay captura a página, a consola, o registo de rede e os detalhes do navegador num único link, para que a pessoa seguinte já tenha tudo à frente.