Все инструменты

Тестер robots.txt

Введите домен и путь и посмотрите, разрешено ли роботу его запрашивать, вместе с решающим правилом и всем файлом, из которого оно взято.

Сайт, путь и робот для проверки
example.com или https://example.com. Мы сами добавляем /robots.txt, поэтому любой путь, вставленный сюда, игнорируется.
Ведущая косая черта добавляется, если вы её опустите.
Выберите из списка или введите имя любого робота.

Мы запрашиваем robots.txt со своего сервера и больше ничего. Проверяемый путь никогда не запрашивается.

Запрос файла с другого сайта может занять несколько секунд.

Как робот принимает решение

Робот не останавливается на первой подходящей строке. Он сравнивает все правила своей группы и берёт то, у которого шаблон пути длиннее, поэтому Allow /blog/public побеждает Disallow /blog для адреса, начинающегося с обоих. Когда два подходящих шаблона одинаковой длины, побеждает Allow.

Робот читает ровно одну группу. Он берёт группу, чей user agent называет его точнее всего, откатывается к группе со звёздочкой и не следует ничему, если нет ни того, ни другого. Правила остальных групп для него невидимы, поэтому правильно выглядящее правило часто оказывается в группе, которую робот никогда не читает.

Зачем нужна эта страница

Google убрал тестер robots.txt из Search Console, а то, что пришло ему на смену, сообщает куда меньше и говорит лишь, заблокирован ли адрес, на подтверждённом ресурсе и без указания правила. Чаще всего вопрос не в том, закрыт ли путь, а в том, какая строка его закрыла, и на чужом сайте.

Правило в robots.txt мешает роботу запросить адрес. Оно не убирает адрес из выдачи и не прячет страницу от того, кто знает адрес. Тому, что должно остаться закрытым, нужна аутентификация, а тому, что должно остаться вне выдачи, нужен тег noindex на странице, которую роботу по-прежнему разрешено читать.

Вопросы про robots.txt

Разрешено всё. Робот, получивший 404 на robots.txt, считает сайт полностью без ограничений. Ошибка сервера означает другое, потому что пока robots.txt не читается, робот воздерживается совсем.

Google убрал тестер robots.txt из Search Console. Проверка URL по-прежнему говорит, заблокирован ли отдельный адрес, но только для подтверждённого ресурса, и не показывает решающее правило. Эта страница работает на любом публичном сайте и показывает правило.

Да. Звёздочка означает любую последовательность символов, а знак доллара привязывает шаблон к концу адреса, поэтому Disallow /*.pdf$ закрывает все PDF. Это расширения исходного стандарта, и основные роботы их поддерживают.

Нет. Запрещённый адрес всё ещё может попасть в индекс, если на него ссылаются другие страницы, потому что запрет останавливает обход, а не показ. Для страницы, которая должна остаться вне выдачи, используйте мета-тег noindex или HTTP-заголовок и оставьте её доступной для обхода, чтобы тег можно было прочитать.

Сообщайте об ошибке, а не о её описании

Session Replay собирает страницу, консоль, сетевой журнал и данные браузера в одну ссылку, так что следующему человеку сразу видно всё целиком.