Alle Tools

robots.txt-Tester

Geben Sie eine Domain und einen Pfad ein und sehen Sie, ob ein Crawler ihn abrufen darf, mit der entscheidenden Regel und der ganzen Datei, aus der sie stammt.

Die Website, der Pfad und der zu testende Crawler
example.com oder https://example.com. Wir hängen /robots.txt an, ein hier eingefügter Pfad wird also ignoriert.
Ein führender Schrägstrich wird ergänzt, wenn Sie ihn weglassen.
Wählen Sie einen aus der Liste oder tippen Sie einen beliebigen Crawler-Namen.

Wir rufen robots.txt von unserem Server aus ab und sonst nichts. Der getestete Pfad wird nie angefordert.

Das Abrufen der Datei von der anderen Website kann einige Sekunden dauern.

Wie ein Crawler entscheidet

Ein Crawler hört nicht bei der ersten passenden Zeile auf. Er vergleicht jede Regel seiner Gruppe und nimmt die mit dem längsten Pfadmuster, sodass Allow /blog/public bei einer URL, die auf beides passt, gegen Disallow /blog gewinnt. Sind zwei passende Muster genau gleich lang, gewinnt Allow.

Ein Crawler liest genau eine Gruppe. Er nimmt die Gruppe, deren User Agent ihn am genauesten benennt, fällt auf die mit einem Sternchen benannte Gruppe zurück und folgt gar nichts, wenn beides fehlt. Regeln in den anderen Gruppen sind für ihn unsichtbar, weshalb eine richtig aussehende Regel oft in einer Gruppe steht, die der Crawler nie liest.

Warum es diese Seite gibt

Google hat den robots.txt-Tester aus der Search Console entfernt, und was an seine Stelle trat, sagt viel weniger, nämlich nur ob eine URL blockiert ist, auf einer bestätigten Property, ohne die Regel zu nennen. Meist lautet die Frage aber nicht, ob ein Pfad gesperrt ist, sondern welche Zeile ihn gesperrt hat, und das auf einer fremden Website.

Eine Regel in der robots.txt hindert einen Crawler daran, eine URL abzurufen. Sie entfernt diese URL nicht aus den Suchergebnissen und verbirgt die Seite nicht vor jemandem, der die Adresse kennt. Was privat bleiben muss, braucht eine Anmeldung, und was aus den Ergebnissen bleiben soll, braucht ein noindex-Tag auf einer Seite, die ein Crawler weiterhin lesen darf.

Fragen zu robots.txt

Alles ist erlaubt. Ein Crawler, der für robots.txt eine 404 erhält, behandelt die Website als völlig unbeschränkt. Ein Serverfehler ist etwas anderes, denn solange robots.txt nicht abrufbar ist, hält sich ein Crawler ganz zurück.

Google hat den robots.txt-Tester aus der Search Console entfernt. Die URL-Prüfung sagt weiterhin, ob eine einzelne URL blockiert ist, aber nur für eine Property, die Sie bestätigt haben, und sie nennt die entscheidende Regel nicht. Diese Seite funktioniert auf jeder öffentlichen Website und zeigt die Regel.

Ja. Ein Sternchen steht für eine beliebige Zeichenfolge und ein Dollarzeichen verankert das Muster am Ende der URL, sodass Disallow /*.pdf$ jede PDF-Datei sperrt. Beides sind Erweiterungen des ursprünglichen Standards, und die großen Crawler unterstützen sie.

Nein. Eine gesperrte URL kann weiterhin indexiert werden, wenn andere Seiten darauf verlinken, denn die Sperre verhindert den Abruf und nicht den Eintrag. Verwenden Sie ein noindex-Meta-Tag oder einen HTTP-Header auf einer Seite, die aus den Ergebnissen bleiben soll, und lassen Sie sie abrufbar, damit das Tag gelesen werden kann.

Melden Sie den Fehler, nicht seine Beschreibung

Session Replay erfasst die Seite, die Konsole, das Netzwerkprotokoll und die Browserdaten in einem einzigen Link, damit die nächste Person alles vor sich hat.