Tester robots.txt
Inserisci un dominio e un percorso e scopri se un crawler può prenderlo, con la regola che ha deciso e l'intero file da cui viene.
Come decide un crawler
Un crawler non si ferma alla prima riga che corrisponde. Confronta tutte le regole del suo gruppo e prende quella con il criterio di percorso più lungo, così Allow /blog/public batte Disallow /blog per un URL che inizia con entrambi. Quando due criteri corrispondenti sono lunghi esattamente uguale, vince Allow.
Un crawler legge esattamente un gruppo. Prende il gruppo il cui user agent lo nomina in modo più specifico, ripiega sul gruppo indicato con un asterisco e non segue nulla se non c'è né l'uno né l'altro. Le regole degli altri gruppi gli sono invisibili, ed è per questo che una regola che sembra giusta spesso sta in un gruppo che il crawler non legge mai.
Perché esiste questa pagina
Google ha tolto il tester di robots.txt da Search Console, e ciò che lo ha sostituito dice molto meno, soltanto se un URL è bloccato, su una proprietà verificata, senza nominare la regola. Quasi sempre la domanda non è se un percorso sia bloccato ma quale riga lo ha bloccato, e su un sito gestito da qualcun altro.
Una regola in robots.txt impedisce a un crawler di prendere un URL. Non lo toglie dai risultati di ricerca e non nasconde la pagina a chi ne conosce l'indirizzo. Ciò che deve restare privato richiede un'autenticazione, e ciò che deve restare fuori dai risultati richiede un tag noindex su una pagina che un crawler può ancora leggere.
Domande su robots.txt
Segnala il bug, non una sua descrizione
Session Replay cattura la pagina, la console, il registro di rete e i dettagli del browser in un unico link, così la persona successiva ha già tutto davanti.