Was ist die robots.txt ĂŒberhaupt genau?
Die robots.txt hilft dem Webmaster â neben anderen Instrumenten â dabei, das Crawling von Suchmaschinen zu steuern. Diese Textdatei muss im Root-Verzeichnis einer Domain oder Subdomain abgelegt sein. Sie erlaubt es, einzelnen Bots den Zugriff zu verwehren oder bestimmte Verzeichnisse auf dem Server zu sperren.
SchlĂŒsselbegriffe sind âAllow“ und âDisallow“ â zum Freigeben und Sperren von Verzeichnissen. Der âUser-Agent“ bezeichnet die Bots, auch Crawler genannt, also etwa den Googlebot, BingBot oder Yandex Bot. Mit dem Sternchen * sprichst du alle Verzeichnisse oder alle Bots auf einmal an. Verbindlich sind die Anweisungen ĂŒbrigens nicht â sie sind eine Empfehlung, keine Pflicht.
Wozu Ănderungen an der robots.txt?
Neben der robots.txt gibt es weitere Möglichkeiten, Crawling und Indexierung zu beeinflussen: die Noindex-Anweisung in den Meta-Tags, Canonical Tags und die Einstellungen in der Google Search Console. Ziel ist es, Suchmaschinen bestimmte Inhalte vorzuenthalten und das Crawl- und Index-Budget optimal zu nutzen.
Bei grossen Nachrichtenseiten oder Webshops kann eines dieser Budgets knapp werden. Unnötige Duplikate vermeiden, hochwertige Inhalte in technisch sauberer Form bereitstellen â das bleibt die Grundregel. Neue Rahmenbedingungen bringen manchmal den Wunsch mit sich, die Gesamtkonfiguration anzupassen und auch den Inhalt der robots.txt zu Ă€ndern.
Problem Google Cache: Aktualisierung nicht in Echtzeit
Die Datei mit einem Text-Editor wie Notepad++ bearbeiten, abspeichern und per FTP-Programm wie Filezilla hochladen â fĂŒr einen erfahrenen Webmaster kein Problem. Die Syntax kann im Einzelfall aber knifflig sein, weil die Reihenfolge der Anweisungen je nach Bot unterschiedlich interpretiert wird.
Orientiere dich am MarktfĂŒhrer Google: Dessen Bot prĂŒft zuerst alle âAllow“-EintrĂ€ge, dann die âDisallow“-EintrĂ€ge. Andere Bots lesen einfach von oben nach unten. Dazu kommt ein PhĂ€nomen, das Gary Illyes â damals fĂŒhrender Mitarbeiter bei Google â im Juli 2020 auf Twitter bestĂ€tigte: Die alte robots.txt-Datei bleibt bis zu einem Tag im Google Cache. Die Crawling-Bedingungen Ă€ndern sich also nicht sofort.
Aktualisierung des Google Cache möglich
Das Cache-PhĂ€nomen ist Ă€rgerlich und sorgt manchmal fĂŒr Verwirrung. Du kannst die Erneuerung aber forcieren â allerdings nur in der alten Version der Google Search Console, ĂŒber den robots.txt-Tester. Dort informierst du Google ĂŒber den Button âSenden“ darĂŒber, dass die Datei gerade aktualisiert wurde. Laut Gary Illyes verkĂŒrzt das die Wartezeit.