Zum Inhalt springen

Die „robots.txt“ richtig verstehen und nutzen – nicht nur bei Google

Geschrieben von
Roger Klein
robots.txt

Was ist die robots.txt ĂŒberhaupt genau?

Die robots.txt hilft dem Webmaster – neben anderen Instrumenten – dabei, das Crawling von Suchmaschinen zu steuern. Diese Textdatei muss im Root-Verzeichnis einer Domain oder Subdomain abgelegt sein. Sie erlaubt es, einzelnen Bots den Zugriff zu verwehren oder bestimmte Verzeichnisse auf dem Server zu sperren.

SchlĂŒsselbegriffe sind „Allow“ und „Disallow“ – zum Freigeben und Sperren von Verzeichnissen. Der „User-Agent“ bezeichnet die Bots, auch Crawler genannt, also etwa den Googlebot, BingBot oder Yandex Bot. Mit dem Sternchen * sprichst du alle Verzeichnisse oder alle Bots auf einmal an. Verbindlich sind die Anweisungen ĂŒbrigens nicht – sie sind eine Empfehlung, keine Pflicht.

Wozu Änderungen an der robots.txt?

Neben der robots.txt gibt es weitere Möglichkeiten, Crawling und Indexierung zu beeinflussen: die Noindex-Anweisung in den Meta-Tags, Canonical Tags und die Einstellungen in der Google Search Console. Ziel ist es, Suchmaschinen bestimmte Inhalte vorzuenthalten und das Crawl- und Index-Budget optimal zu nutzen.

Bei grossen Nachrichtenseiten oder Webshops kann eines dieser Budgets knapp werden. Unnötige Duplikate vermeiden, hochwertige Inhalte in technisch sauberer Form bereitstellen – das bleibt die Grundregel. Neue Rahmenbedingungen bringen manchmal den Wunsch mit sich, die Gesamtkonfiguration anzupassen und auch den Inhalt der robots.txt zu Ă€ndern.

Problem Google Cache: Aktualisierung nicht in Echtzeit

Die Datei mit einem Text-Editor wie Notepad++ bearbeiten, abspeichern und per FTP-Programm wie Filezilla hochladen – fĂŒr einen erfahrenen Webmaster kein Problem. Die Syntax kann im Einzelfall aber knifflig sein, weil die Reihenfolge der Anweisungen je nach Bot unterschiedlich interpretiert wird.

Orientiere dich am MarktfĂŒhrer Google: Dessen Bot prĂŒft zuerst alle „Allow“-EintrĂ€ge, dann die „Disallow“-EintrĂ€ge. Andere Bots lesen einfach von oben nach unten. Dazu kommt ein PhĂ€nomen, das Gary Illyes – damals fĂŒhrender Mitarbeiter bei Google – im Juli 2020 auf Twitter bestĂ€tigte: Die alte robots.txt-Datei bleibt bis zu einem Tag im Google Cache. Die Crawling-Bedingungen Ă€ndern sich also nicht sofort.

Aktualisierung des Google Cache möglich

Das Cache-PhĂ€nomen ist Ă€rgerlich und sorgt manchmal fĂŒr Verwirrung. Du kannst die Erneuerung aber forcieren – allerdings nur in der alten Version der Google Search Console, ĂŒber den robots.txt-Tester. Dort informierst du Google ĂŒber den Button „Senden“ darĂŒber, dass die Datei gerade aktualisiert wurde. Laut Gary Illyes verkĂŒrzt das die Wartezeit.

Themen: GoogleSuchmaschineWebentwicklung

Hat dich der Artikel ins GrĂŒbeln gebracht?

Wir besprechen sowas gerne im ErstgesprĂ€ch — unverbindlich, persönlich, in der Regel innerhalb eines Werktags.

Direkt zum Kontakt
Noch was Grösseres?

rundum.dog — unsere Hunde-Wissensplattform.

Unser Eigenprojekt und Live-Beweis: eigenes KI-Plugin auf Anthropic-API-Basis, 17 Custom Post Types, ein Betrieb, den wir tÀglich am Laufen halten.

rundum.dog ansehen ↗
Über die Person

Roger Klein

GeschĂ€ftsfĂŒhrer dataloft GmbH. WordPress seit Version 3, Frauenfeld. Verantwortet bei dataloft Strategie, Architektur und KI-Integration. Baut mit Mattes und Elena rundum.dog, die grösste deutschsprachige Hunde-Wissensplattform.

Mehr ĂŒber uns →

Schreib uns oder ruf an.
Meist antwortet ein Mensch innerhalb eines Werktags.

Roger Klein
GeschĂ€ftsfĂŒhrer
E-Mail
info@dataloft.ch
Telefon
+41 52 511 05 05
Adresse
dataloft GmbH · Rietweg 1 · 8506 Lanzenneunforn TG