Information!

robots.txt (Steuerdatei für Crawler)

Wozu dient die robots.txt und was ist zu beachten?

Die robots.txt ist eine Textdatei im Stammverzeichnis einer Website, die Suchmaschinen mitteilt, welche Bereiche sie crawlen dürfen und welche nicht. Über einfache Regeln, meist User-agent, Disallow und Allow, steuern Sie den Zugriff einzelner Crawler auf Verzeichnisse oder URLs. Sie folgt dem Robots Exclusion Protocol und ist die erste Datei, die ein Crawler beim Besuch abruft.

Als zentrales Steuerinstrument des Crawling gehört die robots.txt zum technischen SEO. Entscheidend ist ihr Wirkungsbereich: Die robots.txt steuert das Crawling, nicht die Indexierung.

Was die robots.txt kann und was nicht

Die Datei verhindert, dass ein Crawler bestimmte URLs abruft. Ideal also, um unwichtige Bereiche wie interne Suchergebnisse oder Filterpfade vom Crawling fernzuhalten und Crawl-Budget zu schonen. Ein Werkzeug, um Seiten aus dem Index zu halten, ist sie dagegen nicht.

Für Pfadmuster unterstützen die großen Suchmaschinen zwei Platzhalter: * steht für eine beliebige Zeichenfolge, $ markiert das Ende einer URL. Damit lassen sich ganze Muster ansprechen statt nur einzelne Verzeichnisse:

User-agent: *
Disallow: /*.pdf$      # sperrt alle URLs, die auf .pdf enden
Disallow: /*?          # sperrt alle URLs mit Query-Parameter

Und hier liegt der Denkfehler, der in der Praxis am meisten Ärger macht: Eine per Disallow blockierte Seite kann trotzdem im Index erscheinen, wenn andere Seiten auf sie verlinken. Google kennt dann die URL, aber nicht den Inhalt. Noch gravierender wird es, wenn Sie eine Seite per robots.txt sperren und mit Noindex versehen wollen: Google kann die Noindex-Anweisung nicht lesen, weil der Abruf blockiert ist, und erreicht damit das Gegenteil. Zum Deindexieren muss das Crawling erlaubt und die Seite per noindex ausgeschlossen sein.

Zwei Fragen zur robots.txt

Wo liegt die robots.txt und wie sieht sie aus? Sie liegt immer unter domain.de/robots.txt. Ein einfaches Beispiel: User-agent: * (gilt für alle Crawler), gefolgt von Disallow: /intern/ (sperrt dieses Verzeichnis). Zusätzlich lässt sich der Pfad zur XML-Sitemap angeben.

Schützt die robots.txt vertrauliche Inhalte? Nein. Die Datei ist öffentlich einsehbar und nur eine Anweisung, keine Zugriffssperre. Vertrauliche Inhalte gehören hinter eine Authentifizierung, nicht in ein Disallow.

Unterstützung bei der Crawling-Steuerung

Eine falsch gesetzte Zeile in der robots.txt kann ganze Bereiche einer Website aus der Suche nehmen, oder umgekehrt Budget verschwenden. Die Datei regelt den Zutritt, nicht die Sichtbarkeit: Sie hält Crawler fern, entfernt aber keine Seite aus dem Index. mindtwo prüft Crawling-Anweisungen im Zusammenspiel mit den übrigen Signalen und stellt sie widerspruchsfrei ein. Angebot anfragen, wenn Ihre Crawling-Steuerung sicher sitzen soll.

Weiterführende Themen zur robots.txt

Können wir weiterhelfen?

Sie haben ein spannendes Projekt und möchten mit uns zusammenarbeiten? Kontaktieren Sie uns jetzt!

Kostenloses Erstgespräch

Zurück zum Lexikon

Digitaler Erfolg? Ein Klick entfernt.

Unser Angebot ist so vielseitig wie die digitale Welt selbst. Von Webentwicklung bis hin zu strategischer Beratung bieten wir Ihnen ein Rundum-Paket für Ihren digitalen Erfolg. Entdecken Sie jetzt Ihre Möglichkeiten.

Alle Leistungen im Überblick

Erstgespräch vereinbaren

Vereinbaren Sie einen unverbindlichen und kostenlosen Beratungstermin und stellen Sie uns Ihr Projekt vor.

Kostenloses Erstgespräch

mindtwo Management