Information!

Crawler (engl. Webcrawler; auch Spider oder Bot)

Wie arbeitet ein Crawler?

Ein Crawler ist ein automatisiertes Programm, das Webseiten selbstständig aufruft, deren Inhalte ausliest und den enthaltenen Links folgt. Suchmaschinen nutzen ihn, um das Web zu entdecken und Inhalte für ihren Index zu erfassen. Bekanntestes Beispiel ist der Googlebot, der Crawler von Google. Geläufig sind auch die Begriffe Spider und Bot.

Der Crawler ist das ausführende Werkzeug beim Crawling und damit ein Grundpfeiler des technischen SEO. Nur was ein Crawler abrufen kann, hat überhaupt die Chance auf ein Ranking.

Wie ein Crawler eine Website erfasst

Der Crawler beginnt mit bekannten URLs und einer Warteschlange. Er ruft eine URL ab, liest den Quellcode, zieht die enthaltenen Links heraus und stellt neue Adressen zur weiteren Bearbeitung ein. Moderne Crawler wie der Googlebot rendern Seiten zusätzlich, führen also JavaScript aus, um den tatsächlich sichtbaren Inhalt zu erfassen. Dieses Rendern ist allerdings ressourcenintensiv und erfolgt oft zeitverzögert: Inhalte, die erst clientseitig per JavaScript nachgeladen werden, erfasst ein Crawler daher unter Umständen später oder unvollständig. Gecrawlt wird dabei überwiegend mit dem Smartphone-Googlebot (Mobile-First).

Wie ein Crawler eine Website behandeln soll, steuern Sie über die robots.txt und Meta-Anweisungen. Reagiert ein Server langsam oder mit Fehlern, drosselt Google die Zugriffsrate, um die Website nicht zu belasten.

Zwei Fragen, die oft aufkommen

Was ist der Unterschied zwischen Crawler und Crawling? Der Crawler ist das Programm (der Googlebot), Crawling die Tätigkeit, die es ausführt, also das systematische Abrufen von URLs. Der Crawler ist das Werkzeug, das Crawling der Prozess.

Wie erkennt man einen echten Googlebot? Google veröffentlicht die IP-Bereiche seiner Crawler. Ein echter Googlebot lässt sich über eine umgekehrte DNS-Abfrage der zugreifenden IP verifizieren; die angegebene Kennung (User-Agent) allein lässt sich fälschen.

Unterstützung bei der Crawler-Steuerung

Ob der Googlebot die richtigen Seiten erreicht und dabei kein Budget verschwendet, entscheidet über die Sichtbarkeit gerade großer Websites. Der Crawler ist das Auge der Suchmaschine im Web: Er kann eine Seite nur bewerten, wenn er sie ungehindert erreicht und vollständig ausliest. mindtwo prüft, wie Crawler eine Website tatsächlich verarbeiten, und beseitigt technische Zugriffshürden. Angebot anfragen, wenn Suchmaschinen Ihre Inhalte zuverlässig erfassen sollen.

Weiterführende Themen zum Crawler

Können wir weiterhelfen?

Sie haben ein spannendes Projekt und möchten mit uns zusammenarbeiten? Kontaktieren Sie uns jetzt!

Kostenloses Erstgespräch

Zurück zum Lexikon

Digitaler Erfolg? Ein Klick entfernt.

Unser Angebot ist so vielseitig wie die digitale Welt selbst. Von Webentwicklung bis hin zu strategischer Beratung bieten wir Ihnen ein Rundum-Paket für Ihren digitalen Erfolg. Entdecken Sie jetzt Ihre Möglichkeiten.

Alle Leistungen im Überblick

Erstgespräch vereinbaren

Vereinbaren Sie einen unverbindlichen und kostenlosen Beratungstermin und stellen Sie uns Ihr Projekt vor.

Kostenloses Erstgespräch

mindtwo Management