Google-Indexierungs-Pipeline
Die Google-Indexierungs-Pipeline (historisch unter dem Codenamen Caffeine bekannt und durch KI-Systeme wie Hummingbird und RankBrain erweitert) ist das verteilte Infrastruktursystem, das Webdokumente abruft, rendert, analysiert und katalogisiert.
Phasen der Pipeline
Abschnitt betitelt „Phasen der Pipeline“Die Pipeline arbeitet als eine Reihe von asynchronen Warteschlangen:
- Crawling (Googlebot): Ruft den rohen HTML-Code ab. Die Abfragen werden basierend auf der Servergeschwindigkeit und dem Crawl-Budget geplant.
- Verarbeitung & Warteschlange: Parst HTTP-Header, Meta-Tags und ausgehende Links. Wird JavaScript benötigt, wird die URL an die Rendering-Warteschlange weitergeleitet.
- Rendering (Web Rendering Service - WRS): Eine Headless-Chrome-Instanz führt JavaScript aus, erzeugt das gerenderte DOM und gibt ein visuelles Layout aus.
- Indexierung: Extrahiert semantische Token, berechnet die Layout-Stabilität (LCP/CLS) und parst Schema.org-Mikrodaten.
- Ranking & Bereitstellung: Gleicht Dokumententitäten mit dem Knowledge Graph ab, berechnet die Relevanz über Vektormodelle und liefert Suchergebnisse aus.
graph TD A[Googlebot-Crawl] --> B[HTML Parsing] B --> C{JS benötigt?} C -- Ja --> D[WRS Rendering] C -- Nein --> E[Semantische Tokenisierung] D --> E E --> F[Knowledge-Graph Abgleich] F --> G[Index-Bereitstellung]Fehlerquellen in der Pipeline
Abschnitt betitelt „Fehlerquellen in der Pipeline“- WRS-Engpässe: JavaScript-Frameworks führen dazu, dass URLs tagelang in der Rendering-Warteschlange liegen, sodass Aktualisierungen verzögert indexiert werden.
- Timeout-Abbrüche: Wenn das clientseitige Rendering die Ausführungszeit des WRS überschreitet, indexiert der Bot ein leeres Dokument, was zu massiven Sichtbarkeitsverlusten führt.
- Fehlgeschlagene Entitäten-Extraktion: Unstrukturierte Websites ohne Schema JSON-LD werden nur durch heuristische Textalgorithmen analysiert, was sie bei Core-Updates anfällig macht.