Eine XML-Sitemap ist nutzlos, wenn sie URLs enthält, die Google nicht indexieren soll. Wir beobachten regelmäßig überladene Sitemap-Dateien mit 301-Weiterleitungen, Seiten mit noindex oder duplizierten URL-Parametern, was das Crawl-Budget verwässert, anstatt es zu konzentrieren. Die Navigation einer Website über ihre Sitemap zu optimieren, bedeutet zunächst, diese Datei zu bereinigen, sodass nur kanonische, indexierbare und aktuelle URLs übrig bleiben.
Verlässlichkeit von lastmod: das einzige XML-Signal, das Google noch nutzt
Die Tags <priority> und <changefreq> werden von Google ignoriert. Wir empfehlen, sie aus der Datei zu entfernen, um die Lesbarkeit zu verbessern. Der einzige XML-Parameter, der das Verhalten des Crawlers tatsächlich beeinflusst, ist <lastmod> mit einem tatsächlichen Änderungsdatum.
Ein zuverlässiges lastmod-Datum bedeutet, dass es einer signifikanten Änderung des Inhalts, der strukturierten Daten oder der internen Links der Seite entspricht. Eine automatische nächtliche Regeneration der Sitemap, bei der alle Daten aktualisiert werden, stellt kein relevantes Signal dar. Google vergleicht das angegebene Datum mit dem tatsächlichen Inhalt der Seite: Wenn sich nichts geändert hat, sinkt das Vertrauen in die Datei insgesamt.
Bing geht noch weiter und verwendet lastmod als Frischheits-Signal in seinen Suchsystemen, einschließlich für KI-unterstützte Erfahrungen. Eine Sitemap mit zuverlässigen Daten verbessert somit die Sichtbarkeit in beiden Hauptsuchmaschinen. Um zu beobachten, wie eine Website ihre URLs konkret in einer Sitemap strukturiert, illustriert die Sitemap-Seite von Soupir gut eine Gliederung nach thematischen Abschnitten.
XML-Sitemap und Crawl-Budget: Was ausgeschlossen werden sollte

Der erste Reflex, den man annehmen sollte, ist, den Inhalt der Sitemap mit der Indexabdeckung in der Google Search Console abzugleichen. URLs, die Fehler (404, Soft 404, Weiterleitungen) aufweisen oder den Status “erkundet, nicht indexiert” haben, haben in der Datei nichts zu suchen.
Hier sind die Kategorien von URLs, die systematisch ausgeschlossen werden sollten:
- Weitergeleitete Seiten (301 oder 302): Die Sitemap sollte auf das endgültige Ziel verweisen, nicht auf die Quell-URL der Weiterleitung
- URLs mit Sortier-, Filter- oder Paginierungsparametern, die duplizierten Inhalt ohne korrekten kanonischen Tag erzeugen
- Seiten, die durch
noindexgeschützt oder im robots.txt blockiert sind, da ihre Präsenz in der Sitemap ein widersprüchliches Signal an den Crawler sendet - Veraltete Ressourcen (ausverkaufte Produktblätter, nicht veröffentlichte Artikel), die keinen nützlichen Inhalt mehr zurückgeben
Eine Sitemap sollte nur indexierbare und aktuelle URLs enthalten. Jeder überflüssige Eintrag verbraucht Crawl-Budget ohne Rückfluss. Auf einer Website mit mehreren tausend Seiten macht diese Hygiene einen messbaren Unterschied bei der Geschwindigkeit der Indexierung neuer Inhalte.
Sitemap-Index und Segmentierung nach Inhaltstyp
Über ein gewisses Seitenvolumen hinaus wird eine einzelne Datei schwer zu pflegen und zu analysieren. Die Spezifikation des Sitemap-Protokolls erlaubt Indexdateien, die mehrere untergeordnete Sitemaps referenzieren. Wir empfehlen, nach Inhaltstyp zu segmentieren, anstatt alphabetisch oder nach Erstellungsdatum.
Eine effektive Gliederung trennt redaktionelle Seiten (Artikel, Leitfäden), Produkt- oder Dienstleistungsblätter, Kategorieseiten und Medien (Bilder, Videos). Diese Segmentierung ermöglicht es, schnell zu identifizieren, welcher Teilbereich in der Search Console Probleme verursacht. Wenn die Indexierungsrate der Produktblätter sinkt, erfolgt die Diagnose in wenigen Sekunden, anstatt eine monolithische Datei zu durchsuchen.
Spezialisierte Sitemaps für Bilder und Videos verdienen besondere Aufmerksamkeit. Eine Bild-Sitemap, die mit den Tags <image:loc> und <image:title> angereichert ist, erleichtert die Indexierung in Google Bilder. Für Videos ermöglichen die Tags <video:thumbnail_loc>, <video:title> und <video:description>, in den erweiterten Ergebnissen zu erscheinen. Diese spezialisierten Sitemaps werden auf den meisten von uns geprüften Websites untergenutzt.

IndexNow und Einreichung der Sitemap: die beiden Ansätze kombinieren
Die Einreichung der Sitemap über die Google Search Console und die Bing Webmaster Tools bleibt die Referenzmethode für die anfängliche Entdeckung von URLs. Die Erklärung in der robots.txt-Datei (Sitemap: https://example.com/sitemap.xml) stellt sicher, dass jeder Crawler, der dem Protokoll entspricht, die Datei ohne zusätzliche Konfiguration findet.
Für Bing ergänzt das IndexNow-Protokoll die Sitemap bei punktuellen Änderungen. Anstatt darauf zu warten, dass der Crawler die Sitemap erneut besucht, benachrichtigt IndexNow die Suchmaschine in Echtzeit, dass eine URL hinzugefügt, geändert oder gelöscht wurde. Diese Benachrichtigung sollte nicht wiederholt für unveränderte Seiten gesendet werden, da sonst die Glaubwürdigkeit gegenüber dem System verloren geht.
Die Kombination funktioniert folgendermaßen: Die XML-Sitemap deckt die gesamte Website ab und dient als Sicherheitsnetz für die großflächige Entdeckung, während IndexNow die Berücksichtigung dringender Aktualisierungen beschleunigt. Google hat IndexNow nicht übernommen, aber seine Indexierungs-API bietet einen ähnlichen Mechanismus für berechtigte Inhaltstypen.
HTML-Sitemap und interne Verlinkung: zwei komplementäre Werkzeuge
Eine für Besucher sichtbare HTML-Sitemap ersetzt nicht die XML-Datei, sondern stärkt die interne Verlinkung. Jeder Link in einer HTML-Sitemap überträgt PageRank auf tiefere Seiten, die die Hauptnavigation nicht immer abdeckt.
Damit diese Seite nützlich ist und kein einfaches flaches Verzeichnis darstellt, muss sie die tatsächliche Hierarchie der Website widerspiegeln. Links nach Kategorie zu gruppieren, mit einer maximalen Tiefe von zwei oder drei Ebenen, gibt sowohl dem Besucher als auch dem Crawler eine lesbare Karte der Struktur.
Eine Sitemap, ob XML oder HTML, ist kein festes Dokument. Die Aktualisierungsfrequenz sollte dem Publikationsrhythmus der Website folgen. Eine veraltete XML-Datei, die tote URLs referenziert, verschlechtert das Vertrauen des Crawlers in die gesamte Domain. Diese Kohärenz zwischen der Sitemap und dem tatsächlichen Zustand der Website aufrechtzuerhalten, bleibt die erste Voraussetzung dafür, dass das Tool tatsächlich der Navigation und der Indexierung dient.



