Eine komplette Website für einen KI-Chatbot indexieren
Plane, crawle und prüfe eine komplette Website, ohne Kontobereiche, Suchseiten, Navigationsrauschen oder doppelte URLs zu importieren.

Um eine komplette Website für einen Chatbot zuverlässig zu indexieren, definierst du zuerst den nützlichen Seitenbestand und belegst danach Inhalt sowie Antworten.
Eine komplette Website bedeutet selten jede URL, die ein Crawler finden kann. Suchergebnisse, Kontobereiche, Warenkorb-Routen, Druckansichten, Tag-Archive und Sprachduplikate verbrauchen Quote und können Antworten verschlechtern. Ziel ist ein vollständiger Bestand nützlicher öffentlicher Seiten.
Diese Anleitung nutzt eine fiktive Northstar-Support-Website mit einem kleinen dokumentierten Seiteninventar. Du beginnst mit einem begrenzten Crawl, prüfst jede indexierte URL samt extrahiertem Text, entfernst dauerhaftes Rauschen mit Ausschlussmustern und testest feste Fragen, bevor du Auto-Reindex aktivierst.
Der geprüfte Ablauf crawlt exakt vier kanonische Seiten, hält private, Such- und Druckvarianten fern, liefert `two business hours` plus `NORTHSTAR-SITE-42`, erfindet keine fehlende Gebühr für 2029 und speichert ein siebentägiges Reindex-Intervall. Das temporäre Konto wurde mit null verbleibenden Tutorial-Nutzern gelöscht.
Datenschutzfreundlicher Zwei-Klick-Player
Komplette Website für KI-Chatbot indexieren
Indexiere eine komplette Website für einen KI-Chatbot mit Crawling-Tiefe, CSS-Selektoren, Ausschlüssen, URL-Prüfung, Antworttests und Auto-Reindex.
Der YouTube-Player bleibt bis zu deinem Klick gesperrt. Beim Laden verbindet sich dein Browser mit YouTube; dabei können technische Daten an Google übertragen werden.
Direkt auf YouTube öffnenDas hast du am Ende eingerichtet
- Ein dokumentiertes Inventar einbezogener, ausgeschlossener und doppelter URL-Gruppen
- Eine kontrollierte Website-Quelle mit geprüfter Crawling-Tiefe, `main`-Extraktion und Ausschlüssen
- Eine Prüfung indexierter URLs, Zeichen und extrahierter Inhalte auf Seitenebene
- Ein wiederholbarer Regressionstest für belegte und fehlende Informationen
- Ein Aktualisierungsintervall passend zur Inhaltsverantwortung statt nach Bauchgefühl
Das brauchst du
- Berechtigung zum Crawlen des exakten öffentlichen Hosts und Pfads
- Eine Sitemap oder manuelle Übersicht wichtiger Seitentemplates
- Bekannte Konto-, Checkout-, Such-, Druck-, Parameter- und Sprachduplikat-Muster
- Eine inhaltlich verantwortliche Person plus mindestens zwei Fragen mit belegten Antworten
- Genügend freie Zeichenquote für den kontrollierten ersten Crawl
Breit entdecken, gezielt indexieren
Die Crawling-Tiefe steuert, wie viele Link-Ebenen ab der Start-URL entdeckt werden. Null beschränkt auf die eingegebene Seite, eins erreicht direkt verlinkte Seiten; ein leeres Feld entfernt das feste Tiefenlimit. Ausschlussmuster halten passende Seiten aus dem Index, deren Links können aber weiter der Erkennung dienen.
CSS-Selektoren beantworten eine andere Frage: Welcher Bereich jeder akzeptierten Seite wird Wissen? `main` kann wiederholte Navigation und Footer entfernen, muss aber in allen Seitentemplates vorkommen. Completed belegt nur die Verarbeitung. Erst Indexed URLs und feste Antworttests belegen die richtigen Seiten und Fakten.
01–09
Schritt für Schritt einrichten
Website vor dem Crawler kartieren
Trenne nützliche Seiten von reinen Erkennungs-, privaten und doppelten Routen.
Exportiere die Sitemap oder liste repräsentative URLs manuell. Gruppiere sie in Pflichtinhalte, optionale Inhalte, Duplikate und verbotene Seiten. Dokumentiere die kanonische Sprache und ob Parameter den Inhalt oder nur Sortierung, Tracking und Darstellung ändern.
Das fiktive Northstar-Lab erwartet vier nützliche Seiten unter `/tutorial-labs/website-indexing/`: Übersicht, Services, Support und FAQ. Private, Such- und Druckvarianten werden ausgeschlossen. Das Inventar ist die Prüfvorgabe: Unerwartete Seiten lassen den Lauf auch bei grünem Status scheitern.
- Erwartete Nutzseiten: 4
- Ausgeschlossene Gruppen: private, Suche und Druck
- Kanonische Sprache: Englisch
Website im richtigen Assistenten öffnen
Prüfe Assistent, Tarif, Quote und Eigentumshinweis vor der URL.
Öffne den isolierten Assistenten `Website Crawl Lab`, dann Data Sources, Add Data Source und Website. Der Dialog erlaubt nur eigene Websites. Brich ab, wenn Host, Pfad oder Berechtigung nicht zum freigegebenen Umfang passen.
Notiere vor dem Crawl den aktuellen Zeichenstand der Training-data-Anzeige. Nur so lässt sich das Wachstum dieser Quelle zuordnen. Ein stärkeres Modell gleicht keinen zu breiten oder unzulässigen Crawl aus.
Startpfad und begrenzte erste Tiefe festlegen
Starte klein genug, um jede entdeckte Seite prüfen zu können.
Trage den stabilen Northstar-Lab-Stamm ein und nutze für den kontrollierten ersten Lauf Tiefe 2. Tiefe 0 erfasst nur die Übersicht, Tiefe 1 direkte Links. Ein leeres Feld entfernt das feste Limit und gehört erst in einen späteren Lauf mit geprüften Ausschlüssen.
Starte im Bereichsstamm statt auf der Domain-Startseite. WebChatAgent begrenzt die Erkennung auf den Startpfad. Separate Website-Quellen sind daher sinnvoll, wenn Dokumentation, Marketing und Support verschiedene Selektoren oder Intervalle brauchen.
Hauptinhalt behalten und URL-Rauschen dauerhaft ausschließen
Nutze einen Selektor für alle Templates und explizite, groß-/kleinschreibungsabhängige Muster.
Öffne Advanced. Nutze `main` erst, nachdem Übersicht, Services, Support und FAQ geprüft wurden. Ein fehlender Selektor kann eine leere Seite erzeugen; ein zu breiter Selektor wiederholt Menüs, Cookie-Text und Footer-Links in jedem Chunk.
Ergänze exakte Ausschlussmuster für private, Such- und Druckvarianten des Labs. Die Muster beachten Groß-/Kleinschreibung. Prüfe jedes Muster gegen echte URLs; ein breites Fragment wie `/shop` kann auch `/workshop` treffen. Ausgeschlossene Seiten werden nicht indexiert, ihre Links können aber der Erkennung dienen.
- CSS-Selektor: `main`
- Ausschließen: privater Pfad, Suchroute und Druckparameter
- Rechtsseiten nicht pauschal ausschließen, wenn der Bot daraus antworten soll
Einmal starten und jeden Status richtig lesen
Warte auf Completed; stoppe bewusst bei sichtbar falschem Umfang.
Wähle Add & Index exakt einmal. Pending bedeutet Warteschlange, Processing laufenden Abruf, Failed oder Error erfordert die genaue Ursache, Stopped einen bewusst beendeten Lauf. Erstelle keine zweite Quelle, nur weil die erste langsam wirkt.
Steigt Seiten- oder Zeichenzahl deutlich über das Inventar, stoppe, sichere die Diagnose und korrigiere Muster vor einem neuen Lauf mit frischem Konto. Completed bestätigt nur das Jobende, nicht sauberen Inhalt oder richtige Antworten.
Indexierte URL-Liste und Quote prüfen
Vergleiche exakte URLs und Zeichen je Seite mit dem Inventar.
Öffne Indexed URLs in der Website-Zeile. Das Lab muss exakt die vier geplanten kanonischen Seiten enthalten. Suche nach `private`, `search`, `print`, Fragezeichen und doppelten Slash-Varianten. Notiere Gesamtzeichen und vergleiche mit dem Ausgangswert.
Delete entfernt eine Seite jetzt, ein späterer Crawl kann sie erneut finden. Exclude ergänzt einen dauerhaften Ausschluss. Nutze Exclude für dauerhaft unerwünschte URL-Gruppen, indexiere neu und prüfe Liste sowie Zeichenzahl erneut.
Extrahierten Text jedes Templates prüfen
Auch eine richtige URL kann falsche Seitenbereiche enthalten.
Öffne View indexed content für je eine Seite jedes Templates. Überschrift, Bedingungen, Datum und eindeutiger Fakt müssen gemeinsam vorhanden sein. Suche nach wiederholter Navigation, Cookie-Bannern, fremdem Footer-Inhalt und durch den Selektor fehlenden Abschnitten.
Der bekannte Northstar-Supportsatz nennt als Reaktionsziel zwei Geschäftsstunden und den Prüfwert `NORTHSTAR-SITE-42`. Fehlt der vollständige Satz, korrigiere die Extraktion vor Modell oder Prompt.
Abruf und sicheren Nichtwissens-Fallback beweisen
Stelle nach Completed feste Fragen in einer neuen Unterhaltung.
Frage: `What is the Northstar priority support response goal and website verification value?` Erwartet werden `two business hours` und `NORTHSTAR-SITE-42` aus der Support-Seite. Frage danach nach einer nicht vorhandenen Kündigungsgebühr für 2029. Die sichere Antwort nennt die Lücke und erfindet keinen Betrag.
Wiederhole die belegte Frage in zwei natürlichen Varianten. Verfehlen alle Varianten denselben Fakt, prüfe Extraktion und Retrieval vor einem Modellvergleich. Bewahre diese Fragen als Regressionstest für spätere Crawls auf.
Aktualisierungsintervall wählen und Ausgangswerte dokumentieren
Aktualisiere passend zum Änderungsrhythmus und vergleiche gleiche Bedingungen.
Bearbeite die Website-Quelle erst nach dem ersten sauberen Ergebnis. Wähle keine Automatik, täglich, alle drei, sieben oder dreißig Tage passend zu Tarifverfügbarkeit und Prüfzyklus. Täglich ist für statische Richtlinien nicht automatisch besser.
Warte nach jeder Selektor-, Ausschluss-, Anbieter- oder Quellenänderung auf Completed und wiederhole dieselben belegten und unbelegten Fragen. Dokumentiere Datum, Tiefe, Seitenzahl, Zeichen und Ergebnisse. Untersuche unerwartetes Wachstum vor dem Tariflimit.
Beispiel & Ergebnis
So sieht der echte Praxistest aus
Jedes Tutorial nennt eine feste Eingabe, das erwartete Ergebnis und transparent, was im lokalen Test tatsächlich verifiziert wurde.
Praxisbeispiel: Eine komplette Website richtig indexieren
Dieses konkrete Szenario wurde mit dem temporären Tutorial-Konto vollständig ausgeführt.
Konkrete Testeingabe
Öffne die indexierte Support-Seite und prüfe den extrahierten `main`-Inhalt auf Reaktionsziel und Prüfwert.
Erwartetes Ergebnis
Der gespeicherte Seitentext enthält „two business hours“ und `NORTHSTAR-SITE-42`, jedoch keine Navigation oder Inhalte privater Seiten.
Tatsächlich geprüft
Der echte kontrollierte Crawl öffnete die indexierte Support-Seite und zeigte beide Werte im extrahierten Inhalt – exakt wie im Belegbild dargestellt.
Tipps & Tricks
So wird die Einrichtung zuverlässig
Teste mit realistischen Beispielen, dokumentiere deine Ausgangswerte und ändere jeweils nur eine Einstellung. So erkennst du, was die Qualität tatsächlich verbessert.
Quellen nach Verantwortung und Template trennen
Dokumentation, Marketing und Support brauchen oft andere Selektoren, Ausschlüsse, Verantwortliche und Intervalle. Separate Wurzeln erleichtern Diagnose und Quotenprüfung.
URL-Parameter messbar entscheiden
Behalte Parameter nur bei eigenständigem Wissen. Tracking, Sortierung, Suche und Druck erzeugen meist Duplikate; prüfe exakte Beispiele vor breiten Mustern.
Richtlinien nicht reflexartig entfernen
Datenschutz-, Versand-, Garantie- oder Kündigungsseiten können für Antworten wichtig sein. Schließe sie wegen Irrelevanz oder Duplikaten aus, nicht nur wegen rechtlichen Inhalts.
Wenn etwas nicht klappt
Fehlerbehebung
Prüfe Status, Berechtigungen und Testdaten systematisch, bevor du Modell oder Prompt wechselst.
Nur die Startseite erscheint
Prüfe Tiefe größer null, Pfadgrenze und normale Links. Untersuche fehlgeschlagene URLs, bevor du die Tiefe erhöhst.
Eine Seite ist indexiert, aber Nutztext fehlt
Prüfe View indexed content und den CSS-Selektor auf diesem Template. Nutze einen gemeinsamen `main`-Bereich oder eine getrennte Quelle statt blinder Selektorkombinationen.
Ausgeschlossene Seiten kehren zurück
Delete betrifft nur den aktuellen Index. Ergänze einen präzisen dauerhaften Ausschluss, indexiere neu und prüfe Liste, Groß-/Kleinschreibung sowie Parameter-Syntax.
Zeichennutzung wächst schneller als Seitenzahl
Prüfe große Seiten auf Navigation, Cookie-Text, eingebettete Listen und Parametervarianten. Verenge Selektor oder trenne Quellen vor einer Quotenerhöhung.
Completed liefert trotzdem falsche Antworten
Prüfe den exakten Abschnitt, entferne widersprüchliche Duplikate und teste in einem neuen Chat. Vergleiche Modelle erst bei zuverlässig korrektem Retrieval.
Bereit für den Praxistest
Behalte das Vier-URL-Inventar sowie die festen Known-/Unknown-Fragen als Freigabebasis. Warte nach jeder Selektor-, Ausschluss-, Inhalts- oder Anbieteränderung auf Completed und vergleiche URL-Liste, Zeichenzahl, extrahierten Satz und beide Antwortergebnisse.
