RAG-Chatbot-Wissensbasis: Unternehmensdokumente aufbereiten
Verwandle verstreute Seiten und PDFs in einen kleinen, verantworteten Quellenbestand, dessen Fakten leicht auffindbar, prüfbar und aktualisierbar sind.

Eine verlässliche RAG-Chatbot-Wissensbasis aufbereiten heißt, mit freigegebenen, gut extrahierbaren Dokumenten und direkt geprüften Textstellen sowie Antwortgrenzen zu beginnen.
Ein Chatbot liest eine Wissensbasis nicht wie ein Kollege, der sich an den gesamten Ordner erinnert. Meist erhält er nur wenige gefundene Abschnitte. Steht dort „gilt 30 Tage“, während Produkt, Startdatum und Ausnahmen an anderer Stelle liegen, kann die Antwort trotz eines für Menschen klaren Dokuments unvollständig sein.
Diese Anleitung beginnt vor dem Upload. Du bestimmst je Thema eine freigegebene Quelle, formulierst wichtige Fakten eigenständig verständlich, prüfst OCR und Extraktion und belegst das Ergebnis anschließend mit einer bekannten Kontrollfrage sowie einer bewusst unbeantwortbaren Gegenfrage. Das Northstar-Demo-PDF enthält den eindeutigen Fakt NORDSTERN-42, sodass die Antwort nicht mit allgemeinem Modellwissen verwechselt werden kann.
Lade nicht allein deshalb einen ganzen Team-Ordner hoch, weil er verfügbar ist. Ein kleiner aktueller Bestand mit Verantwortlichen, Prüfdatum und wiederholbaren Fragen ist verlässlicher als ein großes Archiv widersprüchlicher Versionen.
Datenschutzfreundlicher Zwei-Klick-Player
RAG-Chatbot-Wissensbasis aufbereiten
RAG-Chatbot-Wissensbasis aufbereiten: Duplikate entfernen, Extraktion verbessern, indexierten Text prüfen und bekannte sowie fehlende Antworten testen.
Der YouTube-Player bleibt bis zu deinem Klick gesperrt. Beim Laden verbindet sich dein Browser mit YouTube; dabei können technische Daten an Google übertragen werden.
Direkt auf YouTube öffnenDas hast du am Ende eingerichtet
- Ein Quellenregister mit Verantwortlichem und Prüfdatum je Thema
- Abruffreundliche Seiten und Dokumente mit eigenständig verständlichen Fakten
- OCR-geprüfte, deduplizierte und klar versionierte Quelldateien
- Eine indexierte WebChatAgent-Quelle mit sichtbar geprüftem Text
- Ein wiederholbarer Known-Answer- und Missing-Information-Freigabetest
Das brauchst du
- Zugriff auf freigegebene Quelldateien und öffentliche Seiten statt nur auf Exportkopien
- Einen Inhaltsverantwortlichen, der Widersprüche klären und die aktuelle Version freigeben kann
- Das herunterladbare fiktive Northstar-Demo-PDF oder ein anderes nicht sensibles Testdokument
- Fünf bis zehn echte Nutzerfragen einschließlich mindestens einer bewusst nicht beantwortbaren Frage
- Einen isolierten WebChatAgent-Testassistenten mit englischer Oberfläche und Light Mode
Retrieval arbeitet mit Abschnitten, deshalb zählt lokaler Kontext
Der Fachbegriff dafür lautet Retrieval-Augmented Generation (RAG): Das System sucht zuerst im verbundenen Quellenbestand nach relevanten Abschnitten. Normalerweise erreichen nur diese Abschnitte und die Frage das Antwortmodell. Ein guter Abschnitt nennt deshalb Subjekt, Regel, Bedingungen, Ausnahme und Gültigkeitsdatum, ohne von „der Tabelle oben“ oder einer ungeklärten Abkürzung abzuhängen.
Die Aufbereitung besitzt drei getrennte Qualitätsstufen. Quellen-Governance bestimmt die maßgebliche Version. Die Extraktionsprüfung kontrolliert, welchen Text der Index tatsächlich erhielt. Antworttests prüfen, ob realistische Fragen die richtigen Belege finden und ob fehlende Belege zu einer sicheren Einschränkung statt zu einer Vermutung führen.
01–11
Schritt für Schritt einrichten
Redundante, veraltete und belanglose Inhalte entfernen
Entferne Konflikte aus dem aktiven Bestand, statt sie zu überstimmen.
Gruppiere Fast-Duplikate nach Thema. Typische Duplikate sind aktueller Artikel plus Druckansicht, altes neben neuem PDF, parametrisierte Website-URLs, exportierte Workspace-Kopien und Übersetzungen mit denselben Fakten. Vergleiche Gültigkeitsdatum und Freigabe und behalte im Chatbot nur die freigegebene Version.
Archiviere ersetztes Material außerhalb des verbundenen Ordners oder Crawl-Umfangs. Search Priority kann später das Ranking beeinflussen, löst aber keine widersprüchlichen Richtlinien. Ein veraltetes Dokument bleibt trotz niedrigerem Gewicht auffindbar.
Wichtige Fakten in eigenständige Abschnitte umschreiben
Halte Subjekt, Regel, Bedingungen und Datum beieinander.
Ersetze allgemeine Überschriften wie „Allgemein“ oder „Weitere Informationen“ durch die beantwortete Frage: „Supportzeiten für Northstar-Kunden“ oder „Berechtigung zur Kündigung eines Jahresplans“. Nutze ein Hauptthema je Abschnitt und kurze Absätze unter einer echten Überschriftenhierarchie.
Formuliere ausdrücklich. Aus „Es ist 30 Tage verfügbar“ wird „Die Northstar-Onboarding-Prüfung ist 30 Kalendertage nach dem Kickoff verfügbar.“ Ergänze Ausnahmen und Gültigkeitsdatum im selben Abschnitt. Vermeide „siehe oben“, denn der gefundene Abschnitt enthält den Verweis möglicherweise nicht.
Namen, Daten, Einheiten und Abkürzungen vereinheitlichen
Nutze Begriffe echter Nutzer und erkläre Fachwörter einmal.
Schreibe den Begriff bei erster Verwendung aus, etwa „Service-level agreement (SLA)“. Nutze Produkt- und Tarifnamen quellenübergreifend einheitlich. Sagen Besucher „refund“, während die Richtlinie „reimbursement“ nutzt, nenne beide Begriffe natürlich im Abschnitt.
Verwende eindeutige Daten wie „1 August 2026“ oder ein ISO-Datum in strukturierten Feldern. Ergänze bei jeder Zahl Währung und Einheit. Nenne die Zeitzone für Uhrzeiten und Fristen. Eine alleinstehende „50“ ist unbrauchbar, wenn sie Euro, Prozent, Stück oder Minuten bedeuten kann.
Komplexe Tabellen und Bilder in abrufbaren Text überführen
Lass Farbe, Zellposition oder Screenshot nie die einzige Kopie einer Regel tragen.
Einfache Tabellen mit einer Kopfzeile und einem einheitlichen Faktenmuster je Zeile lassen sich leichter extrahieren. Teile verbundene Zellen, wiederhole bei Bedarf das Zeilensubjekt und ergänze einen kurzen Absatz mit der Schlussfolgerung, nach der Besucher fragen. Eine Vergleichstabelle nennt in jeder relevanten Zeile Produkt, Bedingung, Preis und Gültigkeitsdatum.
Ergänze Textalternativen für Diagramme und Screenshots. Ein Screenshot mit Öffnungszeiten ist erst eine Wissensquelle, wenn die Zeiten auch als lesbarer Text vorliegen. Halte dekorative Bilder, Unterschriften und Navigation möglichst außerhalb antwortrelevanter Inhalte.
OCR durchführen und extrahierte Lesereihenfolge prüfen
Ein PDF kann perfekt aussehen und dem Index dennoch fehlerhaften oder leeren Text liefern.
Versuche auf jedem Seitentyp einen Satz zu markieren und zu kopieren. Ist die Seite ein Scan, führe vor dem Upload eine optische Zeichenerkennung durch. Prüfe Codes, Daten, Dezimaltrennzeichen, Namen mit Sonderzeichen und Seitenköpfe manuell; dort treten OCR-Fehler häufig auf.
Füge den kopierten Text in einen reinen Texteditor ein und lies ihn ohne Seitenlayout. Prüfe Spaltenreihenfolge, Tabellenzeilen, Trennungen am Zeilenende und wiederholte Kopfzeilen. Exportiere bei vermischten Spalten oder fehlenden Beschriftungen ein sauberes barrierearmes PDF. Der Demo-Kontrollfakt muss exakt `NORDSTERN-42` bleiben.
Sauberes Dokument mit verständlichen Metadaten hochladen
Mache die Quelle in Filtern, Gesprächen und späteren Prüfungen erkennbar.
Öffne den isolierten Assistenten, wähle Data Sources und anschließend Add Data Source → Documents. Lade das freigegebene Northstar-Demo-PDF hoch. Setze den Dokumentnamen auf „Northstar Knowledge Base“ und die Kategorie auf „Support“, damit Prüfer den Zweck ohne Öffnen der Datei erkennen.
Lass AI optimization bei einem sauberen Dokument mit auswählbarem Text ausgeschaltet, solange kein konkretes Extraktionsproblem besteht und du das transformierte Ergebnis nicht prüfst. Warte auf den Status Completed. Dokumentiere Zeichen- oder Chunkzahl als Baseline, nicht als Qualitätsnote.
Indexierten Text, Metadaten und Search Priority prüfen
Prüfe, was Retrieval tatsächlich sieht, nicht nur das Original-PDF.
Öffne Edit für Northstar Knowledge Base. Lies den gespeicherten extrahierten Text an der ersten Überschrift, bei einer Tabelle oder Liste, im letzten Abschnitt und rund um NORDSTERN-42. Prüfe außerdem Document Name und Category.
Belasse Search Priority bei 0, solange wiederholbare Abrufprüfungen keinen begründeten Konflikt zeigen. Ein höherer Wert bevorzugt die Quelle gegenüber anderen; er repariert weder schlechte OCR noch fehlenden Kontext oder veraltete Regeln. Speichere nur geprüfte Korrekturen und pflege die freigegebene Quelldatei als Original.
Index nach dem eindeutigen Kontrollfakt durchsuchen
Trenne Extraktions- und Indexprobleme von Problemen der Antworterzeugung.
Wähle Content Search und suche nach `NORDSTERN-42`. Der Treffer sollte Northstar Knowledge Base nennen und den gespeicherten Abschnitt mit dem Fakt zeigen. Wiederhole die Suche mit einem normalen Begriff wie „support hours“, damit der Abruf nicht nur über einen ungewöhnlichen Code funktioniert.
Fehlt der eindeutige Fakt, ändere weder Modell noch System-Prompt. Prüfe zuerst Quellenstatus, extrahierten Text und ausgewählten Assistenten. Findet Content Search den Abschnitt, während die Chatbot-Antwort scheitert, untersuche Fragestellung, konkurrierende Quellen, Rollenregeln und Modellverhalten.
Known-Answer- und sicheren Unknown-Test ausführen
Ein guter Freigabetest belegt korrekten Abruf und ehrliche Grenzen.
Starte eine frische Test-chatbot-Unterhaltung und frage: „What is the support verification code in the Northstar Knowledge Base? Answer in one sentence and name the source.“ Die Soll-Antwort enthält exakt NORDSTERN-42 und nennt das PDF. Dokumentiere tatsächlichen Wortlaut, Quellenversion, Modell und Datum.
Starte eine weitere frische Unterhaltung und frage nach Northstars Garantierichtlinie 2028. Die Demoquelle enthält bewusst keine Antwort. Bestanden ist der Test, wenn der Assistent die fehlende Information nennt, statt Dauer oder Bedingung zu erfinden. Behalte beide Fragen nach jeder Quellen-, Prompt- oder Modelländerung im Freigabesatz.
Quelle versionieren, neu indexieren und regelmäßig prüfen
Behandle die Wissensbasis als gepflegtes Produkt statt als einmaligen Upload.
Nach einer freigegebenen Änderung aktualisierst du gepflegte Quelle, Gültigkeitsdatum und Registereintrag gemeinsam. Indexiere die WebChatAgent-Quelle neu oder ersetze sie, bestätige Completed, prüfe den geänderten Abschnitt in Content Search und wiederhole den festen Fragenkatalog.
Entferne die ersetzte Quelle erst aus dem aktiven Assistenten, wenn die neue Version bestanden hat. Beobachte Questions, Feedback und Conversations auf echte Formulierungen, die im Test fehlten. Ergänze wiederkehrende Nutzerbedürfnisse als Frage und prüfe kritische Themen im dokumentierten Intervall.
Beispiel & Ergebnis
So sieht der echte Praxistest aus
Jedes Tutorial nennt eine feste Eingabe, das erwartete Ergebnis und transparent, was im lokalen Test tatsächlich verifiziert wurde.
Praxisbeispiel: RAG-Chatbot-Wissensbasis: Unternehmensdokumente aufbereiten
Dieses konkrete Szenario wurde mit dem temporären Tutorial-Konto vollständig ausgeführt.
Konkrete Testeingabe
Durchsuche den indexierten Dokumentinhalt nach dem exakten Kontrollwert NORDSTERN-42.
Erwartetes Ergebnis
Content Search findet NORDSTERN-42 im freigegebenen Northstar-Wissensdokument.
Tatsächlich geprüft
Der echte Light-Mode-Lauf lud das strukturierte Northstar-PDF hoch und indexierte es. Content Search lieferte danach NORDSTERN-42 aus Northstar Knowledge Base.pdf – exakt wie im Belegbild gezeigt.
Tipps & Tricks
So wird die Einrichtung zuverlässig
Teste mit realistischen Beispielen, dokumentiere deine Ausgangswerte und ändere jeweils nur eine Einstellung. So erkennst du, was die Qualität tatsächlich verbessert.
Wartbarkeit vor Optimierungstricks
Eine verständliche und zuverlässig pflegbare Quelle ist sicherer als eine einmalige Transformation, die später niemand reproduzieren kann.
Prüffragen Quellenverantwortlichen zuordnen
Gib jedem kritischen Thema eine Known-Answer-Frage, einen sicheren Unknown-Fall und einen Verantwortlichen für Fehlerprüfungen.
Sprachen bewusst trennen
Entscheide, ob eine freigegebene Quellsprache mehrsprachige Fragen beantwortet oder jede Sprache eine eigene gepflegte Quelle besitzt. Vermeide versehentliche Übersetzungsduplikate.
Änderungen mit demselben Modell messen
Halte Modell, Prompt und Fragewortlaut bei der Bewertung einer Quellenänderung konstant. Sonst lässt sich das Ergebnis nicht der Wissensbasis zuordnen.
Wenn etwas nicht klappt
Fehlerbehebung
Prüfe Status, Berechtigungen und Testdaten systematisch, bevor du Modell oder Prompt wechselst.
Das PDF zeigt Completed, aber Content Search findet den Kontrollfakt nicht
Vergleiche den gespeicherten Text mit dem Original. Prüfe OCR, Lesereihenfolge und den ausgewählten Assistenten. Exportiere die Quelle sauber neu und ersetze sie, statt das Modell zu ändern.
Content Search findet den Abschnitt, aber der Chatbot nennt eine ältere Regel
Durchsuche den aktiven Quellenbestand nach doppelten Formulierungen, Druck-URLs, Übersetzungen und alten Dateien. Entferne die veraltete Kopie, indexiere neu, starte ein frisches Gespräch und wiederhole dieselbe Frage.
Tabellenwerte verlieren nach der Extraktion ihre Beschriftungen
Ersetze verbundene oder rein visuelle Layouts durch eine einfache Kopfzeile, wiederhole das Zeilensubjekt und ergänze eine Textzusammenfassung. Prüfe den gespeicherten Text vor dem Antworttest.
Die bekannte Antwort funktioniert nur manchmal
Nutze frische Gespräche, identischen Wortlaut und dasselbe Modell. Prüfe konkurrierende Quellen und gefundene Abschnitte, bevor du Search Priority erhöhst. Dokumentiere mehrere Läufe statt nur des besten.
Der Assistent erfindet eine Antwort auf die unbekannte Kontrollfrage
Prüfe zuerst, ob keine aktive Quelle eine ähnliche Aussage enthält. Verstärke danach Beleg- und Missing-Information-Regeln der Rolle. Teste Known und Unknown gemeinsam, damit Sicherheit nützliche Antworten nicht unterdrückt.
Bereit für den Praxistest
Verankere Quellenregister und Inhaltsstandard im Freigabeprozess. Verlange für jede kritische Quelle Verantwortlichen, Freigabestatus, Gültigkeits- und Prüfdatum, Known-Answer-Frage und sicheren Unknown-Fall.
Weiterführende Ressourcen
Website und PDF hochladen und indexieren
Folge dem Einsteigerablauf vom leeren Assistenten zu zwei belegten Antworten.
Alle Data-Sources-Steuerelemente verstehen
Prüfe Status, Kategorien, gespeicherten Text, Content Search, Neuindexierung und Löschen.
Fertige Wissensbasis als Regression testen
Überführe wiederholbare Fragen in Knowledge-Test- und Audit-Prüfungen.
Fehlende Belege sicher behandeln
Kombiniere Quellenqualität mit klaren Antwortgrenzen und Negativtests.
