Schritt-für-Schritt-Tutorial Wissensbasis

RAG-Chatbot-Wissensbasis: Unternehmensdokumente aufbereiten

Verwandle verstreute Seiten und PDFs in einen kleinen, verantworteten Quellenbestand, dessen Fakten leicht auffindbar, prüfbar und aktualisierbar sind.

Fortgeschritten34 Min. Lesezeit12. August 2026
RAG-Chatbot-Wissensbasis: Unternehmensdokumente aufbereiten

Eine verlässliche RAG-Chatbot-Wissensbasis aufbereiten heißt, mit freigegebenen, gut extrahierbaren Dokumenten und direkt geprüften Textstellen sowie Antwortgrenzen zu beginnen.

Ein Chatbot liest eine Wissensbasis nicht wie ein Kollege, der sich an den gesamten Ordner erinnert. Meist erhält er nur wenige gefundene Abschnitte. Steht dort „gilt 30 Tage“, während Produkt, Startdatum und Ausnahmen an anderer Stelle liegen, kann die Antwort trotz eines für Menschen klaren Dokuments unvollständig sein.

Diese Anleitung beginnt vor dem Upload. Du bestimmst je Thema eine freigegebene Quelle, formulierst wichtige Fakten eigenständig verständlich, prüfst OCR und Extraktion und belegst das Ergebnis anschließend mit einer bekannten Kontrollfrage sowie einer bewusst unbeantwortbaren Gegenfrage. Das Northstar-Demo-PDF enthält den eindeutigen Fakt NORDSTERN-42, sodass die Antwort nicht mit allgemeinem Modellwissen verwechselt werden kann.

Lade nicht allein deshalb einen ganzen Team-Ordner hoch, weil er verfügbar ist. Ein kleiner aktueller Bestand mit Verantwortlichen, Prüfdatum und wiederholbaren Fragen ist verlässlicher als ein großes Archiv widersprüchlicher Versionen.

Datenschutzfreundlicher Zwei-Klick-Player

RAG-Chatbot-Wissensbasis aufbereiten

RAG-Chatbot-Wissensbasis aufbereiten: Duplikate entfernen, Extraktion verbessern, indexierten Text prüfen und bekannte sowie fehlende Antworten testen.

YouTube · 3:52 · Englisch

Der YouTube-Player bleibt bis zu deinem Klick gesperrt. Beim Laden verbindet sich dein Browser mit YouTube; dabei können technische Daten an Google übertragen werden.

Direkt auf YouTube öffnen

Das hast du am Ende eingerichtet

  • Ein Quellenregister mit Verantwortlichem und Prüfdatum je Thema
  • Abruffreundliche Seiten und Dokumente mit eigenständig verständlichen Fakten
  • OCR-geprüfte, deduplizierte und klar versionierte Quelldateien
  • Eine indexierte WebChatAgent-Quelle mit sichtbar geprüftem Text
  • Ein wiederholbarer Known-Answer- und Missing-Information-Freigabetest

Das brauchst du

  • Zugriff auf freigegebene Quelldateien und öffentliche Seiten statt nur auf Exportkopien
  • Einen Inhaltsverantwortlichen, der Widersprüche klären und die aktuelle Version freigeben kann
  • Das herunterladbare fiktive Northstar-Demo-PDF oder ein anderes nicht sensibles Testdokument
  • Fünf bis zehn echte Nutzerfragen einschließlich mindestens einer bewusst nicht beantwortbaren Frage
  • Einen isolierten WebChatAgent-Testassistenten mit englischer Oberfläche und Light Mode

Retrieval arbeitet mit Abschnitten, deshalb zählt lokaler Kontext

Der Fachbegriff dafür lautet Retrieval-Augmented Generation (RAG): Das System sucht zuerst im verbundenen Quellenbestand nach relevanten Abschnitten. Normalerweise erreichen nur diese Abschnitte und die Frage das Antwortmodell. Ein guter Abschnitt nennt deshalb Subjekt, Regel, Bedingungen, Ausnahme und Gültigkeitsdatum, ohne von „der Tabelle oben“ oder einer ungeklärten Abkürzung abzuhängen.

Die Aufbereitung besitzt drei getrennte Qualitätsstufen. Quellen-Governance bestimmt die maßgebliche Version. Die Extraktionsprüfung kontrolliert, welchen Text der Index tatsächlich erhielt. Antworttests prüfen, ob realistische Fragen die richtigen Belege finden und ob fehlende Belege zu einer sicheren Einschränkung statt zu einer Vermutung führen.

Quelle freigebenIndexierte Abschnitte prüfenAntwortverhalten testen

01–11

Schritt für Schritt einrichten

1

Quellenregister erstellen und Verantwortung zuordnen

Bestimme vor der Formatierung, welche Quelle ein Thema beantworten darf.

Erstelle ein einfaches Register mit Quelle, Thema, Zielgruppe, Verantwortlichem, Freigabestatus, Gültigkeitsdatum, Prüfdatum und WebChatAgent-Ziel. Erfasse Websites, PDFs, Workspace-Seiten und Textquellen. „Team-Laufwerk“ ist kein Verantwortlicher; nenne Team oder Person, die eine Korrektur freigeben kann.

Markiere je Thema eine aktuelle maßgebliche Quelle. Widersprechen sich Helpcenter und PDF bei den Supportzeiten, kläre die Richtlinie mit dem Verantwortlichen. Der Chatbot soll nicht zwischen zwei gleichwertig wirkenden Versionen entscheiden.

  • Halte Entwürfe und private Inhalte aus dem aktiven Quellenbestand.
  • Dokumentiere Zugriffsbeschränkungen vor dem Verbinden eines externen Workspace.
Bestimme vor der Formatierung, welche Quelle ein Thema beantworten darf.
2

Redundante, veraltete und belanglose Inhalte entfernen

Entferne Konflikte aus dem aktiven Bestand, statt sie zu überstimmen.

Gruppiere Fast-Duplikate nach Thema. Typische Duplikate sind aktueller Artikel plus Druckansicht, altes neben neuem PDF, parametrisierte Website-URLs, exportierte Workspace-Kopien und Übersetzungen mit denselben Fakten. Vergleiche Gültigkeitsdatum und Freigabe und behalte im Chatbot nur die freigegebene Version.

Archiviere ersetztes Material außerhalb des verbundenen Ordners oder Crawl-Umfangs. Search Priority kann später das Ranking beeinflussen, löst aber keine widersprüchlichen Richtlinien. Ein veraltetes Dokument bleibt trotz niedrigerem Gewicht auffindbar.

Entferne Konflikte aus dem aktiven Bestand, statt sie zu überstimmen.
3

Wichtige Fakten in eigenständige Abschnitte umschreiben

Halte Subjekt, Regel, Bedingungen und Datum beieinander.

Ersetze allgemeine Überschriften wie „Allgemein“ oder „Weitere Informationen“ durch die beantwortete Frage: „Supportzeiten für Northstar-Kunden“ oder „Berechtigung zur Kündigung eines Jahresplans“. Nutze ein Hauptthema je Abschnitt und kurze Absätze unter einer echten Überschriftenhierarchie.

Formuliere ausdrücklich. Aus „Es ist 30 Tage verfügbar“ wird „Die Northstar-Onboarding-Prüfung ist 30 Kalendertage nach dem Kickoff verfügbar.“ Ergänze Ausnahmen und Gültigkeitsdatum im selben Abschnitt. Vermeide „siehe oben“, denn der gefundene Abschnitt enthält den Verweis möglicherweise nicht.

Halte Subjekt, Regel, Bedingungen und Datum beieinander.
4

Namen, Daten, Einheiten und Abkürzungen vereinheitlichen

Nutze Begriffe echter Nutzer und erkläre Fachwörter einmal.

Schreibe den Begriff bei erster Verwendung aus, etwa „Service-level agreement (SLA)“. Nutze Produkt- und Tarifnamen quellenübergreifend einheitlich. Sagen Besucher „refund“, während die Richtlinie „reimbursement“ nutzt, nenne beide Begriffe natürlich im Abschnitt.

Verwende eindeutige Daten wie „1 August 2026“ oder ein ISO-Datum in strukturierten Feldern. Ergänze bei jeder Zahl Währung und Einheit. Nenne die Zeitzone für Uhrzeiten und Fristen. Eine alleinstehende „50“ ist unbrauchbar, wenn sie Euro, Prozent, Stück oder Minuten bedeuten kann.

Nutze Begriffe echter Nutzer und erkläre Fachwörter einmal.
5

Komplexe Tabellen und Bilder in abrufbaren Text überführen

Lass Farbe, Zellposition oder Screenshot nie die einzige Kopie einer Regel tragen.

Einfache Tabellen mit einer Kopfzeile und einem einheitlichen Faktenmuster je Zeile lassen sich leichter extrahieren. Teile verbundene Zellen, wiederhole bei Bedarf das Zeilensubjekt und ergänze einen kurzen Absatz mit der Schlussfolgerung, nach der Besucher fragen. Eine Vergleichstabelle nennt in jeder relevanten Zeile Produkt, Bedingung, Preis und Gültigkeitsdatum.

Ergänze Textalternativen für Diagramme und Screenshots. Ein Screenshot mit Öffnungszeiten ist erst eine Wissensquelle, wenn die Zeiten auch als lesbarer Text vorliegen. Halte dekorative Bilder, Unterschriften und Navigation möglichst außerhalb antwortrelevanter Inhalte.

Lass Farbe, Zellposition oder Screenshot nie die einzige Kopie einer Regel tragen.
6

OCR durchführen und extrahierte Lesereihenfolge prüfen

Ein PDF kann perfekt aussehen und dem Index dennoch fehlerhaften oder leeren Text liefern.

Versuche auf jedem Seitentyp einen Satz zu markieren und zu kopieren. Ist die Seite ein Scan, führe vor dem Upload eine optische Zeichenerkennung durch. Prüfe Codes, Daten, Dezimaltrennzeichen, Namen mit Sonderzeichen und Seitenköpfe manuell; dort treten OCR-Fehler häufig auf.

Füge den kopierten Text in einen reinen Texteditor ein und lies ihn ohne Seitenlayout. Prüfe Spaltenreihenfolge, Tabellenzeilen, Trennungen am Zeilenende und wiederholte Kopfzeilen. Exportiere bei vermischten Spalten oder fehlenden Beschriftungen ein sauberes barrierearmes PDF. Der Demo-Kontrollfakt muss exakt `NORDSTERN-42` bleiben.

Ein PDF kann perfekt aussehen und dem Index dennoch fehlerhaften oder leeren Text liefern.
7

Sauberes Dokument mit verständlichen Metadaten hochladen

Mache die Quelle in Filtern, Gesprächen und späteren Prüfungen erkennbar.

Öffne den isolierten Assistenten, wähle Data Sources und anschließend Add Data Source → Documents. Lade das freigegebene Northstar-Demo-PDF hoch. Setze den Dokumentnamen auf „Northstar Knowledge Base“ und die Kategorie auf „Support“, damit Prüfer den Zweck ohne Öffnen der Datei erkennen.

Lass AI optimization bei einem sauberen Dokument mit auswählbarem Text ausgeschaltet, solange kein konkretes Extraktionsproblem besteht und du das transformierte Ergebnis nicht prüfst. Warte auf den Status Completed. Dokumentiere Zeichen- oder Chunkzahl als Baseline, nicht als Qualitätsnote.

Mache die Quelle in Filtern, Gesprächen und späteren Prüfungen erkennbar.
8

Indexierten Text, Metadaten und Search Priority prüfen

Prüfe, was Retrieval tatsächlich sieht, nicht nur das Original-PDF.

Öffne Edit für Northstar Knowledge Base. Lies den gespeicherten extrahierten Text an der ersten Überschrift, bei einer Tabelle oder Liste, im letzten Abschnitt und rund um NORDSTERN-42. Prüfe außerdem Document Name und Category.

Belasse Search Priority bei 0, solange wiederholbare Abrufprüfungen keinen begründeten Konflikt zeigen. Ein höherer Wert bevorzugt die Quelle gegenüber anderen; er repariert weder schlechte OCR noch fehlenden Kontext oder veraltete Regeln. Speichere nur geprüfte Korrekturen und pflege die freigegebene Quelldatei als Original.

Prüfe, was Retrieval tatsächlich sieht, nicht nur das Original-PDF.
10

Known-Answer- und sicheren Unknown-Test ausführen

Ein guter Freigabetest belegt korrekten Abruf und ehrliche Grenzen.

Starte eine frische Test-chatbot-Unterhaltung und frage: „What is the support verification code in the Northstar Knowledge Base? Answer in one sentence and name the source.“ Die Soll-Antwort enthält exakt NORDSTERN-42 und nennt das PDF. Dokumentiere tatsächlichen Wortlaut, Quellenversion, Modell und Datum.

Starte eine weitere frische Unterhaltung und frage nach Northstars Garantierichtlinie 2028. Die Demoquelle enthält bewusst keine Antwort. Bestanden ist der Test, wenn der Assistent die fehlende Information nennt, statt Dauer oder Bedingung zu erfinden. Behalte beide Fragen nach jeder Quellen-, Prompt- oder Modelländerung im Freigabesatz.

Ein guter Freigabetest belegt korrekten Abruf und ehrliche Grenzen.
11

Quelle versionieren, neu indexieren und regelmäßig prüfen

Behandle die Wissensbasis als gepflegtes Produkt statt als einmaligen Upload.

Nach einer freigegebenen Änderung aktualisierst du gepflegte Quelle, Gültigkeitsdatum und Registereintrag gemeinsam. Indexiere die WebChatAgent-Quelle neu oder ersetze sie, bestätige Completed, prüfe den geänderten Abschnitt in Content Search und wiederhole den festen Fragenkatalog.

Entferne die ersetzte Quelle erst aus dem aktiven Assistenten, wenn die neue Version bestanden hat. Beobachte Questions, Feedback und Conversations auf echte Formulierungen, die im Test fehlten. Ergänze wiederkehrende Nutzerbedürfnisse als Frage und prüfe kritische Themen im dokumentierten Intervall.

Behandle die Wissensbasis als gepflegtes Produkt statt als einmaligen Upload.

Beispiel & Ergebnis

So sieht der echte Praxistest aus

Jedes Tutorial nennt eine feste Eingabe, das erwartete Ergebnis und transparent, was im lokalen Test tatsächlich verifiziert wurde.

Praxisbeispiel: RAG-Chatbot-Wissensbasis: Unternehmensdokumente aufbereiten

Dieses konkrete Szenario wurde mit dem temporären Tutorial-Konto vollständig ausgeführt.

End-to-End geprüft

Konkrete Testeingabe

Durchsuche den indexierten Dokumentinhalt nach dem exakten Kontrollwert NORDSTERN-42.

Erwartetes Ergebnis

Content Search findet NORDSTERN-42 im freigegebenen Northstar-Wissensdokument.

Tatsächlich geprüft

Der echte Light-Mode-Lauf lud das strukturierte Northstar-PDF hoch und indexierte es. Content Search lieferte danach NORDSTERN-42 aus Northstar Knowledge Base.pdf – exakt wie im Belegbild gezeigt.

Der echte Light-Mode-Lauf lud das strukturierte Northstar-PDF hoch und indexierte es. Content Search lieferte danach NORDSTERN-42 aus Northstar Knowledge Base.pdf – exakt wie im Belegbild gezeigt.

Tipps & Tricks

So wird die Einrichtung zuverlässig

Teste mit realistischen Beispielen, dokumentiere deine Ausgangswerte und ändere jeweils nur eine Einstellung. So erkennst du, was die Qualität tatsächlich verbessert.

Wartbarkeit vor Optimierungstricks

Eine verständliche und zuverlässig pflegbare Quelle ist sicherer als eine einmalige Transformation, die später niemand reproduzieren kann.

Prüffragen Quellenverantwortlichen zuordnen

Gib jedem kritischen Thema eine Known-Answer-Frage, einen sicheren Unknown-Fall und einen Verantwortlichen für Fehlerprüfungen.

Sprachen bewusst trennen

Entscheide, ob eine freigegebene Quellsprache mehrsprachige Fragen beantwortet oder jede Sprache eine eigene gepflegte Quelle besitzt. Vermeide versehentliche Übersetzungsduplikate.

Änderungen mit demselben Modell messen

Halte Modell, Prompt und Fragewortlaut bei der Bewertung einer Quellenänderung konstant. Sonst lässt sich das Ergebnis nicht der Wissensbasis zuordnen.

Wenn etwas nicht klappt

Fehlerbehebung

Prüfe Status, Berechtigungen und Testdaten systematisch, bevor du Modell oder Prompt wechselst.

Das PDF zeigt Completed, aber Content Search findet den Kontrollfakt nicht

Vergleiche den gespeicherten Text mit dem Original. Prüfe OCR, Lesereihenfolge und den ausgewählten Assistenten. Exportiere die Quelle sauber neu und ersetze sie, statt das Modell zu ändern.

Content Search findet den Abschnitt, aber der Chatbot nennt eine ältere Regel

Durchsuche den aktiven Quellenbestand nach doppelten Formulierungen, Druck-URLs, Übersetzungen und alten Dateien. Entferne die veraltete Kopie, indexiere neu, starte ein frisches Gespräch und wiederhole dieselbe Frage.

Tabellenwerte verlieren nach der Extraktion ihre Beschriftungen

Ersetze verbundene oder rein visuelle Layouts durch eine einfache Kopfzeile, wiederhole das Zeilensubjekt und ergänze eine Textzusammenfassung. Prüfe den gespeicherten Text vor dem Antworttest.

Die bekannte Antwort funktioniert nur manchmal

Nutze frische Gespräche, identischen Wortlaut und dasselbe Modell. Prüfe konkurrierende Quellen und gefundene Abschnitte, bevor du Search Priority erhöhst. Dokumentiere mehrere Läufe statt nur des besten.

Der Assistent erfindet eine Antwort auf die unbekannte Kontrollfrage

Prüfe zuerst, ob keine aktive Quelle eine ähnliche Aussage enthält. Verstärke danach Beleg- und Missing-Information-Regeln der Rolle. Teste Known und Unknown gemeinsam, damit Sicherheit nützliche Antworten nicht unterdrückt.

Bereit für den Praxistest

Verankere Quellenregister und Inhaltsstandard im Freigabeprozess. Verlange für jede kritische Quelle Verantwortlichen, Freigabestatus, Gültigkeits- und Prüfdatum, Known-Answer-Frage und sicheren Unknown-Fall.

Weiterführende Ressourcen