Stapsgewijze handleiding Kennisbank

Een AI-chatbot trainen op je website en pdf's

Een praktische handleiding voor beginners om je website te crawlen, een pdf te uploaden en te controleren of je chatbot antwoordt op basis van beide bronnen.

Beginner15 min leestijd16 juli 2026
Een AI-chatbot trainen op je website en pdf's

Om een AI-chatbot betrouwbaar te trainen op je website, heb je een zuiver crawlbereik, nuttige documenten en herhaalbare testvragen nodig die aantonen dat informatie correct wordt opgehaald.

Een chatbot kan alleen betrouwbare, bedrijfsspecifieke antwoorden geven als hij de juiste broncontent kan vinden. In WebChatAgent betekent “training” het uitlezen en indexeren van je website en documenten. Het onderliggende AI-model wordt niet opnieuw getraind of gefinetuned.

Deze handleiding begint met een volledig leeg account. Je maakt een chatbot aan, crawlt één webpagina, uploadt een kleine pdf en test vervolgens één antwoord uit elke bron.

Privacyvriendelijke speler met tweestapsactivering

Een AI-chatbot trainen op je website + pdf's

Train stap voor stap een AI-chatbot op je website en pdf's. Leer alles over crawlen, documenten indexeren, bronnen opschonen en gefundeerde antwoorden testen.

YouTube · 3:11 · Engels

De YouTube-speler blijft geblokkeerd totdat u op Afspelen klikt. Door het laden maakt uw browser verbinding met YouTube en kunnen technische gegevens naar Google worden verzonden.

Rechtstreeks openen op YouTube

Wat u aan het einde heeft bereikt

  • Een nieuwe chatbot met een schone kennisbank
  • Eén succesvol geïndexeerde websitebron
  • Eén succesvol geïndexeerd pdf-document
  • Twee geverifieerde antwoorden gebaseerd op je eigen content

Voordat u begint

  • Een WebChatAgent-account met toestemming om een chatbot aan te maken
  • Een openbare webpagina die je mag indexeren
  • De downloadbare demo-pdf uit deze handleiding of je eigen ondersteunde document
Download de demo-pdfGebruik de fictieve kennisbank van Northstar Services om de documenttest zelf te herhalen.

Wat “training” hier betekent

De technische term is Retrieval-Augmented Generation (RAG): WebChatAgent leest de content, verdeelt deze in nuttige fragmenten en zoekt de fragmenten die het beste aansluiten bij een vraag. Die fragmenten worden als bewijsmateriaal aan het AI-model aangeboden.

Deze brongebaseerde aanpak zorgt ervoor dat je kennis actueel en eenvoudig te vervangen blijft. Als een pagina verandert, kun je deze opnieuw inlezen zonder een nieuw model te trainen. De kwaliteit hangt daarom af van zuivere broncontent, een doordacht crawlbereik en realistische tests.

BroncontentRelevante fragmentenGefundeerd antwoord

01–09

Train je chatbot stap voor stap

1

Begin vanuit het lege dashboard

Maak je eerste assistent aan in het schone account.

Na het inloggen toont het dashboard dat er nog geen AI-assistenten bestaan. Klik op de primaire knop om direct met een schone chatbot te beginnen, in plaats van een assistent te hergebruiken die al bronnen bevat.

Begin met een leeg account en selecteer de knop om een chatbot aan te maken.
2

Tutorial Lab aanmaken

Geef de nieuwe assistent een duidelijke naam en behoud de veilige standaardinstellingen.

Voer “Tutorial Lab” in als naam. De standaard interne provider volstaat voor deze handleiding; je hoeft dus geen eigen API-sleutel toe te voegen.

Maak de chatbot aan. WebChatAgent opent het configuratiedashboard zodra de assistent is opgeslagen.

Gebruik een herkenbare naam, zodat de assistent tijdens het testen eenvoudig terug te vinden is.
3

Open Data Sources

Ga naar het onderdeel waarin de kennisbank van de chatbot wordt beheerd.

Selecteer “Data Sources” in de navigatie van de chatbot. Een nieuwe chatbot toont een lege status, omdat er nog geen website, document of gekoppelde werkruimte is geïndexeerd.

Kies “Add Data Source” om het bronselectiemenu te openen.

Alle kennisbronnen voor deze chatbot worden op één centrale plek beheerd.
4

Kies Website als eerste bron

Open de crawlerinstellingen voor een openbare webpagina.

Het keuzemenu toont websites, documenten, tekstinvoer en gekoppelde kennistools. Selecteer “Website”.

Gebruik een websitebron wanneer de informatie al op openbare, crawlrelevante pagina's staat en de pagina-URL als referentie behouden moet blijven.

Kies Website om content rechtstreeks vanaf een URL te crawlen.
5

Voer de URL in en beperk de crawldiepte

Indexeer eerst één gecontroleerde pagina voordat je een complete website toevoegt.

Voer https://webchatagent.com/train-chatbot-on-your-data in het URL-veld in en stel de crawldiepte in op 0. Een diepte van 0 indexeert alleen deze pagina, waardoor de tutorial snel en voorspelbaar blijft.

Laat automatische herindexering uitstaan voor deze eenmalige test. Voor live content kan Premium een bron dagelijks vernieuwen. Met geavanceerde instellingen kun je een specifiek CSS-contentgebied opgeven of URL-patronen uitsluiten, zoals login-, winkelwagen- of juridische pagina's.

Selecteer “Add & Index” om het extraheren en indexeren te starten.

  • Diepte 0: alleen de ingevoerde pagina
  • Lege diepte: volg alle bereikbare subpagina's
  • CSS-selector: behoud alleen het relevante contentgebied
  • Uitsluitingspatronen: voorkom irrelevante of dubbele URL's
Een diepte van 0 is ideaal voor een gecontroleerde eerste indexering.

Indexeer alleen content die je in eigendom hebt

Controleer voordat je een externe website crawlt of je de content mag verwerken en gebruiken.

6

Wacht tot de website is geïndexeerd

Controleer of de bron gereed is voordat je antwoorden gaat testen.

De nieuwe bron kan kort een status van 'in behandeling' of 'verwerken' tonen. Wacht tot deze verandert in “Indexed” of “Completed”. Het aantal geïndexeerde pagina's en de geëxtraheerde content bevestigen dat de crawler succesvol is afgerond.

Als de bron mislukt, open dan eerst de details ervan. Controleer de URL, de toegankelijkheid van robots.txt, de crawldiepte en eventuele te strikte CSS-selectors voordat je het opnieuw probeert.

Test de chatbot pas nadat de bronstatus bevestigt dat de indexering is geslaagd.
7

Upload de demo-pdf

Voeg een tweede bron toe met een uniek feit dat eenvoudig te verifiëren is.

Selecteer opnieuw “Add Data Source”, kies “Documents” en upload de hierboven gelinkte demo-kennisbank-pdf. Het bestand bevat de unieke ondersteuningscode NORDSTERN-42, die niet op de website voorkomt.

Laat AI-optimalisatie uitstaan voor dit beknopte, al goed gestructureerde document. Deze functie is handig voor slecht opgemaakt bronmateriaal, maar niet noodzakelijk voor zuivere tekst.

Kies de demo-pdf en upload deze als afzonderlijke documentbron.
8

Controleer beide kennisbronnen

Zorg dat de website en de pdf beide de status 'gereed' hebben.

In de lijst met Data Sources moeten nu zowel de website-URL als de pdf met een succesvolle status worden weergegeven. Dit controlepunt voorkomt dat je onvolledige indexeringen aanziet voor onjuist modelgedrag.

Open een bron wanneer je geëxtraheerde content wilt inzien, de categorie wilt wijzigen, een herindexering wilt starten of verouderde kennis wilt verwijderen.

Beide bronnen moeten gereed zijn voor de definitieve antwoordtest.
9

Verifieer het pdf-antwoord in de livechat

Controleer het unieke feit uit de pdf in dezelfde chatomgeving die bezoekers te zien krijgen.

Open het live chat-voorbeeldvenster en vraag: “What is the verification code in the uploaded tutorial PDF? Answer in one sentence and name the source.” De schermafbeelding toont de exacte vraag en het daadwerkelijke antwoord vanuit het tijdelijke tutorial-account.

Het antwoord moet NORDSTERN-42 bevatten en verwijzen naar de demo-kennisbank van Northstar Services. De volledige Knowledge Test-resultaten voor de website en de pdf worden direct onder deze stap getoond, zodat beide geïndexeerde bronnen met vaste vragen zijn geverifieerd.

  • Stel vragen waarvan de antwoorden expliciet in de brontekst staan.
  • Gebruik unieke namen, codes of getallen om het ophalen van informatie te valideren.
  • Als een antwoord niet scherp genoeg is, verbeter dan eerst de brontekst voordat je de prompt uitbreidt.
De livechat retourneert NORDSTERN-42 en noemt het geïndexeerde brondocument.

Een geslaagde test is gebaseerd op aantoonbare feiten

Het doel is niet louter een vloeiend klinkend antwoord. Controleer of de formulering wordt onderbouwd door de geïndexeerde bron en of unieke gegevens exact worden overgenomen.

Voorbeeld en resultaat

Test beide geïndexeerde bronnen met vaste vragen

Dit zijn de exacte vragen die zijn gebruikt in het tijdelijke tutorial-account. Elk resultaat toont het complete Knowledge Test-overzicht; wanneer één weergave niet past, laten opeenvolgende frames de score en elk afzonderlijk antwoord zonder afkappingen zien.

Website-voorbeeld: ondersteunde databronnen verifiëren

Deze vraag is uitgevoerd op de geïndexeerde webpagina WebChatAgent met crawldiepte 0.

End-to-end geverifieerd

Exacte testinvoer

Can I train a WebChatAgent chatbot with both website pages and PDF documents?

Verwacht resultaat

Het antwoord bevestigt dat zowel webpagina's als pdf-documenten als kennisbron kunnen worden gebruikt.

Wat er daadwerkelijk is geverifieerd

De werkelijke Knowledge Test beantwoordde 5 van de 5 varianten correct (100%) en baseerde het resultaat op de geïndexeerde websitecontent.

Frame 1 toont de volledige scorerij van 5/5 en het begin van de antwoordenreeks.
Frame 2 toont het volledige Results-paneel vanaf de kop tot en met alle vijf gegenereerde antwoorden, zonder dat de laatste kaart wordt afgekapt.

PDF-voorbeeld: een uniek documentfeit verifiëren

Deze vraag richt zich op een gegeven dat uitsluitend in de geüploade demo-pdf voorkomt, waardoor de herkomst eenvoudig te verifiëren is.

End-to-end geverifieerd

Exacte testinvoer

What is the unique verification code in the uploaded tutorial PDF?

Verwacht resultaat

Elk antwoord bevat de exacte waarde NORDSTERN-42.

Wat er daadwerkelijk is geverifieerd

De werkelijke Knowledge Test beantwoordde 5 van de 5 varianten correct (100%); elk gegenereerd antwoord bevatte NORDSTERN-42.

Het complete resultaatgebied toont de pdf-vraag, de score van 5/5 en de antwoorden met NORDSTERN-42 overzichtelijk bij elkaar.

Praktijktips

Tips voor betere antwoorden uit je kennisbank

Een krachtiger model kan ontbrekende of tegenstrijdige broncontent niet compenseren. Verbeter eerst de kennisbank en kies daarna het model dat aansluit bij je eisen voor kwaliteit, snelheid, berichtentegoed en gegevenslocatie.

Begin met een snel model

Gebruik voor de eerste tests een model dat als snel of snelst is aangemerkt. Stap pas over op een slimmer model wanneer een vaste vragenset een duidelijke verbetering in redenering of formulering laat zien. De factor in de modelkiezer geeft aan hoe zwaar een keuze meetelt voor je berichtentegoed.

Houd rekening met de locatie van gegevensverwerking

Als de locatie van gegevensverwerking belangrijk is, kies dan een optie met de aanduiding EU in de modelkiezer. Weeg gegevenslocatie, antwoordkwaliteit, responstijd en verbruik samen af, in plaats van puur op modelnaam te selecteren.

Behandel één onderwerp per alinea of sectie

Gebruik duidelijke tussenkopjes, korte alinea's en expliciete feiten. Houd productregels, prijsvoorwaarden of processtappen bij hun context, zodat het opgehaalde tekstfragment de vraag direct kan beantwoorden zonder afhankelijk te zijn van een verderop gelegen alinea.

Bereid documenten voor op tekstextractie

Kies waar mogelijk voor selecteerbare tekst, duidelijke kopstructuren en eenvoudige tabellen. Pas OCR toe op gescande pdf's, licht afkortingen eenmalig toe en vermijd cruciale informatie die alleen in afbeeldingen staat.

Verwijder dubbele en tegenstrijdige informatie

Indexeer geen printversies, tag-archieven, vertaalde duplicaten of meerdere verouderde beleidsdocumenten tegelijk. Tegenstrijdige versies maken het ophalen van de juiste gegevens onvoorspelbaar, zelfs als elke afzonderlijke bron succesvol is geïndexeerd.

Bouw een vaste evaluatieset op

Verzamel 10 tot 20 echte klantvragen met de bijbehorende feiten uit de bronnen. Voer dezelfde testset opnieuw uit na wijzigingen in content, crawlinstellingen, prompts of modellen, zodat verbeteringen objectief meetbaar zijn.

Problemen oplossen

Probleemoplossing en best practices

De meeste trainingsproblemen ontstaan door de kwaliteit van de bron of het crawlbereik, niet door het taalmodel zelf.

De website blijft hangen of mislukt

Controleer of de URL openbaar is, laadt zonder login, crawlen toestaat en niet wordt geblokkeerd door een te restrictieve CSS-selector.

Er worden te veel irrelevante pagina's geïndexeerd

Beperk de crawldiepte en sluit zoek-, account-, winkelwagen-, tag-, juridische en geparametriseerde URL's uit.

De bot mist een feit uit de pdf

Controleer of de documentstatus voltooid is en of het feit duidelijk terugkomt in de selecteerbare tekst of OCR-uitvoer.

Antwoorden raken verouderd

Stel een passend herindexeringsinterval in voor pagina's die regelmatig veranderen en verwijder of vervang verouderde documenten tijdig.

Je chatbot antwoordt nu op basis van jouw content

Ga verder met je eigen webpagina's en documenten en test vervolgens de vragen die je klanten daadwerkelijk stellen. Houd de kennisbank gericht, actueel en vrij van tegenstrijdige versies.

Verder lezen