Een AI-chatbot trainen op je website en pdf's
Een praktische handleiding voor beginners om je website te crawlen, een pdf te uploaden en te controleren of je chatbot antwoordt op basis van beide bronnen.

Om een AI-chatbot betrouwbaar te trainen op je website, heb je een zuiver crawlbereik, nuttige documenten en herhaalbare testvragen nodig die aantonen dat informatie correct wordt opgehaald.
Een chatbot kan alleen betrouwbare, bedrijfsspecifieke antwoorden geven als hij de juiste broncontent kan vinden. In WebChatAgent betekent “training” het uitlezen en indexeren van je website en documenten. Het onderliggende AI-model wordt niet opnieuw getraind of gefinetuned.
Deze handleiding begint met een volledig leeg account. Je maakt een chatbot aan, crawlt één webpagina, uploadt een kleine pdf en test vervolgens één antwoord uit elke bron.
Privacyvriendelijke speler met tweestapsactivering
Een AI-chatbot trainen op je website + pdf's
Train stap voor stap een AI-chatbot op je website en pdf's. Leer alles over crawlen, documenten indexeren, bronnen opschonen en gefundeerde antwoorden testen.
De YouTube-speler blijft geblokkeerd totdat u op Afspelen klikt. Door het laden maakt uw browser verbinding met YouTube en kunnen technische gegevens naar Google worden verzonden.
Rechtstreeks openen op YouTubeWat u aan het einde heeft bereikt
- Een nieuwe chatbot met een schone kennisbank
- Eén succesvol geïndexeerde websitebron
- Eén succesvol geïndexeerd pdf-document
- Twee geverifieerde antwoorden gebaseerd op je eigen content
Voordat u begint
- Een WebChatAgent-account met toestemming om een chatbot aan te maken
- Een openbare webpagina die je mag indexeren
- De downloadbare demo-pdf uit deze handleiding of je eigen ondersteunde document
Wat “training” hier betekent
De technische term is Retrieval-Augmented Generation (RAG): WebChatAgent leest de content, verdeelt deze in nuttige fragmenten en zoekt de fragmenten die het beste aansluiten bij een vraag. Die fragmenten worden als bewijsmateriaal aan het AI-model aangeboden.
Deze brongebaseerde aanpak zorgt ervoor dat je kennis actueel en eenvoudig te vervangen blijft. Als een pagina verandert, kun je deze opnieuw inlezen zonder een nieuw model te trainen. De kwaliteit hangt daarom af van zuivere broncontent, een doordacht crawlbereik en realistische tests.
01–09
Train je chatbot stap voor stap
Begin vanuit het lege dashboard
Maak je eerste assistent aan in het schone account.
Na het inloggen toont het dashboard dat er nog geen AI-assistenten bestaan. Klik op de primaire knop om direct met een schone chatbot te beginnen, in plaats van een assistent te hergebruiken die al bronnen bevat.
Tutorial Lab aanmaken
Geef de nieuwe assistent een duidelijke naam en behoud de veilige standaardinstellingen.
Voer “Tutorial Lab” in als naam. De standaard interne provider volstaat voor deze handleiding; je hoeft dus geen eigen API-sleutel toe te voegen.
Maak de chatbot aan. WebChatAgent opent het configuratiedashboard zodra de assistent is opgeslagen.
Open Data Sources
Ga naar het onderdeel waarin de kennisbank van de chatbot wordt beheerd.
Selecteer “Data Sources” in de navigatie van de chatbot. Een nieuwe chatbot toont een lege status, omdat er nog geen website, document of gekoppelde werkruimte is geïndexeerd.
Kies “Add Data Source” om het bronselectiemenu te openen.
Kies Website als eerste bron
Open de crawlerinstellingen voor een openbare webpagina.
Het keuzemenu toont websites, documenten, tekstinvoer en gekoppelde kennistools. Selecteer “Website”.
Gebruik een websitebron wanneer de informatie al op openbare, crawlrelevante pagina's staat en de pagina-URL als referentie behouden moet blijven.
Voer de URL in en beperk de crawldiepte
Indexeer eerst één gecontroleerde pagina voordat je een complete website toevoegt.
Voer https://webchatagent.com/train-chatbot-on-your-data in het URL-veld in en stel de crawldiepte in op 0. Een diepte van 0 indexeert alleen deze pagina, waardoor de tutorial snel en voorspelbaar blijft.
Laat automatische herindexering uitstaan voor deze eenmalige test. Voor live content kan Premium een bron dagelijks vernieuwen. Met geavanceerde instellingen kun je een specifiek CSS-contentgebied opgeven of URL-patronen uitsluiten, zoals login-, winkelwagen- of juridische pagina's.
Selecteer “Add & Index” om het extraheren en indexeren te starten.
- Diepte 0: alleen de ingevoerde pagina
- Lege diepte: volg alle bereikbare subpagina's
- CSS-selector: behoud alleen het relevante contentgebied
- Uitsluitingspatronen: voorkom irrelevante of dubbele URL's
Indexeer alleen content die je in eigendom hebt
Controleer voordat je een externe website crawlt of je de content mag verwerken en gebruiken.
Wacht tot de website is geïndexeerd
Controleer of de bron gereed is voordat je antwoorden gaat testen.
De nieuwe bron kan kort een status van 'in behandeling' of 'verwerken' tonen. Wacht tot deze verandert in “Indexed” of “Completed”. Het aantal geïndexeerde pagina's en de geëxtraheerde content bevestigen dat de crawler succesvol is afgerond.
Als de bron mislukt, open dan eerst de details ervan. Controleer de URL, de toegankelijkheid van robots.txt, de crawldiepte en eventuele te strikte CSS-selectors voordat je het opnieuw probeert.
Upload de demo-pdf
Voeg een tweede bron toe met een uniek feit dat eenvoudig te verifiëren is.
Selecteer opnieuw “Add Data Source”, kies “Documents” en upload de hierboven gelinkte demo-kennisbank-pdf. Het bestand bevat de unieke ondersteuningscode NORDSTERN-42, die niet op de website voorkomt.
Laat AI-optimalisatie uitstaan voor dit beknopte, al goed gestructureerde document. Deze functie is handig voor slecht opgemaakt bronmateriaal, maar niet noodzakelijk voor zuivere tekst.
Controleer beide kennisbronnen
Zorg dat de website en de pdf beide de status 'gereed' hebben.
In de lijst met Data Sources moeten nu zowel de website-URL als de pdf met een succesvolle status worden weergegeven. Dit controlepunt voorkomt dat je onvolledige indexeringen aanziet voor onjuist modelgedrag.
Open een bron wanneer je geëxtraheerde content wilt inzien, de categorie wilt wijzigen, een herindexering wilt starten of verouderde kennis wilt verwijderen.
Verifieer het pdf-antwoord in de livechat
Controleer het unieke feit uit de pdf in dezelfde chatomgeving die bezoekers te zien krijgen.
Open het live chat-voorbeeldvenster en vraag: “What is the verification code in the uploaded tutorial PDF? Answer in one sentence and name the source.” De schermafbeelding toont de exacte vraag en het daadwerkelijke antwoord vanuit het tijdelijke tutorial-account.
Het antwoord moet NORDSTERN-42 bevatten en verwijzen naar de demo-kennisbank van Northstar Services. De volledige Knowledge Test-resultaten voor de website en de pdf worden direct onder deze stap getoond, zodat beide geïndexeerde bronnen met vaste vragen zijn geverifieerd.
- Stel vragen waarvan de antwoorden expliciet in de brontekst staan.
- Gebruik unieke namen, codes of getallen om het ophalen van informatie te valideren.
- Als een antwoord niet scherp genoeg is, verbeter dan eerst de brontekst voordat je de prompt uitbreidt.
Een geslaagde test is gebaseerd op aantoonbare feiten
Het doel is niet louter een vloeiend klinkend antwoord. Controleer of de formulering wordt onderbouwd door de geïndexeerde bron en of unieke gegevens exact worden overgenomen.
Voorbeeld en resultaat
Test beide geïndexeerde bronnen met vaste vragen
Dit zijn de exacte vragen die zijn gebruikt in het tijdelijke tutorial-account. Elk resultaat toont het complete Knowledge Test-overzicht; wanneer één weergave niet past, laten opeenvolgende frames de score en elk afzonderlijk antwoord zonder afkappingen zien.
Website-voorbeeld: ondersteunde databronnen verifiëren
Deze vraag is uitgevoerd op de geïndexeerde webpagina WebChatAgent met crawldiepte 0.
Exacte testinvoer
Can I train a WebChatAgent chatbot with both website pages and PDF documents?
Verwacht resultaat
Het antwoord bevestigt dat zowel webpagina's als pdf-documenten als kennisbron kunnen worden gebruikt.
Wat er daadwerkelijk is geverifieerd
De werkelijke Knowledge Test beantwoordde 5 van de 5 varianten correct (100%) en baseerde het resultaat op de geïndexeerde websitecontent.
PDF-voorbeeld: een uniek documentfeit verifiëren
Deze vraag richt zich op een gegeven dat uitsluitend in de geüploade demo-pdf voorkomt, waardoor de herkomst eenvoudig te verifiëren is.
Exacte testinvoer
What is the unique verification code in the uploaded tutorial PDF?
Verwacht resultaat
Elk antwoord bevat de exacte waarde NORDSTERN-42.
Wat er daadwerkelijk is geverifieerd
De werkelijke Knowledge Test beantwoordde 5 van de 5 varianten correct (100%); elk gegenereerd antwoord bevatte NORDSTERN-42.
Praktijktips
Tips voor betere antwoorden uit je kennisbank
Een krachtiger model kan ontbrekende of tegenstrijdige broncontent niet compenseren. Verbeter eerst de kennisbank en kies daarna het model dat aansluit bij je eisen voor kwaliteit, snelheid, berichtentegoed en gegevenslocatie.
Begin met een snel model
Gebruik voor de eerste tests een model dat als snel of snelst is aangemerkt. Stap pas over op een slimmer model wanneer een vaste vragenset een duidelijke verbetering in redenering of formulering laat zien. De factor in de modelkiezer geeft aan hoe zwaar een keuze meetelt voor je berichtentegoed.
Houd rekening met de locatie van gegevensverwerking
Als de locatie van gegevensverwerking belangrijk is, kies dan een optie met de aanduiding EU in de modelkiezer. Weeg gegevenslocatie, antwoordkwaliteit, responstijd en verbruik samen af, in plaats van puur op modelnaam te selecteren.
Behandel één onderwerp per alinea of sectie
Gebruik duidelijke tussenkopjes, korte alinea's en expliciete feiten. Houd productregels, prijsvoorwaarden of processtappen bij hun context, zodat het opgehaalde tekstfragment de vraag direct kan beantwoorden zonder afhankelijk te zijn van een verderop gelegen alinea.
Bereid documenten voor op tekstextractie
Kies waar mogelijk voor selecteerbare tekst, duidelijke kopstructuren en eenvoudige tabellen. Pas OCR toe op gescande pdf's, licht afkortingen eenmalig toe en vermijd cruciale informatie die alleen in afbeeldingen staat.
Verwijder dubbele en tegenstrijdige informatie
Indexeer geen printversies, tag-archieven, vertaalde duplicaten of meerdere verouderde beleidsdocumenten tegelijk. Tegenstrijdige versies maken het ophalen van de juiste gegevens onvoorspelbaar, zelfs als elke afzonderlijke bron succesvol is geïndexeerd.
Bouw een vaste evaluatieset op
Verzamel 10 tot 20 echte klantvragen met de bijbehorende feiten uit de bronnen. Voer dezelfde testset opnieuw uit na wijzigingen in content, crawlinstellingen, prompts of modellen, zodat verbeteringen objectief meetbaar zijn.
Problemen oplossen
Probleemoplossing en best practices
De meeste trainingsproblemen ontstaan door de kwaliteit van de bron of het crawlbereik, niet door het taalmodel zelf.
De website blijft hangen of mislukt
Controleer of de URL openbaar is, laadt zonder login, crawlen toestaat en niet wordt geblokkeerd door een te restrictieve CSS-selector.
Er worden te veel irrelevante pagina's geïndexeerd
Beperk de crawldiepte en sluit zoek-, account-, winkelwagen-, tag-, juridische en geparametriseerde URL's uit.
De bot mist een feit uit de pdf
Controleer of de documentstatus voltooid is en of het feit duidelijk terugkomt in de selecteerbare tekst of OCR-uitvoer.
Antwoorden raken verouderd
Stel een passend herindexeringsinterval in voor pagina's die regelmatig veranderen en verwijder of vervang verouderde documenten tijdig.
Je chatbot antwoordt nu op basis van jouw content
Ga verder met je eigen webpagina's en documenten en test vervolgens de vragen die je klanten daadwerkelijk stellen. Houd de kennisbank gericht, actueel en vrij van tegenstrijdige versies.
