Comment entraîner un chatbot IA sur votre site web et vos PDF
Un guide pratique pour débutants afin d'explorer votre site web, d'importer un PDF et de vérifier que votre chatbot répond à partir de ces deux sources.

Pour entraîner de manière fiable un chatbot IA sur votre site web, vous avez besoin d'un périmètre d'exploration propre, de documents utiles et de questions répétables démontrant la bonne récupération des données.
Un chatbot ne peut fournir des réponses fiables propres à votre entreprise que s'il parvient à trouver le bon contenu source. Dans WebChatAgent, “training” signifie lire et indexer votre site web ainsi que vos documents. Cela ne réentraîne ni n'affine (fine-tuning) le modèle d'IA sous-jacent.
Ce guide démarre à partir d'un compte totalement vide. Vous allez créer un chatbot, explorer une page web, importer un petit fichier PDF, puis tester une réponse issue de chaque source.
Lecteur vidéo respectueux de la vie privée (en deux clics)
Comment entraîner un chatbot IA sur votre site web et vos PDF
Entraînez un chatbot IA sur votre site et vos PDF pas à pas : exploration, indexation, nettoyage des sources et validation des réponses.
Le lecteur YouTube reste bloqué jusqu'à ce que vous cliquiez sur Lecture. Son chargement connecte votre navigateur à YouTube et peut transmettre des données techniques à Google.
Ouvrir directement sur YouTubeCe que vous maîtriserez à la fin
- Un nouveau chatbot avec une base de connaissances propre
- Une source de site web indexée avec succès
- Un document PDF indexé avec succès
- Deux réponses vérifiées et appuyées sur votre propre contenu
Avant de commencer
- Un compte WebChatAgent avec les droits pour créer un chatbot
- Une page web publique que vous êtes autorisé à indexer
- Le PDF de démonstration téléchargeable de ce tutoriel ou votre propre document pris en charge
Ce que signifie “training” ici
Le terme technique est la génération augmentée par récupération (RAG, Retrieval-Augmented Generation) : WebChatAgent lit le contenu, le découpe en passages pertinents et trouve ceux qui correspondent le mieux à une question. Ces passages sont ensuite fournis au modèle d'IA sous forme de preuves.
Cette approche basée sur les sources garde vos connaissances facilement modifiables et à jour. Si une page change, vous pouvez la relire sans avoir à entraîner un nouveau modèle. La qualité dépend donc de la clarté du contenu source, d'un périmètre d'exploration cohérent et de tests réalistes.
01–09
Entraînez votre chatbot étape par étape
Partir du tableau de bord vide
Créez votre premier assistant depuis un compte propre.
Après connexion, le tableau de bord indique qu'aucun assistant IA n'existe encore. Cliquez sur le bouton principal de création pour démarrer avec un chatbot vierge plutôt que de réutiliser un assistant contenant déjà des sources.
Créer Tutorial Lab
Donnez un nom clair au nouvel assistant et conservez les valeurs par défaut sécurisées.
Saisissez “Tutorial Lab” comme nom. Le fournisseur interne par défaut est suffisant pour ce guide, vous n'avez donc pas besoin d'ajouter de clé API personnelle.
Créez le chatbot. WebChatAgent ouvre son tableau de bord de configuration une fois l'assistant enregistré.
Ouvrir Data Sources
Accédez à l'espace de gestion de la base de connaissances du chatbot.
Sélectionnez “Data Sources” dans la navigation du chatbot. Un nouveau chatbot affiche un état vide car aucun site web, document ou espace de travail connecté n'a encore été indexé.
Choisissez “Add Data Source” pour ouvrir le sélecteur de sources.
Choisir Website comme première source
Ouvrez les paramètres d'exploration pour une page web publique.
Le sélecteur propose des sites web, des documents, de la saisie de texte libre et des outils de connaissances connectés. Sélectionnez “Website”.
Utilisez une source de type site web lorsque les informations se trouvent déjà sur des pages publiques explorables et doivent conserver leur URL d'origine comme référence.
Saisir l'URL et limiter la profondeur d'exploration
Indexez une page contrôlée avant d'étendre à l'ensemble d'un site.
Saisissez https://webchatagent.com/train-chatbot-on-your-data dans le champ URL et réglez la profondeur d'exploration (crawling depth) sur 0. Une profondeur de 0 n'indexe que cette page, ce qui rend le tutoriel rapide et prévisible.
Laissez la réindexation automatique désactivée pour ce test ponctuel. En production, Premium peut actualiser une source quotidiennement. Les paramètres avancés permettent de cibler une zone de contenu via un sélecteur CSS ou d'exclure certains formats d'URL (pages de connexion, panier ou mentions légales).
Sélectionnez “Add & Index” pour lancer l'extraction et l'indexation.
- Profondeur 0 : uniquement la page saisie
- Profondeur vide : suit toutes les sous-pages accessibles
- Sélecteur CSS : ne conserve que le conteneur de contenu utile
- Motifs d'exclusion : évite les URL non pertinentes ou en double
N'indexez que les contenus qui vous appartiennent
Avant d'explorer un site web tiers, assurez-vous d'avoir l'autorisation de traiter et d'utiliser son contenu.
Attendre l'indexation du site web
Vérifiez que la source est prête avant de tester les réponses.
La nouvelle source peut brièvement afficher un état en attente ou en cours de traitement. Attendez qu'elle passe à “Indexed” ou “Completed”. Le nombre de pages indexées et d'éléments de contenu extraits confirme que l'explorateur a terminé avec succès.
Si la source échoue, ouvrez d'abord ses détails. Vérifiez l'URL, l'accessibilité de robots.txt, la profondeur d'exploration et l'absence de sélecteur CSS trop restrictif avant de réessayer.
Importer le PDF de démonstration
Ajoutez une seconde source contenant un fait unique facile à vérifier.
Sélectionnez à nouveau “Add Data Source”, choisissez “Documents” et importez le PDF de démonstration lié ci-dessus. Ce fichier contient le code d'assistance unique NORDSTERN-42, qui ne figure pas sur le site web.
Laissez l'optimisation par IA désactivée pour ce petit document déjà bien structuré. Elle est utile pour des documents sources mal mis en forme, mais superflue pour un texte propre.
Vérifier les deux sources de connaissances
Assurez-vous que le site web et le PDF sont tous deux prêts.
La liste Data Sources doit désormais afficher à la fois l'URL du site web et le PDF avec des statuts de succès. Ce point de contrôle évite de confondre le comportement du modèle avec un travail d'indexation inachevé.
Ouvrez une source si vous devez inspecter le contenu extrait, modifier sa catégorie, lancer une nouvelle indexation ou supprimer des connaissances obsolètes.
Vérifier la réponse du PDF dans le chat en direct
Confirmez le fait unique du PDF dans le même chat que celui utilisé par vos visiteurs.
Ouvrez l'aperçu du chat en direct et demandez : “What is the verification code in the uploaded tutorial PDF? Answer in one sentence and name the source.” La capture d'écran montre la question exacte et la réponse réelle obtenue depuis le compte temporaire du tutoriel.
La réponse doit inclure NORDSTERN-42 et identifier la base de connaissances de démonstration Northstar Services. Les résultats complets du Knowledge Test pour le site web et le PDF sont présentés juste après cette étape, validant ainsi les deux sources indexées à l'aide de questions prédéfinies.
- Posez des questions dont les réponses figurent explicitement dans la source.
- Incluez des noms uniques, des codes ou des chiffres pour valider l'extraction.
- Si une réponse est imprécise, améliorez le texte source avant de complexifier le prompt.
Un test réussi repose sur des preuves concrètes
L'objectif n'est pas simplement d'obtenir une réponse fluide. Vérifiez que la formulation s'appuie bien sur la source indexée et que les éléments factuels uniques sont restitués sans erreur.
Exemple et résultat
Tester les deux sources indexées avec des questions fixes
Voici les questions exactes utilisées sur le compte temporaire du tutoriel. Chaque résultat conserve l'intégralité de la zone Knowledge Test ; lorsqu'une vue ne suffit pas, des captures successives présentent le score et chaque réponse sans coupure.
Exemple site web : vérifier les sources de données prises en charge
Cette question a été exécutée sur la page web WebChatAgent indexée avec une profondeur d'exploration de 0.
Données de test exactes
Can I train a WebChatAgent chatbot with both website pages and PDF documents?
Résultat attendu
La réponse confirme que les pages de sites web et les documents PDF peuvent tous deux servir de sources de connaissances.
Ce qui a été réellement vérifié
Le Knowledge Test réel a répondu à 5 variantes sur 5 (100%) en appuyant le résultat sur le contenu indexé du site web.
Exemple PDF : vérifier un fait unique issu d'un document
Cette question cible un fait figurant uniquement dans le PDF de démonstration importé, ce qui rend la source simple à vérifier.
Données de test exactes
What is the unique verification code in the uploaded tutorial PDF?
Résultat attendu
Chaque réponse contient la valeur exacte NORDSTERN-42.
Ce qui a été réellement vérifié
Le Knowledge Test réel a répondu à 5 variantes sur 5 (100%) ; chaque réponse générée contenait NORDSTERN-42.
Conseils d'experts
Conseils pour obtenir de meilleures réponses depuis votre base de connaissances
Un modèle plus puissant ne peut pas compenser un contenu source manquant ou contradictoire. Améliorez d'abord la base de connaissances, puis sélectionnez le modèle qui répond à vos exigences de qualité, de rapidité, de quota et d'hébergement des données.
Commencer avec un modèle rapide
Utilisez un modèle indiqué comme rapide ou très rapide pour vos premiers tests d'extraction. Ne passez à un modèle plus intelligent que si un ensemble fixe de questions montre un gain réel en matière de raisonnement ou de rédaction. Le multiplicateur présent dans le sélecteur de modèles indique l'impact de votre choix sur votre quota de messages.
Intégrer l'hébergement des données dans le choix du modèle
Si le lieu de traitement des données est un critère, choisissez une option marquée UE dans le sélecteur de modèles. Évaluez ensemble la localisation des données, la qualité des réponses, la latence et l'usage du quota au lieu de vous baser uniquement sur le nom du modèle.
Rédiger un sujet par section
Utilisez des titres explicites, des paragraphes courts et des faits précis. Regroupez une règle produit, une condition tarifaire ou une procédure avec son contexte afin que le passage extrait réponde directement à la question sans dépendre d'une autre section éloignée.
Préparer les documents pour l'extraction
Privilégiez du texte sélectionnable, une hiérarchie de titres claire et des tableaux simples. Appliquez l'OCR sur les PDF scannés, explicitez les abréviations dès leur première mention et évitez de placer des informations clés uniquement dans des images illustratives.
Supprimer les doublons et les contradictions
N'indexez pas simultanément des versions imprimables, des pages d'archives d'étiquettes, des doublons traduits ou plusieurs anciennes versions de règlements. Des versions contradictoires rendent la recherche moins prévisible, même si toutes les sources ont été correctement indexées.
Construire un jeu de test répétable
Rassemblez 10 à 20 vraies questions de clients accompagnées des faits sources attendus. Relancez cette même série après chaque modification de contenu, de paramètre d'exploration, de prompt ou de modèle, afin de mesurer objectivement les améliorations.
Dépannage
Dépannage et bonnes pratiques
La majorité des difficultés d'entraînement proviennent de la qualité des sources ou du périmètre d'exploration, et non du modèle de langage lui-même.
Le site web reste en attente ou échoue
Vérifiez que l'URL est publique, accessible sans authentification, autorise l'exploration et n'est pas bloquée par un sélecteur CSS trop strict.
Trop de pages non pertinentes sont indexées
Réduisez la profondeur d'exploration et excluez les pages de recherche, d'espace client, de panier, d'étiquettes, de mentions légales ou comportant des paramètres d'URL.
Le bot omet un fait présent dans le PDF
Vérifiez que le document est bien à l'état terminé et que le texte sélectionnable ou le résultat OCR contient clairement l'information recherchée.
Les réponses deviennent obsolètes
Définissez une fréquence de réindexation adaptée pour les pages qui évoluent souvent et supprimez ou remplacez rapidement les documents dépassés.
Votre chatbot répond désormais à partir de votre contenu
Poursuivez avec vos vraies pages web et vos documents, puis testez les questions que vos clients posent au quotidien. Veillez à garder une base de connaissances ciblée, à jour et sans versions contradictoires.
