Come addestrare un chatbot AI sul tuo sito web e sui PDF
Una guida pratica per principianti per eseguire la scansione del sito web, caricare un PDF e verificare che il chatbot risponda da entrambe le fonti.

Per addestrare in modo affidabile un chatbot AI sul tuo sito web, hai bisogno di un ambito di scansione pulito, documenti utili e domande ripetibili che certifichino il recupero delle informazioni.
Un chatbot può fornire risposte aziendali affidabili solo se riesce a trovare i contenuti di origine corretti. In WebChatAgent, “training” significa leggere e indicizzare il tuo sito web e i tuoi documenti. Non comporta il riaddestramento o il fine-tuning del modello AI sottostante.
Questa guida parte da un account completamente vuoto. Creerai un chatbot, eseguirai la scansione di una pagina web, caricherai un piccolo file PDF e verificherai una risposta per ciascuna fonte.
Player a due clic conforme alla privacy
Come addestrare un chatbot AI sul tuo sito web e sui PDF
Addestra un chatbot AI su sito web e PDF passo dopo passo: scansione, indicizzazione dei documenti, pulizia fonti e test con risposte verificate.
Il player di YouTube rimane bloccato finché non selezioni Riproduci. Il caricamento connette il browser a YouTube e potrebbe trasferire dati tecnici a Google.
Apri direttamente su YouTubeCosa otterrai alla fine
- Un nuovo chatbot con una knowledge base pulita
- Una fonte del sito web indicizzata correttamente
- Un documento PDF indicizzato con successo
- Due risposte verificate e basate sui tuoi contenuti
Prima di iniziare
- Un account WebChatAgent con i permessi per creare un chatbot
- Una pagina web pubblica che hai il permesso di indicizzare
- Il PDF demo scaricabile da questo tutorial o un tuo documento supportato
Cosa significa “training” in questo contesto
Il termine tecnico è Retrieval-Augmented Generation (RAG): WebChatAgent legge i contenuti, li suddivide in passaggi utili e individua quelli più pertinenti alla domanda. Questi passaggi vengono poi forniti al modello AI come fonti documentali.
Questo approccio basato sulle fonti mantiene la tua conoscenza aggiornabile e modulare. Se una pagina cambia, puoi rileggerla senza dover addestrare un nuovo modello. La qualità dipende quindi dalla pulizia dei contenuti di origine, da un ambito di scansione ragionato e da test realistici.
01–09
Addestra il tuo chatbot passo dopo passo
Inizia dalla dashboard vuota
Crea il tuo primo assistente da un account pulito.
Dopo aver effettuato l'accesso, la dashboard mostrerà che non è ancora presente alcun assistente AI. Seleziona il pulsante principale di creazione per partire con un chatbot pulito anziché riutilizzare un assistente che contiene già altre fonti.
Crea Tutorial Lab
Assegna al nuovo assistente un nome chiaro e mantieni le impostazioni predefinite sicure.
Inserisci “Tutorial Lab” come nome. Il provider interno predefinito è sufficiente per questa guida, quindi non è necessario aggiungere una chiave API personale.
Crea il chatbot. WebChatAgent aprirà la dashboard di configurazione non appena l'assistente sarà stato salvato.
Apri Data Sources
Passa alla sezione che gestisce la knowledge base del chatbot.
Seleziona “Data Sources” nel menu di navigazione del chatbot. Un nuovo chatbot mostra uno stato vuoto perché non è stato ancora indicizzato alcun sito web, documento o workspace collegato.
Seleziona “Add Data Source” per aprire il selettore delle fonti.
Scegli Website come prima fonte
Apri le impostazioni del crawler per una pagina web pubblica.
Il selettore propone siti web, documenti, inserimento di testo e strumenti di conoscenza collegati. Seleziona “Website”.
Usa una fonte di tipo sito web quando le informazioni si trovano già su pagine pubbliche e scansionabili e devono conservare l'URL della pagina come riferimento.
Inserisci l'URL e limita la profondità di scansione
Indicizza una sola pagina controllata prima di estendere la scansione a un intero sito.
Inserisci https://webchatagent.com/train-chatbot-on-your-data nel campo URL e imposta la profondità di scansione su 0. Una profondità pari a 0 indicizza solo questa pagina, mantenendo il tutorial veloce e prevedibile.
Lascia disattivata la reindicizzazione automatica per questo singolo test. Per i contenuti in produzione, il piano Premium consente di aggiornare una fonte quotidianamente. Nelle impostazioni avanzate è possibile specificare un'area di contenuto CSS specifica o escludere pattern di URL come pagine di login, carrello o note legali.
Seleziona “Add & Index” per avviare l'estrazione e l'indicizzazione.
- Profondità 0: solo la pagina inserita
- Profondità vuota: segue tutte le sottopagine raggiungibili
- Selettore CSS: isola solo il contenitore con i contenuti rilevanti
- Pattern di esclusione: previene l'indicizzazione di URL irrilevanti o duplicati
Indicizza solo contenuti di tua proprietà
Prima di scansionare un sito web, verifica di disporre dei diritti necessari per elaborare e utilizzare i relativi contenuti.
Attendi l'indicizzazione del sito web
Verifica che la fonte sia pronta prima di testare le risposte.
La nuova fonte potrebbe mostrare brevemente uno stato di attesa o di elaborazione. Attendi che passi a “Indexed” o “Completed”. Il conteggio delle pagine indicizzate e dei contenuti estratti confermerà che il crawler ha terminato correttamente.
Se l'indicizzazione fallisce, apri prima i dettagli della fonte. Verifica l'URL, l'accessibilità da parte di robots.txt, la profondità di scansione e la presenza di eventuali selettori CSS troppo restrittivi prima di riprovare.
Carica il PDF demo
Aggiungi una seconda fonte contenente un dato univoco facile da verificare.
Seleziona nuovamente “Add Data Source”, scegli “Documents” e carica il file PDF demo della knowledge base linkato sopra. Il file contiene il codice di supporto univoco NORDSTERN-42, non presente sul sito web.
Mantieni disattivata l'ottimizzazione AI per questo documento piccolo e già strutturato. L'opzione è utile per materiali di origine formattati male, ma non è necessaria per testi puliti.
Verifica entrambe le fonti di conoscenza
Assicurati che sia il sito web sia il PDF siano pronti contemporaneamente.
L'elenco in Data Sources dovrebbe ora mostrare sia l'URL del sito web sia il PDF con stato completato. Questo controllo evita di confondere un comportamento imprevisto del modello con un processo di indicizzazione non ancora terminato.
Apri una fonte ogni volta che devi controllare i contenuti estratti, modificarne la categoria, avviare una nuova indicizzazione o rimuovere informazioni obsolete.
Verifica la risposta sul PDF nella chat dal vivo
Verifica il dato univoco del PDF nella stessa chat che useranno i visitatori.
Apri l'anteprima live del chatbot e chiedi: “What is the verification code in the uploaded tutorial PDF? Answer in one sentence and name the source.” Lo screenshot mostra la domanda esatta e la risposta reale generata dall'account temporaneo del tutorial.
La risposta deve contenere NORDSTERN-42 e identificare la knowledge base demo di Northstar Services. I risultati completi dei Knowledge Test per il sito web e per il PDF sono riportati subito sotto questo passaggio, così da verificare entrambe le fonti con domande fisse.
- Poni domande le cui risposte siano esplicitamente presenti nella fonte.
- Includi nomi, codici o numeri univoci durante la validazione del recupero delle informazioni.
- Se una risposta risulta debole, ottimizza il testo di origine prima di allungare il prompt.
Un test efficace si basa sulle fonti
L'obiettivo non è solo ottenere una risposta fluida. Controlla che il testo sia supportato dalla fonte indicizzata e che i dati univoci vengano riportati fedelmente.
Esempio e risultato
Testa entrambe le fonti indicizzate con domande fisse
Queste sono le domande esatte utilizzate nell'account temporaneo del tutorial. Ogni risultato include integralmente l'area del Knowledge Test; quando una singola visuale non basta, riquadri sovrapposti mostrano il punteggio e tutte le risposte senza tagli.
Esempio sito web: verifica le fonti dati supportate
Questa domanda è stata eseguita a fronte della pagina web WebChatAgent indicizzata con profondità di scansione pari a 0.
Input esatto del test
Can I train a WebChatAgent chatbot with both website pages and PDF documents?
Risultato previsto
La risposta conferma che sia le pagine dei siti web sia i documenti PDF possono essere utilizzati come fonti di conoscenza.
Cosa è stato effettivamente verificato
Il Knowledge Test reale ha risposto a 5 varianti su 5 (100%), basando il risultato sui contenuti indicizzati del sito web.
Esempio PDF: verifica un dato univoco del documento
Questa domanda punta a un dato presente esclusivamente nel PDF demo caricato, rendendo la fonte facilmente verificabile.
Input esatto del test
What is the unique verification code in the uploaded tutorial PDF?
Risultato previsto
Ogni risposta contiene il valore esatto NORDSTERN-42.
Cosa è stato effettivamente verificato
Il Knowledge Test reale ha risposto a 5 varianti su 5 (100%); ogni risposta generata conteneva NORDSTERN-42.
Consigli avanzati
Suggerimenti per ottenere risposte migliori dalla tua knowledge base
Un modello più avanzato non può compensare contenuti di origine mancanti o contraddittori. Ottimizza prima la knowledge base, poi scegli il modello più adatto ai tuoi requisiti di qualità, velocità, quota e residenza dei dati.
Inizia con un modello rapido
Usa un modello contrassegnato come veloce o velocissimo per i primi test di recupero. Passa a un modello smart solo quando un set di domande fisse mostra un reale miglioramento nel ragionamento o nella formulazione. Il moltiplicatore nel selettore del modello indica l'impatto sul consumo della quota messaggi.
Valuta la residenza dei dati nella scelta del modello
Se la sede di elaborazione è rilevante, scegli un'opzione contrassegnata con EU nel selettore dei modelli. Valuta contestualmente residenza, qualità delle risposte, latenza e consumo della quota invece di scegliere basandoti unicamente sul nome del modello.
Scrivi un solo argomento per sezione
Usa intestazioni descrittive, paragrafi brevi e dati espliciti. Mantieni le condizioni di un prodotto, i prezzi o le procedure insieme al rispettivo contesto, in modo che il passaggio estratto possa rispondere alla domanda senza dover ricorrere a sezioni distanti.
Prepara i documenti per l'estrazione
Prediligi testi selezionabili, gerarchie chiare di intestazioni e tabelle semplici. Esegui l'OCR sui PDF scansionati, spiega le sigle alla prima occorrenza ed evita di inserire informazioni importanti solo all'interno di immagini decorative.
Rimuovi duplicati e conflitti
Non indicizzare contemporaneamente versioni stampabili, archivi di tag, duplicati tradotti o più file di policy obsoleti. Le versioni in conflitto rendono il recupero delle informazioni meno prevedibile, anche se ogni singola fonte è stata indicizzata correttamente.
Crea un set di valutazione ripetibile
Raccogli da 10 a 20 domande reali dei clienti indicando i dati di origine previsti. Esegui nuovamente lo stesso set dopo aver modificato contenuti, impostazioni di scansione, prompt o modelli, così da misurare i miglioramenti in modo oggettivo.
Risoluzione dei problemi
Risoluzione dei problemi e buone pratiche
La maggior parte dei problemi di addestramento dipende dalla qualità delle fonti o dall'ambito di scansione, non dal modello linguistico in sé.
Il sito web rimane in attesa o fallisce
Verifica che l'URL sia pubblico, accessibile senza autenticazione, consenta la scansione e non sia bloccato da un selettore CSS eccessivamente restrittivo.
Vengono indicizzate troppe pagine irrilevanti
Riduci la profondità di scansione ed escludi URL relativi a ricerca, account, carrello, tag, note legali e parametri di tracciamento.
Il bot ignora un dato del PDF
Verifica che lo stato del documento sia completato e che il testo selezionabile o l'output OCR contenga chiaramente l'informazione cercata.
Le risposte diventano obsolete
Attiva un intervallo di reindicizzazione appropriato per le pagine che cambiano spesso e rimuovi o sostituisci tempestivamente i documenti superati.
Il tuo chatbot ora risponde dai tuoi contenuti
Prosegui aggiungendo le pagine e i documenti reali del tuo sito, quindi esegui i test con le domande poste effettivamente dai tuoi clienti. Mantieni la knowledge base focalizzata, aggiornata e priva di versioni contrastanti.
