Knowledge base per chatbot RAG: preparare i documenti aziendali
Trasforma pagine sparse e file PDF in un set di fonti circoscritto e controllato, i cui fatti importanti sono facili da recuperare, verificare e aggiornare.

Per preparare una knowledge base affidabile per un chatbot RAG, parti da documenti aziendali approvati ed estraibili, verificando direttamente i passaggi memorizzati e i limiti di risposta.
Un chatbot non legge una knowledge base come un collega che ricorda l'intera cartella. Di solito riceve pochi passaggi estratti. Se un passaggio dice “this applies for 30 days” ma il prodotto, la data di inizio e le eccezioni si trovano altrove, la risposta può risultare incompleta anche se il documento originale sembrava chiaro a una persona.
Questa guida parte prima del caricamento. Sceglierai un'unica fonte approvata per ciascun argomento, riscriverai i fatti chiave in modo che siano autosufficienti, verificherai OCR ed estrazione, e convaliderai il risultato indicizzato con una domanda a risposta nota e una domanda di controllo intenzionalmente priva di risposta. Il PDF dimostrativo Northstar fornisce il fatto univoco NORDSTERN-42, così il risultato non potrà essere confuso con la conoscenza generale del modello.
Non caricare un'intera cartella condivisa solo perché è accessibile. Una raccolta aggiornata più piccola, con responsabili, date di revisione e domande verificabili, è molto più affidabile di un grande archivio con versioni contrastanti.
Player a due clic conforme alla privacy
Best practice per knowledge base RAG: correggi le fonti del tuo chatbot
Prepara la knowledge base per chatbot RAG: rimuovi i duplicati, ottimizza l'estrazione, ispeziona i testi indicizzati e testa ogni risposta.
Il player di YouTube rimane bloccato finché non selezioni Riproduci. Il caricamento connette il browser a YouTube e potrebbe trasferire dati tecnici a Google.
Apri direttamente su YouTubeCosa otterrai alla fine
- Un registro delle fonti con un responsabile incaricato e una data di revisione per argomento
- Pagine e documenti ottimizzati per il recupero con fatti autosufficienti
- File sorgente verificati con OCR, deduplicati e con versioni chiare
- Una fonte WebChatAgent indicizzata con testo memorizzato verificato visivamente
- Un test di rilascio ripetibile su risposte note e informazioni mancanti
Prima di iniziare
- Accesso ai file sorgente approvati e alle pagine pubbliche, non solo a copie esportate
- Un responsabile dei contenuti in grado di risolvere incongruenze e approvare la versione corrente
- Il PDF dimostrativo fittizio scaricabile Northstar o un altro documento di test non riservato
- Da cinque a dieci domande reali degli utenti, inclusa almeno una domanda a cui le fonti non devono rispondere
- Un assistente di test WebChatAgent isolato con interfaccia in inglese e Light Mode
Il recupero funziona per passaggi: il contesto locale è fondamentale
Il termine tecnico è Retrieval-Augmented Generation (RAG): il sistema cerca prima i passaggi pertinenti nel set di fonti collegate. Solo questi passaggi e la domanda arrivano solitamente al modello di risposta. Un passaggio utile deve quindi indicare soggetto, regola, condizioni, eccezioni e data di decorrenza senza dipendere da “the table above” o da sigle non spiegate.
La preparazione prevede tre controlli di qualità distinti. La governance delle fonti stabilisce quale versione fa testo. La qualità dell'estrazione verifica quale testo ha effettivamente ricevuto l'indice. La valutazione delle risposte testa se domande realistiche recuperano le prove corrette e se l'assenza di dati produce un limite sicuro anziché un'invenzione.
01–11
Configura passo dopo passo
Rimuovi contenuti ridondanti, obsoleti e marginali
Elimina le contraddizioni dal set attivo invece di tentare di superarle con il ranking.
Raggruppa i quasi-duplicati per argomento. I duplicati tipici includono un articolo corrente affiancato alla versione stampabile, un vecchio PDF accanto a uno nuovo, URL web con parametri, copie esportate da aree di lavoro e traduzioni che ripetono gli stessi dati. Confronta date di decorrenza e stato di approvazione, poi mantieni nel set del chatbot solo la versione approvata.
Archivia il materiale superato fuori dalla cartella collegata o dall'ambito di scansione. Search Priority può influenzare il ranking in seguito, ma non risolve in sicurezza direttive contraddittorie. Un documento non aggiornato rimane recuperabile anche se il suo peso è inferiore.
Non eliminare l'archivio aziendale
Rimuovi le copie obsolete dal set di fonti attive del chatbot. Conserva i record nell'archivio appropriato nel rispetto delle policy legali e di conservazione dei dati.
Riscrivi i fatti importanti come sezioni autosufficienti
Mantieni soggetto, regola, condizioni e data l'uno vicino all'altro.
Sostituisci intestazioni generiche come “General” o “More information” con la domanda specifica a cui la sezione risponde: “Support hours for Northstar customers” o “Annual-plan cancellation eligibility”. Mantieni un solo tema principale per sezione e usa paragrafi brevi all'interno di una gerarchia di titoli strutturata.
Scrivi frasi esplicite. “It is available for 30 days” diventa “The Northstar onboarding review is available for 30 calendar days after the kickoff date.”. Inserisci le eccezioni e la data di decorrenza nella stessa sezione. Evita riferimenti come “see above”, poiché il passaggio recuperato potrebbe non contenere il testo a cui si rimanda.
Normalizza nomi, date, unità di misura e abbreviazioni
Usa i termini cercati dagli utenti e spiega le definizioni specialistiche alla prima occorrenza.
Scrivi il termine per esteso al primo utilizzo, ad esempio “Service-level agreement (SLA)”. Mantieni coerenti i nomi di prodotti e piani in tutte le fonti. Se gli utenti dicono “refund” mentre la policy riporta “reimbursement”, includi entrambi i termini in modo naturale nella sezione.
Utilizza date non ambigue come “1 August 2026” o un formato ISO nei campi strutturati. Associa valute e unità a ciascun numero. Specifica il fuso orario per orari e scadenze. Un semplice “50” non è un dato utilizzabile se può indicare euro, percentuali, articoli o minuti.
Converti tabelle complesse e immagini in testo recuperabile
Evita che il colore, la posizione delle celle o uno screenshot siano l'unico punto in cui compare una regola.
Le tabelle semplici con una sola riga di intestazione e un singolo schema di dati per riga sono più facili da estrarre. Separa le celle unite, ripeti il soggetto della riga dove necessario e aggiungi un breve paragrafo con la conclusione che un utente potrebbe richiedere. Nelle tabelle comparative, includi prodotto, condizione, prezzo e data di decorrenza in ogni riga rilevante.
Aggiungi alternative testuali per diagrammi e screenshot. Lo screenshot di un orario di apertura non è una fonte di conoscenza finché gli orari non sono disponibili anche come testo leggibile. Mantieni immagini decorative, firme ed elementi di navigazione fuori dai contenuti informativi principali, quando possibile.
Esegui l'OCR e verifica l'ordine di lettura estratto
Un PDF può sembrare perfetto alla vista ed esporre invece testo corrotto o vuoto all'indice.
Prova a selezionare e copiare una frase da ogni tipologia di pagina. Se la pagina è una scansione, esegui il riconoscimento ottico dei caratteri (OCR) prima del caricamento. Controlla manualmente codici, date, separatori decimali, lettere accentate e intestazioni: sono i punti tipici in cui l'OCR può fallire.
Incolla il testo copiato in un editor di testo semplice e rileggilo senza il layout di pagina. Controlla l'ordine delle colonne multiple, le righe delle tabelle, i ritorni a capo con trattino e le intestazioni ripetute. Esporta nuovamente un PDF accessibile e pulito se l'estrazione mescola le colonne o tralascia etichette essenziali. Il dato di controllo demo deve rimanere esattamente `NORDSTERN-42`.
L'OCR produce una bozza, non una garanzia
Un processo OCR riuscito indica solo che è stato generato del testo. Confronta il testo prodotto con l'originale approvato prima di indicizzarlo.
Carica il documento pulito con metadati comprensibili
Rendi la fonte facilmente riconoscibile nei filtri, nelle conversazioni e nelle revisioni successive.
Apri l'assistente isolato, scegli Data Sources e seleziona Add Data Source → Documents. Carica il PDF dimostrativo approvato Northstar. Imposta il nome del documento su “Northstar Knowledge Base” e la categoria su “Support”, così chi esamina i dati potrà identificarne lo scopo senza aprire il file.
Disattiva l'ottimizzazione AI per i documenti con testo pulito e selezionabile, a meno che non ci sia un problema specifico di estrazione e tu possa verificare il risultato elaborato. Attendi che la riga mostri Completed. Registra il conteggio di caratteri o chunk indicizzati come riferimento iniziale, non come punteggio qualitativo.
Ispeziona testo indicizzato, metadati e Search Priority
Esamina ciò che il recupero vede effettivamente, non limitarti al PDF originale.
Apri Edit per la knowledge base Northstar. Leggi il testo estratto e memorizzato attorno alla prima intestazione, a una tabella o elenco, alla sezione finale e a NORDSTERN-42. Verifica che l'editor mostri ancora i valori corretti di Document Name e Category.
Mantieni Search Priority su 0 a meno che test di recupero ripetibili non evidenzino un conflitto giustificato. Un valore più alto dà priorità a una fonte rispetto alle altre, ma non corregge errori di OCR, contesti mancanti o regole obsolete. Salva solo le correzioni verificate e mantieni il file sorgente approvato come originale gestito.
Cerca nell'indice il dato di controllo univoco
Separa i problemi di estrazione e indicizzazione da quelli legati alla generazione della risposta.
Seleziona Content Search e cerca `NORDSTERN-42`. Il risultato corrispondente deve indicare la knowledge base Northstar e mostrare il passaggio memorizzato contenente il dato. Ripeti la prova con un'espressione comune come “support hours” per verificare che il recupero non sia limitato a un codice insolito.
Se il dato univoco non produce risultati, fermati prima di modificare il modello o il prompt di sistema. Ricontrolla lo stato della fonte, il testo estratto e l'assistente selezionato. Se Content Search trova il passaggio ma la risposta del chatbot è errata, analizza la formulazione della domanda, le fonti concorrenti, le istruzioni di ruolo e il comportamento del modello.
Esegui un test a risposta nota e un test di sicurezza per informazioni assenti
Un test di rilascio efficace verifica sia la precisione del recupero sia la corretta gestione dei limiti informativi.
Avvia una nuova conversazione con Test chatbot e chiedi: “What is the support verification code in the Northstar Knowledge Base? Answer in one sentence and name the source.”. La risposta attesa contiene esattamente NORDSTERN-42 e cita il PDF. Registra la formulazione esatta, la versione della fonte, il modello e la data.
Apri un'altra nuova conversazione e richiedi le condizioni di garanzia 2028 di Northstar. La fonte demo non contiene questa risposta, per impostazione voluta. Il test è superato se l'assistente dichiara che l'informazione non è disponibile, senza inventare scadenze o requisiti. Mantieni entrambe le domande nel set di rilascio a ogni modifica di fonti, prompt o modelli.
Gestisci versioni, reindicizza e revisiona le fonti periodicamente
Tratta la knowledge base come un prodotto in costante manutenzione, non come un caricamento una tantum.
Quando un responsabile approva una modifica, aggiorna contemporaneamente la fonte gestita, la data di decorrenza e la voce nel registro. Reindicizza o sostituisci la fonte WebChatAgent, verifica che lo stato sia Completed, ricontrolla il passaggio modificato in Content Search e riesegui la serie di domande standard.
Rimuovi la fonte superata dall'assistente attivo solo dopo che la nuova versione ha superato i controlli. Monitora Questions, Feedback e Conversations per intercettare formulazioni reali non coperte dal set di test. Aggiungi una domanda quando riflette un'esigenza frequente, quindi revisiona i temi critici secondo la cadenza documentata.
Esempio e risultato
Guarda il test pratico e il relativo risultato
Ogni tutorial include un input definito, il risultato atteso e un riepilogo trasparente di quanto effettivamente verificato in ambiente di prova.
Esempio pratico: Knowledge base per chatbot: preparare i documenti aziendali
Questo scenario esatto è stato completato utilizzando l'account di prova temporaneo.
Input esatto del test
Search the indexed document content for the exact control value NORDSTERN-42.
Risultato previsto
Content Search trova NORDSTERN-42 nel documento approvato della knowledge base Northstar.
Cosa è stato effettivamente verificato
Nel test reale eseguito in Light Mode è stato caricato e indicizzato il PDF strutturato Northstar. Content Search ha restituito NORDSTERN-42 da Northstar Knowledge Base.pdf, esattamente come documentato nella schermata di verifica.
Consigli e suggerimenti
Rendi affidabile la configurazione
Esegui i test con esempi realistici, registra i dati di base e modifica una sola impostazione alla volta. In questo modo i miglioramenti reali risulteranno evidenti.
Privilegia la manutenzione costante rispetto ai trucchi di ottimizzazione
Una fonte che il responsabile può comprendere e aggiornare con facilità è molto più sicura di trasformazioni complesse e non riproducibili in seguito.
Collega ogni domanda al rispettivo responsabile della fonte
Associa a ciascun tema critico una domanda a risposta nota, un test per informazioni mancanti e un responsabile che verifichi eventuali errori.
Separa le lingue in modo deliberato
Decidi se utilizzare un'unica lingua sorgente approvata per rispondere a domande multilingue o se gestire una fonte dedicata per ciascuna lingua. Evita traduzioni duplicate non pianificate.
Misura le modifiche utilizzando lo stesso modello
Mantieni invariati modello, prompt e formulazione delle domande durante la valutazione di una riscrittura. Altrimenti non potrai attribuire il risultato alla modifica della knowledge base.
Cosa fare se qualcosa non funziona
Risoluzione dei problemi
Verifica lo stato, i permessi e i dati di test in modo sistematico prima di modificare il modello o il prompt.
Il PDF caricato mostra Completed, ma il dato di controllo non compare in Content Search
Apri il testo memorizzato e confrontalo con l'originale. Verifica l'OCR, l'ordine di lettura e che il file sia stato assegnato all'assistente corretto. Esporta nuovamente e sostituisci la fonte prima di intervenire sul modello.
Content Search trova il passaggio, ma il chatbot risponde con una regola obsoleta
Verifica l'intero set di fonti attive cercando testi duplicati, URL di stampa, traduzioni e file non aggiornati. Elimina la copia obsoleta, reindicizza, avvia una nuova conversazione e riproponi la stessa identica domanda.
I valori delle tabelle perdono le relative etichette dopo l'estrazione
Sostituisci strutture basate su celle unite o formattazioni solo visive con una riga di intestazione semplice, ripeti il soggetto della riga e inserisci un breve riepilogo testuale. Verifica il testo memorizzato prima di testare le risposte.
La risposta nota viene fornita correttamente solo a volte
Usa conversazioni nuove, formulazioni identiche e lo stesso modello invariato. Ispeziona le fonti concorrenti e i passaggi recuperati prima di aumentare Search Priority. Registra più prove invece di considerare solo il risultato migliore.
L'assistente inventa una risposta alla domanda di controllo su dati non presenti
Verifica che nessuna fonte attiva contenga affermazioni simili, quindi rendi più stringenti le regole sulle prove fornite e sulle informazioni mancanti nelle istruzioni di ruolo. Rilancia i test sia per le domande note sia per quelle non note, in modo che i vincoli di sicurezza non blocchino risposte utili.
Pronto per un test strutturato
Pubblica il registro delle fonti e le linee guida sui contenuti all'interno del processo di rilascio. Richiedi un responsabile, uno stato di approvazione, la data di decorrenza, la data di revisione, una domanda a risposta nota e un test per informazioni mancanti per ogni fonte critica.
Risorse correlate
Pianificare un chatbot per knowledge base interna
Collega la preparazione delle fonti ai casi d'uso dei team, all'assegnazione delle responsabilità e alla verifica delle risposte.
Caricare e indicizzare un sito web e un PDF
Segui il flusso iniziale da un assistente vuoto fino a due risposte basate su fonti verificate.
Comprendere ogni comando di Data Sources
Esamina stati, categorie, testo memorizzato, Content Search, reindicizzazione ed eliminazione.
Eseguire test di regressione sulla knowledge base completata
Trasforma domande verificabili in controlli per Knowledge Test e Audit.
Gestire in sicurezza le informazioni mancanti
Combina la qualità delle fonti con limiti di risposta espliciti e test negativi mirati.
