Tutorial dettagliato Knowledge base

Knowledge base per chatbot RAG: preparare i documenti aziendali

Trasforma pagine sparse e file PDF in un set di fonti circoscritto e controllato, i cui fatti importanti sono facili da recuperare, verificare e aggiornare.

IntermedioLettura di 34 min12 agosto 2026
Knowledge base per chatbot RAG: preparare i documenti aziendali

Per preparare una knowledge base affidabile per un chatbot RAG, parti da documenti aziendali approvati ed estraibili, verificando direttamente i passaggi memorizzati e i limiti di risposta.

Un chatbot non legge una knowledge base come un collega che ricorda l'intera cartella. Di solito riceve pochi passaggi estratti. Se un passaggio dice “this applies for 30 days” ma il prodotto, la data di inizio e le eccezioni si trovano altrove, la risposta può risultare incompleta anche se il documento originale sembrava chiaro a una persona.

Questa guida parte prima del caricamento. Sceglierai un'unica fonte approvata per ciascun argomento, riscriverai i fatti chiave in modo che siano autosufficienti, verificherai OCR ed estrazione, e convaliderai il risultato indicizzato con una domanda a risposta nota e una domanda di controllo intenzionalmente priva di risposta. Il PDF dimostrativo Northstar fornisce il fatto univoco NORDSTERN-42, così il risultato non potrà essere confuso con la conoscenza generale del modello.

Non caricare un'intera cartella condivisa solo perché è accessibile. Una raccolta aggiornata più piccola, con responsabili, date di revisione e domande verificabili, è molto più affidabile di un grande archivio con versioni contrastanti.

Player a due clic conforme alla privacy

Best practice per knowledge base RAG: correggi le fonti del tuo chatbot

Prepara la knowledge base per chatbot RAG: rimuovi i duplicati, ottimizza l'estrazione, ispeziona i testi indicizzati e testa ogni risposta.

YouTube · 3:52 · Inglese

Il player di YouTube rimane bloccato finché non selezioni Riproduci. Il caricamento connette il browser a YouTube e potrebbe trasferire dati tecnici a Google.

Apri direttamente su YouTube

Cosa otterrai alla fine

  • Un registro delle fonti con un responsabile incaricato e una data di revisione per argomento
  • Pagine e documenti ottimizzati per il recupero con fatti autosufficienti
  • File sorgente verificati con OCR, deduplicati e con versioni chiare
  • Una fonte WebChatAgent indicizzata con testo memorizzato verificato visivamente
  • Un test di rilascio ripetibile su risposte note e informazioni mancanti

Prima di iniziare

  • Accesso ai file sorgente approvati e alle pagine pubbliche, non solo a copie esportate
  • Un responsabile dei contenuti in grado di risolvere incongruenze e approvare la versione corrente
  • Il PDF dimostrativo fittizio scaricabile Northstar o un altro documento di test non riservato
  • Da cinque a dieci domande reali degli utenti, inclusa almeno una domanda a cui le fonti non devono rispondere
  • Un assistente di test WebChatAgent isolato con interfaccia in inglese e Light Mode

Il recupero funziona per passaggi: il contesto locale è fondamentale

Il termine tecnico è Retrieval-Augmented Generation (RAG): il sistema cerca prima i passaggi pertinenti nel set di fonti collegate. Solo questi passaggi e la domanda arrivano solitamente al modello di risposta. Un passaggio utile deve quindi indicare soggetto, regola, condizioni, eccezioni e data di decorrenza senza dipendere da “the table above” o da sigle non spiegate.

La preparazione prevede tre controlli di qualità distinti. La governance delle fonti stabilisce quale versione fa testo. La qualità dell'estrazione verifica quale testo ha effettivamente ricevuto l'indice. La valutazione delle risposte testa se domande realistiche recuperano le prove corrette e se l'assenza di dati produce un limite sicuro anziché un'invenzione.

Approva la fonte di riferimentoVerifica i passaggi indicizzatiTesta il comportamento delle risposte

01–11

Configura passo dopo passo

1

Crea un registro delle fonti e assegna le responsabilità

Stabilisci quale fonte è autorizzata a rispondere su ciascun argomento prima di modificarne la formattazione.

Crea un registro semplice con Fonte, Argomento, Destinatari, Responsabile, Stato di approvazione, Data di decorrenza, Data di revisione e destinazione WebChatAgent. Includi siti web, PDF, pagine dell'area di lavoro e snippet di testo. “Shared drive” non è un responsabile; indica il team o la persona che può approvare una correzione.

Per ogni argomento, individua un'unica fonte di riferimento aggiornata. Se il centro assistenza e un PDF indicano orari di supporto differenti, fermati e allinea le direttive con il responsabile. Non chiedere al chatbot di scegliere tra due versioni con la stessa autorevolezza.

  • Escludi bozze e materiali riservati dal set di fonti attive.
  • Registra le limitazioni di accesso prima di collegare un'area di lavoro esterna.
Stabilisci quale fonte è autorizzata a rispondere su ciascun argomento prima di modificarne la formattazione.
2

Rimuovi contenuti ridondanti, obsoleti e marginali

Elimina le contraddizioni dal set attivo invece di tentare di superarle con il ranking.

Raggruppa i quasi-duplicati per argomento. I duplicati tipici includono un articolo corrente affiancato alla versione stampabile, un vecchio PDF accanto a uno nuovo, URL web con parametri, copie esportate da aree di lavoro e traduzioni che ripetono gli stessi dati. Confronta date di decorrenza e stato di approvazione, poi mantieni nel set del chatbot solo la versione approvata.

Archivia il materiale superato fuori dalla cartella collegata o dall'ambito di scansione. Search Priority può influenzare il ranking in seguito, ma non risolve in sicurezza direttive contraddittorie. Un documento non aggiornato rimane recuperabile anche se il suo peso è inferiore.

Elimina le contraddizioni dal set attivo invece di tentare di superarle con il ranking.

Non eliminare l'archivio aziendale

Rimuovi le copie obsolete dal set di fonti attive del chatbot. Conserva i record nell'archivio appropriato nel rispetto delle policy legali e di conservazione dei dati.

3

Riscrivi i fatti importanti come sezioni autosufficienti

Mantieni soggetto, regola, condizioni e data l'uno vicino all'altro.

Sostituisci intestazioni generiche come “General” o “More information” con la domanda specifica a cui la sezione risponde: “Support hours for Northstar customers” o “Annual-plan cancellation eligibility”. Mantieni un solo tema principale per sezione e usa paragrafi brevi all'interno di una gerarchia di titoli strutturata.

Scrivi frasi esplicite. “It is available for 30 days” diventa “The Northstar onboarding review is available for 30 calendar days after the kickoff date.”. Inserisci le eccezioni e la data di decorrenza nella stessa sezione. Evita riferimenti come “see above”, poiché il passaggio recuperato potrebbe non contenere il testo a cui si rimanda.

Mantieni soggetto, regola, condizioni e data l'uno vicino all'altro.
4

Normalizza nomi, date, unità di misura e abbreviazioni

Usa i termini cercati dagli utenti e spiega le definizioni specialistiche alla prima occorrenza.

Scrivi il termine per esteso al primo utilizzo, ad esempio “Service-level agreement (SLA)”. Mantieni coerenti i nomi di prodotti e piani in tutte le fonti. Se gli utenti dicono “refund” mentre la policy riporta “reimbursement”, includi entrambi i termini in modo naturale nella sezione.

Utilizza date non ambigue come “1 August 2026” o un formato ISO nei campi strutturati. Associa valute e unità a ciascun numero. Specifica il fuso orario per orari e scadenze. Un semplice “50” non è un dato utilizzabile se può indicare euro, percentuali, articoli o minuti.

Usa i termini cercati dagli utenti e spiega le definizioni specialistiche alla prima occorrenza.
5

Converti tabelle complesse e immagini in testo recuperabile

Evita che il colore, la posizione delle celle o uno screenshot siano l'unico punto in cui compare una regola.

Le tabelle semplici con una sola riga di intestazione e un singolo schema di dati per riga sono più facili da estrarre. Separa le celle unite, ripeti il soggetto della riga dove necessario e aggiungi un breve paragrafo con la conclusione che un utente potrebbe richiedere. Nelle tabelle comparative, includi prodotto, condizione, prezzo e data di decorrenza in ogni riga rilevante.

Aggiungi alternative testuali per diagrammi e screenshot. Lo screenshot di un orario di apertura non è una fonte di conoscenza finché gli orari non sono disponibili anche come testo leggibile. Mantieni immagini decorative, firme ed elementi di navigazione fuori dai contenuti informativi principali, quando possibile.

Evita che il colore, la posizione delle celle o uno screenshot siano l'unico punto in cui compare una regola.
6

Esegui l'OCR e verifica l'ordine di lettura estratto

Un PDF può sembrare perfetto alla vista ed esporre invece testo corrotto o vuoto all'indice.

Prova a selezionare e copiare una frase da ogni tipologia di pagina. Se la pagina è una scansione, esegui il riconoscimento ottico dei caratteri (OCR) prima del caricamento. Controlla manualmente codici, date, separatori decimali, lettere accentate e intestazioni: sono i punti tipici in cui l'OCR può fallire.

Incolla il testo copiato in un editor di testo semplice e rileggilo senza il layout di pagina. Controlla l'ordine delle colonne multiple, le righe delle tabelle, i ritorni a capo con trattino e le intestazioni ripetute. Esporta nuovamente un PDF accessibile e pulito se l'estrazione mescola le colonne o tralascia etichette essenziali. Il dato di controllo demo deve rimanere esattamente `NORDSTERN-42`.

Un PDF può sembrare perfetto alla vista ed esporre invece testo corrotto o vuoto all'indice.

L'OCR produce una bozza, non una garanzia

Un processo OCR riuscito indica solo che è stato generato del testo. Confronta il testo prodotto con l'originale approvato prima di indicizzarlo.

7

Carica il documento pulito con metadati comprensibili

Rendi la fonte facilmente riconoscibile nei filtri, nelle conversazioni e nelle revisioni successive.

Apri l'assistente isolato, scegli Data Sources e seleziona Add Data Source → Documents. Carica il PDF dimostrativo approvato Northstar. Imposta il nome del documento su “Northstar Knowledge Base” e la categoria su “Support”, così chi esamina i dati potrà identificarne lo scopo senza aprire il file.

Disattiva l'ottimizzazione AI per i documenti con testo pulito e selezionabile, a meno che non ci sia un problema specifico di estrazione e tu possa verificare il risultato elaborato. Attendi che la riga mostri Completed. Registra il conteggio di caratteri o chunk indicizzati come riferimento iniziale, non come punteggio qualitativo.

Rendi la fonte facilmente riconoscibile nei filtri, nelle conversazioni e nelle revisioni successive.
8

Ispeziona testo indicizzato, metadati e Search Priority

Esamina ciò che il recupero vede effettivamente, non limitarti al PDF originale.

Apri Edit per la knowledge base Northstar. Leggi il testo estratto e memorizzato attorno alla prima intestazione, a una tabella o elenco, alla sezione finale e a NORDSTERN-42. Verifica che l'editor mostri ancora i valori corretti di Document Name e Category.

Mantieni Search Priority su 0 a meno che test di recupero ripetibili non evidenzino un conflitto giustificato. Un valore più alto dà priorità a una fonte rispetto alle altre, ma non corregge errori di OCR, contesti mancanti o regole obsolete. Salva solo le correzioni verificate e mantieni il file sorgente approvato come originale gestito.

Esamina ciò che il recupero vede effettivamente, non limitarti al PDF originale.
10

Esegui un test a risposta nota e un test di sicurezza per informazioni assenti

Un test di rilascio efficace verifica sia la precisione del recupero sia la corretta gestione dei limiti informativi.

Avvia una nuova conversazione con Test chatbot e chiedi: “What is the support verification code in the Northstar Knowledge Base? Answer in one sentence and name the source.”. La risposta attesa contiene esattamente NORDSTERN-42 e cita il PDF. Registra la formulazione esatta, la versione della fonte, il modello e la data.

Apri un'altra nuova conversazione e richiedi le condizioni di garanzia 2028 di Northstar. La fonte demo non contiene questa risposta, per impostazione voluta. Il test è superato se l'assistente dichiara che l'informazione non è disponibile, senza inventare scadenze o requisiti. Mantieni entrambe le domande nel set di rilascio a ogni modifica di fonti, prompt o modelli.

Un test di rilascio efficace verifica sia la precisione del recupero sia la corretta gestione dei limiti informativi.
11

Gestisci versioni, reindicizza e revisiona le fonti periodicamente

Tratta la knowledge base come un prodotto in costante manutenzione, non come un caricamento una tantum.

Quando un responsabile approva una modifica, aggiorna contemporaneamente la fonte gestita, la data di decorrenza e la voce nel registro. Reindicizza o sostituisci la fonte WebChatAgent, verifica che lo stato sia Completed, ricontrolla il passaggio modificato in Content Search e riesegui la serie di domande standard.

Rimuovi la fonte superata dall'assistente attivo solo dopo che la nuova versione ha superato i controlli. Monitora Questions, Feedback e Conversations per intercettare formulazioni reali non coperte dal set di test. Aggiungi una domanda quando riflette un'esigenza frequente, quindi revisiona i temi critici secondo la cadenza documentata.

Tratta la knowledge base come un prodotto in costante manutenzione, non come un caricamento una tantum.

Esempio e risultato

Guarda il test pratico e il relativo risultato

Ogni tutorial include un input definito, il risultato atteso e un riepilogo trasparente di quanto effettivamente verificato in ambiente di prova.

Esempio pratico: Knowledge base per chatbot: preparare i documenti aziendali

Questo scenario esatto è stato completato utilizzando l'account di prova temporaneo.

Verificato end-to-end

Input esatto del test

Search the indexed document content for the exact control value NORDSTERN-42.

Risultato previsto

Content Search trova NORDSTERN-42 nel documento approvato della knowledge base Northstar.

Cosa è stato effettivamente verificato

Nel test reale eseguito in Light Mode è stato caricato e indicizzato il PDF strutturato Northstar. Content Search ha restituito NORDSTERN-42 da Northstar Knowledge Base.pdf, esattamente come documentato nella schermata di verifica.

Nel test reale eseguito in Light Mode è stato caricato e indicizzato il PDF strutturato Northstar. Content Search ha restituito NORDSTERN-42 da Northstar Knowledge Base.pdf, esattamente come documentato nella schermata di verifica.

Consigli e suggerimenti

Rendi affidabile la configurazione

Esegui i test con esempi realistici, registra i dati di base e modifica una sola impostazione alla volta. In questo modo i miglioramenti reali risulteranno evidenti.

Privilegia la manutenzione costante rispetto ai trucchi di ottimizzazione

Una fonte che il responsabile può comprendere e aggiornare con facilità è molto più sicura di trasformazioni complesse e non riproducibili in seguito.

Collega ogni domanda al rispettivo responsabile della fonte

Associa a ciascun tema critico una domanda a risposta nota, un test per informazioni mancanti e un responsabile che verifichi eventuali errori.

Separa le lingue in modo deliberato

Decidi se utilizzare un'unica lingua sorgente approvata per rispondere a domande multilingue o se gestire una fonte dedicata per ciascuna lingua. Evita traduzioni duplicate non pianificate.

Misura le modifiche utilizzando lo stesso modello

Mantieni invariati modello, prompt e formulazione delle domande durante la valutazione di una riscrittura. Altrimenti non potrai attribuire il risultato alla modifica della knowledge base.

Cosa fare se qualcosa non funziona

Risoluzione dei problemi

Verifica lo stato, i permessi e i dati di test in modo sistematico prima di modificare il modello o il prompt.

Il PDF caricato mostra Completed, ma il dato di controllo non compare in Content Search

Apri il testo memorizzato e confrontalo con l'originale. Verifica l'OCR, l'ordine di lettura e che il file sia stato assegnato all'assistente corretto. Esporta nuovamente e sostituisci la fonte prima di intervenire sul modello.

Content Search trova il passaggio, ma il chatbot risponde con una regola obsoleta

Verifica l'intero set di fonti attive cercando testi duplicati, URL di stampa, traduzioni e file non aggiornati. Elimina la copia obsoleta, reindicizza, avvia una nuova conversazione e riproponi la stessa identica domanda.

I valori delle tabelle perdono le relative etichette dopo l'estrazione

Sostituisci strutture basate su celle unite o formattazioni solo visive con una riga di intestazione semplice, ripeti il soggetto della riga e inserisci un breve riepilogo testuale. Verifica il testo memorizzato prima di testare le risposte.

La risposta nota viene fornita correttamente solo a volte

Usa conversazioni nuove, formulazioni identiche e lo stesso modello invariato. Ispeziona le fonti concorrenti e i passaggi recuperati prima di aumentare Search Priority. Registra più prove invece di considerare solo il risultato migliore.

L'assistente inventa una risposta alla domanda di controllo su dati non presenti

Verifica che nessuna fonte attiva contenga affermazioni simili, quindi rendi più stringenti le regole sulle prove fornite e sulle informazioni mancanti nelle istruzioni di ruolo. Rilancia i test sia per le domande note sia per quelle non note, in modo che i vincoli di sicurezza non blocchino risposte utili.

Pronto per un test strutturato

Pubblica il registro delle fonti e le linee guida sui contenuti all'interno del processo di rilascio. Richiedi un responsabile, uno stato di approvazione, la data di decorrenza, la data di revisione, una domanda a risposta nota e un test per informazioni mancanti per ogni fonte critica.

Risorse correlate