Tutorial paso a paso Base de conocimientos

Base de conocimiento para chatbot RAG: preparar documentos de empresa

Convierta páginas y PDF dispersos en un conjunto de fuentes reducido y con responsables claros, cuyos datos clave sean fáciles de recuperar, verificar y actualizar.

IntermedioLectura de 34 min12 de agosto de 2026
Base de conocimiento para chatbot RAG: preparar documentos de empresa

Para preparar una base de conocimiento fiable para un chatbot RAG, comience con documentos de empresa aprobados y legibles cuyo texto indexado y límites de respuesta se comprueben directamente.

Un chatbot no lee una base de conocimiento como un compañero que recuerda toda la carpeta: suele recibir solo unos pocos fragmentos recuperados. Si un fragmento dice “this applies for 30 days” pero el producto, la fecha de inicio y las excepciones aparecen en otra parte, la respuesta puede ser incompleta aunque el documento original pareciera claro para una persona.

Esta guía comienza antes de subir los archivos. Elegirá una única fuente aprobada para cada tema, reescribirá los datos clave para que sean autosuficientes, verificará el OCR y la extracción, y luego comprobará el resultado indexado con una pregunta de respuesta conocida y una pregunta de control deliberadamente sin respuesta. El PDF de prueba de Northstar incluye el dato exclusivo NORDSTERN-42, por lo que el resultado no podrá confundirse con el conocimiento general del modelo.

No suba una unidad compartida entera solo porque esté disponible. Es mucho más fácil confiar en una colección actual y reducida con responsables asignados, fechas de revisión y preguntas repetibles que en un gran archivo con versiones contradictorias.

Reproductor en dos clics que protege la privacidad

Buenas prácticas para la base de conocimiento RAG: optimice las fuentes de su chatbot

Prepare una base de conocimiento para RAG: elimine duplicados, mejore la extracción, revise el texto indexado y valide las respuestas.

YouTube · 3:52 · Inglés

El reproductor de YouTube permanece bloqueado hasta que pulsa Reproducir. Al cargarlo, su navegador se conecta a YouTube y puede transmitir datos técnicos a Google.

Abrir directamente en YouTube

Qué obtendrá al final

  • Un registro de fuentes con un responsable directo y una fecha de revisión por tema
  • Páginas y documentos optimizados para recuperación con información autosuficiente
  • Archivos de origen verificados por OCR, sin duplicados y con control claro de versiones
  • Una fuente indexada de WebChatAgent cuyo texto almacenado se ha comprobado visualmente
  • Una prueba de publicación repetible con respuestas conocidas e información ausente

Antes de empezar

  • Acceso a los archivos de origen aprobados y a las páginas públicas, no solo a copias exportadas
  • Un responsable del contenido que pueda resolver contradicciones y aprobar la versión actual
  • El PDF de prueba ficticio y descargable de Northstar u otro documento de prueba no confidencial
  • De cinco a diez preguntas reales de usuarios, incluida al menos una que las fuentes no deban responder
  • Un asistente de prueba aislado en WebChatAgent con interfaz en inglés y modo claro (Light Mode)

La recuperación funciona por fragmentos: el contexto local es fundamental

El término técnico es generación aumentada por recuperación (RAG, Retrieval-Augmented Generation): el sistema busca primero fragmentos relevantes en el conjunto de fuentes conectado. Por lo general, solo esos fragmentos y la pregunta llegan al modelo de respuesta. Por tanto, un fragmento útil debe indicar su tema, regla, condiciones, excepciones y fecha de entrada en vigor sin depender de “the table above” o de abreviaturas sin explicar.

La preparación consta de tres filtros de calidad independientes. La gobernanza de fuentes define qué versión es la oficial. La calidad de extracción comprueba qué texto ha recibido realmente el índice. La evaluación de respuestas comprueba si las preguntas realistas recuperan la información correcta y si la falta de datos produce una limitación segura en lugar de una invención.

Aprobar la fuente de referenciaVerificar los fragmentos indexadosProbar el comportamiento de las respuestas

01–11

Configuración paso a paso

1

Crear un registro de fuentes y asignar autoridad

Decida qué fuente tiene autorización para responder a cada tema antes de cambiar su formato.

Cree un registro sencillo con Fuente, Tema, Audiencia, Responsable, Estado de aprobación, Fecha de entrada en vigor, Fecha de revisión y destino en WebChatAgent. Incluya sitios web, PDF, páginas de espacios de trabajo y fragmentos de texto. “Shared drive” no es un responsable; indique el equipo o la persona que puede aprobar una corrección.

Para cada tema, designe una única fuente de referencia actual. Si el centro de ayuda y un PDF discrepan sobre los horarios de atención, deténgase y aclare la política con el responsable. No pida al chatbot que elija entre dos versiones con el mismo nivel de autoridad.

  • Mantenga los borradores y el material privado fuera del conjunto de fuentes activo.
  • Registre las restricciones de acceso antes de conectar un espacio de trabajo externo.
Decida qué fuente tiene autorización para responder a cada tema antes de cambiar su formato.
2

Eliminar contenido redundante, obsoleto e irrelevante

Elimine los conflictos del conjunto activo en lugar de intentar priorizarlos en las búsquedas.

Agrupe los duplicados cercanos por tema. Los duplicados típicos son un artículo actual junto con su vista de impresión, un PDF antiguo junto a uno nuevo, URL de sitios web con parámetros, copias exportadas de espacios de trabajo y traducciones que repiten los mismos datos. Compare sus fechas de entrada en vigor y su estado de aprobación; después, conserve solo la versión aprobada en las fuentes del chatbot.

Archive el material reemplazado fuera de la carpeta conectada o del alcance de rastreo. La Search Priority puede influir en el posicionamiento más adelante, pero no es una solución segura para políticas contradictorias. Un documento desfasado sigue pudiendo recuperarse aunque tenga menor peso.

Elimine los conflictos del conjunto activo en lugar de intentar priorizarlos en las búsquedas.

No elimine el archivo histórico de la empresa

Retire las copias obsoletas del conjunto de fuentes activo del chatbot. Conserve los registros según su política legal y de retención en el archivo correspondiente.

3

Reescribir datos clave como secciones independientes

Mantenga juntos el asunto, la regla, las condiciones y la fecha.

Sustituya los encabezados genéricos como “General” o “More information” por la pregunta concreta que responde la sección: “Support hours for Northstar customers” o “Annual-plan cancellation eligibility”. Mantenga un solo tema principal por sección y utilice párrafos cortos bajo una jerarquía de encabezados real.

Redacte frases explícitas. “It is available for 30 days” pasa a ser “The Northstar onboarding review is available for 30 calendar days after the kickoff date.”. Añada las excepciones y la fecha de entrada en vigor en la misma sección. Evite referencias como “see above”, ya que el fragmento recuperado podría no incluir el texto al que se hace referencia.

Mantenga juntos el asunto, la regla, las condiciones y la fecha.
4

Normalizar nombres, fechas, unidades y abreviaturas

Utilice los términos que los usuarios escriben habitualmente y explique los tecnicismos al menos una vez.

Escriba el término completo la primera vez que aparezca, por ejemplo “Service-level agreement (SLA)”. Mantenga la coherencia en los nombres de productos y planes en todas las fuentes. Si los usuarios suelen escribir “refund” mientras que la política oficial usa “reimbursement”, incluya ambos términos de forma natural en la sección.

Utilice fechas inequívocas como “1 August 2026” o un formato ISO en los campos estructurados. Especifique siempre la moneda y las unidades de medida en cada cifra. Indique la zona horaria en los horarios y plazos. Un “50” sin contexto no es un dato aprovechable si puede referirse a euros, porcentajes, unidades o minutos.

Utilice los términos que los usuarios escriben habitualmente y explique los tecnicismos al menos una vez.
5

Convertir tablas complejas e imágenes en texto recuperable

No permita que el color, la posición de una celda o una captura de pantalla contengan la única copia de una regla.

Las tablas sencillas con una sola fila de encabezado y un patrón de datos por fila son más fáciles de extraer. Divida las celdas combinadas, repita el asunto de la fila donde sea necesario y añada un párrafo breve que resuma la conclusión sobre la que un usuario podría preguntar. En una tabla comparativa, incluya el producto, la condición, el precio y la fecha de entrada en vigor en cada fila correspondiente.

Añada descripciones de texto alternativas para diagramas y capturas de pantalla. Una captura de pantalla de los horarios de apertura no es una fuente de conocimiento válida hasta que esos horarios existan también como texto legible. Siempre que sea posible, mantenga las imágenes decorativas, firmas y elementos de navegación fuera del contenido que contiene respuestas.

No permita que el color, la posición de una celda o una captura de pantalla contengan la única copia de una regla.
6

Aplicar OCR y comprobar el orden de lectura extraído

Un PDF puede verse perfecto y, sin embargo, transferir al índice texto incompleto o vacío.

Pruebe a seleccionar y copiar una frase de cada tipo de página. Si la página es un documento escaneado, aplique reconocimiento óptico de caracteres (OCR) antes de subirla. Revise manualmente códigos, fechas, separadores decimales, nombres con tilde y encabezados de página, ya que son puntos donde el OCR suele fallar.

Pegue el texto copiado en un editor de texto plano y léalo sin el diseño de página. Compruebe el orden de las columnas múltiples, las filas de tablas, los guiones de separación de línea y los encabezados repetidos. Vuelva a exportar un PDF accesible y limpio si la extracción mezcla columnas o descarta etiquetas esenciales. El dato de control de la demo debe mantenerse exactamente como `NORDSTERN-42`.

Un PDF puede verse perfecto y, sin embargo, transferir al índice texto incompleto o vacío.

El OCR es un borrador, no una confirmación definitiva

Que un proceso de OCR se complete con éxito solo significa que se ha generado texto. Compare el texto obtenido con el original aprobado antes de indexarlo.

7

Subir el documento limpio con metadatos descriptivos

Haga que la fuente sea fácil de identificar en filtros, conversaciones y revisiones posteriores.

Abra el asistente de prueba aislado, vaya a Data Sources y seleccione Add Data Source → Documents. Suba el PDF de demostración aprobado de Northstar. Asigne al documento el nombre “Northstar Knowledge Base” y la categoría “Support” para que cualquier revisor pueda identificar su finalidad sin abrir el archivo.

Deje la optimización por IA (AI optimization) desactivada para documentos limpios con texto seleccionable, a menos que tenga un problema de extracción específico y vaya a revisar el resultado transformado. Espere hasta que la fila muestre el estado Completed. Registre el recuento de caracteres o fragmentos indexados como referencia inicial, no como una puntuación de calidad.

Haga que la fuente sea fácil de identificar en filtros, conversaciones y revisiones posteriores.
8

Inspeccionar el texto indexado, los metadatos y Search Priority

Revise lo que el sistema de recuperación puede leer realmente, no solo el archivo PDF original.

Abra Edit en la base de conocimiento Northstar. Lea el texto extraído y almacenado alrededor del primer encabezado, una tabla o lista, la sección final y NORDSTERN-42. Confirme que el editor sigue mostrando los valores previstos en Document Name y Category.

Mantenga Search Priority en 0 a menos que pruebas de recuperación repetibles demuestren un conflicto justificado. Un valor más alto destaca una fuente sobre otras, pero no corrige un OCR defectuoso, la falta de contexto o una norma desfasada. Guarde solo las correcciones verificadas y conserve el archivo de origen aprobado como el original de mantenimiento.

Revise lo que el sistema de recuperación puede leer realmente, no solo el archivo PDF original.
10

Ejecutar una prueba con respuesta conocida y una con información ausente

Una prueba de publicación eficaz valida tanto la precisión en la recuperación como la capacidad de reconocer sus propios límites.

Inicie una nueva conversación de prueba con Test chatbot y pregunte: “What is the support verification code in the Northstar Knowledge Base? Answer in one sentence and name the source.”. La respuesta esperada debe contener exactamente NORDSTERN-42 e identificar el PDF. Registre la redacción exacta obtenida, la versión de la fuente, el modelo y la fecha.

Inicie otra conversación nueva y pregunte por la política de garantía de Northstar para 2028. La fuente de demostración carece intencionadamente de respuesta. La prueba se supera si el asistente indica que la información no está disponible en lugar de inventar un plazo o una condición. Conserve ambas preguntas en el conjunto de pruebas de publicación tras cualquier cambio de fuentes, instrucciones o modelo.

Una prueba de publicación eficaz valida tanto la precisión en la recuperación como la capacidad de reconocer sus propios límites.
11

Versionar, reindexar y revisar la fuente de forma periódica

Trate la base de conocimiento como un producto en continuo mantenimiento y no como una carga de archivos puntual.

Cuando un responsable apruebe un cambio, actualice a la vez la fuente de mantenimiento, la fecha de entrada en vigor y la entrada del registro. Reindexe o sustituya la fuente en WebChatAgent, confirme que el estado sea Completed, vuelva a comprobar el fragmento modificado en Content Search y repita el conjunto fijo de preguntas.

Elimine la fuente obsoleta del asistente activo solo cuando la nueva versión haya superado las pruebas. Revise Questions, Feedback y Conversations para identificar términos reales de los usuarios que el conjunto de pruebas no haya previsto. Añada una pregunta cada vez que detecte una necesidad recurrente y revise los temas críticos con la periodicidad establecida.

Trate la base de conocimiento como un producto en continuo mantenimiento y no como una carga de archivos puntual.

Ejemplo y resultado

Vea la prueba práctica y su resultado

Cada tutorial incluye un caso de entrada definido, el resultado previsto y un registro transparente de las comprobaciones realizadas.

Ejemplo práctico: Base de conocimiento del chatbot: preparar documentos de empresa

Este escenario exacto se completó con la cuenta temporal del tutorial.

Verificación de principio a fin

Entrada exacta de la prueba

Search the indexed document content for the exact control value NORDSTERN-42.

Resultado previsto

Content Search localiza NORDSTERN-42 en el documento de base de conocimiento aprobado de Northstar.

Qué se comprobó realmente

La prueba real en modo claro subió e indexó el PDF estructurado de Northstar. A continuación, Content Search devolvió NORDSTERN-42 de Northstar Knowledge Base.pdf, exactamente como se muestra en la captura de verificación.

La prueba real en modo claro subió e indexó el PDF estructurado de Northstar. A continuación, Content Search devolvió NORDSTERN-42 de Northstar Knowledge Base.pdf, exactamente como se muestra en la captura de verificación.

Consejos útiles

Consiga una configuración fiable

Pruebe con ejemplos realistas, guarde su punto de partida y modifique un solo ajuste cada vez para evaluar las mejoras con claridad.

Priorice el mantenimiento sobre los trucos de optimización

Una fuente que un responsable puede entender y actualizar de forma fiable es más segura que una transformación puntual que nadie pueda reproducir después.

Asignar preguntas a los responsables de las fuentes

Asocie a cada tema crítico una pregunta con respuesta conocida, otra con información no disponible y un responsable que revise los fallos.

Separar los idiomas de forma deliberada

Defina si una única fuente en el idioma principal debe responder a preguntas multilingües o si cada idioma contará con su propia fuente mantenida. Evite traducciones duplicadas involuntarias.

Evaluar los cambios siempre con el mismo modelo

Mantenga fijos el modelo, las instrucciones y la redacción de las preguntas mientras evalúa la reescritura de una fuente. De lo contrario, no podrá atribuir la variación del resultado al cambio en la base de conocimiento.

Si algo no funciona

Resolución de problemas

Revise el estado, los permisos y los datos de prueba de forma sistemática antes de cambiar el modelo o la instrucción.

El PDF subido muestra el estado Completed, pero el dato de control no aparece en Content Search

Abra el texto almacenado y compárelo con el original. Compruebe el OCR, el orden de lectura y si el archivo se ha subido al asistente correcto. Vuelva a exportar y sustituir la fuente en lugar de cambiar el modelo.

Content Search localiza el fragmento, pero el chatbot responde con una regla desfasada

Busque en todo el conjunto de fuentes activo posibles redacciones duplicadas, URL de impresión, traducciones o archivos antiguos. Elimine la copia obsoleta, reindexe, inicie una conversación limpia y repita la misma pregunta.

Los valores de las tablas pierden sus etiquetas tras la extracción

Sustituya los diseños combinados o exclusivamente visuales por una fila de encabezado sencilla, repita el asunto en cada fila y añada un breve resumen en texto. Verifique el texto almacenado antes de evaluar las respuestas.

La respuesta conocida solo se obtiene de forma intermitente

Utilice conversaciones limpias, la misma redacción exacta y un modelo sin cambios. Inspeccione las fuentes en conflicto y los fragmentos recuperados antes de subir la Search Priority. Registre varias ejecuciones en lugar de quedarse solo con el mejor intento.

El asistente inventa una respuesta ante la pregunta de control sin información

Confirme que ninguna fuente activa contenga una afirmación similar y refuerce las reglas de justificación y de información ausente en las instrucciones de rol. Vuelva a probar a la vez las preguntas con respuesta conocida y las no disponibles para que las medidas de seguridad no bloqueen respuestas válidas.

Listo para una prueba tipo producción

Publique el registro de fuentes y los estándares de contenido como parte del proceso de publicación. Exija un responsable, un estado de aprobación, una fecha de entrada en vigor, una fecha de revisión, una pregunta con respuesta conocida y una de control sin respuesta para cada fuente crítica.

Recursos relacionados