Tutorial paso a paso Base de conocimientos

Cómo entrenar un chatbot de IA con tu sitio web y archivos PDF

Una guía práctica para principiantes para rastrear tu sitio web, subir un PDF y verificar que tu chatbot responda a partir de ambas fuentes.

PrincipianteLectura de 15 min16 de julio de 2026
Cómo entrenar un chatbot de IA con tu sitio web y archivos PDF

Para entrenar un chatbot de IA con tu sitio web de forma fiable, necesitas un alcance de rastreo limpio, documentos útiles y preguntas reproducibles que demuestren la recuperación de información.

Un chatbot solo puede ofrecer respuestas fiables y específicas sobre tu empresa cuando encuentra el contenido de origen adecuado. En WebChatAgent, “training” significa leer e indexar tu sitio web y tus documentos. No reentrena ni realiza un ajuste fino (fine-tuning) del modelo de IA subyacente.

Esta guía comienza con una cuenta completamente vacía. Crearás un chatbot, rastrearás una página web, subirás un PDF pequeño y luego probarás una respuesta de cada fuente.

Reproductor en dos clics que protege la privacidad

Cómo entrenar un chatbot de IA con tu sitio web y PDFs

Entrena un chatbot de IA con tu web y PDFs. Aprende a rastrear, indexar documentos, limpiar fuentes y validar respuestas fundamentadas.

YouTube · 3:11 · Inglés

El reproductor de YouTube permanece bloqueado hasta que pulsa Reproducir. Al cargarlo, su navegador se conecta a YouTube y puede transmitir datos técnicos a Google.

Abrir directamente en YouTube

Qué obtendrá al final

  • Un chatbot nuevo con una base de conocimientos limpia
  • Una fuente de sitio web indexada correctamente
  • Un documento PDF indexado correctamente
  • Dos respuestas verificadas y fundamentadas en tu propio contenido

Antes de empezar

  • Una cuenta de WebChatAgent con permisos para crear un chatbot
  • Una página web pública que tengas autorización para indexar
  • El PDF de demostración descargable de este tutorial o tu propio documento compatible
Descarga el PDF de demostraciónUtiliza la base de conocimientos ficticia de Northstar Services para reproducir la prueba con documentos.

Qué significa “training” en este contexto

El término técnico es Generación Aumentada por Recuperación (RAG, por sus siglas en inglés): WebChatAgent lee el contenido, lo divide en fragmentos útiles y encuentra los que mejor responden a una pregunta. Esos fragmentos se envían al modelo de IA como evidencia.

Este enfoque basado en fuentes permite que tu conocimiento sea reemplazable y se mantenga actualizado. Si una página cambia, puedes volver a leerla sin necesidad de entrenar un nuevo modelo. Por lo tanto, la calidad depende de contar con contenido de origen limpio, un alcance web razonable y pruebas realistas.

Contenido de origenFragmentos relevantesRespuesta fundamentada

01–09

Entrena tu chatbot paso a paso

1

Comienza desde el panel de control vacío

Crea tu primer asistente desde una cuenta limpia.

Tras iniciar sesión, el panel de control muestra que todavía no existe ningún asistente de IA. Selecciona el botón principal de creación para empezar con un chatbot limpio en lugar de reutilizar un asistente que ya contenga fuentes.

Empieza con una cuenta vacía y selecciona el botón para crear un chatbot.
2

Crea Tutorial Lab

Asigna un nombre claro al nuevo asistente y mantén los ajustes predeterminados seguros.

Introduce “Tutorial Lab” como nombre. El proveedor interno predeterminado es suficiente para esta guía, por lo que no necesitas añadir una clave de API personal.

Crea el chatbot. WebChatAgent abrirá su panel de configuración una vez guardado el asistente.

Utiliza un nombre reconocible para que el asistente sea fácil de encontrar durante las pruebas.
3

Abre Data Sources

Dirígete al área donde se gestiona la base de conocimientos del chatbot.

Selecciona “Data Sources” en la navegación del chatbot. Un chatbot nuevo muestra un estado vacío porque todavía no se ha indexado ningún sitio web, documento o espacio de trabajo conectado.

Elige “Add Data Source” para abrir el selector de fuentes.

Todas las fuentes de conocimiento de este chatbot se gestionan en un solo lugar.
4

Elige Website como primera fuente

Abre la configuración del rastreador para una página web pública.

El selector ofrece sitios web, documentos, entrada de texto y herramientas de conocimiento conectadas. Selecciona “Website”.

Utiliza una fuente de tipo sitio web cuando la información ya resida en páginas públicas y rastreables, y deba conservar la URL de la página como referencia.

Elige Website para rastrear contenido directamente desde una URL.
5

Introduce la URL y limita la profundidad de rastreo

Indexa una página controlada antes de ampliar el rastreo a todo el sitio web.

Introduce https://webchatagent.com/train-chatbot-on-your-data en el campo de URL y ajusta la profundidad de rastreo a 0. Una profundidad de 0 indexa únicamente esta página, lo que mantiene el tutorial rápido y predecible.

Deja desactivada la reindexación automática para esta prueba puntual. En entornos de producción, el plan Premium puede actualizar una fuente a diario. La configuración avanzada permite incluir un área de contenido CSS específica o excluir patrones de URL como páginas de inicio de sesión, carrito o avisos legales.

Selecciona “Add & Index” para iniciar la extracción y la indexación.

  • Profundidad 0: solo la página introducida
  • Profundidad vacía: sigue todas las subpáginas accesibles
  • Selector CSS: conserva únicamente el contenedor de contenido relevante
  • Patrones de exclusión: evita URLs irrelevantes o duplicadas
Una profundidad de 0 es ideal para una primera ejecución de indexación controlada.

Indexa únicamente contenido del que seas propietario

Antes de rastrear cualquier sitio web, confirma que tienes autorización para procesar y utilizar su contenido.

6

Espera a que el sitio web se indexe

Confirma que la fuente esté lista antes de probar las respuestas.

La nueva fuente puede mostrar brevemente un estado pendiente o en procesamiento. Espera hasta que cambie a “Indexed” o “Completed”. El recuento de páginas indexadas y contenido extraído confirma que el rastreador finalizó con éxito.

Si la fuente falla, abre primero sus detalles. Comprueba la URL, la accesibilidad de robots.txt, la profundidad de rastreo y cualquier selector CSS restrictivo antes de volver a intentarlo.

Prueba el chatbot únicamente después de que el estado de la fuente confirme que la indexación fue correcta.
7

Sube el PDF de demostración

Añade una segunda fuente con un dato único que sea fácil de verificar.

Selecciona “Add Data Source” de nuevo, elige “Documents” y sube el PDF de demostración de la base de conocimientos enlazado anteriormente. El archivo contiene el código de soporte único NORDSTERN-42, que no aparece en el sitio web.

Mantén desactivada la optimización por IA para este documento pequeño y ya estructurado. Esta opción es útil para material de origen con mal formato, pero no es necesaria para texto limpio.

Elige el PDF de demostración y súbelo como una fuente de documento independiente.
8

Verifica ambas fuentes de conocimiento

Asegúrate de que tanto el sitio web como el PDF estén listos conjuntamente.

La lista de Data Sources debería mostrar ahora tanto la URL del sitio web como el PDF con estados correctos. Este es el punto de control clave para evitar confundir el comportamiento del modelo con una tarea de indexación incompleta.

Abre una fuente cuando necesites inspeccionar el contenido extraído, cambiar su categoría, iniciar una nueva indexación o eliminar información desactualizada.

Ambas fuentes deben estar listas antes de la prueba final de respuestas.
9

Verifica la respuesta del PDF en el chat en vivo

Confirma el dato exclusivo del PDF en el mismo chat que utilizarán los visitantes.

Abre la vista previa del chat en vivo y pregunta: “What is the verification code in the uploaded tutorial PDF? Answer in one sentence and name the source.” La captura de pantalla muestra la pregunta exacta y la respuesta real obtenida en la cuenta temporal del tutorial.

La respuesta debe contener NORDSTERN-42 e identificar la base de conocimientos de demostración de Northstar Services. Los resultados completos del Knowledge Test para el sitio web y el PDF se muestran justo debajo de este paso, lo que permite verificar ambas fuentes indexadas mediante preguntas fijas.

  • Formula preguntas cuyas respuestas aparezcan explícitamente en la fuente.
  • Incluye nombres, códigos o números únicos al validar la recuperación de información.
  • Si una respuesta es imprecisa, mejora el texto de origen antes de ampliar las instrucciones del prompt.
El chat en vivo real devuelve NORDSTERN-42 y nombra el documento fuente indexado.

Una prueba exitosa se basa en evidencias

El objetivo no es solo obtener una respuesta bien redactada. Comprueba que el texto esté respaldado por la fuente indexada y que los datos únicos se reproduzcan de forma exacta.

Ejemplo y resultado

Prueba ambas fuentes indexadas con preguntas fijas

Estas son las preguntas exactas utilizadas en la cuenta temporal del tutorial. Cada resultado mantiene visible el área relevante del Knowledge Test; cuando una sola captura no es suficiente, varias vistas superpuestas muestran la puntuación y todas las respuestas completas sin cortes.

Ejemplo de sitio web: verificar fuentes de datos compatibles

Esta pregunta se ejecutó sobre la página web indexada de WebChatAgent con una profundidad de rastreo de 0.

Verificación de principio a fin

Entrada exacta de la prueba

Can I train a WebChatAgent chatbot with both website pages and PDF documents?

Resultado previsto

La respuesta confirma que tanto las páginas web como los documentos PDF pueden utilizarse como fuentes de conocimiento.

Qué se comprobó realmente

El Knowledge Test real respondió a 5 de 5 variantes (100%) y fundamentó el resultado en el contenido indexado del sitio web.

El marco 1 mantiene visible la fila completa de puntuación de 5/5 y el inicio del bloque de respuestas.
El marco 2 muestra el panel de Results completo desde su encabezado hasta las cinco respuestas generadas, sin cortar la última tarjeta.

Ejemplo de PDF: verificar un dato exclusivo del documento

Esta pregunta busca un dato que solo existe en el PDF de demostración subido, lo que facilita la verificación de la fuente.

Verificación de principio a fin

Entrada exacta de la prueba

What is the unique verification code in the uploaded tutorial PDF?

Resultado previsto

Cada respuesta contiene el valor exacto NORDSTERN-42.

Qué se comprobó realmente

El Knowledge Test real respondió a 5 de 5 variantes (100%); todas las respuestas generadas incluyeron NORDSTERN-42.

El área completa del resultado mantiene visibles conjuntamente la pregunta del PDF, la puntuación de 5/5 y las respuestas con NORDSTERN-42.

Consejos avanzados

Consejos para obtener mejores respuestas de tu base de conocimientos

Un modelo más potente no puede compensar la falta de contenido de origen o la presencia de contradicciones. Optimiza primero la base de conocimientos y luego elige el modelo que mejor se adapte a tus requisitos de calidad, velocidad, consumo de cuota y ubicación de los datos.

Comienza con un modelo rápido

Utiliza un modelo catalogado como rápido (fast o fastest) para las primeras pruebas de recuperación. Pasa a un modelo más avanzado (smart) únicamente cuando un conjunto de preguntas fijas demuestre una mejora real en el razonamiento o la redacción. El multiplicador en el selector de modelos indica cuánto consume cada opción respecto a la cuota de mensajes.

Ten en cuenta la residencia de datos al elegir el modelo

Si la ubicación del procesamiento es importante para tu empresa, elige una opción con el distintivo EU en el selector de modelos. Evalúa la residencia de datos, la calidad de respuesta, la latencia y el uso de cuota en conjunto, en lugar de guiarte solo por el nombre del modelo.

Trata un solo tema por sección

Utiliza encabezados descriptivos, párrafos cortos y datos explícitos. Mantén las reglas de un producto, condiciones de precios o procesos junto con su contexto, de modo que el fragmento recuperado pueda responder a la pregunta sin depender de una sección lejana.

Prepara los documentos para la extracción

Prioriza texto seleccionable, niveles de encabezado claros y tablas sencillas. Aplica OCR a los PDF escaneados, define las abreviaturas la primera vez que aparezcan y evita incluir datos importantes exclusivamente dentro de imágenes decorativas.

Elimina duplicados y contradicciones

No indexes simultáneamente versiones para imprimir, archivos de etiquetas, copias traducidas o varias versiones obsoletas de un reglamento. Las versiones contradictorias reducen la precisión de la recuperación, incluso si todas las fuentes se indexaron correctamente.

Crea un conjunto de evaluación reproducible

Recopila entre 10 y 20 preguntas reales de clientes con los datos de origen esperados. Vuelve a ejecutar el mismo conjunto tras modificar contenido, ajustes de rastreo, prompts o modelos, para que las mejoras sean medibles y no subjetivas.

Resolución de problemas

Resolución de problemas y prácticas recomendadas

La mayoría de los problemas de entrenamiento proceden de la calidad de las fuentes o del alcance del rastreo, no del modelo de lenguaje en sí.

El sitio web se queda pendiente o da error

Comprueba que la URL sea pública, cargue sin necesidad de iniciar sesión, permita el rastreo y no esté bloqueada por un selector CSS excesivamente restrictivo.

Se indexan demasiadas páginas irrelevantes

Reduce la profundidad de rastreo y excluye URLs de búsqueda, cuentas de usuario, carritos de compra, etiquetas, páginas legales o con parámetros.

El bot pasa por alto un dato del PDF

Confirma que el estado del documento sea completado y que el texto seleccionable o el resultado del OCR contengan el dato con claridad.

Las respuestas quedan desactualizadas

Activa un intervalo de reindexación adecuado para las páginas que cambian con frecuencia y elimina o sustituye los documentos obsoletos a tiempo.

Tu chatbot ya responde a partir de tu contenido

Continúa añadiendo las páginas web y documentos reales de tu empresa, y luego prueba las preguntas que tus clientes hacen con mayor frecuencia. Mantén la base de conocimientos organizada, actualizada y libre de versiones contradictorias.

Sigue aprendiendo