Cómo entrenar un chatbot de IA con tu sitio web y archivos PDF
Una guía práctica para principiantes para rastrear tu sitio web, subir un PDF y verificar que tu chatbot responda a partir de ambas fuentes.

Para entrenar un chatbot de IA con tu sitio web de forma fiable, necesitas un alcance de rastreo limpio, documentos útiles y preguntas reproducibles que demuestren la recuperación de información.
Un chatbot solo puede ofrecer respuestas fiables y específicas sobre tu empresa cuando encuentra el contenido de origen adecuado. En WebChatAgent, “training” significa leer e indexar tu sitio web y tus documentos. No reentrena ni realiza un ajuste fino (fine-tuning) del modelo de IA subyacente.
Esta guía comienza con una cuenta completamente vacía. Crearás un chatbot, rastrearás una página web, subirás un PDF pequeño y luego probarás una respuesta de cada fuente.
Reproductor en dos clics que protege la privacidad
Cómo entrenar un chatbot de IA con tu sitio web y PDFs
Entrena un chatbot de IA con tu web y PDFs. Aprende a rastrear, indexar documentos, limpiar fuentes y validar respuestas fundamentadas.
El reproductor de YouTube permanece bloqueado hasta que pulsa Reproducir. Al cargarlo, su navegador se conecta a YouTube y puede transmitir datos técnicos a Google.
Abrir directamente en YouTubeQué obtendrá al final
- Un chatbot nuevo con una base de conocimientos limpia
- Una fuente de sitio web indexada correctamente
- Un documento PDF indexado correctamente
- Dos respuestas verificadas y fundamentadas en tu propio contenido
Antes de empezar
- Una cuenta de WebChatAgent con permisos para crear un chatbot
- Una página web pública que tengas autorización para indexar
- El PDF de demostración descargable de este tutorial o tu propio documento compatible
Qué significa “training” en este contexto
El término técnico es Generación Aumentada por Recuperación (RAG, por sus siglas en inglés): WebChatAgent lee el contenido, lo divide en fragmentos útiles y encuentra los que mejor responden a una pregunta. Esos fragmentos se envían al modelo de IA como evidencia.
Este enfoque basado en fuentes permite que tu conocimiento sea reemplazable y se mantenga actualizado. Si una página cambia, puedes volver a leerla sin necesidad de entrenar un nuevo modelo. Por lo tanto, la calidad depende de contar con contenido de origen limpio, un alcance web razonable y pruebas realistas.
01–09
Entrena tu chatbot paso a paso
Comienza desde el panel de control vacío
Crea tu primer asistente desde una cuenta limpia.
Tras iniciar sesión, el panel de control muestra que todavía no existe ningún asistente de IA. Selecciona el botón principal de creación para empezar con un chatbot limpio en lugar de reutilizar un asistente que ya contenga fuentes.
Crea Tutorial Lab
Asigna un nombre claro al nuevo asistente y mantén los ajustes predeterminados seguros.
Introduce “Tutorial Lab” como nombre. El proveedor interno predeterminado es suficiente para esta guía, por lo que no necesitas añadir una clave de API personal.
Crea el chatbot. WebChatAgent abrirá su panel de configuración una vez guardado el asistente.
Abre Data Sources
Dirígete al área donde se gestiona la base de conocimientos del chatbot.
Selecciona “Data Sources” en la navegación del chatbot. Un chatbot nuevo muestra un estado vacío porque todavía no se ha indexado ningún sitio web, documento o espacio de trabajo conectado.
Elige “Add Data Source” para abrir el selector de fuentes.
Elige Website como primera fuente
Abre la configuración del rastreador para una página web pública.
El selector ofrece sitios web, documentos, entrada de texto y herramientas de conocimiento conectadas. Selecciona “Website”.
Utiliza una fuente de tipo sitio web cuando la información ya resida en páginas públicas y rastreables, y deba conservar la URL de la página como referencia.
Introduce la URL y limita la profundidad de rastreo
Indexa una página controlada antes de ampliar el rastreo a todo el sitio web.
Introduce https://webchatagent.com/train-chatbot-on-your-data en el campo de URL y ajusta la profundidad de rastreo a 0. Una profundidad de 0 indexa únicamente esta página, lo que mantiene el tutorial rápido y predecible.
Deja desactivada la reindexación automática para esta prueba puntual. En entornos de producción, el plan Premium puede actualizar una fuente a diario. La configuración avanzada permite incluir un área de contenido CSS específica o excluir patrones de URL como páginas de inicio de sesión, carrito o avisos legales.
Selecciona “Add & Index” para iniciar la extracción y la indexación.
- Profundidad 0: solo la página introducida
- Profundidad vacía: sigue todas las subpáginas accesibles
- Selector CSS: conserva únicamente el contenedor de contenido relevante
- Patrones de exclusión: evita URLs irrelevantes o duplicadas
Indexa únicamente contenido del que seas propietario
Antes de rastrear cualquier sitio web, confirma que tienes autorización para procesar y utilizar su contenido.
Espera a que el sitio web se indexe
Confirma que la fuente esté lista antes de probar las respuestas.
La nueva fuente puede mostrar brevemente un estado pendiente o en procesamiento. Espera hasta que cambie a “Indexed” o “Completed”. El recuento de páginas indexadas y contenido extraído confirma que el rastreador finalizó con éxito.
Si la fuente falla, abre primero sus detalles. Comprueba la URL, la accesibilidad de robots.txt, la profundidad de rastreo y cualquier selector CSS restrictivo antes de volver a intentarlo.
Sube el PDF de demostración
Añade una segunda fuente con un dato único que sea fácil de verificar.
Selecciona “Add Data Source” de nuevo, elige “Documents” y sube el PDF de demostración de la base de conocimientos enlazado anteriormente. El archivo contiene el código de soporte único NORDSTERN-42, que no aparece en el sitio web.
Mantén desactivada la optimización por IA para este documento pequeño y ya estructurado. Esta opción es útil para material de origen con mal formato, pero no es necesaria para texto limpio.
Verifica ambas fuentes de conocimiento
Asegúrate de que tanto el sitio web como el PDF estén listos conjuntamente.
La lista de Data Sources debería mostrar ahora tanto la URL del sitio web como el PDF con estados correctos. Este es el punto de control clave para evitar confundir el comportamiento del modelo con una tarea de indexación incompleta.
Abre una fuente cuando necesites inspeccionar el contenido extraído, cambiar su categoría, iniciar una nueva indexación o eliminar información desactualizada.
Verifica la respuesta del PDF en el chat en vivo
Confirma el dato exclusivo del PDF en el mismo chat que utilizarán los visitantes.
Abre la vista previa del chat en vivo y pregunta: “What is the verification code in the uploaded tutorial PDF? Answer in one sentence and name the source.” La captura de pantalla muestra la pregunta exacta y la respuesta real obtenida en la cuenta temporal del tutorial.
La respuesta debe contener NORDSTERN-42 e identificar la base de conocimientos de demostración de Northstar Services. Los resultados completos del Knowledge Test para el sitio web y el PDF se muestran justo debajo de este paso, lo que permite verificar ambas fuentes indexadas mediante preguntas fijas.
- Formula preguntas cuyas respuestas aparezcan explícitamente en la fuente.
- Incluye nombres, códigos o números únicos al validar la recuperación de información.
- Si una respuesta es imprecisa, mejora el texto de origen antes de ampliar las instrucciones del prompt.
Una prueba exitosa se basa en evidencias
El objetivo no es solo obtener una respuesta bien redactada. Comprueba que el texto esté respaldado por la fuente indexada y que los datos únicos se reproduzcan de forma exacta.
Ejemplo y resultado
Prueba ambas fuentes indexadas con preguntas fijas
Estas son las preguntas exactas utilizadas en la cuenta temporal del tutorial. Cada resultado mantiene visible el área relevante del Knowledge Test; cuando una sola captura no es suficiente, varias vistas superpuestas muestran la puntuación y todas las respuestas completas sin cortes.
Ejemplo de sitio web: verificar fuentes de datos compatibles
Esta pregunta se ejecutó sobre la página web indexada de WebChatAgent con una profundidad de rastreo de 0.
Entrada exacta de la prueba
Can I train a WebChatAgent chatbot with both website pages and PDF documents?
Resultado previsto
La respuesta confirma que tanto las páginas web como los documentos PDF pueden utilizarse como fuentes de conocimiento.
Qué se comprobó realmente
El Knowledge Test real respondió a 5 de 5 variantes (100%) y fundamentó el resultado en el contenido indexado del sitio web.
Ejemplo de PDF: verificar un dato exclusivo del documento
Esta pregunta busca un dato que solo existe en el PDF de demostración subido, lo que facilita la verificación de la fuente.
Entrada exacta de la prueba
What is the unique verification code in the uploaded tutorial PDF?
Resultado previsto
Cada respuesta contiene el valor exacto NORDSTERN-42.
Qué se comprobó realmente
El Knowledge Test real respondió a 5 de 5 variantes (100%); todas las respuestas generadas incluyeron NORDSTERN-42.
Consejos avanzados
Consejos para obtener mejores respuestas de tu base de conocimientos
Un modelo más potente no puede compensar la falta de contenido de origen o la presencia de contradicciones. Optimiza primero la base de conocimientos y luego elige el modelo que mejor se adapte a tus requisitos de calidad, velocidad, consumo de cuota y ubicación de los datos.
Comienza con un modelo rápido
Utiliza un modelo catalogado como rápido (fast o fastest) para las primeras pruebas de recuperación. Pasa a un modelo más avanzado (smart) únicamente cuando un conjunto de preguntas fijas demuestre una mejora real en el razonamiento o la redacción. El multiplicador en el selector de modelos indica cuánto consume cada opción respecto a la cuota de mensajes.
Ten en cuenta la residencia de datos al elegir el modelo
Si la ubicación del procesamiento es importante para tu empresa, elige una opción con el distintivo EU en el selector de modelos. Evalúa la residencia de datos, la calidad de respuesta, la latencia y el uso de cuota en conjunto, en lugar de guiarte solo por el nombre del modelo.
Trata un solo tema por sección
Utiliza encabezados descriptivos, párrafos cortos y datos explícitos. Mantén las reglas de un producto, condiciones de precios o procesos junto con su contexto, de modo que el fragmento recuperado pueda responder a la pregunta sin depender de una sección lejana.
Prepara los documentos para la extracción
Prioriza texto seleccionable, niveles de encabezado claros y tablas sencillas. Aplica OCR a los PDF escaneados, define las abreviaturas la primera vez que aparezcan y evita incluir datos importantes exclusivamente dentro de imágenes decorativas.
Elimina duplicados y contradicciones
No indexes simultáneamente versiones para imprimir, archivos de etiquetas, copias traducidas o varias versiones obsoletas de un reglamento. Las versiones contradictorias reducen la precisión de la recuperación, incluso si todas las fuentes se indexaron correctamente.
Crea un conjunto de evaluación reproducible
Recopila entre 10 y 20 preguntas reales de clientes con los datos de origen esperados. Vuelve a ejecutar el mismo conjunto tras modificar contenido, ajustes de rastreo, prompts o modelos, para que las mejoras sean medibles y no subjetivas.
Resolución de problemas
Resolución de problemas y prácticas recomendadas
La mayoría de los problemas de entrenamiento proceden de la calidad de las fuentes o del alcance del rastreo, no del modelo de lenguaje en sí.
El sitio web se queda pendiente o da error
Comprueba que la URL sea pública, cargue sin necesidad de iniciar sesión, permita el rastreo y no esté bloqueada por un selector CSS excesivamente restrictivo.
Se indexan demasiadas páginas irrelevantes
Reduce la profundidad de rastreo y excluye URLs de búsqueda, cuentas de usuario, carritos de compra, etiquetas, páginas legales o con parámetros.
El bot pasa por alto un dato del PDF
Confirma que el estado del documento sea completado y que el texto seleccionable o el resultado del OCR contengan el dato con claridad.
Las respuestas quedan desactualizadas
Activa un intervalo de reindexación adecuado para las páginas que cambian con frecuencia y elimina o sustituye los documentos obsoletos a tiempo.
Tu chatbot ya responde a partir de tu contenido
Continúa añadiendo las páginas web y documentos reales de tu empresa, y luego prueba las preguntas que tus clientes hacen con mayor frecuencia. Mantén la base de conocimientos organizada, actualizada y libre de versiones contradictorias.
