Tutorial paso a paso Optimización

Optimizador de conocimiento para chatbots de IA: tutorial completo

Utilice un conjunto fijo de preguntas para diagnosticar la capa con fallos, aplique un único cambio controlado y demuestre si la respuesta mejoró realmente.

Avanzado30 min de lectura16 de julio de 2026
Optimizador de conocimiento para chatbots de IA: tutorial completo

El optimizador de conocimiento para chatbots de IA convierte una queja imprecisa sobre una respuesta deficiente en una prueba reproducible que evalúa fuentes, comportamiento de instrucciones y selección del modelo.

Una respuesta deficiente no significa automáticamente que el modelo de IA sea inadecuado. Es posible que falte el dato aprobado, que la recuperación seleccione el fragmento incorrecto, que el rol del sistema fomente suposiciones sin fundamento o que el modelo elegido sea simplemente más lento sin ofrecer una mejor respuesta.

Este flujo de trabajo accesible para principiantes utiliza una prueba fija de cinco preguntas sobre un PDF como base de referencia correcta y una pregunta sobre la garantía de 2028 deliberadamente sin respaldo documental como caso de fallo. Inspeccionará Knowledge Test, Optimize, Role, Model Arena y Audit, modificará únicamente la capa respaldada por evidencias y rechazará una propuesta de rol generada por IA cuando la prueba A/B demuestre que empeora el resultado.

El hábito fundamental consiste en separar la recuperación del comportamiento de la respuesta. Primero, confirme qué evidencia se encontró. Después, evalúe si la respuesta es precisa, fundamentada, lo bastante completa y si rechaza de forma segura la información inexistente. Solo después de esto deben la latencia, el coste del modelo o el estilo de redacción decidir entre candidatos igualmente correctos.

Reproductor en dos clics que protege la privacidad

Tutorial del optimizador de conocimiento para chatbots de IA: corregir respuestas deficientes

Optimice el conocimiento de su chatbot: evalúe respuestas débiles, revise la recuperación, compare modelos y descarte cambios peores.

YouTube · 3:26 · Inglés

El reproductor de YouTube permanece bloqueado hasta que pulsa Reproducir. Al cargarlo, su navegador se conecta a YouTube y puede transmitir datos técnicos a Google.

Abrir directamente en YouTube

Qué obtendrá al final

  • Una base de referencia reproducible de conocimiento con cinco preguntas
  • Un par de regresión con respuesta conocida y rechazo seguro ante la falta de datos
  • Una decisión clara entre cambios en fuentes, recuperación, rol y modelo
  • Un resultado A/B verificado en lugar de una sugerencia de IA sin comprobar
  • Una rutina práctica de revisión para Optimize y Audit
  • Un control de publicación que incluye verificaciones de calidad, latencia y regresión

Antes de empezar

  • Una base de conocimiento indexada con un dato verificable de forma única
  • Una pregunta real deficiente o sin respuesta
  • El responsable o revisor de fuentes aprobado para cambios factuales
  • Cuota de mensajes suficiente para pruebas repetidas, validación A/B y comparación de modelos
  • Una copia guardada del rol actual, la versión de la fuente y la configuración del modelo

Optimizar la capa con fallos

Utilice Knowledge Test para reproducir la respuesta e inspeccionar la evidencia. Utilice Optimize para las lagunas de contenido detectadas en conversaciones reales, Role para el comportamiento de respuesta, Model Arena para una comparación controlada de modelos y Audit para una revisión más amplia de la base de conocimiento. La bandeja Optimization Inbox mantiene cada sugerencia lista para revisión en lugar de alterar el conocimiento en producción silenciosamente.

Diagnostique la capa con fallos antes de editar: la falta de un dato aprobado exige corregir la fuente; una evidencia errónea o débil apunta a la recuperación o a la estructura de la fuente; una evidencia correcta con una respuesta insegura requiere ajustar el rol o el modelo; respuestas igualmente correctas con distinta velocidad o coste deben evaluarse en Model Arena.

Mantenga fijas las preguntas, las respuestas esperadas, la versión de la fuente y las reglas de puntuación. Modifique una sola capa y ejecute nuevamente las mismas pruebas de respuesta conocida y sin respuesta. Un cambio de proveedor puede invalidar los embeddings y requerir una reindexación, por lo que debe planificarse por separado en lugar de mezclarlo con una comparación habitual de modelos.

Reproducir el falloCorregir una capaVerificar con la misma pregunta

01–06

Configuración paso a paso

1

Crear un Knowledge Test fijo antes de modificar nada

Una comparación solo es útil cuando las preguntas y los datos esperados se mantienen idénticos.

Abra Knowledge Optimizer → Knowledge Test, elija el asistente correspondiente y seleccione Custom Question. Añada cinco reformulaciones naturales que deban devolver el dato único del PDF `NORDSTERN-42`. Incluya la pregunta directa, una variante cortés y la redacción que emplearía un usuario real.

Anote el dato esperado, la fuente aprobada y la condición de aprobación antes de pulsar Start test. Una respuesta válida debe contener el código exacto, identificar el PDF de demostración de Northstar Services y evitar afirmaciones inventadas sobre garantías, precios o disponibilidad.

Mantenga la misma versión de la fuente, rol, modelo y temperatura. Añada una pregunta independiente sobre la garantía de 2028 sin respaldo documental para verificar un comportamiento seguro ante la falta de datos. Esto evita que una respuesta fluida o una configuración de prueba modificada parezcan una mejora cuando no lo son.

Una comparación solo es útil cuando las preguntas y los datos esperados se mantienen idénticos.
2

Analizar la base de referencia completa con cinco aciertos de cinco

No se limite a mirar la puntuación; inspeccione cada respuesta fundamentada.

La ejecución registrada muestra 5 respondida, 0 parcial, 0 sin respuesta y una puntuación de 100%. Abra cada resultado y confirme que cada respuesta contiene `NORDSTERN-42`, cita el PDF de demostración de Northstar Services y no añade afirmaciones inventadas sobre garantías, precios o disponibilidad.

Evalúe dos capas por separado. Primero, compruebe si se recuperó el fragmento correcto. Luego, juzgue si la respuesta es precisa, está respaldada por ese fragmento, es lo bastante completa para la pregunta y carece de añadidos sin fundamento. Una sola puntuación global puede ocultar una respuesta fluida basada en evidencias débiles.

Esto demuestra que el PDF indexado y la ruta de recuperación funcionan para el dato conocido. No demuestra que el chatbot conozca una política de garantía de 2028. Plantee esa pregunta sin respaldo por separado y espere una respuesta segura de “no information” en lugar de una suposición.

No se limite a mirar la puntuación; inspeccione cada respuesta fundamentada.
3

Revisar Optimize y decidir cuándo ejecutar un Audit

Las sugerencias basadas en conversaciones y las auditorías más amplias responden a necesidades distintas.

Abra Optimize para revisar las lagunas de conocimiento extraídas de conversaciones reales con usuarios. La cuenta verificada del tutorial está vacía porque los Knowledge Tests controlados no generan tráfico ficticio de clientes. En producción, elija un intervalo de 30 o 90 días, ejecute Analyze, abra la conversación original y verifique cada sugerencia con el responsable oficial y la fuente autorizada antes de aceptarla.

Utilice Audit cuando necesite una revisión global en lugar de examinar un fallo puntual conocido. Analiza datos obsoletos, contradicciones, cobertura insuficiente y estructuras deficientes. Trate cada hallazgo como un elemento priorizado de una lista de verificación: lea el fragmento afectado, confirme el dato aprobado más reciente y decida si edita la fuente o descarta el aviso. Nunca utilice Save to Inbox como una aprobación automática.

Un resultado vacío en Optimize significa “no conversation-derived suggestion in this range”, no “the knowledge base is perfect”. El vídeo publicado con clics reales ejecuta Audit hasta el final y muestra el resultado auténtico. También verifica que no se guardó ningún hallazgo, no se aplicó ningún rol y no se cambió de modelo automáticamente.

Las sugerencias basadas en conversaciones y las auditorías más amplias responden a necesidades distintas.
4

Generar una propuesta de rol, pero sin aplicarla todavía

Compare el rol actual, el rol propuesto y la justificación de forma paralela.

Abra Role y utilice las variantes de la pregunta sobre la garantía de 2028 sin respaldo para generar una propuesta. La sugerencia visible mantiene las respuestas breves, exige evidencias indexadas, prohíbe extrapolar y ordena al asistente indicar cuándo falta información. Son pautas de comportamiento razonables.

Aun así, un rol no puede inventar una política de garantía que no exista en una fuente aprobada. Lea Current role, Proposed role y Rationale en paralelo. Elimine cualquier instrucción que entre en conflicto con su proceso de soporte, ruta de escalado, tono requerido o redacción legal.

Deje la propuesta sin aplicar. Seleccione la prueba guardada de cinco preguntas como fuente A/B y compare el comportamiento actual y el propuesto ante entradas idénticas. Esto aísla el cambio de rol; editar la fuente o el modelo al mismo tiempo haría imposible atribuir el resultado.

Compare el rol actual, el rol propuesto y la justificación de forma paralela.
5

Comparar la calidad de respuesta y la latencia en Model Arena

Utilice las mismas cinco preguntas y luego inspeccione las respuestas individuales.

Reutilice el último Knowledge Test para que ambos candidatos reciban las mismas cinco preguntas sobre el PDF. La comparación registrada muestra Vertex Gemini 2.5 Flash y Claude Haiku 4.5 con una calidad de 100%; la latencia mediana es de 2.6 segundos para Gemini y de 4.4 segundos para Claude, por lo que se recomienda el modelo actual para esta prueba.

Abra las respuestas de cada pregunta antes de tomar una decisión. Compruebe la exactitud de los datos, el uso de evidencias, el rechazo seguro ante falta de información, la exhaustividad y cualquier respuesta inusualmente lenta. Compare el consumo de cuota o el coste del modelo además de la latencia mediana; una mediana rápida no debe ocultar valores atípicos lentos y recurrentes o un comportamiento de seguridad inferior.

Una recomendación en verde no implica un ganador absoluto. Amplíe el conjunto de regresión con respuestas largas, ambigüedad, rechazo ante falta de datos, idioma y casos de uso de herramientas pertinentes para su chatbot. Cambiar de proveedor de IA puede requerir nuevos embeddings y una reindexación completa, así que guarde una copia de seguridad de la configuración actual y programe esa comparación por separado.

Utilice las mismas cinco preguntas y luego inspeccione las respuestas individuales.
6

Rechazar el rol propuesto si la prueba A/B obtiene un resultado peor

Los cambios generados solo ganan confianza mediante resultados medidos.

Ejecute exactamente las cinco preguntas sobre la garantía con el rol actual y el propuesto. El resultado registrado muestra 0% mejor, 3 empates y 2 peor. Abra los pares con peor resultado para comprobar si la nueva redacción se volvió menos precisa, menos útil o peor fundamentada. No toque Apply role y mantenga el rol actual.

Si la empresa realmente ofrece una garantía de 2028, añada la política aprobada (con responsable, fecha de entrada en vigor, alcance y excepciones) a una fuente oficial, vuelva a indexar y repita las pruebas de respuesta conocida y rechazo seguro. Si no existe tal política, la mejora adecuada es un mensaje de reserva seguro y coherente o una derivación a un agente humano, no una redacción más asertiva.

Antes de publicar cualquier cambio, registre la versión aprobada de la fuente, el rol, el modelo, el resultado de las cinco preguntas, el resultado de la pregunta sin respaldo y la latencia. Revise la bandeja Optimization Inbox de forma periódica y mantenga las sugerencias pendientes hasta que un responsable humano confirme tanto el dato como el resultado medido de la regresión.

Los cambios generados solo ganan confianza mediante resultados medidos.

Ejemplo y resultado

Vea la prueba práctica y su resultado

Cada tutorial incluye un caso de entrada definido, el resultado previsto y un registro transparente de las comprobaciones realizadas.

Ejemplo práctico: Optimizador de conocimiento para chatbots de IA: detectar y corregir respuestas deficientes

Este escenario exacto se completó con la cuenta temporal del tutorial.

Verificación de principio a fin

Entrada exacta de la prueba

What is the unique verification code in the uploaded tutorial PDF?

Resultado previsto

Todas las variantes reciben respuesta y contienen NORDSTERN-42.

Qué se comprobó realmente

El Knowledge Test real obtuvo 5/5 respondidas (100%); cada respuesta contenía NORDSTERN-42.

El Knowledge Test real obtuvo 5/5 respondidas (100%); cada respuesta contenía NORDSTERN-42.

Consejos útiles

Consiga una configuración fiable

Pruebe con ejemplos realistas, guarde su punto de partida y modifique un solo ajuste cada vez para evaluar las mejoras con claridad.

Mantener un conjunto de regresión

Una mejora en una pregunta no debe perjudicar a otras preguntas importantes. Vuelva a ejecutar un pequeño conjunto fijo antes de publicar.

No aceptar nunca reescrituras factuales de forma automática

Las sugerencias de IA pueden omitir excepciones o fechas al simplificar. Compare cada cambio factual con la fuente autorizada.

Separar el contenido del comportamiento

Añada una política inexistente a una fuente bajo su control. Utilice el rol únicamente para regular el tono, las reglas de evidencia, los mensajes de reserva y el escalado.

Controlar las versiones de la evidencia

Registre conjuntamente la versión de la fuente, el rol, el modelo y la fecha de la prueba para que una regresión posterior pueda reproducirse en lugar de suponerse.

Si algo no funciona

Resolución de problemas

Revise el estado, los permisos y los datos de prueba de forma sistemática antes de cambiar el modelo o la instrucción.

El dato aprobado existe, pero la respuesta sigue omitiéndolo

Confirme que la fuente esté indexada, abra el fragmento recuperado y elimine documentos duplicados u obsoletos. Vuelva a indexar tras modificar la fuente aprobada y repita la misma pregunta.

La puntuación es alta, pero una respuesta es insegura

Inspeccione cada respuesta y su evidencia. Añada casos explícitos de falta de datos y verifique un mensaje de reserva seguro o una derivación a un agente humano en lugar de fiarse solo del porcentaje global.

Optimize no muestra sugerencias

Compruebe el rango de 30 o 90 días y si existen conversaciones reales de visitantes. Los Knowledge Tests no generan sugerencias de análisis de conversaciones de forma intencionada.

Los resultados de Model Arena varían entre ejecuciones

Mantenga fijos el conjunto de preguntas y la versión de la fuente, repita la ejecución, inspeccione las respuestas individuales y compare la latencia mediana junto con los valores atípicos lentos, la calidad y el coste de cuota.

Un hallazgo de Audit parece verosímil pero no está verificado

No lo guarde ni lo aplique automáticamente. Abra el fragmento afectado, consulte al responsable de la fuente el dato aprobado más reciente y edite la fuente oficial o descarte el hallazgo.

Listo para una prueba tipo producción

Añada la pregunta verificada a un conjunto de regresión periódico y revise la bandeja Optimization Inbox de forma programada en lugar de realizar cambios improvisados.

Recursos relacionados