Пошаговое руководство База знаний

Как обучить ИИ-чат-бота на вашем сайте и PDF-файлах

Практическое руководство для начинающих: сканирование сайта, загрузка PDF и проверка того, что чат-бот берет ответы из обоих источников.

Для начинающих15 мин чтения16 июля 2026 г.
Как обучить ИИ-чат-бота на вашем сайте и PDF-файлах

Чтобы надежно обучить ИИ-чат-бота на сайте, вам потребуются четко заданная глубина сканирования, полезные документы и повторяемые вопросы для проверки точности поиска.

Чат-бот может давать надежные ответы о вашей компании только тогда, когда находит нужные первоисточники. В WebChatAgent термин «“training”» означает чтение и индексирование вашего сайта и документов. Это не переобучение и не fine-tuning самой базовой модели ИИ.

Это руководство начинается с полностью пустого аккаунта. Вы создадите чат-бота, просканируете одну страницу сайта, загрузите небольшой PDF-файл, а затем протестируете по одному ответу из каждого источника.

Видеоплеер с защитой конфиденциальности (запуск в два клика)

Как обучить ИИ-чат-бота на сайте и PDF-файлах

Руководство по обучению ИИ-чат-бота на сайте и PDF: индексация документов, очистка источников и тестирование фактологических ответов.

YouTube · 3:11 · Английский

Плеер YouTube заблокирован до нажатия кнопки воспроизведения. Его загрузка подключает браузер к YouTube и может передавать технические данные в Google.

Открыть напрямую на YouTube

Что вы узнаете по итогам руководства

  • Новый чат-бот с чистой базой знаний
  • Один успешно проиндексированный источник-сайт
  • Один успешно проиндексированный PDF-документ
  • Два проверенных ответа с привязкой к вашим материалам

Перед началом работы

  • Аккаунт в WebChatAgent с правами на создание чат-бота
  • Публичная страница сайта, которую разрешено индексировать
  • Демонстрационный PDF-файл из этого руководства или собственный поддерживаемый документ
Скачать демонстрационный PDFИспользуйте вымышленную базу знаний Northstar Services для воспроизведения теста документов.

Что означает «“training”» в данном контексте

Технический термин для этого процесса — Retrieval-Augmented Generation (RAG): WebChatAgent считывает контент, разбивает его на удобные фрагменты и находит отрывки, наиболее точно подходящие под вопрос. Эти фрагменты передаются модели ИИ в качестве подтвержденных фактов.

Такой подход на основе источников позволяет легко обновлять и заменять знания. Если страница изменилась, ее можно просто перечитать заново без обучения новой модели. Поэтому итоговое качество зависит от чистоты исходного текста, разумных границ сканирования сайта и реалистичных тестов.

Исходный контентРелевантные фрагментыОтвет на основе фактов

01–09

Пошаговое обучение вашего чат-бота

1

Начните с пустой панели управления

Создайте первого ассистента в чистом аккаунте.

После входа в систему панель управления покажет, что ассистентов еще нет. Нажмите основную кнопку создания, чтобы начать с чистого чат-бота, а не переиспользовать ассистента, где уже добавлены другие источники.

Начните с пустого аккаунта и нажмите кнопку создания чат-бота.
2

Создайте Tutorial Lab

Задайте новому ассистенту понятное имя и сохраните безопасные стандартные настройки.

Введите имя “Tutorial Lab”. Стандартного внутреннего провайдера достаточно для этого руководства, поэтому добавлять собственный API-ключ не требуется.

Создайте чат-бота. WebChatAgent откроет панель настроек сразу после сохранения ассистента.

Используйте узнаваемое имя, чтобы ассистента было легко найти во время тестирования.
3

Откройте Data Sources

Перейдите в раздел управления базой знаний чат-бота.

В меню навигации чат-бота выберите “Data Sources”. У нового чат-бота этот раздел пуст, так как ни один сайт, документ или подключенное рабочее пространство еще не индексировались.

Нажмите “Add Data Source”, чтобы открыть окно выбора источников.

Все источники знаний для этого чат-бота настраиваются в одном месте.
4

Выберите Website в качестве первого источника

Откройте параметры сканирования для публичной веб-страницы.

Окно выбора предлагает веб-сайты, документы, ввод текста и интеграции с базами знаний. Выберите “Website”.

Используйте источник Website, если информация уже опубликована на доступных для сканирования страницах и должна сохранять URL-адрес в качестве ссылки на первоисточник.

Выберите Website, чтобы сканировать контент напрямую по URL-адресу.
5

Введите URL и ограничьте глубину сканирования

Проиндексируйте одну конкретную страницу перед тем, как запускать обход всего сайта.

В поле URL введите https://webchatagent.com/train-chatbot-on-your-data и установите глубину сканирования (crawling depth) на значение 0. Глубина 0 означает, что будет обработана только эта страница, благодаря чему проверка пройдет быстро и предсказуемо.

Для разового теста оставьте автоматическую переиндексацию отключенной. В рабочей среде на тарифе Premium источник можно обновлять ежедневно. Дополнительные параметры позволяют указать точный CSS-селектор области контента или исключить шаблоны URL, такие как страницы входа, корзины или юридические документы.

Нажмите “Add & Index”, чтобы запустить извлечение текста и индексирование.

  • Глубина 0: только указанная страница
  • Пустая глубина: переход по всем доступным подстраницам
  • CSS-селектор: сохранение только нужного контейнера с текстом
  • Шаблоны исключения: фильтрация ненужных или дублирующихся URL
Глубина 0 оптимальна для первого контролируемого запуска индексации.

Индексируйте только разрешенный контент

Прежде чем сканировать сторонний сайт, убедитесь, что у вас есть право обрабатывать и использовать его содержимое.

6

Дождитесь завершения индексации сайта

Убедитесь, что источник готов, прежде чем проверять ответы.

Новый источник может ненадолго перейти в статус ожидания или обработки. Подождите, пока он не сменится на “Indexed” или “Completed”. Количество проиндексированных страниц и извлеченного контента подтвердит успешное завершение работы краулера.

Если при обработке источника возникла ошибка, откройте его параметры. Перед повторной попыткой проверьте корректность URL, доступность robots.txt, глубину сканирования и отсутствие слишком строгих CSS-селекторов.

Тестируйте чат-бота только после того, как статус подтвердит успешное завершение индексации.
7

Загрузите демонстрационный PDF

Добавьте второй источник с уникальным фактом, который легко проверить.

Снова нажмите “Add Data Source”, выберите “Documents” и загрузите демонстрационный PDF-файл базы знаний, ссылка на который приведена выше. Файл содержит уникальный код поддержки NORDSTERN-42, которого нет на сайте.

Для этого небольшого структурированного документа оставьте AI-оптимизацию выключенной. Она полезна для плохо отформатированных исходных материалов, но для чистого текста не требуется.

Выберите демонстрационный PDF и загрузите его как отдельный источник документов.
8

Проверьте оба источника знаний

Убедитесь, что сайт и PDF готовы к одновременной работе.

В списке Data Sources теперь должны отображаться и URL сайта, и PDF со статусом успешной обработки. Это контрольная точка: она помогает избежать ситуации, когда некорректное поведение модели вызвано еще не завершившейся индексацией.

Открывайте источник, если вам нужно просмотреть извлеченный контент, изменить его категорию, запустить повторную индексацию или удалить устаревшие данные.

Оба источника должны быть полностью готовы перед итоговой проверкой ответов.
9

Проверьте ответ по PDF в живом чате

Убедитесь в наличии уникального факта из PDF в том же чате, которым будут пользоваться посетители.

Откройте окно предварительного просмотра чат-бота и спросите: “What is the verification code in the uploaded tutorial PDF? Answer in one sentence and name the source.” На скриншоте показан точный вопрос и реальный ответ из временного тестового аккаунта.

Ответ должен содержать NORDSTERN-42 и указывать на демонстрационную базу знаний Northstar Services. Полные результаты тестирования знаний для сайта и PDF приведены сразу под этим шагом, поэтому оба источника проверяются фиксированными вопросами.

  • Задавайте вопросы, ответы на которые прямо присутствуют в источнике.
  • Используйте уникальные названия, коды или цифры для точной проверки поиска.
  • Если ответ неточен, сначала улучшите исходный текст, а не усложняйте системный промпт.
Реальный чат возвращает код NORDSTERN-42 и указывает название исходного документа.

Критерий успешного теста — опора на факты

Цель — не просто гладкий и связный ответ. Проверьте, подтверждены ли формулировки проиндексированным источником и воспроизводятся ли уникальные факты без искажений.

Пример и результаты тестирования

Проверьте оба источника фиксированным набором вопросов

Вот точные вопросы, которые использовались во временном аккаунте. Каждый результат полностью отражает область Knowledge Test: если одного экрана недостаточно, перекрывающиеся кадры показывают итоговую оценку и каждый ответ целиком без обрезки.

Пример для сайта: проверка поддерживаемых источников данных

Этот вопрос запускался по проиндексированной странице сайта WebChatAgent с глубиной сканирования 0.

Сквозная проверка выполнена успешно

Тестовые входные данные

Can I train a WebChatAgent chatbot with both website pages and PDF documents?

Ожидаемый результат

Ответ подтверждает, что в качестве источников знаний можно использовать как страницы веб-сайтов, так и PDF-документы.

Фактически проверенные результаты

В реальном Knowledge Test успешно обработано 5 из 5 вариантов (100%), при этом ответ опирается на проиндексированный контент сайта.

Кадр 1 отображает полную строку оценки 5/5 и начало списка ответов.
Кадр 2 показывает панель Results целиком — от заголовка до всех пяти сгенерированных ответов без обрезки последней карточки.

Пример для PDF: проверка уникального факта из документа

Этот вопрос нацелен на факт, который есть только в загруженном демонстрационном PDF, что позволяет легко подтвердить источник.

Сквозная проверка выполнена успешно

Тестовые входные данные

What is the unique verification code in the uploaded tutorial PDF?

Ожидаемый результат

Каждый ответ содержит точное значение NORDSTERN-42.

Фактически проверенные результаты

Реальный Knowledge Test успешно ответил на 5 из 5 вариантов (100%); каждый сгенерированный ответ содержал NORDSTERN-42.

Вся область результатов показывает вопрос по PDF, оценку 5/5 и ответы с кодом NORDSTERN-42.

Советы экспертов

Как получать более качественные ответы из базы знаний

Более мощная модель не компенсирует отсутствие информации или противоречия в источниках. Сначала улучшите базу знаний, а затем выберите модель, подходящую по качеству, скорости, лимитам сообщений и требованиям к расположению данных.

Начните с быстрой модели

Для первых тестов поиска используйте модель с пометкой fast или fastest. Переходите на умную модель (smart) только тогда, когда фиксированный набор вопросов показывает реальное улучшение логики или формулировок. Множитель при выборе модели показывает, с каким коэффициентом списываются сообщения из вашего лимита.

Учитывайте требования к расположению данных

Если важно место обработки данных, выберите в списке модель с пометкой EU. Оценивайте юрисдикцию, качество ответов, время отклика и расход квоты комплексно, а не только по названию модели.

Посвящайте один раздел одной теме

Используйте описательные заголовки, короткие абзацы и четкие формулировки фактов. Описание продукта, условия цены или регламент процесса держите в рамках одного блока, чтобы извлеченный фрагмент содержал полный ответ без привязки к отдаленным разделам.

Готовьте документы к извлечению текста

Используйте документы с выделяемым текстом, понятной иерархией заголовков и простыми таблицами. Для отсканированных PDF применяйте OCR, расшифровывайте аббревиатуры при первом упоминании и не размещайте важную информацию только внутри декоративных изображений.

Удаляйте дубликаты и противоречия

Не индексируйте одновременно версии для печати, архивы тегов, дублирующие переводы или несколько устаревших редакций одного регламента. Противоречия в данных снижают точность поиска даже при полностью успешной индексации.

Создайте постоянный набор для оценки качества

Соберите от 10 до 20 реальных вопросов клиентов с ожидаемыми фактами из источников. Запускайте этот набор после любых изменений контента, настроек краулера, системных инструкций или моделей, чтобы прогресс был измеримым, а не субъективным.

Устранение неполадок

Устранение неполадок и рекомендации

Большинство сложностей при обучении связаны с качеством источников или настройками сканирования, а не с самой языковой моделью.

Сайт завис в обработке или выдает ошибку

Убедитесь, что страница публична, открывается без авторизации, не запрещает сканирование и не отсекается слишком узким CSS-селектором.

Индексируется слишком много лишних страниц

Уменьшите глубину обхода и добавьте в исключения страницы поиска, личного кабинета, корзины, тегов, юридической информации и ссылки с техническими параметрами.

Бот не находит факт из PDF

Убедитесь, что документ имеет статус завершенной обработки, а сам факт четко виден в выделяемом тексте или результатах OCR.

Ответы устаревают со временем

Настройте подходящий интервал автообновления для часто меняющихся страниц, а устаревшие документы своевременно удаляйте или заменяйте новыми версиями.

Ваш чат-бот готов отвечать по вашим материалам

Переходите к подключению реальных страниц сайта и рабочих документов, а затем протестируйте вопросы, которые действительно задают клиенты. Следите, чтобы база знаний оставалась структурированной, актуальной и без внутренних противоречий.

Материалы по теме