Сотрудник ищет пункт о штрафах в договоре поставки, менеджер поддержки уточняет условия возврата, новичок разбирается в регламенте отпусков. Все ответы уже есть в документах компании, но найти их долго. Отсюда желание: пусть нейросеть по документам отвечает сама, коротко и со ссылкой на нужный пункт.

Разберем, какие есть способы это сделать, когда достаточно загрузить файл в обычный чат-бот, а когда нужен отдельный инструмент, как подготовить документы и проверить, что ответам можно доверять.

Три способа заставить нейросеть отвечать по документам

Под запросом «нейросеть на своих данных» обычно скрывается один из трех подходов.

1. Загрузить файл в чат-бот. Вы прикрепляете договор или инструкцию к сообщению в универсальном чат-боте (ChatGPT и аналоги) и задаете вопрос. Модель читает файл целиком и отвечает.

2. Дообучить модель. Дообучение (fine-tuning) — дополнительная тренировка языковой модели на ваших текстах. Предполагается, что после этого модель «знает» содержимое документов.

3. Подключить RAG. RAG (Retrieval Augmented Generation, «генерация, дополненная поиском») — подход, при котором система сначала находит в базе документов подходящие фрагменты, а затем языковая модель формулирует ответ только на их основе. Подробнее об устройстве — в статье «Что такое RAG-система».

Критерий Файл в чат-боте Дообучение RAG
Сколько документов Один-два за раз Сотни и тысячи Сотни и тысячи
Время на запуск Минуты Недели, нужны ML-специалисты От минут в готовом сервисе
Обновление документов Загружать заново в каждый чат Переобучать модель Заменить файл в базе
Ссылки на источник Иногда, без гарантий Нет Да, на конкретный фрагмент
Права доступа Нет Нет Да, если заложены в системе
Работа для команды Каждый загружает сам Да Да, общая база
Риск выдуманных ответов Средний Высокий Ниже: ответ строится по найденным фрагментам

Когда хватит обычного чат-бота

Загрузка файла в чат — нормальный вариант, если:

Для задачи «ответ по документу нейросеть дает за минуту» этого достаточно, и городить отдельную систему незачем.

Когда чат-бота уже мало

Ограничения проявляются, как только документов и людей становится больше:

Если узнали свою ситуацию хотя бы в двух пунктах, нужна нейросеть по работе с документами в формате общей базы знаний, то есть RAG.

Почему «обучить нейросеть на своих данных» чаще всего не нужно

Запрос «обучение нейросети на своих данных» звучит как очевидное решение, но для справочных задач оно работает плохо:

Дообучение оправдано для других задач: научить модель специфическому формату ответа, отраслевой терминологии или классификации обращений. Для ответов по документам почти всегда достаточно RAG: модель остается прежней, а меняется только база документов, к которой она обращается.

Как подготовить документы

Качество ответов напрямую зависит от того, что лежит в базе. Перед загрузкой стоит потратить час на наведение порядка.

Чек-лист подготовки:

  1. Уберите дубли и старые версии. Если в базе лежат два регламента отпусков 2023 и 2025 года, нейросеть может процитировать устаревший.
  2. Проверьте, что текст читается. Сканы подойдут, если они четкие: размытая фотография документа распознается с ошибками.
  3. Дайте файлам понятные названия. «Регламент_возвратов_2026.docx» лучше, чем «Документ1 (3).docx». По названию проще понять, откуда взят ответ.
  4. Сохраните структуру. Заголовки, нумерация пунктов и разделы помогают системе находить нужный фрагмент и строить оглавление.
  5. Разделите по темам и доступу. Документы для всех сотрудников, для отдела продаж и для руководства лучше сразу разложить по разным группам.
  6. Заполните пробелы. Если на частый вопрос нет ответа ни в одном документе, никакая нейросеть его не найдет. Иногда проще написать короткую памятку на страницу.

Для нейросети по поиску документов важна и полнота: если половина инструкций живет в головах сотрудников и переписке, начните с того, что записано, а остальное добавляйте постепенно.

Нейросеть по документам за 15 минут: инструкция на примере Pragmaticus

Покажем путь от регистрации до первого ответа в готовом сервисе. Программировать не нужно.

Шаг 1. Регистрация

Зарегистрируйтесь в Pragmaticus. Оплата идет по факту в рублях, без подписки, а при регистрации на баланс начисляется 300 ₽ — этого хватит, чтобы проверить сервис на своих документах.

Шаг 2. Создайте проект

Проект — это папка с документами на одну тему: «Договоры с поставщиками», «HR-регламенты», «Инструкции для поддержки». Ассистент ищет ответ внутри выбранного проекта, поэтому вопросы про отпуск не смешаются с вопросами про поставки.

Шаг 3. Загрузите документы

Поддерживаются PDF (включая сканы — текст распознается), DOCX, PPTX, XLSX, Markdown, TXT и изображения: JPG, PNG, WEBP и другие. Если инструкции опубликованы на сайте или в справочном центре, их можно импортировать: укажите адрес сайта или раздела, система просканирует страницы и связанные файлы, а вы отметите нужные.

После загрузки система сама извлекает текст, составляет краткое содержание и оглавление документа и делит текст на фрагменты для поиска по смыслу. Поиск по смыслу означает, что вопрос «сколько дней на возврат» найдет пункт «срок возврата товара составляет 14 календарных дней», даже если слова не совпадают.

Шаг 4. Задайте первые вопросы

Откройте AI-чат, выберите проект и спросите о том, что чаще всего спрашивают коллеги или клиенты. Например:

Ассистент ищет ответ в несколько шагов: делает несколько поисковых запросов подряд, подтягивает соседние фрагменты и сверяется с оглавлением документа. К ответу прилагаются ссылки на конкретные фрагменты-источники. Если информации в базе нет, ассистент прямо об этом говорит.

Шаг 5. Подключите команду

Пригласите коллег по email и назначьте роль — участник или администратор. Уровень доступа задается для проекта и для документа. Права проверяются еще на этапе поиска, поэтому закрытые фрагменты не попадают в ответ тому, кому они не положены. Для каждого пользователя можно задать лимит расходов, а в истории запросов видна стоимость каждого вопроса.

Дальше базу можно подключить туда, где работают люди: чат-виджетом на сайт или ботом в рабочие группы Telegram.

Как проверить качество ответов

Не стоит переводить сотрудников на новый инструмент после трех удачных вопросов. Проведите небольшую проверку.

1. Соберите 20–30 реальных вопросов. Возьмите их из переписки поддержки, вопросов новичков, обращений в HR. Важно, чтобы это были формулировки живых людей, а не заголовки из документов.

2. Проверьте каждую ссылку. Откройте источник и убедитесь, что в нем действительно написано то, что в ответе. Особое внимание — цифрам, датам и суммам.

3. Задайте вопросы-ловушки. Это вопросы, ответа на которые в документах точно нет:

Хорошая система ответит, что информации нет, а не придумает правдоподобную скидку.

4. Проверьте вопросы на стыке документов. Например: «Можно ли менеджеру одобрить возврат, если сумма больше лимита?» Ответ требует сведений и из регламента возвратов, и из положения о полномочиях.

5. Проверьте права доступа. Зайдите под учетной записью с ролью Участник и спросите про документ, закрытый для этой роли. Ответа быть не должно.

6. Повторите после обновления. Замените документ новой версией и убедитесь, что ответ изменился.

Типичные ошибки

Как это решается в Pragmaticus

Pragmaticus — готовая нейросеть по документам компании: вы загружаете файлы или импортируете страницы сайта, а ассистент отвечает со ссылками на фрагменты-источники и честно говорит, когда ответа в базе нет. Права доступа проверяются до того, как фрагменты попадут в языковую модель, а оплата идет по факту, без подписки. Типовой сценарий для команды описан на странице базы знаний для сотрудников, а если нужна установка на ваших серверах или доработки под задачу, посмотрите раздел о RAG-системе.

Ещё статьи