Многие компании хотели бы получить ИИ-ассистента, который отвечает по внутренним регламентам, договорам и технической документации. Но часть из них не может отправлять такие документы во внешний облачный сервис: мешают внутренние правила, коммерческая тайна или устройство сети. Для таких случаев есть локальная RAG-система — та же технология, но установленная на серверах самой компании.

В статье разберем, чем локальная установка отличается от облака, когда она действительно нужна, из каких частей состоит система и как проходит проект внедрения.

Что такое локальная RAG-система

RAG-система — это ИИ-ассистент, который перед ответом ищет нужные фрагменты в документах компании и формулирует ответ на их основе, со ссылками на источники. Как это работает по шагам, мы подробно разобрали в статье «Что такое RAG-система», здесь повторять не будем.

Локальная RAG-система — это вариант установки, при котором все компоненты работают в инфраструктуре заказчика: на его серверах или в выделенном частном облаке. Такую установку называют on-premise (англ. «в помещении», то есть на своей площадке). Документы, их фрагменты и поисковые индексы хранятся внутри контура компании, а доступ к системе есть только у ее сотрудников.

Часто такой запрос формулируют проще: «нужна локальная нейросеть для компании» или «нейросеть на своем сервере». На практике под этим почти всегда понимают именно RAG: компании нужна не отдельная языковая модель, а ассистент, который знает ее документы.

Облако или локальная установка: сравнение

У обоих вариантов одна задача — отвечать по документам. Разница в том, кто отвечает за инфраструктуру и сколько усилий нужно на старте.

Критерий Облачный сервис Локальная установка (on-premise)
Сроки запуска От нескольких часов: регистрация, загрузка документов Недели: подготовка серверов, установка, настройка, интеграции
Стоимость Низкий порог входа, оплата за использование Затраты на инфраструктуру, внедрение и сопровождение
Контроль над данными Документы обрабатываются на стороне поставщика Документы и индексы остаются в контуре компании
Обслуживание Полностью на поставщике Нужен администратор со стороны заказчика или договор сопровождения
Обновления Приходят автоматически Устанавливаются по согласованному графику, после проверки
Интеграции В рамках того, что предусмотрено в продукте Можно подключить внутренние системы и источники

Короткий вывод: облако быстрее и дешевле на старте, локальная установка дает больше контроля, но требует ресурсов. Если жестких ограничений нет, разумно начать с облака и проверить качество ответов на своих документах.

Когда локальная RAG-система действительно нужна

Локальная установка — не «более правильный» вариант, а ответ на конкретные ограничения. Вот типичные ситуации, когда без нее не обойтись.

Когда локальная установка, скорее всего, не нужна:

Частый компромисс: начать с облака на неконфиденциальных документах, оценить пользу и уже потом переходить к локальной установке для чувствительных материалов.

Из чего состоит локальная RAG-система

Набор компонентов такой же, как у облачной системы. Разница в том, что каждый из них нужно развернуть и поддерживать в своей инфраструктуре.

Компонент Что делает На что обратить внимание при локальной установке
Хранилище документов Хранит исходные файлы и извлеченный текст Объем, резервное копирование
Векторная база данных Хранит эмбеддинги фрагментов и ищет близкие по смыслу Скорость поиска при росте базы
Модель эмбеддингов Превращает фрагменты и вопросы в числовые векторы, по которым ищется смысл Качество на русском языке, ресурсы на индексацию
Языковая модель (LLM) Формулирует ответ по найденным фрагментам Где она работает: внутри контура или снаружи
Права доступа Определяют, какие документы видит конкретный пользователь Роли, уровни доступа, связь с учетными записями компании
Интерфейсы Чат в веб-кабинете, виджет, бот, API Какие каналы доступны внутри контура

Эмбеддинг — это набор чисел, который описывает смысл фрагмента текста. Тексты с похожим смыслом получают похожие наборы чисел, поэтому система находит нужное, даже если в вопросе другие слова, чем в документе.

Отдельно про права доступа. В локальной системе они не менее важны, чем в облаке: если отдел продаж и бухгалтерия пользуются одним ассистентом, каждый должен видеть только свои документы. Проверять права нужно на этапе поиска, до того как фрагменты попадут в языковую модель. Иначе содержание закрытого документа может оказаться в пересказе.

Инфраструктура: своя модель или внешняя

Главное решение при проектировании — где будет работать языковая модель. Есть два варианта.

  1. Модель внутри контура. Языковая модель запускается на серверах компании. Для этого обычно нужны серверы с графическими ускорителями (GPU) — процессорами, которые быстро выполняют вычисления нейросети. Плюс: ни один фрагмент документов не покидает контур. Минус: затраты на оборудование и его обслуживание, а модели, которые помещаются на собственное оборудование, бывают слабее крупных внешних.
  2. Внешняя модель. Хранилище, поиск и права доступа работают у вас, а для формулировки ответа найденные фрагменты отправляются во внешнюю языковую модель. Плюс: не нужно мощное оборудование, качество ответов выше. Минус: во внешний сервис уходят фрагменты, пусть и небольшие, а не весь архив.

Какой вариант выбрать, зависит от требований к безопасности, бюджета и ожидаемой нагрузки: сколько сотрудников будут задавать вопросы одновременно. Конкретную конфигурацию серверов имеет смысл считать после того, как ясны эти параметры, а не до.

Этапы внедрения локальной RAG-системы

Проект внедрения обычно состоит из шести этапов. Сроки каждого зависят от объема документов и числа интеграций.

  1. Обследование и требования. Какие документы попадут в базу, кто будет пользоваться ассистентом, какие есть ограничения по безопасности, где будет работать языковая модель.
  2. Подготовка инфраструктуры. Выделение серверов или ресурсов в частном облаке, настройка сети и доступов.
  3. Установка и базовая настройка. Развертывание компонентов, проверка, что все работает внутри контура.
  4. Загрузка документов и права доступа. Наполнение базы знаний, разбивка документов по проектам, назначение ролей.
  5. Пилот и проверка качества. Небольшая группа сотрудников задает реальные вопросы. Команда проверяет ответы и ссылки на источники, дописывает недостающие материалы.
  6. Запуск и сопровождение. Подключение остальных пользователей и каналов, обновления платформы, помощь с наполнением базы.

Совет по пилоту: заранее соберите 30–50 типичных вопросов от будущих пользователей и добавьте несколько вопросов, ответов на которые в документах точно нет. Так вы проверите и точность, и то, что ассистент честно говорит «не знаю», а не придумывает.

Что подготовить до старта

Разработка с нуля или готовая платформа с установкой у заказчика

Создание RAG-системы с нуля по туториалам выглядит быстрым: подключить библиотеку, загрузить пару файлов, получить первые ответы. Основная работа начинается позже — со сканами, таблицами, правами доступа, качеством поиска, интерфейсами и поддержкой.

Критерий Собственная разработка Готовая платформа с установкой у заказчика
Сроки Месяцы Недели: установка и настройка
Качество поиска Нужно доводить самостоятельно Уже отлажено в платформе
Интерфейсы и права доступа Разрабатываются отдельно Есть в платформе
Гибкость Полная В рамках платформы плюс доработки под задачу
Поддержка Своя команда Поставщик или по договору сопровождения

Собственная разработка RAG-систем оправдана, если ассистент — часть вашего продукта, у вас нестандартная логика ответов или уже есть команда, которая будет развивать систему годами. В остальных случаях готовая платформа с установкой на ваши серверы обычно быстрее и дешевле, а недостающее закрывается доработками.

При выборе подрядчика задайте ему несколько вопросов:

Как это решается в Pragmaticus

Pragmaticus — готовая RAG-система от Alt.Point, компании, которая занимается заказной разработкой с 2011 года. По запросу мы устанавливаем Pragmaticus на серверы заказчика или в его частное облако, а выбор языковой модели обсуждаем отдельно — под требования к безопасности и бюджет. В локальной версии есть то же, что в облачной: ответы со ссылками на фрагменты-источники, агентный поиск, роли и уровни доступа с проверкой прав до передачи фрагментов в модель. Доработки и интеграции с внутренними системами делает команда Alt.Point. Подробнее — в разделе об установке в вашем контуре и на странице RAG-системы для бизнеса. А качество ответов можно проверить заранее в облачной версии на неконфиденциальных документах.

Ещё статьи