Локальное развёртывание ИИ на архитектуре заказчикаЛюбая кастомизация и доработка бота
Главная / Локальный ИИ в закрытом контуре

Локальный ИИ в закрытом контуре компании

Мы разворачиваем нейросети и LLM на серверах заказчика: без передачи документов и запросов во внешнее облако, с соответствием требованиям 152-ФЗ к обработке персональных данных. Подходит там, где данные не должны покидать периметр компании, — юристам, закупкам, медицине, промышленности и госсектору.

Зачем бизнесу локальный ИИ

Публичные ИИ-сервисы отправляют каждый запрос — и часто сам документ целиком — на серверы внешнего провайдера. Для договора, тендерной документации, истории болезни или производственных данных это чаще всего не вопрос удобства, а условие, при котором работа с ИИ вообще допустима. Локальное развёртывание переносит и модель, и обработку данных в контур заказчика: данные не покидают периметр компании ни на одном из этапов.

Это не «облако, но медленнее» — это другой периметр ответственности. Мы отвечаем за то, что модель работает на вашей инфраструктуре предсказуемо и без внешних зависимостей; вы сохраняете полный контроль над тем, куда идут данные.

Что разворачиваем

  • LLM для инференса — открытые модели (Llama, Qwen, российские модели уровня GigaChat/YandexGPT в open-weight части) под конкретную задачу и доступный объём видеопамяти.
  • RAG по базе знаний — модель отвечает на основе ваших регламентов, инструкций и документов, а не только по тому, чему её обучили изначально. Подробнее — в статье что такое RAG.
  • Локальные ИИ-агенты — сценарии, где модель не только отвечает, но и выполняет действия в ваших системах (поиск в документах, заполнение карточек, маршрутизация обращений). Разбор термина — в статье что такое ИИ-агент.

Сравнение: облако, коробка и локальное развёртывание

ПодходЧто даётОграничение
Публичный облачный ИИЗапуск за день, платите за запросыДокументы уходят во внешнее облако; для договоров, закупок и медданных обычно неприемлемо
Коробочный чат-бот со сценариямиДёшево, предсказуемо на простых вопросахНе читает ваши документы и не отвечает на то, чего нет в сценарии
On-premise в контуре заказчикаДанные не покидают периметр, модель работает на ваших документах и регламентахНужен сервер и этап внедрения — это не подписка «включил и пошёл»
Air-gapped (без выхода в интернет)Ни одного автоматического исходящего соединения — максимальный уровень изоляцииОбновления моделей — только вручную, с проверкой подписи и хэша

Требования к инфраструктуре

Ориентир по железу — конкретную конфигурацию считаем после аудита задачи:

  • Компактные модели (7–8B) — для чат-бота или RAG по базе знаний хватает одной GPU с 16–24 ГБ видеопамяти.
  • Модели среднего размера (13–34B) в квантованном виде — GPU от 48 ГБ видеопамяти.
  • Модели от 70B и параллельное дообучение — кластер из нескольких GPU.
  • Отдельно — дисковое пространство под веса моделей и логи, и сетевая изоляция контура при air-gapped варианте.

Схема развёртывания и air-gapped вариант

Для большинства задач достаточно on-premise с ограниченным исходящим доступом. Там, где нужен максимальный уровень изоляции — оборонные и режимные объекты, критическая инфраструктура — разворачиваем air-gapped контур: сегментация сети, доставка обновлений вручную, свой MLOps-контур без внешних вызовов. Подробная архитектура — в статье про закрытый контур AI (air-gapped).

Дообучение моделей под ваши задачи

Базовая модель отвечает общими словами, пока не увидит вашу терминологию и типовые формулировки. Дообучаем через LoRA/QLoRA — эти методы адаптируют небольшую долю параметров и обходятся кратно дешевле полного дообучения всей модели. Разбор методов, стоимости и сроков — в статье про дообучение LLM: fine-tuning, LoRA.

Передача исходников и выход-стратегия

Отдельный риск закрытого контура — привязка к подрядчику: если работа встроена в инфраструктуру заказчика, важно заранее понимать, что останется у вас, если сотрудничество прекратится. Условия передачи кода, весов дообученной модели и документации фиксируются в договоре до начала работ. План перехода — в статье про выход-стратегию ИИ-проекта.

Цены и сроки

Развёртывание в закрытом контуре — часть персональной разработки: от 44 900 ₽, точная стоимость зависит от размера модели, требований к инфраструктуре и объёма интеграций. Локальный вариант также доступен как опция у части готовых продуктов каталога — например, у ИИ-ассистента для 1С, ИИ-бота техподдержки и ИИ-энергоменеджера. Типовой порядок работ: аудит задачи и данных → выбор модели → развёртывание и, если нужно, дообучение → интеграции → тест на ваших документах → передача в эксплуатацию.

Кейсы

Примеры внедрений с цифрами — в разделе кейсов. Если задача похожа на уже решённую — расчёт НМЦК в закупках, техподдержку на базе знаний или энергомониторинг — быстрее отталкиваться от готового продукта и переносить его в закрытый контур, а не начинать с нуля.

Частые вопросы

Чем локальный ИИ отличается от обычного облачного сервиса?

Модель и все данные, с которыми она работает, остаются на серверах заказчика. Запросы, документы и результаты не уходят к внешнему провайдеру API — это снимает вопрос о том, где физически хранятся и обрабатываются чувствительные данные.

Нужен ли для этого выход в интернет?

Нет, если того требует контур. Возможны два варианта: on-premise с ограниченным исходящим доступом (обновления по расписанию) и air-gapped — без единого автоматического исходящего соединения, когда веса моделей и обновления завозятся вручную с проверкой подписи и хэша.

Какой сервер нужен для локального ИИ?

Зависит от размера модели и задачи. Компактные модели 7–8B для чат-бота или RAG по базе знаний работают на одной GPU с 16–24 ГБ видеопамяти. Модели среднего размера в квантованном виде (13–34B) требуют GPU от 48 ГБ. Для моделей от 70B и параллельного дообучения нужен кластер из нескольких GPU. Точную конфигурацию считаем после аудита задачи.

Можно ли дообучить модель под наши документы и терминологию?

Да, через LoRA или QLoRA — эти методы дообучают небольшую долю параметров и требуют кратно меньше видеопамяти и времени, чем полное дообучение. Ориентир по стоимости и срокам — в статье о дообучении LLM.

Что будет с решением, если мы захотим сменить подрядчика?

Вы получаете код, веса дообученной модели, инфраструктуру как код и документацию по эксплуатации — это прописывается в договоре до начала работ, а не решается постфактум. Подробный план перехода — в статье про выход-стратегию.

Подходит ли локальное развёртывание под 152-ФЗ и 44-ФЗ?

Локальное развёртывание — это то, что чаще всего запрашивают операторы персональных данных и участники закупок по 44-ФЗ: данные не покидают периметр компании, а значит проще выполнить требования к их размещению и обработке. Итоговое соответствие всегда проверяется под конкретный регламент заказчика.

Сколько стоит и сколько занимает внедрение?

Стоимость зависит от объёма: размера модели, требований к инфраструктуре и глубины интеграций. Развёртывание в закрытом контуре доступно как часть персональной разработки (от 44 900 ₽) и как опция части готовых продуктов каталога. Срок называем после разбора задачи, а не до него.

Остались вопросы?

Отправьте заявку и наш специалист свяжется с вами в ближайшее время и проконсультирует по всем вопросам.