Локальный ИИ в закрытом контуре компании
Мы разворачиваем нейросети и LLM на серверах заказчика: без передачи документов и запросов во внешнее облако, с соответствием требованиям 152-ФЗ к обработке персональных данных. Подходит там, где данные не должны покидать периметр компании, — юристам, закупкам, медицине, промышленности и госсектору.
Зачем бизнесу локальный ИИ
Публичные ИИ-сервисы отправляют каждый запрос — и часто сам документ целиком — на серверы внешнего провайдера. Для договора, тендерной документации, истории болезни или производственных данных это чаще всего не вопрос удобства, а условие, при котором работа с ИИ вообще допустима. Локальное развёртывание переносит и модель, и обработку данных в контур заказчика: данные не покидают периметр компании ни на одном из этапов.
Это не «облако, но медленнее» — это другой периметр ответственности. Мы отвечаем за то, что модель работает на вашей инфраструктуре предсказуемо и без внешних зависимостей; вы сохраняете полный контроль над тем, куда идут данные.
Что разворачиваем
- LLM для инференса — открытые модели (Llama, Qwen, российские модели уровня GigaChat/YandexGPT в open-weight части) под конкретную задачу и доступный объём видеопамяти.
- RAG по базе знаний — модель отвечает на основе ваших регламентов, инструкций и документов, а не только по тому, чему её обучили изначально. Подробнее — в статье что такое RAG.
- Локальные ИИ-агенты — сценарии, где модель не только отвечает, но и выполняет действия в ваших системах (поиск в документах, заполнение карточек, маршрутизация обращений). Разбор термина — в статье что такое ИИ-агент.
Сравнение: облако, коробка и локальное развёртывание
| Подход | Что даёт | Ограничение |
|---|---|---|
| Публичный облачный ИИ | Запуск за день, платите за запросы | Документы уходят во внешнее облако; для договоров, закупок и медданных обычно неприемлемо |
| Коробочный чат-бот со сценариями | Дёшево, предсказуемо на простых вопросах | Не читает ваши документы и не отвечает на то, чего нет в сценарии |
| On-premise в контуре заказчика | Данные не покидают периметр, модель работает на ваших документах и регламентах | Нужен сервер и этап внедрения — это не подписка «включил и пошёл» |
| Air-gapped (без выхода в интернет) | Ни одного автоматического исходящего соединения — максимальный уровень изоляции | Обновления моделей — только вручную, с проверкой подписи и хэша |
Требования к инфраструктуре
Ориентир по железу — конкретную конфигурацию считаем после аудита задачи:
- Компактные модели (7–8B) — для чат-бота или RAG по базе знаний хватает одной GPU с 16–24 ГБ видеопамяти.
- Модели среднего размера (13–34B) в квантованном виде — GPU от 48 ГБ видеопамяти.
- Модели от 70B и параллельное дообучение — кластер из нескольких GPU.
- Отдельно — дисковое пространство под веса моделей и логи, и сетевая изоляция контура при air-gapped варианте.
Схема развёртывания и air-gapped вариант
Для большинства задач достаточно on-premise с ограниченным исходящим доступом. Там, где нужен максимальный уровень изоляции — оборонные и режимные объекты, критическая инфраструктура — разворачиваем air-gapped контур: сегментация сети, доставка обновлений вручную, свой MLOps-контур без внешних вызовов. Подробная архитектура — в статье про закрытый контур AI (air-gapped).
Дообучение моделей под ваши задачи
Базовая модель отвечает общими словами, пока не увидит вашу терминологию и типовые формулировки. Дообучаем через LoRA/QLoRA — эти методы адаптируют небольшую долю параметров и обходятся кратно дешевле полного дообучения всей модели. Разбор методов, стоимости и сроков — в статье про дообучение LLM: fine-tuning, LoRA.
Передача исходников и выход-стратегия
Отдельный риск закрытого контура — привязка к подрядчику: если работа встроена в инфраструктуру заказчика, важно заранее понимать, что останется у вас, если сотрудничество прекратится. Условия передачи кода, весов дообученной модели и документации фиксируются в договоре до начала работ. План перехода — в статье про выход-стратегию ИИ-проекта.
Цены и сроки
Развёртывание в закрытом контуре — часть персональной разработки: от 44 900 ₽, точная стоимость зависит от размера модели, требований к инфраструктуре и объёма интеграций. Локальный вариант также доступен как опция у части готовых продуктов каталога — например, у ИИ-ассистента для 1С, ИИ-бота техподдержки и ИИ-энергоменеджера. Типовой порядок работ: аудит задачи и данных → выбор модели → развёртывание и, если нужно, дообучение → интеграции → тест на ваших документах → передача в эксплуатацию.
Кейсы
Примеры внедрений с цифрами — в разделе кейсов. Если задача похожа на уже решённую — расчёт НМЦК в закупках, техподдержку на базе знаний или энергомониторинг — быстрее отталкиваться от готового продукта и переносить его в закрытый контур, а не начинать с нуля.
Частые вопросы
Чем локальный ИИ отличается от обычного облачного сервиса?
Модель и все данные, с которыми она работает, остаются на серверах заказчика. Запросы, документы и результаты не уходят к внешнему провайдеру API — это снимает вопрос о том, где физически хранятся и обрабатываются чувствительные данные.
Нужен ли для этого выход в интернет?
Нет, если того требует контур. Возможны два варианта: on-premise с ограниченным исходящим доступом (обновления по расписанию) и air-gapped — без единого автоматического исходящего соединения, когда веса моделей и обновления завозятся вручную с проверкой подписи и хэша.
Какой сервер нужен для локального ИИ?
Зависит от размера модели и задачи. Компактные модели 7–8B для чат-бота или RAG по базе знаний работают на одной GPU с 16–24 ГБ видеопамяти. Модели среднего размера в квантованном виде (13–34B) требуют GPU от 48 ГБ. Для моделей от 70B и параллельного дообучения нужен кластер из нескольких GPU. Точную конфигурацию считаем после аудита задачи.
Можно ли дообучить модель под наши документы и терминологию?
Да, через LoRA или QLoRA — эти методы дообучают небольшую долю параметров и требуют кратно меньше видеопамяти и времени, чем полное дообучение. Ориентир по стоимости и срокам — в статье о дообучении LLM.
Что будет с решением, если мы захотим сменить подрядчика?
Вы получаете код, веса дообученной модели, инфраструктуру как код и документацию по эксплуатации — это прописывается в договоре до начала работ, а не решается постфактум. Подробный план перехода — в статье про выход-стратегию.
Подходит ли локальное развёртывание под 152-ФЗ и 44-ФЗ?
Локальное развёртывание — это то, что чаще всего запрашивают операторы персональных данных и участники закупок по 44-ФЗ: данные не покидают периметр компании, а значит проще выполнить требования к их размещению и обработке. Итоговое соответствие всегда проверяется под конкретный регламент заказчика.
Сколько стоит и сколько занимает внедрение?
Стоимость зависит от объёма: размера модели, требований к инфраструктуре и глубины интеграций. Развёртывание в закрытом контуре доступно как часть персональной разработки (от 44 900 ₽) и как опция части готовых продуктов каталога. Срок называем после разбора задачи, а не до него.
