Локальное развёртывание ИИ на архитектуре заказчикаЛюбая кастомизация и доработка бота
Главная / Услуги / Локальный ИИ на сервере заказчика
On-premise развёртывание

Локальный ИИ и LLM на сервере заказчика: 152-ФЗ

Мы разворачиваем нейросети и LLM на серверах заказчика: Ollama для прототипа, vLLM для нагрузки, без передачи документов во внешнее облако и с учётом 152-ФЗ. Это коммерческое внедрение. Если ИБ запрещает любой исходящий канал — схема изоляции разобрана в статье про air-gapped архитектуру; сравнение движков — в Ollama vs vLLM.

от 40 000 ₽
единовременно, развёртывание on-premise
после аудита
срок называем после разбора задачи, а не до него
Посмотреть кейсы
  • Без передачи данных во внешнее облако
  • 152-ФЗ и закупки по 44-ФЗ
  • Локальная нейросеть на вашем GPU

Что вы получаете

Данные не покидают периметр

Запросы, документы и результаты не уходят к внешнему провайдеру API — и модель, и обработка данных находятся в контуре заказчика.

152-ФЗ и 44-ФЗ

Локальное развёртывание чаще всего запрашивают операторы персональных данных и участники закупок по 44-ФЗ.

RAG по вашей базе знаний

Модель отвечает на основе ваших регламентов, инструкций и документов, а не только по тому, чему её обучили изначально.

Открытые модели под задачу

Llama, Qwen, российские модели уровня GigaChat/YandexGPT в open-weight части — под конкретную задачу и доступный объём видеопамяти.

Дообучение LoRA/QLoRA

Адаптация модели под вашу терминологию — кратно дешевле полного дообучения всей модели.

Передача исходников

Код, веса дообученной модели, инфраструктура как код и документация — условия фиксируются в договоре до начала работ.

01 / 07

Зачем бизнесу локальный ИИ

Публичные ИИ-сервисы отправляют каждый запрос — и часто сам документ целиком — на серверы внешнего провайдера. Для договора, тендерной документации, истории болезни или производственных данных это чаще всего не вопрос удобства, а условие, при котором работа с ИИ вообще допустима. Локальное развёртывание переносит и модель, и обработку данных в контур заказчика: данные не покидают периметр компании ни на одном из этапов.

Это не «облако, но медленнее» — это другой периметр ответственности. Мы отвечаем за то, что модель работает на вашей инфраструктуре предсказуемо и без внешних зависимостей; вы сохраняете полный контроль над тем, куда идут данные.

02 / 07

Что разворачиваем

  • LLM для инференса — открытые модели (Llama, Qwen, российские модели уровня GigaChat/YandexGPT в open-weight части) на Ollama или vLLM под задачу и доступный объём видеопамяти.
  • RAG по базе знаний — модель отвечает на основе ваших регламентов, инструкций и документов, а не только по тому, чему её обучили изначально. Подробнее — в статье что такое RAG.
  • Локальные ИИ-агенты — сценарии, где модель не только отвечает, но и выполняет действия в ваших системах (поиск в документах, заполнение карточек, маршрутизация обращений). Разбор термина — в статье что такое ИИ-агент, разработка агентов и чат-ботов под ключ — на странице про ИИ-агентов и чат-ботов.
  • Изоляция по требованиям ИБ. Типовой on-premise работает с ограниченным исходящим доступом. Если нужен контур без автоматических соединений — сегментация, MLOps и офлайн-доставка моделей разобраны в статье про air-gapped архитектуру; здесь считаем внедрение LLM на вашем сервере.
03 / 07

Ollama, vLLM и локальные LLM

На практике локальную нейросеть почти всегда поднимают одним из двух движков. Ollama — быстрый старт: одна команда, удобно проверить гипотезу на ноутбуке или слабом сервере. vLLM — продакшен: непрерывный батчинг, десятки параллельных сессий на одной GPU. Оба отдают OpenAI-совместимый API, так что приложение не переписывают при переезде.

На этой странице мы продаём внедрение: железо, модель, RAG, агенты, 152-ФЗ. Замеры токенов в секунду, GGUF и команды запуска — в статье Ollama vs vLLM, чтобы услуга и публикация не боролись за один и тот же сниппет.

04 / 07

Сравнение: облако, коробка и локальное развёртывание

ПодходЧто даётОграничение
Публичный облачный ИИЗапуск за день, платите за запросыДокументы уходят во внешнее облако; для договоров, закупок и медданных обычно неприемлемо
Коробочный чат-бот со сценариямиДёшево, предсказуемо на простых вопросахНе читает ваши документы и не отвечает на то, чего нет в сценарии
On-premise в контуре заказчикаДанные не покидают периметр, модель работает на ваших документах и регламентахНужен сервер и этап внедрения — это не подписка «включил и пошёл»
05 / 07

Требования к инфраструктуре

Ориентир по железу — конкретную конфигурацию считаем после аудита задачи:

  • Компактные модели (7–8B) — для чат-бота или RAG по базе знаний хватает одной GPU с 16–24 ГБ видеопамяти.
  • Модели среднего размера (13–34B) в квантованном виде — GPU от 48 ГБ видеопамяти.
  • Модели от 70B и параллельное дообучение — кластер из нескольких GPU.
  • Отдельно — дисковое пространство под веса моделей и логи. Схема сети без исходящего интернета (air-gapped) — не тариф этой страницы, а архитектура в статье про изоляцию.
06 / 07

Дообучение моделей под ваши задачи

Базовая модель отвечает общими словами, пока не увидит вашу терминологию и типовые формулировки. Дообучаем через LoRA/QLoRA — эти методы адаптируют небольшую долю параметров и обходятся кратно дешевле полного дообучения всей модели. Разбор методов, стоимости и сроков — в статье про дообучение LLM: fine-tuning, LoRA.

07 / 07

Передача исходников и выход-стратегия

Отдельный риск on-premise внедрения — привязка к подрядчику: если работа встроена в инфраструктуру заказчика, важно заранее понимать, что останется у вас, если сотрудничество прекратится. Условия передачи кода, весов дообученной модели и документации фиксируются в договоре до начала работ. План перехода — в статье про выход-стратегию ИИ-проекта.

Как проходит проект

Типовой порядок работ:

  1. 1

    Аудит задачи и данных

  2. 2

    Выбор модели

  3. 3

    Развёртывание и, если нужно, дообучение

  4. 4

    Интеграции

  5. 5

    Тест на ваших документах

  6. 6

    Передача в эксплуатацию

Цены и сроки

Точная смета — после аудита задачи

Развёртывание локальной нейросети on-premise — от 40 000 ₽ единовременно, точная стоимость зависит от размера модели, требований к инфраструктуре и объёма интеграций. Локальный вариант также доступен как опция у части готовых продуктов каталога — например, у ИИ-ассистента для 1С, ИИ-бота техподдержки и ИИ-энергоменеджера.

Развёртывание on-premise

Популярный
от 40 000 ₽
единовременно

Модель и данные — на серверах заказчика, без передачи во внешнее облако.

  • Развёртывание LLM в вашем контуре
  • RAG по вашей базе знаний
  • Интеграции с вашими системами
  • Передача в эксплуатацию

Готовое решение

от 19 900 ₽/мес
подписка каталога, локальный вариант — как опция

Часть готовых продуктов каталога доступна с локальным развёртыванием.

  • ИИ-ассистент для 1С
  • ИИ-бот техподдержки
  • ИИ-энергоменеджер

Жёсткая изоляция сети

по расчёту
считается после аудита задачи

Без автоматических исходящих соединений. Архитектуру air-gapped разбираем в статье; здесь — смета внедрения LLM.

  • Сегментация по требованиям ИБ
  • Офлайн-обновления моделей
  • Передача в эксплуатацию

Кейсы

Примеры внедрений с цифрами — в разделе кейсов. Если задача похожа на уже решённую — расчёт НМЦК в закупках, техподдержку на базе знаний или энергомониторинг — быстрее отталкиваться от готового продукта и переносить его on-premise, а не начинать с нуля.

Опишите требования вашей службы ИБ и доступное железо — предложим конфигурацию контура, а срок и точную стоимость назовём после разбора задачи.

Смежные услуги

Все услуги целиком — на странице «Услуги».

Частые вопросы

Ollama или vLLM — что ставите в контуре?

Для прототипа и одного пользователя обычно Ollama, для нагрузки отдела — vLLM. Оба отдают OpenAI-совместимый API, данные не уходят в облако. Техническое сравнение и замеры — в статье «Ollama vs vLLM»; на этой странице — внедрение под ключ.

Чем эта услуга отличается от статьи про air-gapped архитектуру?

Услуга — коммерческое внедрение локальной нейросети и LLM на вашем сервере: Ollama или vLLM, RAG, агенты, 152-ФЗ, смета от 40 000 ₽. Статья в блоге — как устроена изоляция без исходящего интернета: сегментация, MLOps, data diode. H1 и кластеры у страниц разные.

Чем локальный ИИ отличается от обычного облачного сервиса?

Модель и все данные, с которыми она работает, остаются на серверах заказчика. Запросы, документы и результаты не уходят к внешнему провайдеру API — это снимает вопрос о том, где физически хранятся и обрабатываются чувствительные данные.

Нужен ли для этого выход в интернет?

Для типового on-premise достаточно ограниченного исходящего доступа (обновления по расписанию). Если ИБ требует ноль автоматических соединений — это уже air-gapped схема: сегментация, офлайн-доставка весов. Разбор архитектуры — в статье про air-gapped, смета внедрения LLM — на этой странице.

Какой сервер нужен для локального ИИ?

Зависит от размера модели и задачи. Компактные модели 7–8B для чат-бота или RAG по базе знаний работают на одной GPU с 16–24 ГБ видеопамяти. Модели среднего размера в квантованном виде (13–34B) требуют GPU от 48 ГБ. Для моделей от 70B и параллельного дообучения нужен кластер из нескольких GPU. Точную конфигурацию считаем после аудита задачи.

Можно ли дообучить модель под наши документы и терминологию?

Да, через LoRA или QLoRA — эти методы дообучают небольшую долю параметров и требуют кратно меньше видеопамяти и времени, чем полное дообучение. Ориентир по стоимости и срокам — в статье о дообучении LLM.

Что будет с решением, если мы захотим сменить подрядчика?

Вы получаете код, веса дообученной модели, инфраструктуру как код и документацию по эксплуатации — это прописывается в договоре до начала работ, а не решается постфактум. Подробный план перехода — в статье про выход-стратегию.

Подходит ли локальное развёртывание под 152-ФЗ и 44-ФЗ?

Локальное развёртывание — это то, что чаще всего запрашивают операторы персональных данных и участники закупок по 44-ФЗ: данные не покидают периметр компании, а значит проще выполнить требования к их размещению и обработке. Итоговое соответствие всегда проверяется под конкретный регламент заказчика.

Сколько стоит и сколько занимает внедрение?

Развёртывание локальной нейросети on-premise — от 40 000 ₽ единовременно. Точная стоимость зависит от объёма: размера модели, требований к инфраструктуре и глубины интеграций. Локальный вариант доступен и как опция части готовых продуктов каталога. Срок называем после разбора задачи, а не до него.