Данные не покидают периметр
Запросы, документы и результаты не уходят к внешнему провайдеру API — и модель, и обработка данных находятся в контуре заказчика.
Мы разворачиваем нейросети и LLM на серверах заказчика: Ollama для прототипа, vLLM для нагрузки, без передачи документов во внешнее облако и с учётом 152-ФЗ. Это коммерческое внедрение. Если ИБ запрещает любой исходящий канал — схема изоляции разобрана в статье про air-gapped архитектуру; сравнение движков — в Ollama vs vLLM.
Запросы, документы и результаты не уходят к внешнему провайдеру API — и модель, и обработка данных находятся в контуре заказчика.
Локальное развёртывание чаще всего запрашивают операторы персональных данных и участники закупок по 44-ФЗ.
Модель отвечает на основе ваших регламентов, инструкций и документов, а не только по тому, чему её обучили изначально.
Llama, Qwen, российские модели уровня GigaChat/YandexGPT в open-weight части — под конкретную задачу и доступный объём видеопамяти.
Адаптация модели под вашу терминологию — кратно дешевле полного дообучения всей модели.
Код, веса дообученной модели, инфраструктура как код и документация — условия фиксируются в договоре до начала работ.
Публичные ИИ-сервисы отправляют каждый запрос — и часто сам документ целиком — на серверы внешнего провайдера. Для договора, тендерной документации, истории болезни или производственных данных это чаще всего не вопрос удобства, а условие, при котором работа с ИИ вообще допустима. Локальное развёртывание переносит и модель, и обработку данных в контур заказчика: данные не покидают периметр компании ни на одном из этапов.
Это не «облако, но медленнее» — это другой периметр ответственности. Мы отвечаем за то, что модель работает на вашей инфраструктуре предсказуемо и без внешних зависимостей; вы сохраняете полный контроль над тем, куда идут данные.
На практике локальную нейросеть почти всегда поднимают одним из двух движков. Ollama — быстрый старт: одна команда, удобно проверить гипотезу на ноутбуке или слабом сервере. vLLM — продакшен: непрерывный батчинг, десятки параллельных сессий на одной GPU. Оба отдают OpenAI-совместимый API, так что приложение не переписывают при переезде.
На этой странице мы продаём внедрение: железо, модель, RAG, агенты, 152-ФЗ. Замеры токенов в секунду, GGUF и команды запуска — в статье Ollama vs vLLM, чтобы услуга и публикация не боролись за один и тот же сниппет.
| Подход | Что даёт | Ограничение |
|---|---|---|
| Публичный облачный ИИ | Запуск за день, платите за запросы | Документы уходят во внешнее облако; для договоров, закупок и медданных обычно неприемлемо |
| Коробочный чат-бот со сценариями | Дёшево, предсказуемо на простых вопросах | Не читает ваши документы и не отвечает на то, чего нет в сценарии |
| On-premise в контуре заказчика | Данные не покидают периметр, модель работает на ваших документах и регламентах | Нужен сервер и этап внедрения — это не подписка «включил и пошёл» |
Ориентир по железу — конкретную конфигурацию считаем после аудита задачи:
Базовая модель отвечает общими словами, пока не увидит вашу терминологию и типовые формулировки. Дообучаем через LoRA/QLoRA — эти методы адаптируют небольшую долю параметров и обходятся кратно дешевле полного дообучения всей модели. Разбор методов, стоимости и сроков — в статье про дообучение LLM: fine-tuning, LoRA.
Отдельный риск on-premise внедрения — привязка к подрядчику: если работа встроена в инфраструктуру заказчика, важно заранее понимать, что останется у вас, если сотрудничество прекратится. Условия передачи кода, весов дообученной модели и документации фиксируются в договоре до начала работ. План перехода — в статье про выход-стратегию ИИ-проекта.
Типовой порядок работ:
Точная смета — после аудита задачи
Развёртывание локальной нейросети on-premise — от 40 000 ₽ единовременно, точная стоимость зависит от размера модели, требований к инфраструктуре и объёма интеграций. Локальный вариант также доступен как опция у части готовых продуктов каталога — например, у ИИ-ассистента для 1С, ИИ-бота техподдержки и ИИ-энергоменеджера.
Модель и данные — на серверах заказчика, без передачи во внешнее облако.
Часть готовых продуктов каталога доступна с локальным развёртыванием.
Без автоматических исходящих соединений. Архитектуру air-gapped разбираем в статье; здесь — смета внедрения LLM.
Примеры внедрений с цифрами — в разделе кейсов. Если задача похожа на уже решённую — расчёт НМЦК в закупках, техподдержку на базе знаний или энергомониторинг — быстрее отталкиваться от готового продукта и переносить его on-premise, а не начинать с нуля.
Опишите требования вашей службы ИБ и доступное железо — предложим конфигурацию контура, а срок и точную стоимость назовём после разбора задачи.
Все услуги целиком — на странице «Услуги».
Для прототипа и одного пользователя обычно Ollama, для нагрузки отдела — vLLM. Оба отдают OpenAI-совместимый API, данные не уходят в облако. Техническое сравнение и замеры — в статье «Ollama vs vLLM»; на этой странице — внедрение под ключ.
Услуга — коммерческое внедрение локальной нейросети и LLM на вашем сервере: Ollama или vLLM, RAG, агенты, 152-ФЗ, смета от 40 000 ₽. Статья в блоге — как устроена изоляция без исходящего интернета: сегментация, MLOps, data diode. H1 и кластеры у страниц разные.
Модель и все данные, с которыми она работает, остаются на серверах заказчика. Запросы, документы и результаты не уходят к внешнему провайдеру API — это снимает вопрос о том, где физически хранятся и обрабатываются чувствительные данные.
Для типового on-premise достаточно ограниченного исходящего доступа (обновления по расписанию). Если ИБ требует ноль автоматических соединений — это уже air-gapped схема: сегментация, офлайн-доставка весов. Разбор архитектуры — в статье про air-gapped, смета внедрения LLM — на этой странице.
Зависит от размера модели и задачи. Компактные модели 7–8B для чат-бота или RAG по базе знаний работают на одной GPU с 16–24 ГБ видеопамяти. Модели среднего размера в квантованном виде (13–34B) требуют GPU от 48 ГБ. Для моделей от 70B и параллельного дообучения нужен кластер из нескольких GPU. Точную конфигурацию считаем после аудита задачи.
Да, через LoRA или QLoRA — эти методы дообучают небольшую долю параметров и требуют кратно меньше видеопамяти и времени, чем полное дообучение. Ориентир по стоимости и срокам — в статье о дообучении LLM.
Вы получаете код, веса дообученной модели, инфраструктуру как код и документацию по эксплуатации — это прописывается в договоре до начала работ, а не решается постфактум. Подробный план перехода — в статье про выход-стратегию.
Локальное развёртывание — это то, что чаще всего запрашивают операторы персональных данных и участники закупок по 44-ФЗ: данные не покидают периметр компании, а значит проще выполнить требования к их размещению и обработке. Итоговое соответствие всегда проверяется под конкретный регламент заказчика.
Развёртывание локальной нейросети on-premise — от 40 000 ₽ единовременно. Точная стоимость зависит от объёма: размера модели, требований к инфраструктуре и глубины интеграций. Локальный вариант доступен и как опция части готовых продуктов каталога. Срок называем после разбора задачи, а не до него.