
бенчмарк
Модель Claude Opus 5 показала результат 30,2% на новом бенчмарке ARC-AGI-3 — это в четыре раза выше предыдущего лидера GPT-5.6 Sol.
13

Дообучение LLM (fine-tuning больших языковых моделей) в российских условиях — это не только выбор архитектуры и гиперпараметров. Нужно одновременно учитывать локализацию данных по 152-ФЗ, санкционные ограничения на GPU, лицензии открытых моделей, качество русскоязычных корпусов и стоимость PEFT-методов вроде LoRA и QLoRA.
Ниже — практическое исполнительное резюме для руководителей и ML-команд: право, инфраструктура, датасеты, модели, методы дообучения, оценка качества, кейсы, риски и поэтапный план внедрения корпоративного LLM на инфраструктуре в РФ.
Закон о персональных данных обязывает хранить и обрабатывать ПДн граждан РФ на территории страны. С ужесточением правил трансграничной передачи это напрямую влияет на fine-tuning: диалоги, тикеты поддержки и внутренние документы нельзя «скармливать» зарубежным API без юридической оценки.
Проекты регулирования ИИ вводят категории «суверенных» и «национальных» моделей с требованием обрабатывать запросы и хранить данные внутри РФ. Для бизнеса это значит: даже при использовании зарубежной базы модель-сервис должен работать через российскую инфраструктуру.
По авторскому праву обучение на открытых новостях и веб-страницах обычно допустимо, но закрытые базы, платный контент без лицензии и неанонимизированные ПДн — зона риска. Отдельно учитывают экспортные ограничения на закрытые AI-модели и современные ускорители: открытые лицензии (MIT/Apache) остаются рабочим путём, а «под ключ» GPT-4-класс через западные API — нет.
Российские облака (Yandex Cloud, SberCloud, Selectel, MTS Cloud, VK Cloud) предлагают GPU предыдущих поколений и акцентируют размещение данных в дата-центрах РФ. On-prem возможен, но импорт свежих карт затруднён; отечественные CPU (Baikal, Эльбрус) для крупных LLM пока не закрывают потребность.
Ориентиры по стоимости (порядок величин): аренда A100 в облаке — сотни рублей в час; L40S на рынке РФ — сотни тысяч рублей за карту. Неделя обучения 30B на 4–8 GPU легко уходит в сотни тысяч рублей. Поэтому для среднего бизнеса критичны PEFT и квантизация, а не «полный» FT 70B.
Практика: QLoRA позволяет уместить крупные модели на GPU с ~48 ГБ памяти; LoRA снижает требования к памяти в десятки раз относительно полного обновления весов. Для кластера важны InfiniBand/быстрый Ethernet и воспроизводимое окружение (Docker, Git, фиксированные версии PyTorch/Transformers).
Качество данных определяет успех fine-tuning сильнее «магии» архитектуры. Базовые открытые источники:
Корпоративные датасеты (регламенты, FAQ, тикеты, договоры) дают максимум бизнес-эффекта, но требуют анонимизации и политики доступа. Синтетика (перевод англоязычных инструкций, генерация пар вопрос–ответ) ускоряет набор данных, но качество зависит от учительской модели и обязательной человеческой вычитки критичных примеров.
По оценкам исследований русскоязычных LLM, корпуса для претрейна/адаптации лежат в диапазоне примерно от десятков до сотен гигабайт текста — объёма достаточно для прикладных задач, если вычистить токсичность, дубли и ПДн.
Для среднего бизнеса разумная стартовая точка — открытая модель 7–13B с понятной лицензией и поддержкой кириллицы, затем LoRA/SFT под корпоративный стиль. Полностью «свои» 70B+ модели требуют капитальных затрат и редко окупаются на первом этапе.
| Модель | Параметры | Лицензия | Зачем брать |
|---|---|---|---|
| ruGPT-3XL | 1,3B | MIT | Лёгкая русская генерация, быстрые эксперименты |
| ruGPT-3.5 | 13B | MIT | База под корпоративный чат/документы |
| ruT5 / FRED-T5 | 0,7–11B | MIT | Суммаризация, перевод, seq2seq |
| ruBERT-large | ~330M | MIT | Классификация, NER, NLU (не генерация) |
| Mistral 7B | 7B | Apache/CC | Сильный open-baseline с русским |
| Falcon 7B/40B | 7–40B | Apache 2.0 | Мультилингвальный декодер |
| Llama 2 / наследники | 7–70B | ограничения Meta | Качество высоко, лицензия и экспорт — внимательно |
| BLOOM | до 176B | RAIL | Многоязычность, включая русский |
Важно: часть «отечественных» сервисов фактически опирается на иностранные ядра (например, линии Qwen/DeepSeek). Для продукта сверяйте не только бренд API, но и лицензию, локализацию инференса и стоимость токена.
Схемы вроде NVIDIA NeMo описывают итеративный цикл «данные → настройка → оценка → guardrails → деплой» — Enterprise AI Flywheel.
Комбинируйте общие метрики генерации (perplexity, BLEU/ROUGE, F1) со специализированными наборами:
Для продакшена важнее не «очки на бенчмарке», а latency, доля полезных ответов и удовлетворённость пользователей на равных запросах до/после fine-tuning.
Публичных детальных отчётов мало, но картина рынка понятна: корпорации строят чат-боты и анализ документов на русскоязычных или адаптированных базах; обучение «с нуля» 70B–700B остаётся прерогативой крупных игроков с бюджетами в миллионы долларов. Среднему бизнесу выгоднее PEFT на 7–13B плюс RAG по внутренним знаниям — прирост по прикладным метрикам часто даёт 10–20% при контролируемых затратах.
Санкции и 152-ФЗ повысили ценность on-prem и российских облаков, но увеличили стоимость железа и время поставки. Это ещё один аргумент в пользу LoRA/QLoRA вместо полного FT.
| Задача | Мощности | Время | Порядок стоимости |
|---|---|---|---|
| Fine-tuning 7–13B (LoRA) | 1–2 GPU A100 / несколько V100 | 1–2 суток | от нескольких тыс. руб. |
| Fine-tuning 30B (QLoRA) | 4–8 GPU A100 | 3–7 суток | ~100–300 тыс. руб. |
| Full FT 30B | 4–8 GPU A100 | 1–2 недели | ~500–800 тыс. руб. |
| Full FT 70B | 16+ GPU A100 | 3–4 недели | от миллионов руб. |
Полный цикл от PoC до пилота у команды 2–5 человек обычно занимает 2–4 месяца. Pretraining с нуля дороже fine-tuning на порядки — для большинства компаний это нецелесообразно.
Команда Роботок внедряет ИИ в контуре заказчика: локальное развёртывание LLM, кастомизация ботов, интеграции с Telegram и корпоративными системами, сценарии без передачи данных во внешние облака. Если нужен закрытый контур AI или дорожная карта по внедрению ИИ — оставьте заявку на консультацию.
Материал подготовлен на основе анализа законодательства РФ, практик российских облаков и открытых исследований по русскоязычным LLM. Цифры по стоимости GPU и срокам — ориентировочные и зависят от тарифов провайдера.
Отправьте заявку и наш специалист свяжется с вами в ближайшее время и проконсультирует по всем вопросам.