Тренировка ИИ-моделей на GPU-кластере DevFlux
Как команда разработки «НейроФабрики» обучила собственную большую языковую модель на 128 GPU-картах A100, ускорив цикл обучения в 2,5 раза и сократив операционные расходы.
Обучение большой языковой модели
Клиенту требовалась языковая модель на 7 млрд параметров для анализа технической документации на русском и английском языках. Предыдущая инфраструктура на арендованных инстансах не справлялась с нагрузкой: обучение одной эпохи занимало 14 дней, а стоимость месячного цикла достигала 2,3 млн ₽.
Масштаб модели
7 млрд параметров, обучение на корпусе из 4,2 трлн токенов с использованием смешанной точности FP16/BF16.
Целевой SLA
Безопасность данных модели и чекпоинтов, изоляция тензоров, шифрование данных на диске и в памяти.
Экономическая цель
Сократить стоимость одного полного цикла обучения как минимум вдвое без потери качества сходимости.
Конфигурация GPU-узлов и сети
Для обучения мы развернули выделенный кластер в региональном центре DevFlux с оптимизированной топологией InfiniBand и NVLink. Ниже — ключевые параметры конфигурации.
GPU-узлы
16 нод × 8 × NVIDIA A100 80 GB (HBM2e) с NVLink 4.0, суммарно 128 GPU-карт и 10,2 ТБ видеопамяти.
Сеть
Внутрикластерная связка InfiniBand NDR 400 Gbps с топологией Fat-Tree, задержка между узлами менее 2 мкс.
Хранилище
Объединённый NVMe-пул на 384 ТБ с пропускной способностью 12 ГБ/с и параллельным доступом через Lustre.
Операционная система
Ubuntu 22.04 LTS, CUDA 12.2, NCCL 2.18.3, Docker 24.0 с поддержкой nvidia-container-toolkit.
Оркестрация
DevFlux Kubernetes с кастомными GPU-распределителями и приоритизацией задач обучения и валидации.
Мониторинг
Сбор метрик DC GM, DCGM и Prometheus каждые 10 секунд, алерты при отклонении температуры выше 82 °C.
Распределённое обучение и шардинг данных
Мы разбили обучение на несколько независимых осей параллелизма и настроили шардинг датасета по узлам, чтобы минимизировать пересылку тензоров.
Data Parallelism
16 реплик модели на 16 GPU-узлах, синхронизация градиентов через AllReduce с компрессией градиентов.
Tensor Parallelism
Разбиение матриц по 8 картам внутри узла через NVLink, что снижает объём меж-узловой коммуникации на 64%.
ZeRO Stage 3
Шардинг оптимизатора, градиентов и весов по всем 128 GPU, экономия 7,8 ТБ видеопамяти на эпоху.
Шардинг датасета
Корпус разбит на 512 шардов по 8,2 ГБ, каждый узел читает только свой диапазон — без повторных IO.
Пipelining
14-модульный пайплайн с микро-батчами по 128 последовательностей, загрузка GPU поддерживается на 94%.
Автоскейлинг чекпоинтов
Сохранение состояния каждые 2 000 итераций с асинхронной записью — простой на восстановление менее 90 секунд.
Технические характеристики и замеры
Ниже приведены измеренные показатели за полный цикл обучения модели на 7 млрд параметров (3 эпохи, 4,2 трлн токенов) на кластере DevFlux.
Токены в секунду
1,84 млн токенов/сек на весь кластер, пиковая производительность — 2,1 млн ток/сек на итерациях с батчем 1024.
Время итерации
Среднее 0,42 сек на шаг обучения при батче 1024 последовательностей и длине контекста 2048 токенов.
Сходимость
Перекрёстная энтропия на валидационном наборе снизилась с 2,34 до 1,18 бит/символ за 3 эпохи.
Пропускная сеть
Фактическая пропускная InfiniBand 372 Гбит/с (93% от номинала NDR 400 Гбит/с) на каждом узле.
Эффективность MFU
Model FLOPs Utilization — 58%, что на 12 пунктов выше среднего показателя для кластеров такого масштаба.
Надёжность
За 18 дней непрерывного обучения — 0 критических сбоев, 3 автоматических восстановления отдельных GPU-карт.
Слово команды «НейроФабрики»
«Переход на DevFlux сократил время полного цикла обучения с 14 дней до 5,6 дней. Мы получили предсказуемую стоимость и смогли запустить в 3 раза больше экспериментов в том же бюджете. Команда ML-инженеров DevFlux помогала с настройкой параллелизма на каждом этапе».
Андрей Соболев
Технический директор, «НейроФабрика»
Ключевые решения
Выделенный кластер 128 GPU A100, InfiniBand NDR, ZeRO Stage 3, шардинг датасета на 512 порций, асинхронные чекпоинты каждые 2 000 итераций.
Итог: 2,5× ускорение, −47% стоимости цикла, 0 критических инцидентов за 18 дней.
Обсудите свой ML-проект с нашей командой
Наши ML-инженеры помогут подобрать конфигурацию GPU-кластера, оценить бюджет и спланировать стратегию распределённого обучения под вашу задачу.
Какие модели можно обучать на кластере DevFlux?
Мы поддерживаем обучение LLM до 70 млрд параметров, диффузионных моделей, трансформеров для CV и рекомендательных систем. Для моделей свыше 70 млрд параметров рекомендуем конфигурацию с 512 GPU и шардингом через ZeRO Stage 3.
Как быстро можно развернуть выделенный GPU-кластер?
Стандартный кластер из 8–32 GPU-карт разворачивается за 4 часа. Кластеры от 64 GPU с InfiniBand-топологией — за 24–48 часов, включая настройку сети и хранилища.
Можно ли подключить свой датасет и репозиторий?
Да. Поддерживается импорт данных из S3-совместимых хранилищ, Google Cloud Storage и собственного MinIO. Интеграция с GitHub, GitLab и внутренними Git-серверами — из коробки.
Что входит в пакет консультаций ML-инженеров?
Первичный аудит нагрузки, подбор конфигурации GPU, расчёт стоимости цикла, настройка параллелизма и шардинга, оптимизация пайплайна и 30 дней сопровождения в процессе обучения.
Запустите следующий эксперимент на DevFlux
Свяжитесь с нашей командой ML-инженеров — мы поможем спланировать кластер и рассчитать бюджет под вашу модель.
Запросить консультацию