Кейс · ML-инженерия

Тренировка ИИ-моделей на GPU-кластере DevFlux

Как команда разработки «НейроФабрики» обучила собственную большую языковую модель на 128 GPU-картах A100, ускорив цикл обучения в 2,5 раза и сократив операционные расходы.

GPU-кластер DevFlux в дата-центре
Задача

Обучение большой языковой модели

Клиенту требовалась языковая модель на 7 млрд параметров для анализа технической документации на русском и английском языках. Предыдущая инфраструктура на арендованных инстансах не справлялась с нагрузкой: обучение одной эпохи занимало 14 дней, а стоимость месячного цикла достигала 2,3 млн ₽.

Масштаб модели

7 млрд параметров, обучение на корпусе из 4,2 трлн токенов с использованием смешанной точности FP16/BF16.

Целевой SLA

Безопасность данных модели и чекпоинтов, изоляция тензоров, шифрование данных на диске и в памяти.

Экономическая цель

Сократить стоимость одного полного цикла обучения как минимум вдвое без потери качества сходимости.

Инфраструктура

Конфигурация GPU-узлов и сети

Для обучения мы развернули выделенный кластер в региональном центре DevFlux с оптимизированной топологией InfiniBand и NVLink. Ниже — ключевые параметры конфигурации.

GPU-узлы

16 нод × 8 × NVIDIA A100 80 GB (HBM2e) с NVLink 4.0, суммарно 128 GPU-карт и 10,2 ТБ видеопамяти.

Сеть

Внутрикластерная связка InfiniBand NDR 400 Gbps с топологией Fat-Tree, задержка между узлами менее 2 мкс.

Хранилище

Объединённый NVMe-пул на 384 ТБ с пропускной способностью 12 ГБ/с и параллельным доступом через Lustre.

Операционная система

Ubuntu 22.04 LTS, CUDA 12.2, NCCL 2.18.3, Docker 24.0 с поддержкой nvidia-container-toolkit.

Оркестрация

DevFlux Kubernetes с кастомными GPU-распределителями и приоритизацией задач обучения и валидации.

Мониторинг

Сбор метрик DC GM, DCGM и Prometheus каждые 10 секунд, алерты при отклонении температуры выше 82 °C.

Оптимизация

Распределённое обучение и шардинг данных

Мы разбили обучение на несколько независимых осей параллелизма и настроили шардинг датасета по узлам, чтобы минимизировать пересылку тензоров.

Data Parallelism

16 реплик модели на 16 GPU-узлах, синхронизация градиентов через AllReduce с компрессией градиентов.

Tensor Parallelism

Разбиение матриц по 8 картам внутри узла через NVLink, что снижает объём меж-узловой коммуникации на 64%.

ZeRO Stage 3

Шардинг оптимизатора, градиентов и весов по всем 128 GPU, экономия 7,8 ТБ видеопамяти на эпоху.

Шардинг датасета

Корпус разбит на 512 шардов по 8,2 ГБ, каждый узел читает только свой диапазон — без повторных IO.

Пipelining

14-модульный пайплайн с микро-батчами по 128 последовательностей, загрузка GPU поддерживается на 94%.

Автоскейлинг чекпоинтов

Сохранение состояния каждые 2 000 итераций с асинхронной записью — простой на восстановление менее 90 секунд.

2,5×
Ускорение полного цикла обучения
5,6 дн.
Вместо 14 дней на одну эпоху
47%
Снижение стоимости цикла
94%
Загрузка GPU в среднем
Бенчмарки

Технические характеристики и замеры

Ниже приведены измеренные показатели за полный цикл обучения модели на 7 млрд параметров (3 эпохи, 4,2 трлн токенов) на кластере DevFlux.

Токены в секунду

1,84 млн токенов/сек на весь кластер, пиковая производительность — 2,1 млн ток/сек на итерациях с батчем 1024.

Время итерации

Среднее 0,42 сек на шаг обучения при батче 1024 последовательностей и длине контекста 2048 токенов.

Сходимость

Перекрёстная энтропия на валидационном наборе снизилась с 2,34 до 1,18 бит/символ за 3 эпохи.

Пропускная сеть

Фактическая пропускная InfiniBand 372 Гбит/с (93% от номинала NDR 400 Гбит/с) на каждом узле.

Эффективность MFU

Model FLOPs Utilization — 58%, что на 12 пунктов выше среднего показателя для кластеров такого масштаба.

Надёжность

За 18 дней непрерывного обучения — 0 критических сбоев, 3 автоматических восстановления отдельных GPU-карт.

Отзыв

Слово команды «НейроФабрики»

«Переход на DevFlux сократил время полного цикла обучения с 14 дней до 5,6 дней. Мы получили предсказуемую стоимость и смогли запустить в 3 раза больше экспериментов в том же бюджете. Команда ML-инженеров DevFlux помогала с настройкой параллелизма на каждом этапе».

Андрей Соболев
Технический директор, «НейроФабрика»

Ключевые решения

Выделенный кластер 128 GPU A100, InfiniBand NDR, ZeRO Stage 3, шардинг датасета на 512 порций, асинхронные чекпоинты каждые 2 000 итераций.

Итог: 2,5× ускорение, −47% стоимости цикла, 0 критических инцидентов за 18 дней.

Консультация

Обсудите свой ML-проект с нашей командой

Наши ML-инженеры помогут подобрать конфигурацию GPU-кластера, оценить бюджет и спланировать стратегию распределённого обучения под вашу задачу.

Какие модели можно обучать на кластере DevFlux?

Мы поддерживаем обучение LLM до 70 млрд параметров, диффузионных моделей, трансформеров для CV и рекомендательных систем. Для моделей свыше 70 млрд параметров рекомендуем конфигурацию с 512 GPU и шардингом через ZeRO Stage 3.

Как быстро можно развернуть выделенный GPU-кластер?

Стандартный кластер из 8–32 GPU-карт разворачивается за 4 часа. Кластеры от 64 GPU с InfiniBand-топологией — за 24–48 часов, включая настройку сети и хранилища.

Можно ли подключить свой датасет и репозиторий?

Да. Поддерживается импорт данных из S3-совместимых хранилищ, Google Cloud Storage и собственного MinIO. Интеграция с GitHub, GitLab и внутренними Git-серверами — из коробки.

Что входит в пакет консультаций ML-инженеров?

Первичный аудит нагрузки, подбор конфигурации GPU, расчёт стоимости цикла, настройка параллелизма и шардинга, оптимизация пайплайна и 30 дней сопровождения в процессе обучения.

Запустите следующий эксперимент на DevFlux

Свяжитесь с нашей командой ML-инженеров — мы поможем спланировать кластер и рассчитать бюджет под вашу модель.

Запросить консультацию