Поднимаем распределённое обучение на заказ на вашем GPU-кластере — группе серверов с видеокартами. Частая картина: карты докупили, а обучение быстрее не стало — они ждут пересылки данных по сети. Мы настраиваем расчёт так, чтобы каждая карта была занята работой.
Когда модель или датасет не влезают в одну карту
Датасет — это набор данных для обучения. Распределённое обучение оправдано в трёх случаях:
- модель со всеми рабочими данными не помещается в память одной видеокарты;
- обучение на одном сервере длится неделями и сдерживает команду;
- базовую модель нужно обучить или дообучить на терабайтах данных.
Как делим модель и данные между картами
Работу делим между картами тремя способами сразу — это 3D-параллелизм. Технология FSDP/ZeRO снимает с карт хранение полной копии модели — у каждой только свой фрагмент. Пересылки по сети совмещаем с вычислениями, чтобы карты не простаивали.
Чем отличаемся
Стартуем с замеров: находим, где карты теряют время — на пересылках, на загрузке данных или в неравномерном разбиении. Ускорение подтверждаем измерениями на вашем кластере до и после работ. Права на код и настройки обучения остаются у вас.
Мы отвечаем за этап обучения — до передачи модели в эксплуатацию. Сопровождение модели в бою — направление MLOps и продакшн ML, тяжёлые модели под боевой нагрузкой — High-load и Foundation Models. Прикинуть бюджет можно в калькуляторе стоимости.