ИИтак

← Назад

Простаивающая видеокарта — как самолёт на земле: Dharma-AI о новом узком месте ИИ

Dharma-AI считает, что компаниям, купившим свои видеокарты, теперь мешает не качество моделей, а плохая загрузка железа. Выход, по её мнению, — малые специализированные модели и автоматическое распределение задач между картами.

Дальше в корпоративном ИИ компании будут соревноваться не умом моделей, а тем, сколько времени их видеокарты действительно работают. Такую мысль продвигает в колонке на Hugging Face Dharma-AI — компания, которая делает специализированные модели.

Авторы сравнивают видеокарты с самолётами. Самолёт обходится авиакомпании в деньги каждый час: кредит, страховка, обслуживание. Выручку же он приносит только в полёте. С видеокартой так же: деньги на кредит, износ, электричество и охлаждение уходят круглые сутки, а пользу она приносит, только когда считает. Поэтому две компании с одинаковыми бюджетами на железо могут получить очень разную отдачу.

Проблема растёт, потому что компании уходят от платных API к своим серверам. Пока проект пилотный, оплата за токены выглядит терпимо. Но при рабочих объёмах счёт растёт вместе с нагрузкой, и собственное железо с фиксированной ценой становится выгоднее. Кластер при этом покупают с запасом под пиковую нагрузку, и вне пиков часть мощностей простаивает.

Эту часть простоя можно было бы закрыть точным прогнозом нагрузки, но карты не взаимозаменяемы. Одна и та же машина занята обучением, дообучением, ответами пользователям в реальном времени и пакетной обработкой. Ответам важна скорость, пакетным задачам — объём, обучение занимает карту на дни. По словам авторов, панель мониторинга может показывать высокую загрузку, пока задачи в очереди ждут карту с нужным объёмом памяти. Самолёт из Чикаго можно отправить на любой рейс, а видеокарта справится только с той задачей, которая ей подходит.

Dharma-AI предлагает действовать с двух сторон. Малые модели под конкретную задачу занимают меньше железа. Отдельный программный слой постоянно решает, какая задача на какой карте и когда запускается, и отдаёт освободившиеся мощности следующей задаче из очереди. Без такого распределения освобождённые мощности просто простаивают. Авторы признают, что общепринятых методов для этого пока нет, и обещают следующую статью — о своём планировщике задач.

Стоит учитывать, что это колонка компании, чей бизнес — малые специализированные модели. Кроме давних цифр о суперкомпьютере Microsoft для OpenAI, цифр в ней нет: сколько простаивает типичный кластер, авторы не говорят.

← Все новости