ИИтак

← Назад

Cohere собрала всю генерацию North Mini Code в одно ядро и обогнала vLLM до 1,58 раза

Cohere выложила движок, который выполняет генерацию модели North Mini Code одним «мегаядром» на H100. При одном запросе он выдаёт 292 токена в секунду против 185 у vLLM. На реальной нагрузке выигрыш составляет 1,25–1,41 раза.

Cohere выложила на GitHub движок, который запускает её модель для программирования North Mini Code в 1,25–1,41 раза быстрее популярного vLLM. Замеры сделаны на одной видеокарте H100 при полной работе сервера. Если обрабатывать один запрос, разрыв больше: 292 токена в секунду против 185, то есть в 1,58 раза. По бенчмаркам качество ответов не упало.

Обычно каждый шаг генерации распадается на десятки отдельных программ для видеокарты — ядер. Одно ядро считает внимание, другое — слой экспертов и так далее. Каждое ядро ждёт, пока все блоки видеокарты закончат предыдущее, а видеокарта в эти паузы простаивает. North Mini Code — модель на 30 млрд параметров, из которых на каждый токен работают 3,3 млрд. По расчёту Cohere, теоретический потолок для неё на H100 — около 470 токенов в секунду. vLLM использует лишь 39% этой пропускной способности.

Cohere вместо этого запускает одно «мегаядро» на весь шаг. Каждый вычислительный блок видеокарты берёт задачи из заранее составленного списка. Зависимости между задачами отслеживаются простыми счётчиками в памяти. Свободный блок сразу подхватывает готовую работу, а веса модели начинают загружаться ещё до того, как готовы входные данные. Идею авторы взяли у Hazy Research, но утверждают, что их движок первым дорос до полноценного сервера. Он обрабатывает несколько запросов сразу, совместим с API OpenAI и умеет вызывать инструменты.

Разработчики говорят, что мегаядро написать проще, чем принято думать. Код занимает один файл CUDA и обходится без компилятора и новой модели программирования. Готовые ядра достаточно привести к общему соглашению о вызове. Самым сложным авторы называют расстановку счётчиков: одна ошибка может привести к зависанию намного позже.

Ограничений пока хватает. Мегаядро ускоряет только генерацию, а обработка входного текста идёт обычным путём и ставит генерацию на паузу. Размер пакета ограничен восемью запросами. Дальше Cohere планирует версию для видеокарт RTX Blackwell с форматами FP8 и FP4, а затем — для серверных Blackwell и работы на нескольких видеокартах.

← Все новости