ИИтак

← Назад

Ai2 ускорил в 2,7 раза свою открытую систему обучения больших моделей

Новая открытая система Ai2 держит части модели — «экспертов» — постоянно на видеокартах и шлёт к ним обучающие данные, поэтому на том же оборудовании обучает модель примерно в 2,7 раза быстрее прежней версии.

Карточка анонса Olmo-core 3 Изображение: Ai2

Институт Ai21 выложил в открытый доступ Olmo-core 3 — систему для обучения больших моделей, устроенных как смесь экспертов. На ней будут обучать следующее поколение моделей Olmo, сообщил институт в соцсети X.

Ai2, который выкладывает модели вместе с данными и кодом обучения, сделал общедоступной и систему для обучения моделей намного крупнее своих прежних. Семейство Olmo 3, вышедшее в ноябре 2025 года, состояло из плотных моделей2 на 7 и 32 млрд параметров, а Olmo-core 3 рассчитана на смеси экспертов с триллионами параметров.

смесь экспертов состоит из многих специализированных блоков — экспертов — и на каждый токен включает лишь некоторые из них. Это экономит вычисления. Но чем больше модель, тем сильнее эту экономию съедает обмен данными: модель хранится частями на многих видеокартах, и при обучении между ними приходится пересылать либо её веса, либо сами токены.

главное отличие от прошлой версии в том, что перемещается между видеокартами:

  • Olmo-core 2 для каждой небольшой порции обучающих данных заново собирала веса модели с разных видеокарт.
  • Olmo-core 3 держит экспертов постоянно на их видеокартах и отправляет данные к ним, так что собирать веса раз за разом не нужно.

по замерам Ai2:

  • На той же модели и том же числе видеокарт пропускная способность3 Olmo-core 3 примерно в 2,7 раза выше, чем у Olmo-core 2.
  • Если общий размер модели растёт, а число параметров, которые работают на каждый токен, остаётся примерно прежним, скорость обучения почти не падает.

в техническом отчёте Ai2 описывает не только находки, но и неудачи. Одна из них — джерримендеринг4 токенов: показатель равномерности нагрузки на экспертов улучшался, хотя на деле нагрузка распределялась всё менее равномерно.

готовые сборки со всеми нужными библиотеками Ai2 регулярно проверяет на своих кластерах с ускорителями NVIDIA H100. На другом оборудовании или с другими версиями драйверов они могут не запуститься, и окружение придётся собирать самому по образцу Ai2.

Ai2 предлагает сторонним командам обучать на Olmo-core 3 собственные модели-смеси экспертов и подстраивать систему под своё оборудование. Когда выйдут новые модели Olmo, институт не сообщил.

← Все новости