Ai2 ускорил в 2,7 раза свою открытую систему обучения больших моделей
Новая открытая система Ai2 держит части модели — «экспертов» — постоянно на видеокартах и шлёт к ним обучающие данные, поэтому на том же оборудовании обучает модель примерно в 2,7 раза быстрее прежней версии.

Институт Ai21 выложил в открытый доступ Olmo-core 3 — систему для обучения больших моделей, устроенных как смесь экспертов. На ней будут обучать следующее поколение моделей Olmo, сообщил институт в соцсети X.
Почему это важно: Ai2, который выкладывает модели вместе с данными и кодом обучения, сделал общедоступной и систему для обучения моделей намного крупнее своих прежних. Семейство Olmo 3, вышедшее в ноябре 2025 года, состояло из плотных моделей2 на 7 и 32 млрд параметров, а Olmo-core 3 рассчитана на смеси экспертов с триллионами параметров.
Как это работает: смесь экспертов состоит из многих специализированных блоков — экспертов — и на каждый токен включает лишь некоторые из них. Это экономит вычисления. Но чем больше модель, тем сильнее эту экономию съедает обмен данными: модель хранится частями на многих видеокартах, и при обучении между ними приходится пересылать либо её веса, либо сами токены.
Детали: главное отличие от прошлой версии в том, что перемещается между видеокартами:
- Olmo-core 2 для каждой небольшой порции обучающих данных заново собирала веса модели с разных видеокарт.
- Olmo-core 3 держит экспертов постоянно на их видеокартах и отправляет данные к ним, так что собирать веса раз за разом не нужно.
В цифрах: по замерам Ai2:
- На той же модели и том же числе видеокарт пропускная способность3 Olmo-core 3 примерно в 2,7 раза выше, чем у Olmo-core 2.
- Если общий размер модели растёт, а число параметров, которые работают на каждый токен, остаётся примерно прежним, скорость обучения почти не падает.
Интрига: в техническом отчёте Ai2 описывает не только находки, но и неудачи. Одна из них — джерримендеринг4 токенов: показатель равномерности нагрузки на экспертов улучшался, хотя на деле нагрузка распределялась всё менее равномерно.
Но: готовые сборки со всеми нужными библиотеками Ai2 регулярно проверяет на своих кластерах с ускорителями NVIDIA H100. На другом оборудовании или с другими версиями драйверов они могут не запуститься, и окружение придётся собирать самому по образцу Ai2.
Что дальше: Ai2 предлагает сторонним командам обучать на Olmo-core 3 собственные модели-смеси экспертов и подстраивать систему под своё оборудование. Когда выйдут новые модели Olmo, институт не сообщил.