ИИтак

← Назад

IBM объяснила, как учила рассуждать открытые модели Granite 4.2

Модели Granite 4.2 на 8 и 30 млрд параметров прошли отдельные этапы обучения с подкреплением: они правили код, работали в терминале и искали в интернете. Модель на 3 млрд параметров эти этапы пропустила.

Изображение: Hugging Face

IBM рассказала, как обучала Granite 4.2 — свои первые модели с рассуждениями. Всего их три, на 3, 8 и 30 млрд параметров, все с открытыми весами под лицензией Apache 2.0. Каждая умеет думать перед ответом, отвечать сразу или рассуждать коротко, если вопрос лёгкий.

Основой стали модели Granite 4.1. Их с нуля обучили примерно на 15 трлн токенов, а под конец расширили контекстное окно до 512 тысяч токенов. Затем модели дообучили на 7,2 млн примеров. Около трети из них — записи работы агентов, в основном программистских. Качество примеров проверяли другие модели, GPT-OSS-120B и Gemma 4. Они отсеивали выдумки и вызовы несуществующих инструментов.

Главная часть работы — обучение с подкреплением. IBM провела его не одним прогоном, а цепочкой этапов. Каждый этап тренирует один навык и стартует с результата предыдущего. Сначала идут задачи, ответ на которые легко проверить: математика, олимпиадное программирование, естественные науки, вызов инструментов.

Дальше модели на 8 и 30 млрд параметров проходят агентный блок в настоящих, а не имитированных средах. Сначала модель правит код в реальных репозиториях и получает награду, если проходят скрытые тесты. Потом выполняет многошаговые задачи в терминале, до 64 действий подряд. На последнем этапе блока она ищет ответы на сложные вопросы в интернете, а оценивает её другая модель. Самая маленькая модель агентный блок пропускает. Все три модели завершают обучение этапом выравнивания под предпочтения людей и безопасность. Там же их отучают от слишком длинных рассуждений.

Обучение шло на кластере Nvidia GB200 NVL72 у CoreWeave. Для обучения с подкреплением IBM взяла открытые инструменты Nvidia — NeMo-RL и NeMo Gym. Вместе с моделями вышли четыре сжатые версии, в том числе в формате GGUF для llama.cpp. Модели понимают 12 языков, включая английский, немецкий, японский и китайский. Русского среди них нет.

← Все новости