GigaChat 3.5 Reasoning: первая «думающая» модель Сбера с открытыми весами на 432B
Команда GigaChat выложила на Hugging Face модель GigaChat 3.5 Reasoning на 432 млрд параметров под лицензией MIT. По заявлению авторов, она заметно сильнее прошлой версии в математике и коде, но по среднему баллу уступает DeepSeek V4 Flash Preview.
Команда GigaChat из Сбера опубликовала на Hugging Face открытые веса модели GigaChat 3.5 Reasoning. Это первая модель линейки с полноценными рассуждениями: прежде чем ответить, она выписывает ход решения. Лицензия — MIT, то есть модель можно использовать и в коммерческих проектах.
Модель большая: 432 млрд параметров, но на каждый токен работают только 28 млрд. Такая схема называется смесью экспертов и позволяет держать много знаний при умеренных затратах на ответ. Внутри гибрид: обычное внимание сочетается со слоями линейного внимания GatedDeltaNet, которые дешевле на длинных текстах. Контекст — до 262 тысяч токенов. Модель обучали в формате FP8 на всех этапах, а для запуска авторы приводят пример на восьми видеокартах H100.
Самое любопытное — как её доучивали. Разработчики отдельно натренировали шесть «экспертов» по направлениям: математика и естественные науки, код, работа с репозиторием, агентные задачи, диалог и точное следование инструкциям. У каждого своя награда: где-то проверяют итоговый ответ, где-то запускают код и тесты, а диалог оценивает другая языковая модель. Потом шесть экспертов свели в одну модель: она решает задачи сама, а эксперт нужного профиля поправляет её на каждом токене. Из обучающего набора по ходу выкидывали задачи, которые модель решала больше чем в 75% попыток, так что задания постепенно усложнялись.
По данным разработчиков, прирост к GigaChat 3.5 Ultra Instruct большой. На математической олимпиаде AIME 2025 балл вырос с 68 до 89, на SWE-bench Verified — с 42,6 до 64,7. Средний балл по всем тестам поднялся с 51,5 до 68,9.
Но с китайским конкурентом картина скромнее. DeepSeek V4 Flash Preview в той же таблице набирает в среднем 72,7 и впереди в большинстве тестов, особенно в агентных: в Terminal-Bench 2 у него 56,6 против 30,3. GigaChat выигрывает в следовании инструкциям, структурированных ответах и на русскоязычных аренах. Зато рассуждает он экономнее: на олимпиадной математике тратит на 37% меньше токенов, чем DeepSeek.
Все цифры — из карточки модели, независимых проверок пока нет. Часть тестов оценивали другие модели-судьи, так что результаты зависят и от выбора судьи.