Яндекс выложил AliceAI-T5 — модель на 35 млрд параметров, из которых работают 0,6 млрд
Яндекс опубликовал на Hugging Face базовую модель AliceAI-T5-35B-A0.6B со смесью экспертов и архитектурой энкодер-декодер. По тестам разработчиков, в задачах на знание фактов она обходит Qwen 3.5 35B-A3B.
Яндекс выложил на Hugging Face базовую языковую модель AliceAI-T5-35B-A0.6B. Всего в ней 34,35 млрд параметров, но при обработке каждого токена работает лишь малая часть сети — примерно 0,6 млрд, о чём и говорит суффикс A0.6B в названии. В каждом слое со смесью экспертов 512 экспертов, и на каждый токен модель выбирает восемь из них.
Модель построена по схеме энкодер-декодер, как T5 от Google: одна часть читает и осмысляет входной текст, другая пишет ответ. Большинство современных чат-моделей устроены иначе и состоят из одного декодера. В энкодере AliceAI-T5 16 слоёв, в декодере 12. Контекст — до 128 тыс. токенов. Энкодер можно загрузить отдельно от остальной модели. Такой вариант пригодится, например, чтобы переводить тексты в векторы для поиска.
Модель базовая, то есть её только предобучили. Инструкциям она специально не обучена, и авторы предлагают дообучать её под свои задачи. В карточке есть готовый пример дообучения методом LoRA на открытом наборе данных Alpaca. Лицензию карточка не называет. Подробности об устройстве модели Яндекс опубликовал в отдельной статье на Хабре.
Разработчики сравнили модель с T5 Gemma 2, Gemma 4 E4B и несколькими версиями Qwen 3.5. Сильнее всего она выглядит в задачах на знание фактов. На внутреннем тесте Яндекса WikiWebFacts она набрала 81,3 балла, а Qwen 3.5 35B-A3B — 62,4. На тесте CultCat счёт 68,0 против 59,2. На длинном контексте в 32 тыс. токенов (Ruler 32K) AliceAI-T5 тоже впереди.
В математике и программировании картина другая. Там модель уступает Qwen 3.5 35B-A3B и на MATH 500 проигрывает даже Qwen 3.5 4B. Qwen 3.5 35B-A3B лучше и в MMLU, и в англоязычном TriviaQA. Все цифры Яндекс получил на своей инфраструктуре, а часть тестов — собственные тесты компании, поэтому результаты стоит считать заявленными.