ИИтак

← Назад

Яндекс выложил открытую базовую модель AliceAI-Foundation на 80 млрд параметров

AliceAI-Foundation-80B-A3B-Base обучена с нуля и распространяется по лицензии Apache 2.0. На каждый токен модель задействует 3 млрд параметров и принимает до 262 144 токенов контекста. По данным Яндекса, особенно сильна она в русскоязычных вопросах на знание фактов.

Яндекс опубликовал на Hugging Face языковую модель AliceAI-Foundation-80B-A3B-Base. Лицензия Apache 2.0 разрешает в том числе коммерческое использование. Всего в модели 80 млрд параметров, но при обработке каждого токена работают только 3 млрд. Контекстное окно — до 262 144 токенов. Авторы подчёркивают, что модель обучена полностью с нуля, а не собрана на основе чужой.

Это базовая модель: у неё прошло только предобучение, дообучения и выравнивания не было. Значит, это заготовка для исследователей и компаний, которые доведут её под свои задачи, а не готовый чат-бот. Яндекс прямо предупреждает, что встраивать её в пользовательские продукты без собственного тестирования и дообучения не стоит. Для дообучения в репозитории есть пример на LoRA, рассчитанный на четыре видеокарты с 80 ГБ памяти каждая. Там же лежит шаблон, по которому оформлялись диалоги с вызовами инструментов: в таком формате модель видела эти данные при обучении.

Архитектура гибридная. В модели 48 слоёв, и в каждой группе из четырёх три используют быстрое линейное внимание Kimi Delta Attention (KDA), а один — обычное полное внимание. После каждого слоя внимания стоит блок смеси экспертов: из 512 экспертов на каждый токен выбираются 10, плюс один общий эксперт работает всегда. Словарь насчитывает 129 024 токена. Ещё есть дополнительный слой предсказания следующих токенов. По словам команды, корпус данных собирали заново, а ключевые решения проверяли на отдельных пробных обучениях с нуля объёмом по 2 трлн токенов каждое.

Результаты тестов Яндекс получил на своей инфраструктуре и сравнил модель с базовыми версиями Qwen3.5-35B-A3B, GLM-4.5-Air, Nemotron-3-Super-120B-A12B и DeepSeek-V4-Flash. Сильнее всего модель выглядит в русскоязычных вопросах на знание фактов. На WikiWebFacts у неё 86,5 против 83,2 у DeepSeek-V4-Flash и 62,4 у Qwen3.5. В юридических вопросах, составленных экспертами, — 49,6 против 40,5 у ближайшего соперника. На MATH-500 она набрала 91,1, на тесте из заданий ЕГЭ — 90,5.

Проигрышей в таблице тоже хватает. В англоязычном TriviaQA модель набрала 79,0, а Nemotron — 89,8. В MMLU-Pro у неё 66,8 против 69,9 у Nemotron, в задачах Codeforces — 64,6 против 73,7 у Qwen3.5. В олимпиадной математике AIME 2026 результат 96,7 совпадает с Qwen3.5, а в задачах LiveCodeBench, где нужно придумать алгоритм и написать код, модели практически равны.

Вместе с весами Яндекс выложил два своих теста на знание фактов, ориентированных на русскоязычный контекст, — WikiWebFacts и HardMultiQA, а также описание того, как по ним оценивать модели. Так сторонние команды смогут перепроверить заявленные цифры. На этой неделе компания уже открыла две модели с архитектурой «кодировщик — декодер» примерно на 35 млрд параметров. Новая модель в несколько раз больше и устроена иначе: это привычная авторегрессионная модель, которая пишет текст токен за токеном, как большинство современных языковых моделей.

← Все новости