Яндекс рассказал, как обучал открытую модель Alice AI Foundation, и выложил свои бенчмарки
Яндекс официально представил базовую модель Alice AI Foundation на 80 млрд параметров. Вместе с ней компания открыла два бенчмарка для проверки знаний на русском. Модель служит полигоном для будущей рассуждающей модели Алисы AI.

Яндекс официально представил Alice AI Foundation LLM — базовую языковую модель, которую компания обучила с нуля и открыла под свободной лицензией Apache 2.0. Её можно брать и в исследования, и в коммерческие продукты. Саму модель на Hugging Face заметили ещё 12 сентября. Теперь компания рассказала, зачем она нужна, как её обучали и как проверяли.
Модель экспериментальная. На ней Яндекс проверяет архитектурные решения для будущей единой рассуждающей модели. Та станет основой агентных возможностей Алисы AI: пользователь сможет поручать ассистенту конкретные действия, а не только задавать вопросы.
Модель построена как смесь экспертов: всего в ней 80 млрд параметров, но на каждом шаге работают только 3 млрд. Поэтому она быстрая и нетребовательная к железу. По тестам Яндекса, на олимпиадных задачах по математике она делит первое место с Qwen3.5-35B-A3B-Base. В программировании обходит Nemotron-3-Super-120B-Base от NVIDIA, хотя активных параметров у неё вчетверо меньше. В вопросах на знание фактов она опережает более крупную DeepSeek-V4-Flash-Base и держится на уровне прежней закрытой Alice AI LLM, которая в три раза больше.
Для проверки знаний на русском компания сделала два бенчмарка и открыла их вместе с эталонными ответами и порядком оценки. WikiWebFacts состоит из коротких вопросов о датах, событиях и людях. HardMultiQA собран из обезличенных запросов к Алисе AI и охватывает медицину, право, IT и искусство. В нём нужно выбрать несколько верных вариантов, перечислить подходящие факты или найти ошибку в тексте. По мнению Яндекса, англоязычные тесты объективно оценить знания на русском не позволяют.
Инженеры перестроили оптимизатор — программу, которая управляет обучением. Теперь видеокарты обмениваются данными параллельно с вычислениями, и шаг обучения стал примерно вдвое быстрее. Отбор обучающих текстов тоже подешевел. Если прогнать весь корпус через тяжёлую оценочную модель, понадобилось бы больше 200 тысяч часов работы видеокарт. Поэтому документы сначала отсеивает каскад всё более сложных классификаторов. Вычислений стало в десятки раз меньше, а полезных документов сохранилось около 95%.