ИИтак

← Назад

Модель · Яндекс

AliceAI-Foundation-80B-A3B-Base

Экспериментальная базовая модель Яндекса с открытыми весами, обученная с нуля: основа для дообучения и исследований, сильна в фактах на русском

вышла 12 сентября

Характеристики

Вышла
12 сентября
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
262 тыс. токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
aliceai-foundation-80b-a3b-base

Что это за модель

AliceAI-Foundation-80B-A3B-Base — базовая языковая модель Яндекса. Базовая значит, что она прошла только предобучение: умеет продолжать текст, но не обучена следовать инструкциям и вести диалог. Модель устроена как смесь экспертов (mixture of experts): из 80 млрд параметров на каждый токен работают только 3 млрд. Поэтому запускать её дешевле, чем плотные модели того же размера. В каждом слое 512 экспертов, из них на токен выбираются десять, плюс один общий эксперт.

Архитектура гибридная. Из 48 слоёв 36 используют Kimi Delta Attention — упрощённый механизм внимания, который быстрее обрабатывает длинный текст. В остальных 12 слоях стоит обычное полное внимание. Главное отличие модели в том, что Яндекс обучил её с нуля, без весов чужих открытых моделей. Компания сама собрала обучающий корпус, в том числе данные для рассуждений и работы с инструментами. Перед основным обучением она проверила архитектурные решения на серии отдельных запусков, каждый на 2 трлн токенов.

По замерам Яндекса, сильнее всего модель в вопросах на знание фактов на русском языке: 86,5% в тесте WikiWebFacts. В математике у неё 91,1% в MATH-500, а в работе с длинным текстом — 74,1% в FinQA на 128 тыс. токенов. Компания заявляет, что в ряде тестов модель обходит более крупные открытые базовые модели, включая DeepSeek-V4-Flash. Яндекс называет её экспериментальной: на ней компания проверяет решения для будущей единой модели с рассуждениями, которая станет основой агентных возможностей Alice AI.

Веса распространяются по лицензии Apache 2.0, так что модель можно использовать и в коммерческих проектах. Яндекс предназначает её прежде всего для исследований, экспериментов и дообучения под свои задачи. Перед применением в рабочей среде компания советует провести собственное тестирование. Как готовый чат-ассистент модель без дообучения не подходит.

Источники: Анонс Яндекса на Хабре, Карточка модели на Hugging Face

Новости о модели

  1. 01

    Яндекс выложил открытую базовую модель AliceAI-Foundation на 80 млрд параметров

    Яндекс · HF

все 1 новость о AliceAI-Foundation-80B-A3B-Base →

Данные: models.dev (MIT).