ИИтак

← Назад

Модель · Яндекс

AliceAI-T5-35B-A0.6B

Открытая базовая модель Яндекса со схемой «энкодер — декодер» для быстрых ответов по найденным документам, её нужно дообучать под задачу

вышла 10 сентября

Характеристики

Вышла
10 сентября
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
aliceai-t5-35b-a0.6b

Что это за модель

AliceAI-T5 — базовая языковая модель Яндекса. «Базовая» значит, что она прошла только предобучение: собеседником её не делали, это заготовка, которую дообучают под свою задачу. Модель устроена по схеме «энкодер — декодер», как классическая T5 от Google: одна часть читает входной текст и строит его внутреннее представление, другая по нему пишет ответ. Внутри — смесь экспертов (mixture of experts): в каждом таком слое 512 небольших подсетей, и на каждый токен включаются только 8 из них. Поэтому из примерно 35 млрд параметров на одно слово работают около 0,6 млрд. Компания пишет, что обучала модель на 15 трлн токенов собственного корпуса и затем расширила контекстное окно до 128 тыс. токенов.

Модель сделали для одной рабочей задачи. На ней в Alice AI Search собирается итоговый ответ: модель получает найденные поиском документы и за секунды пишет по ним короткий ответ. Схему «энкодер — декодер» Яндекс выбрал как раз потому, что она быстро отвечает, опираясь на результаты поиска. Большинство открытых моделей сейчас состоит из одного декодера, так что AliceAI-T5 среди них заметно выделяется. Рядом в линейке стоят Alice AI Search Pretrain и более крупная AliceAI-Foundation-80B-A3B-Base.

Сильнее всего модель в знании фактов. По замерам Яндекса, на тесте WikiWebFacts она набирает 81,3 против 62,4 у Qwen 3.5 35B-A3B Base, на CultCat — 68,0 против 59,2. В общих знаниях, математике и работе с длинным текстом Qwen 3.5 35B-A3B её обходит: на MMLU у AliceAI-T5 78,5 против 84,4, на GSM8K — 84,7 против 90,4, на Ruler с контекстом 128 тыс. токенов — 81,4 против 90,1. Для дообучения в карточке есть готовый пример с библиотеками Transformers и PEFT LoRA.

Есть и оговорки. Архитектура нестандартная, и загружать модель приходится с кодом из самого репозитория. Оптимизированный инференс для рабочей среды (так называют запуск готовой модели для ответов), по словам Яндекса, пока есть только внутри компании. Без дообучения модель просто продолжает текст и на вопросы как чат-бот не отвечает.

Источники: Карточка модели на Hugging Face, Статья Яндекса на Хабре

Новости о модели

  1. 01

    Яндекс выложил AliceAI-T5 — модель на 35 млрд параметров, из которых работают 0,6 млрд

    Яндекс · HF

все 1 новость о AliceAI-T5 →

Данные: models.dev (MIT).