Ai2 выложил открытую модель AstaBrief для научных отчётов со ссылками
В сервисе Asta новая модель Ai2 на 8 млрд параметров пишет отчёт по научным статьям в среднем в 3,5 раза быстрее, чем режим Thinking на Claude.
Институт Ai2 выложил с открытыми весами1 AstaBrief 8B. Это модель, которая берёт научный вопрос и подобранные отрывки из статей и пишет по ним отчёт со ссылками на источники.
Почему это важно: в научном сервисе Ai2 Asta быстрые отчёты пишет небольшая открытая модель, а не закрытая Claude. Ту же модель организации могут развернуть у себя, в том числе за собственным файрволом, и не отправлять запросы в чужой API.
Как это работает: Asta — научный помощник Ai2. Он ищет по более чем 108 млн аннотаций и 12 млн полных текстов статей и собирает из найденного отчёты. В режиме Thinking, который работает на Claude, система сначала пересказывает найденные отрывки и группирует их по темам. Быстрый режим на AstaBrief эти шаги пропускает и пишет отчёт за один проход. Это отдельный режим, его выбирают вместо Thinking: исследователь быстрее получает первый вариант отчёта и дорабатывает его следующими запросами.
В цифрах: скорость и обучение
- С учётом всех этапов работы Asta быстрый режим на AstaBrief тратит на отчёт в среднем 51,1 секунды, а режим Thinking — 178,5 секунды, то есть примерно в 3,5 раза больше.
- Модель учили на настоящих запросах к прежним системам Ai2 для обзоров литературы. После чистки от ботов, личных данных и ненаучных вопросов осталось 90 тыс. запросов.
- По части этих запросов закрытые модели написали отчёты со ссылками. После проверки качества 39,5 тыс. из них пошли на дообучение.
- Ещё около 6 тыс. пар отчётов пошли на обучение прямой оптимизацией предпочтений2. В него брали только пары, где обе модели-судьи, GPT-4.1 и DeepSeek-R1, выбрали один и тот же лучший отчёт. Судьи разметили пары заранее, само обучение идёт без них.
Детали: Ai2 проверял качество модели автоматическими тестами на вопросах по информатике и статьях arXiv, а также с участием исследователей.
- В автоматических тестах AstaBrief сопоставима с режимом Thinking и с DR Tulu3 по точности ответов и по качеству ссылок.
- Трое исследователей оценили отчёты по 14 вопросам и в целом предпочли DR Tulu.
- При этом двое из трёх поставили AstaBrief выше остальных систем по точности ссылок.
Но: большую часть обучения и замеров Ai2 провёл ещё в 2025 году. Поэтому закрытые модели, которые писали учебные отчёты и служили для сравнения, в том числе Claude 3.7 Sonnet, o3 и GPT-4.1, — уровня того времени.
Модель построена на Qwen3-8B от Alibaba и выложена под лицензией Apache 2.0. Ai2 предназначил её для исследований и обучения. Вместе с ней Ai2 открыл обучающие данные и пример, как собирать отчёты из собственных PDF-файлов. В соцсети X институт предлагает пользователям запускать модель у себя, на собственном оборудовании.