Модель · Google
Gemma 4 31B IT
Старшая открытая модель линейки Gemma 4 для чатов, рассуждений и агентов, которую можно запустить на своём сервере
вышла 2 апреля
Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗
91 место из 266
индекс 143, вероятный разброс 140–145 · весь рейтинг →
| Бенчмарк | РезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию теста | УсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен |
|---|---|---|
| DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ | 71,1% | |
| LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ | 46,2% | |
| Surface Evolver Bench16 задач: описать для физической программы Surface Evolver форму жидкости под действием поверхностного натяжения, гравитации и ограниченийЗасчитывается частичное выполнение: отдельные баллы за корректный файл, успешный прогон симуляции и совпадение объёма, площади и энергии с эталоном.Подробнее на английском ↗ | 30,6% | |
| Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ | 0,0% | |
| SimpleQA Verified1000 коротких вопросов на факты, на которые модель отвечает по памяти, без поиска в интернетеБалл — F1: учитываются и доля верных ответов, и точность там, где модель решилась ответить, так что честное «не знаю» лучше ошибки.Подробнее на английском ↗ | 10,4% | |
| WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ | 52,3% | |
| OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ | 73,3% | |
| GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ | 67,7% |
Характеристики
- Вышла
- 2 апреля
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 262 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 32 тыс. токенов
- Понимает
- текст, изображения
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Идентификатор в API
- gemma-4-31b-it
Что это за модель
Gemma 4 31B IT — самая крупная модель в открытой линейке Gemma 4 от Google DeepMind. Приставка IT означает, что модель дообучена выполнять инструкции, то есть готова к диалогу. Google пишет, что линейка построена на тех же технологиях, что и Gemini 3. Это плотная модель на 31 млрд параметров: при каждом ответе работают все параметры сразу. У неё 60 слоёв. Внимание устроено гибридно: одни слои смотрят только на ближайшие 1024 токена, другие видят весь текст целиком. Картинки обрабатывает отдельный блок зрения примерно на 550 млн параметров.
В линейке четыре размера: E2B и E4B для телефонов и ноутбуков, 26B и 31B для видеокарт и серверов. Соседняя 26B устроена как смесь экспертов (mixture of experts): при каждом ответе у неё работают только около 4 млрд параметров, поэтому она быстрее. Версия 31B медленнее, но точнее. Например, в тесте знаний MMLU Pro она набирает 85,2% против 82,6% у 26B. По сравнению с Gemma 3 у новой линейки появился режим рассуждений: модель может сначала продумать задачу шаг за шагом и только потом ответить. Ещё она научилась вызывать внешние функции и выдавать ответ в формате JSON.
По данным Google, на старте 31B занимала третье место среди открытых моделей в текстовом рейтинге Arena.ai. В карточке модели лаборатория приводит такие результаты: 89,2% в математическом тесте AIME 2026, 80,0% в LiveCodeBench v6 (олимпиадное программирование) и 84,3% в научном тесте GPQA Diamond. Модель берут для чат-ботов, агентов, написания кода без подключения к интернету, извлечения данных из изображений и как основу для собственного дообучения. Google называет 31B удобной базой для дообучения именно потому, что в ней ставка сделана на качество, а не на скорость.
Веса выложены под лицензией Apache 2.0, поэтому модель можно применять и в коммерческих продуктах. Звук 31B не понимает: его в линейке поддерживают только малые версии. В карточке модели Google предупреждает, что модель может не уловить тонкие оттенки смысла, сарказм и переносные значения. Кроме того, она может выдавать неверные или устаревшие факты, потому что опирается на закономерности из обучающих данных и базой знаний не является. В рейтинге Epoch модель находится в середине списка, заметно ниже закрытых моделей Gemini.
Источники: Анонс Gemma 4 в блоге Google, Карточка модели на Hugging Face, Технический разбор Gemma 4 на Hugging Face
Того же уровня по индексу Epoch
-
Qwen3.5 35B-A3B
Qwen92-е место в Epochконтекст 262 тыс.$0,25 / $2открытые весарассуждения
-
Claude Haiku 4.5
Anthropic96-е место в Epochконтекст 200 тыс.$1 / $5рассуждения
-
Qwen3.6 Flash
Qwen88-е место в Epochконтекст 1 млн$0,188 / $1,125рассуждения
Другие модели семейства
-
Gemma 4 26B A4B IT
Google98-е место в Epochконтекст 262 тыс.открытые весарассуждения
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).