ИИтак

← Назад

Модель · Google

Gemma 4 31B IT

Старшая открытая модель линейки Gemma 4 для чатов, рассуждений и агентов, которую можно запустить на своём сервере

вышла 2 апреля

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

91 место из 266
индекс 143, вероятный разброс 140–145 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ 71,1%
LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ 46,2%
Surface Evolver Bench16 задач: описать для физической программы Surface Evolver форму жидкости под действием поверхностного натяжения, гравитации и ограниченийЗасчитывается частичное выполнение: отдельные баллы за корректный файл, успешный прогон симуляции и совпадение объёма, площади и энергии с эталоном.Подробнее на английском ↗ 30,6%
Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ 0,0%
SimpleQA Verified1000 коротких вопросов на факты, на которые модель отвечает по памяти, без поиска в интернетеБалл — F1: учитываются и доля верных ответов, и точность там, где модель решилась ответить, так что честное «не знаю» лучше ошибки.Подробнее на английском ↗ 10,4%
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 52,3%
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 73,3%
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 67,7%

Характеристики

Вышла
2 апреля
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
262 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 32 тыс. токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
gemma-4-31b-it

Что это за модель

Gemma 4 31B IT — самая крупная модель в открытой линейке Gemma 4 от Google DeepMind. Приставка IT означает, что модель дообучена выполнять инструкции, то есть готова к диалогу. Google пишет, что линейка построена на тех же технологиях, что и Gemini 3. Это плотная модель на 31 млрд параметров: при каждом ответе работают все параметры сразу. У неё 60 слоёв. Внимание устроено гибридно: одни слои смотрят только на ближайшие 1024 токена, другие видят весь текст целиком. Картинки обрабатывает отдельный блок зрения примерно на 550 млн параметров.

В линейке четыре размера: E2B и E4B для телефонов и ноутбуков, 26B и 31B для видеокарт и серверов. Соседняя 26B устроена как смесь экспертов (mixture of experts): при каждом ответе у неё работают только около 4 млрд параметров, поэтому она быстрее. Версия 31B медленнее, но точнее. Например, в тесте знаний MMLU Pro она набирает 85,2% против 82,6% у 26B. По сравнению с Gemma 3 у новой линейки появился режим рассуждений: модель может сначала продумать задачу шаг за шагом и только потом ответить. Ещё она научилась вызывать внешние функции и выдавать ответ в формате JSON.

По данным Google, на старте 31B занимала третье место среди открытых моделей в текстовом рейтинге Arena.ai. В карточке модели лаборатория приводит такие результаты: 89,2% в математическом тесте AIME 2026, 80,0% в LiveCodeBench v6 (олимпиадное программирование) и 84,3% в научном тесте GPQA Diamond. Модель берут для чат-ботов, агентов, написания кода без подключения к интернету, извлечения данных из изображений и как основу для собственного дообучения. Google называет 31B удобной базой для дообучения именно потому, что в ней ставка сделана на качество, а не на скорость.

Веса выложены под лицензией Apache 2.0, поэтому модель можно применять и в коммерческих продуктах. Звук 31B не понимает: его в линейке поддерживают только малые версии. В карточке модели Google предупреждает, что модель может не уловить тонкие оттенки смысла, сарказм и переносные значения. Кроме того, она может выдавать неверные или устаревшие факты, потому что опирается на закономерности из обучающих данных и базой знаний не является. В рейтинге Epoch модель находится в середине списка, заметно ниже закрытых моделей Gemini.

Источники: Анонс Gemma 4 в блоге Google, Карточка модели на Hugging Face, Технический разбор Gemma 4 на Hugging Face

Того же уровня по индексу Epoch

Другие модели семейства

Новости о модели

  1. 01

    Агенты Amazon спроектировали антитела против цели редкой детской опухоли: 46 подтверждены в лаборатории

    Amazon Science

  2. 02

    Натан Ламберт рассказал Конгрессу, насколько Китай обогнал США в открытых моделях

    Interconnects

  3. 03

    Шесть копий за два дня: сообщество пытается повторить модель-«решалу» Jev

    Latent Space

  4. 04

    Google Research научила маленькую модель за один проход подбирать разнообразную выдачу

    Google Research

  5. 05

    NVIDIA на примере Nemotron 3.5 Lightning объяснила, когда смесь экспертов лучше плотной модели

    NVIDIA для разработчиков

  6. 06

    Яндекс открыл базовую модель, на которой работают быстрые ИИ-ответы в Поиске

    Яндекс

все 15 новостей о Gemma 4 →

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).