ИИтак

← Назад

Модель · Google

Gemma 4 26B A4B IT

Открытая модель Google со смесью экспертов для чата, кода и агентов: отвечает быстро и запускается на одной видеокарте

вышла 2 апреля

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

98 место из 266
индекс 142, вероятный разброс 139–144 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ 58,2%
LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ 34,9%
Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ 1,1%
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 35,2%
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 82,2%
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 64,3%

Характеристики

Вышла
2 апреля
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
262 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 32 тыс. токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
gemma-4-26b-a4b-it

Что это за модель

Gemma 4 26B A4B — открытая модель из линейки Gemma 4, версия, дообученная выполнять инструкции. Она устроена как смесь экспертов (mixture of experts): модель состоит из множества небольших подсетей, и на каждом шаге работает лишь часть из них. Всего у неё 25,2 млрд параметров, из них одновременно работают около 3,8 млрд: 8 экспертов из 128 и ещё один общий. Около 550 млн параметров занимает визуальный кодировщик, через который модель понимает картинки.

В линейке Gemma 4 пять размеров. Малые E2B, E4B и 12B рассчитаны на слабое железо и понимают звук, а у 26B A4B и 31B звука нет. Главное отличие 26B A4B от плотной 31B — скорость. Google пишет, что по задержке она ведёт себя как модель на 4 млрд параметров, а по качеству выигрывает от всех 26 млрд. Плотную 31B компания советует брать, когда важнее качество и нужна основа для дообучения. В рейтинге открытых моделей Arena AI 26B A4B на момент анонса стояла шестой, а 31B — третьей.

Модель берут, чтобы запускать у себя: для чат-ботов, пересказа текстов, извлечения данных из изображений, программирования и агентов. Она умеет вызывать функции, выдавать ответ в формате JSON и следовать системным инструкциям. По замерам Google, она набирает 82,6% в MMLU Pro, 88,3% в AIME 2026, 77,1% в LiveCodeBench и 82,3% в GPQA Diamond. Веса без сжатия помещаются на одну видеокарту NVIDIA H100 с 80 ГБ памяти. Квантизованные версии, то есть сжатые за счёт меньшей точности чисел, работают на обычных игровых видеокартах.

Веса выложены под лицензией Apache 2.0, она разрешает и коммерческое применение. Сама Google предупреждает, что модель может выдавать неверные факты, хуже справляется со сложными открытыми задачами и тонкостями языка, а здравый смысл у неё ограничен. Для телефонов она слишком тяжела: ей нужен сервер или мощная рабочая станция. С длинными текстами модель справляется заметно слабее: в тесте MRCR v2 на поиск в длинном контексте она набирает 44,1%.

Источники: Анонс Gemma 4 в блоге Google, Карточка модели на Hugging Face

Того же уровня по индексу Epoch

Другие модели семейства

Новости о модели

  1. 01

    Агенты Amazon спроектировали антитела против цели редкой детской опухоли: 46 подтверждены в лаборатории

    Amazon Science

  2. 02

    Натан Ламберт рассказал Конгрессу, насколько Китай обогнал США в открытых моделях

    Interconnects

  3. 03

    Шесть копий за два дня: сообщество пытается повторить модель-«решалу» Jev

    Latent Space

  4. 04

    Google Research научила маленькую модель за один проход подбирать разнообразную выдачу

    Google Research

  5. 05

    NVIDIA на примере Nemotron 3.5 Lightning объяснила, когда смесь экспертов лучше плотной модели

    NVIDIA для разработчиков

  6. 06

    Яндекс открыл базовую модель, на которой работают быстрые ИИ-ответы в Поиске

    Яндекс

все 15 новостей о Gemma 4 →

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).