Модель · Google
Gemma 4 26B A4B IT
Открытая модель Google со смесью экспертов для чата, кода и агентов: отвечает быстро и запускается на одной видеокарте
вышла 2 апреля
Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗
98 место из 266
индекс 142, вероятный разброс 139–144 · весь рейтинг →
| Бенчмарк | РезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию теста | УсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен |
|---|---|---|
| DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ | 58,2% | |
| LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ | 34,9% | |
| Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ | 1,1% | |
| WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ | 35,2% | |
| OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ | 82,2% | |
| GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ | 64,3% |
Характеристики
- Вышла
- 2 апреля
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 262 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 32 тыс. токенов
- Понимает
- текст, изображения
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Идентификатор в API
- gemma-4-26b-a4b-it
Что это за модель
Gemma 4 26B A4B — открытая модель из линейки Gemma 4, версия, дообученная выполнять инструкции. Она устроена как смесь экспертов (mixture of experts): модель состоит из множества небольших подсетей, и на каждом шаге работает лишь часть из них. Всего у неё 25,2 млрд параметров, из них одновременно работают около 3,8 млрд: 8 экспертов из 128 и ещё один общий. Около 550 млн параметров занимает визуальный кодировщик, через который модель понимает картинки.
В линейке Gemma 4 пять размеров. Малые E2B, E4B и 12B рассчитаны на слабое железо и понимают звук, а у 26B A4B и 31B звука нет. Главное отличие 26B A4B от плотной 31B — скорость. Google пишет, что по задержке она ведёт себя как модель на 4 млрд параметров, а по качеству выигрывает от всех 26 млрд. Плотную 31B компания советует брать, когда важнее качество и нужна основа для дообучения. В рейтинге открытых моделей Arena AI 26B A4B на момент анонса стояла шестой, а 31B — третьей.
Модель берут, чтобы запускать у себя: для чат-ботов, пересказа текстов, извлечения данных из изображений, программирования и агентов. Она умеет вызывать функции, выдавать ответ в формате JSON и следовать системным инструкциям. По замерам Google, она набирает 82,6% в MMLU Pro, 88,3% в AIME 2026, 77,1% в LiveCodeBench и 82,3% в GPQA Diamond. Веса без сжатия помещаются на одну видеокарту NVIDIA H100 с 80 ГБ памяти. Квантизованные версии, то есть сжатые за счёт меньшей точности чисел, работают на обычных игровых видеокартах.
Веса выложены под лицензией Apache 2.0, она разрешает и коммерческое применение. Сама Google предупреждает, что модель может выдавать неверные факты, хуже справляется со сложными открытыми задачами и тонкостями языка, а здравый смысл у неё ограничен. Для телефонов она слишком тяжела: ей нужен сервер или мощная рабочая станция. С длинными текстами модель справляется заметно слабее: в тесте MRCR v2 на поиск в длинном контексте она набирает 44,1%.
Источники: Анонс Gemma 4 в блоге Google, Карточка модели на Hugging Face
Того же уровня по индексу Epoch
-
Claude Haiku 4.5
Anthropic96-е место в Epochконтекст 200 тыс.$1 / $5рассуждения
-
Mistral Medium 3.5
Mistral102-е место в Epochконтекст 262 тыс.$1,50 / $7,50открытые весарассуждения
-
Qwen3.5 35B-A3B
Qwen92-е место в Epochконтекст 262 тыс.$0,25 / $2открытые весарассуждения
Другие модели семейства
-
Gemma 4 31B IT
Google91-е место в Epochконтекст 262 тыс.открытые весарассуждения
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).