Модель · Google
Gemini Embedding 2
Модель Google для поиска по смыслу: переводит текст, картинки, видео, звук и PDF в векторы одного общего пространства
вышла 22 апреля
Характеристики
- Вышла
- 22 апреля
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 8,2 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 1 токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,20 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $0 за миллион токенов
- Понимает
- текст, изображения, аудио, видео, PDF
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- ноябрь 2025
- Идентификатор в API
- gemini-embedding-2
Что это за модель
Gemini Embedding 2 — модель векторных представлений (эмбеддингов). Она не пишет ответы, а превращает материал в набор чисел — вектор. Чем ближе по смыслу два материала, тем ближе их векторы. На этом строят поиск по смыслу, рекомендации и генерацию с поиском, когда чат-бот перед ответом находит нужные документы. Google называет её своей первой изначально мультимодальной моделью такого рода, то есть сразу рассчитанной на разные типы данных. Она построена на архитектуре Gemini и обучена сопоставлять похожие и непохожие пары примеров (контрастивное обучение) на многих задачах в несколько этапов.
Главное отличие от прошлой модели компании, gemini-embedding-001, в том, что текст, картинки, видео, звук и документы попадают в одно общее пространство. Поэтому текстовым запросом можно найти подходящий ролик, аудиозапись или страницу PDF, и отдельные модели для каждого типа данных не нужны. Звук модель обрабатывает сама, без перевода в текст. В одном запросе можно смешивать типы данных: до шести картинок, до 120 секунд видео, до 180 секунд звука и до шести страниц PDF. Модель понимает больше ста языков. Её выпустили как предварительную версию в марте 2026 года, а в общий доступ она вышла в конце апреля.
Модель берут для поиска и базы знаний, где рядом лежат тексты, изображения и записи. Ещё её применяют для кластеризации, классификации, проверки фактов и поиска по коду: тип задачи можно указать при запросе. По умолчанию вектор состоит из 3072 чисел. Его можно укоротить до 1536 или 768 почти без потери качества: так хранилище выходит дешевле и поиск идёт быстрее. В научной статье о модели Google приводит 69,9 балла в многоязычном MTEB, 84,0 в MTEB Code и 62,9 R@1 в поиске картинок MSCOCO. Компания также ссылается на своих клиентов: у магазина одежды Nuuly точность подбора по показателю Match@20 выросла с 60 до 87%.
Ограничения связаны с объёмом одного запроса: длинные ролики, записи и многостраничные документы придётся заранее резать на куски. Google советует брать вектор длиной 3072, 1536 или 768 чисел, для других размеров качество не гарантируется. Модель доступна только через Gemini API и облачную платформу Google, открытых весов нет.
Источники: Анонс Gemini Embedding 2 в блоге Google, Выход в общий доступ: блог для разработчиков, Научная статья о модели на arXiv
Другие модели семейства
-
Gemini Omni Flash Preview
Googleконтекст 131 тыс.$1,50 / $17,50рассуждения
-
Gemini Embedding 001
Googleконтекст 2 тыс.$0,15 / $0
Новости о модели
- 01
- 02
- 03
- 04
Данные: models.dev (MIT).