ИИтак

← Назад

Модель · Google

Gemini Embedding 2

Модель Google для поиска по смыслу: переводит текст, картинки, видео, звук и PDF в векторы одного общего пространства

вышла 22 апреля

Характеристики

Вышла
22 апреля
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
8,2 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 1 токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,20 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0 за миллион токенов
Понимает
текст, изображения, аудио, видео, PDF
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
ноябрь 2025
Идентификатор в API
gemini-embedding-2

Что это за модель

Gemini Embedding 2 — модель векторных представлений (эмбеддингов). Она не пишет ответы, а превращает материал в набор чисел — вектор. Чем ближе по смыслу два материала, тем ближе их векторы. На этом строят поиск по смыслу, рекомендации и генерацию с поиском, когда чат-бот перед ответом находит нужные документы. Google называет её своей первой изначально мультимодальной моделью такого рода, то есть сразу рассчитанной на разные типы данных. Она построена на архитектуре Gemini и обучена сопоставлять похожие и непохожие пары примеров (контрастивное обучение) на многих задачах в несколько этапов.

Главное отличие от прошлой модели компании, gemini-embedding-001, в том, что текст, картинки, видео, звук и документы попадают в одно общее пространство. Поэтому текстовым запросом можно найти подходящий ролик, аудиозапись или страницу PDF, и отдельные модели для каждого типа данных не нужны. Звук модель обрабатывает сама, без перевода в текст. В одном запросе можно смешивать типы данных: до шести картинок, до 120 секунд видео, до 180 секунд звука и до шести страниц PDF. Модель понимает больше ста языков. Её выпустили как предварительную версию в марте 2026 года, а в общий доступ она вышла в конце апреля.

Модель берут для поиска и базы знаний, где рядом лежат тексты, изображения и записи. Ещё её применяют для кластеризации, классификации, проверки фактов и поиска по коду: тип задачи можно указать при запросе. По умолчанию вектор состоит из 3072 чисел. Его можно укоротить до 1536 или 768 почти без потери качества: так хранилище выходит дешевле и поиск идёт быстрее. В научной статье о модели Google приводит 69,9 балла в многоязычном MTEB, 84,0 в MTEB Code и 62,9 R@1 в поиске картинок MSCOCO. Компания также ссылается на своих клиентов: у магазина одежды Nuuly точность подбора по показателю Match@20 выросла с 60 до 87%.

Ограничения связаны с объёмом одного запроса: длинные ролики, записи и многостраничные документы придётся заранее резать на куски. Google советует брать вектор длиной 3072, 1536 или 768 чисел, для других размеров качество не гарантируется. Модель доступна только через Gemini API и облачную платформу Google, открытых весов нет.

Источники: Анонс Gemini Embedding 2 в блоге Google, Выход в общий доступ: блог для разработчиков, Научная статья о модели на arXiv

Другие модели семейства

Новости о модели

  1. 01

    Медицинская модель поиска за 14,5 часа на одной RTX 3090 обошла все универсальные

    Hugging Face

  2. 02

    Hugging Face объяснила, как устроен поиск статей на возрождённом Papers with Code

    Hugging Face

  3. 03

    Sentence Transformers 6.0 научилась работать с поисковыми моделями в духе ColBERT

    Hugging Face

  4. 04

    Ai2 научила OlmoEarth Studio выгружать векторные представления спутниковых снимков

    Hugging Face

все 4 новости о Embedding 2 →

Данные: models.dev (MIT).