ИИтак

← Назад

Модель · OpenAI

text-embedding-ada-002

Устаревшая модель OpenAI для векторных представлений текста в поиске и классификации, её сменила линейка text-embedding-3

вышла 15 декабря 2022

Характеристики

Вышла
15 декабря 2022
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
8,2 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 1,5 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,10 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
декабрь 2022
Идентификатор в API
text-embedding-ada-002

Что это за модель

text-embedding-ada-002 не пишет ответов, как чат-бот. Она превращает текст в векторное представление (embedding): набор из 1536 чисел, который передаёт смысл текста. У похожих по смыслу текстов векторы получаются близкими. На этом строятся поиск по смыслу, группировка документов, рекомендации, поиск аномалий и классификация. Работает модель только через два адреса API: для векторных представлений и для пакетной обработки. Чата, ассистентов и дообучения у неё нет.

OpenAI выпустила её в декабре 2022 года, и одна модель заменила пять старых: для поиска по тексту, для сходства текстов и для поиска по коду. Компания заявляла, что на большинстве задач новая модель лучше прежней самой сильной модели Davinci, а стоит на 99,8% дешевле. Она в четыре раза больше старых моделей по контексту: 8192 токена вместо 2048, поэтому с длинными документами работать удобнее. Её векторы в восемь раз короче, чем у davinci-001, поэтому хранить их в векторных базах данных дешевле.

Сейчас в документации OpenAI она значится как старая модель. В январе 2024 года её сменили text-embedding-3-small и text-embedding-3-large. По замерам лаборатории, ada-002 набирает в среднем 31,4% на многоязычном поисковом тесте MIRACL и 61,0% на MTEB, а text-embedding-3-large — 54,9% и 64,6%. Сама OpenAI сравнивает ada-002 с text-embedding-3-small, которая стоит в пять раз дешевле. Старую модель держат в основном в системах, где на ней уже построен поисковый индекс. Векторы разных моделей несовместимы, поэтому при переходе на новую модель документы придётся пересчитать заново.

Источники: Страница модели в документации OpenAI

Другие модели семейства

Данные: models.dev (MIT).