Модель · OpenAI
text-embedding-ada-002
Устаревшая модель OpenAI для векторных представлений текста в поиске и классификации, её сменила линейка text-embedding-3
вышла 15 декабря 2022
Характеристики
- Вышла
- 15 декабря 2022
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 8,2 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 1,5 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,10 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $0 за миллион токенов
- Понимает
- текст
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- декабрь 2022
- Идентификатор в API
- text-embedding-ada-002
Что это за модель
text-embedding-ada-002 не пишет ответов, как чат-бот. Она превращает текст в векторное представление (embedding): набор из 1536 чисел, который передаёт смысл текста. У похожих по смыслу текстов векторы получаются близкими. На этом строятся поиск по смыслу, группировка документов, рекомендации, поиск аномалий и классификация. Работает модель только через два адреса API: для векторных представлений и для пакетной обработки. Чата, ассистентов и дообучения у неё нет.
OpenAI выпустила её в декабре 2022 года, и одна модель заменила пять старых: для поиска по тексту, для сходства текстов и для поиска по коду. Компания заявляла, что на большинстве задач новая модель лучше прежней самой сильной модели Davinci, а стоит на 99,8% дешевле. Она в четыре раза больше старых моделей по контексту: 8192 токена вместо 2048, поэтому с длинными документами работать удобнее. Её векторы в восемь раз короче, чем у davinci-001, поэтому хранить их в векторных базах данных дешевле.
Сейчас в документации OpenAI она значится как старая модель. В январе 2024 года её сменили text-embedding-3-small и text-embedding-3-large. По замерам лаборатории, ada-002 набирает в среднем 31,4% на многоязычном поисковом тесте MIRACL и 61,0% на MTEB, а text-embedding-3-large — 54,9% и 64,6%. Сама OpenAI сравнивает ada-002 с text-embedding-3-small, которая стоит в пять раз дешевле. Старую модель держат в основном в системах, где на ней уже построен поисковый индекс. Векторы разных моделей несовместимы, поэтому при переходе на новую модель документы придётся пересчитать заново.
Источники: Страница модели в документации OpenAI
Другие модели семейства
-
text-embedding-3-large
OpenAIконтекст 8,2 тыс.$0,13 / $0
-
text-embedding-3-small
OpenAIконтекст 8,2 тыс.$0,02 / $0
Данные: models.dev (MIT).