Модель · OpenAI
GPT-Realtime-2.1
Старшая голосовая модель OpenAI для голосовых агентов в реальном времени: слышит речь, отвечает голосом, рассуждает и вызывает инструменты
вышла 6 июля
Характеристики
- Вышла
- 6 июля
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 128 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 32 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $4 за миллион токенов
- Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
- $0,40 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $24 за миллион токенов
- Понимает
- текст, аудио, изображения
- Отвечает
- текст, аудио
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- сентябрь 2024
- Идентификатор в API
- gpt-realtime-2.1
Что это за модель
GPT-Realtime-2.1 — голосовая модель OpenAI для разговора в реальном времени. Она работает по схеме «речь в речь»: принимает голос и сразу отвечает голосом, без отдельных шагов распознавания и синтеза. Модель умеет рассуждать перед ответом, и глубину рассуждений разработчик настраивает сам. Работает она только через Realtime API — интерфейс OpenAI для потокового голосового общения. В обычном чате через Chat Completions и в пакетной обработке она недоступна.
Это обновление GPT-Realtime-2. По словам OpenAI, новая версия лучше распознаёт буквы и цифры на слух, например номера заказов или коды. Кроме того, она спокойнее реагирует на паузы и фоновый шум и правильнее ведёт себя, когда собеседник её перебивает. Вместе с ней компания выпустила облегчённую версию той же линейки: она быстрее и дешевле, а старшая модель рассчитана на задачи, где нужно больше рассуждать. Одновременно OpenAI заявила, что за счёт улучшенного кэширования задержка самых медленных ответов у всех её голосовых моделей сократилась минимум на четверть.
Её берут для голосовых агентов: телефонных помощников, службы поддержки, голосовых интерфейсов в приложениях. В таких сценариях модель должна по ходу разговора следовать инструкциям и обращаться к внешним сервисам: искать заказ, записывать клиента, проверять данные.
OpenAI предупреждает, что высокий уровень рассуждений увеличивает и задержку, и расход токенов. Поэтому в живом разговоре приходится выбирать между скоростью и глубиной ответа. Звук обходится заметно дороже текста. Своих знаний о свежих событиях у модели нет: они ограничены осенью 2024 года.
Источники: Карточка модели в документации OpenAI, Объявление OpenAI о новых голосовых моделях
Другие модели семейства
Новости о модели
- 01
Данные: models.dev (MIT).