ИИтак

← Назад

Модель · OpenAI

GPT-Realtime-2.1

Старшая голосовая модель OpenAI для голосовых агентов в реальном времени: слышит речь, отвечает голосом, рассуждает и вызывает инструменты

вышла 6 июля

Характеристики

Вышла
6 июля
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
128 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 32 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$4 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,40 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$24 за миллион токенов
Понимает
текст, аудио, изображения
Отвечает
текст, аудио
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
сентябрь 2024
Идентификатор в API
gpt-realtime-2.1

Что это за модель

GPT-Realtime-2.1 — голосовая модель OpenAI для разговора в реальном времени. Она работает по схеме «речь в речь»: принимает голос и сразу отвечает голосом, без отдельных шагов распознавания и синтеза. Модель умеет рассуждать перед ответом, и глубину рассуждений разработчик настраивает сам. Работает она только через Realtime API — интерфейс OpenAI для потокового голосового общения. В обычном чате через Chat Completions и в пакетной обработке она недоступна.

Это обновление GPT-Realtime-2. По словам OpenAI, новая версия лучше распознаёт буквы и цифры на слух, например номера заказов или коды. Кроме того, она спокойнее реагирует на паузы и фоновый шум и правильнее ведёт себя, когда собеседник её перебивает. Вместе с ней компания выпустила облегчённую версию той же линейки: она быстрее и дешевле, а старшая модель рассчитана на задачи, где нужно больше рассуждать. Одновременно OpenAI заявила, что за счёт улучшенного кэширования задержка самых медленных ответов у всех её голосовых моделей сократилась минимум на четверть.

Её берут для голосовых агентов: телефонных помощников, службы поддержки, голосовых интерфейсов в приложениях. В таких сценариях модель должна по ходу разговора следовать инструкциям и обращаться к внешним сервисам: искать заказ, записывать клиента, проверять данные.

OpenAI предупреждает, что высокий уровень рассуждений увеличивает и задержку, и расход токенов. Поэтому в живом разговоре приходится выбирать между скоростью и глубиной ответа. Звук обходится заметно дороже текста. Своих знаний о свежих событиях у модели нет: они ограничены осенью 2024 года.

Источники: Карточка модели в документации OpenAI, Объявление OpenAI о новых голосовых моделях

Другие модели семейства

Новости о модели

  1. 01

    Голосовая модель GPT-Live-1 вышла в API: 5 центов за минуту и поддержка звонков

    OpenAI

все 1 новость о Realtime-2.1 →

Данные: models.dev (MIT).