OpenAI объяснила, как голосовой GPT-Live научился говорить и слушать одновременно
Голосовая модель GPT-Live обходится без детектора очереди: она слушает и говорит одновременно, а сложные задачи отдаёт GPT-5.5. Соединение теперь устанавливается за один сетевой обмен вместо шести.
Голосовой ИИ OpenAI больше не ждёт, пока пользователь договорит. GPT-Live, третье поколение голосовой системы компании, слушает и говорит одновременно. Инженеры OpenAI Джастин Уберти (Justin Uberti) и Захан Малкани (Zahan Malkani) рассказали, как её построили за полгода.
Прежние голосовые системы работали по очереди. Маленькая модель, детектор очереди, угадывала, закончил ли человек фразу. Если она торопилась, ИИ перебивал собеседника. Если опаздывала, ответ звучал вяло. Большая модель начинала думать только после её решения. В GPT-Live такого детектора нет: звук непрерывно идёт в модель и обратно. Когда нужны рассуждения или инструменты, голосовая модель в фоне обращается к передовым моделям вроде GPT-5.5 и тем временем продолжает разговор.
Ради этого OpenAI переписала почти всю цепочку. Звук идёт по отдельному быстрому каналу, а вызовы инструментов и остальная логика приложения работают отдельно. Медленный сервис задержит только свой ответ, а голос не прервётся. Код обработки звука перевели с Python на Go. По данным авторов, самые медленные 5% кадров теперь доставляются так же быстро, как раньше доставлялась половина. Когда разговор перерастает контекстное окно, система сжимает историю на запасном экземпляре модели и незаметно переключается на него.
Отдельно ускорили начало разговора. Стандартному WebRTC нужно шесть сетевых обменов, прежде чем пойдёт звук. Протокол WARP сокращает их до одного. OpenAI предложила его как открытую спецификацию через IETF. Поддержку уже добавили в две реализации WebRTC, в том числе в библиотеку Pion. Вдобавок механизм Instant Connect заранее согласует параметры соединения, так что сессия может начаться с единственного UDP-пакета.
Перед запуском систему проверили скрытно: часть реальных сессий ChatGPT Voice шла одновременно в старый Advanced Voice Mode и в новую систему, но пользователи слышали только старую. Выяснилось, что упираются не только в видеокарты: вспомогательный компонент перегрузился раньше, чем обещали нагрузочные тесты. Долгие сессии нагружали память, а обычные разрывы связи вскрыли ошибки при завершении сессии.
На этой архитектуре уже работают управление компьютером и координация агентов голосом в настольном приложении ChatGPT. На ней же построят будущий GPT-Live API. Сроков его выхода OpenAI не называет.