ИИтак

← Назад

Тема

#голос

Распознавание и синтез речи, голосовые ассистенты.

15 новостей за 60 дней

19 сентября суббота

SpaceXAI

SpaceXAI выпустила Grok Voice Transcribe 2.0: вдвое точнее расшифровка речи за те же деньги

Новая модель распознавания речи от SpaceXAI ошибается вдвое реже первой версии, лучше всех справляется с телефонными звонками и стоит столько же: 0,10 доллара за час записи и 0,20 доллара за час потокового аудио.

18 сентября пятница

17 сентября четверг

OpenAI для разработчиков · X

Codex получил голосового агента на GPT-Live-1: код можно поручать с телефона

Аккаунт OpenAI для разработчиков сообщил, что в Codex появился голосовой агент на модели GPT-Live-1. Судя по процитированному посту, говорить с ним можно с телефона, и он подключается к компьютеру откуда угодно.

16 сентября среда

дополнено в 01:47 Google для разработчиков

Google выпустила голосовые модели Gemini 3.8 Live: агент работает, не прерывая разговор

Разработчикам стали доступны голосовые модели Gemini 3.8 Live и 3.8 Live Extended Thinking. Они ведут разговор и параллельно выполняют задачи. Минута входящего звука стоит примерно полцента, минута ответа — около 1,8 цента.

10 сентября четверг

2 сентября среда

Microsoft · HF

Microsoft открыла потоковую модель распознавания речи VibeVoice, которая различает говорящих

Microsoft Research выложила на Hugging Face две версии VibeVoice-ASR-Streaming — 7B и 1.5B. Модель расшифровывает речь на лету, отмечает, кто говорит, и понимает 10 языков, включая русский. Лицензия MIT.

28 августа пятница

Hugging Face

В рейтинге распознавания речи появились хинди и индийский английский, а с ними — данные о каждом дикторе

Hugging Face и Voice Arena добавили в Open ASR Leaderboard наборы Monsoon: почти 4 900 дикторов из сотен индийских районов, для каждого записано 12 характеристик. Хинди — первый язык из Индии в многоязычном разделе рейтинга.

26 августа среда

Google DeepMind

Google выпустила Gemini 3.5 Transcribe — модель, которая превращает речь в чистый текст

Gemini 3.5 Transcribe убирает «эээ», учитывает оговорки и понимает более 85 языков. Разработчикам модель доступна в предварительной версии через Gemini API, а обычным пользователям — в Gemini для macOS и функции Rambler на Android.

25 августа вторник

IBM Research

IBM выпустила открытые модели Granite 4.2 для агентов и крошечную модель распознавания речи

Модели Granite 4.2 на 3, 8 и 30 млрд параметров умеют рассуждать перед ответом и вызывать инструменты. Вместе с ними вышла модель распознавания речи на 470 млн параметров, которая работает даже на ноутбуке.

21 августа пятница

Hugging Face

Модели распознавания речи узнают бенчмарк по звуку и пишут «ожидаемый» ответ

Авторы Open ASR Leaderboard проверили 11 открытых моделей распознавания речи. Лучшие по оценкам модели повторяют ошибки эталонных расшифровок VoxPopuli и LibriSpeech и даже «слышат» числа, вырезанные из записи.

10 августа понедельник

Hugging Face

NVIDIA научила открытую модель синтеза речи Magpie TTS арабскому, корейскому и португальскому

Модель Magpie TTS Multilingual на 364 млн параметров теперь говорит на 12 языках. На B200 первый звук она выдаёт через 32 мс, а запускать её можно на своих серверах.

3 августа понедельник

OpenAI

OpenAI объяснила, как голосовой GPT-Live научился говорить и слушать одновременно

Голосовая модель GPT-Live обходится без детектора очереди: она слушает и говорит одновременно, а сложные задачи отдаёт GPT-5.5. Соединение теперь устанавливается за один сетевой обмен вместо шести.

30 июля четверг

OpenAI

Голосовой агент на GPT-Realtime за две недели поговорил с 30 000 покупателей Yamada Denki

Японская компания Avatarin сделала для покупателей сети Yamada Denki голосового ИИ-консультанта на GPT-Realtime. Он работает круглосуточно на нескольких языках. За две недели им воспользовались 30 000 человек.