Microsoft открыла потоковую модель распознавания речи VibeVoice, которая различает говорящих
Microsoft Research выложила на Hugging Face две версии VibeVoice-ASR-Streaming — 7B и 1.5B. Модель расшифровывает речь на лету, отмечает, кто говорит, и понимает 10 языков, включая русский. Лицензия MIT.