
Meta* Superintelligence Labs представила Muse Voice Transcribe — модель для потокового распознавания речи. Она одновременно расшифровывает речь, определяет говорящих и отмечает начало и конец реплик. Meta* называет её первой разработанной компанией моделью для восприятия аудио в реальном времени.
Модель работает с более чем 20 участниками разговора, поддерживает переключение языков в одной фразе и учитывает язык, ключевые слова и контекст. Доступ к ней открыт через Meta* Model API, Meta* AI для Mac и Muse Code.
Читайте также: Цепляющие заголовки для Reels в Instagram*: +15 триггерных фраз и хуков
Что умеет Muse Voice Transcribe
Muse Voice Transcribe обучили более чем на 70 языках; из них Meta* подробно проверила 25 и рекомендует их для первоначального использования. Модель обрабатывает аудио фрагментами по 80 миллисекунд и сама выбирает, сколько контекста нужно перед выводом следующего слова.
Она также может обрабатывать аудиозаписи длиннее часа и определять более 20 говорящих без отдельной постобработки. Meta* называет модель частью семейства Muse Spark.
Как пользоваться
Разработчики могут подключить Muse Voice Transcribe через Meta* Model API. Тариф составляет $3 (≈260 ₽) за 1000 минут аудио.
В Meta* AI для Mac и Muse Code диктовка уже работает на базе новой модели. Чтобы начать ввод голосом в любом приложении, удерживайте клавишу Fn.
Почему это важно? В одном потоковом интерфейсе Muse Voice Transcribe выдаёт расшифровку, разделение по говорящим и границы реплик. Это позволяет использовать результат для голосовых интерфейсов и расшифровки многоголосых записей.
Meta* также заявляет, что Muse Voice Transcribe занимает первое место в рейтинге Artificial Analysis по потоковому распознаванию речи и лидирует на публичных бенчмарках диаризации по состоянию на 1 сентября 2026 года.
Ранее Meta* выпустила Muse Glimmer — мультимодальную модель с открытыми весами для локальных ИИ-агентов. Она рассчитана на многошаговые задачи: работу с инструментами, файлами, изображениями и длинным контекстом
Итог. Meta* открыла доступ к Muse Voice Transcribe — модели, которая в реальном времени распознаёт речь и разделяет реплики участников разговора.
*Meta — признана экстремистской организацией и запрещена в РФ.




