AI

Meta* представила Muse Voice Transcribe — модель для распознавания речи в реальном времени

Meta* представила Muse Voice Transcribe — модель для распознавания речи в реальном времени />

Meta* Superintelligence Labs представила Muse Voice Transcribe — модель для потокового распознавания речи. Она одновременно расшифровывает речь, определяет говорящих и отмечает начало и конец реплик. Meta* называет её первой разработанной компанией моделью для восприятия аудио в реальном времени.

Модель работает с более чем 20 участниками разговора, поддерживает переключение языков в одной фразе и учитывает язык, ключевые слова и . Доступ к ней открыт через Meta* Model API, Meta* AI для Mac и Muse Code.

Читайте также: Цепляющие заголовки для Reels в *: +15 триггерных фраз и хуков

Что умеет Muse Voice Transcribe

Muse Voice Transcribe обучили более чем на 70 языках; из них Meta* подробно проверила 25 и рекомендует их для первоначального использования. Модель обрабатывает аудио фрагментами по 80 миллисекунд и сама выбирает, сколько контекста нужно перед выводом следующего слова.

Meta* представила Muse Voice Transcribe — модель для распознавания речи в реальном времени

Meta* представила Muse Voice Transcribe — модель для распознавания речи в реальном времени

Она также может обрабатывать аудиозаписи длиннее часа и определять более 20 говорящих без отдельной постобработки. Meta* называет модель частью семейства Muse Spark.

Meta* представила Muse Voice Transcribe — модель для распознавания речи в реальном времени

Meta* представила Muse Voice Transcribe — модель для распознавания речи в реальном времени

Как пользоваться

Разработчики могут подключить Muse Voice Transcribe через Meta* Model API. Тариф составляет $3 (≈260 ₽) за 1000 минут аудио.

В Meta* AI для Mac и Muse Code диктовка уже работает на базе новой модели. Чтобы начать ввод голосом в любом приложении, удерживайте клавишу Fn.

Почему это важно? В одном потоковом интерфейсе Muse Voice Transcribe выдаёт расшифровку, разделение по говорящим и границы реплик. Это позволяет использовать результат для голосовых интерфейсов и расшифровки многоголосых записей.

Meta* также заявляет, что Muse Voice Transcribe занимает первое место в рейтинге Artificial Analysis по потоковому распознаванию речи и лидирует на публичных бенчмарках диаризации по состоянию на 1 сентября 2026 года.

Ранее Meta* выпустила Muse Glimmer — мультимодальную модель с открытыми весами для локальных -агентов. Она рассчитана на многошаговые задачи: работу с инструментами, файлами, изображениями и длинным контекстом

Итог. Meta* открыла доступ к Muse Voice Transcribe — модели, которая в реальном времени распознаёт речь и разделяет реплики участников разговора.

*Meta — признана экстремистской организацией и запрещена в РФ.

Источник

Добавить комментарий

Кнопка «Наверх»