MiniMax добавит в H3 поддержку аудиореференсов при генерации видео. В официальном анонсе компания показала, как модель переносит тембр мужского голоса из аудиозаписи и на речь персонажа в сгенерированном ролике.
Аудиореференсы можно использовать вместе с изображениями и видео. Текстовый запрос остаётся частью промпта: в нём описываются сцена, персонажи и нужное действие. Детали в материале Postium.
Читайте также: 7 лучших нейросетей для генерации видео
Как работают аудиореференсы в MiniMax H3
MiniMax H3 позволяет добавлять в запрос до трёх аудиореференсов. Модель также поддерживает изображения и видео: с их помощью можно сохранить внешность персонажа, композицию или другие элементы исходной сцены.
В текстовом запросе можно указать роль каждого референса: какой голос использовать для реплики, какого персонажа сохранить и что должно происходить в кадре.
MiniMax H3 генерирует видео и стереозвук одновременно. Максимальная длительность ролика составляет 15 секунд, а в облачной версии заявлено разрешение до 2K.
Как пользоваться
Для работы с аудиореференсами выберите MiniMax H3 на платформе Hailuo AI или другом сервисе, где доступен режим генерации по референсам.
Добавьте текстовое описание сцены, аудиозапись с нужным голосом и при необходимости изображение или видео. В промпте укажите роль каждого референса и опишите, что должно получиться.
Ограничения на форматы файлов, их длительность и количество могут зависеть от платформы или API, через которые используется MiniMax H3.
Что это меняет? Аудиозапись задаёт голосовой ориентир для речи в ролике, а изображения и видео помогают сохранить персонажа и особенности сцены в одной генерации.
Напомним, 31 июля MiniMax представила H3 — новую ИИ-модель для генерации видео с открытыми весами. Она принимает в одном запросе текст, изображения, видео и аудио и генерирует ролики длительностью до 15 секунд со звуком. .
Итог: MiniMax H3 получит поддержку аудиореференсов, которые можно будет использовать вместе с изображениями и видео для генерации речи и звука в роликах.




