AI

MiniMax открыла веса Music 3 — модель генерирует песни до пяти минут

MiniMax открыла веса Music 3 — модель генерирует песни до пяти минут

MiniMax опубликовала на Hugging Face веса Music 3 — модели для генерации музыки. Она создаёт готовые песни длительностью до пяти минут по тексту песни и подробному описанию музыки.

Результат сохраняется в стерео WAV с частотой 32 кГц и разрядностью 16 бит. Веса можно скачать; для запуска разработчик указывает SGLang-Omni, Diffusers и ComfyUI. Подробности — в материале Postium.

Читайте также: Как пользоваться нейросетью Dreamina AI бесплатно — гайд

MiniMax Music 3 — возможности и характеристики

В текст песни можно добавлять теги частей композиции: [Intro], [Verse], [Chorus], [Bridge] и другие. Отдельное описание задаёт жанр, темп, тональность, вокал, инструменты, аранжировку и развитие настроения.

Архитектура разделяет работу над структурой композиции и акустическими деталями. Глобальная языковая модель на 8 млрд параметров отвечает за структуру песни, локальная на 0,6 млрд — за детали звучания. Затем их скрытые состояния поступают в Flow Matching-модель на 2,4 млрд параметров и декодируются в аудио.

MiniMax открыла веса Music 3 — модель генерирует песни до пяти минут

MiniMax открыла веса Music 3 — модель генерирует песни до пяти минут

Генерация требует CUDA. Разработчик пишет, что для запуска в полной точности нужно менее 24 ГБ видеопамяти; с выгрузкой компонентов в CPU модель может работать примерно на 22 ГБ, а с послойной выгрузкой — на 8 ГБ, но медленнее. Модель не гарантирует точного соответствия заданным темпу, тональности, инструментам, тексту и структуре песни. Потоковая генерация пока не поддерживается.

Как пользоваться

Скачайте веса со страницы MiniMax Music 3 на Hugging Face и запустите модель через SGLang-Omni, Diffusers или ComfyUI. Для Diffusers пока требуется версия с исправлениями из отдельного PR, пока они не вошли в основную ветку. В поле с текстом укажите слова песни и теги её частей, а в описании — стиль, вокал и аранжировку. Модель вернёт WAV-файл.

Почему это важно? Веса Music 3 доступны для самостоятельного развёртывания по условиям MiniMax-Music3 Community License: разработчик может запускать генерацию в своей среде и передавать модели не только краткий промпт, но и текст, структуру и параметры композиции.

Облачная генерация Music 3.0 также доступна через API: стоимость составляет $0,15 за песню. Для бесплатного режима предусмотрено ограничение в три запроса в минуту.

Ранее мы писали, что MiniMax H3 позволит использовать аудиореференсы для голосов — в официальном анонсе компания показала, как модель переносит тембр мужского голоса из аудиозаписи на речь персонажа в сгенерированном ролике.

Итог. MiniMax опубликовала веса Music 3 для генерации песен до пяти минут с управлением текстом, вокалом и аранжировкой.

Источник

Добавить комментарий

Кнопка «Наверх»