Команда DreamX из Alibaba Group представила DreamX-Creator 1.0 — модель для совместной генерации видео и аудио. На вход DreamX-Creator получает первый кадр и текстовый промт, после чего одновременно генерирует видеоряд и звуковую дорожку: речь, звуки окружения и музыку. В основе модели — 7 млрд параметров.
Авторы опубликовали технический отчёт и репозиторий на GitHub, но веса модели и inference-код ещё не выложили, их обещают открыть позже. Детали в материале Postium.
Читайте также: 7 лучших нейросетей для генерации видео
Нейросеть DreamX-Creator: что умеет и как работает
DreamX-Creator использует отдельные потоки для аудио и видео. В первой половине сети модель обрабатывает их независимо, а во второй связывает через Gated Cross-Modal Attention. Связь двусторонняя: видео влияет на звук, а аудио — на видеоряд. Так модель синхронизирует речь с движением губ, а происходящее в кадре — со звуками.
После основной генерации видео можно обработать через 2K Refiner. Базовая модель сначала генерирует ролик в меньшем разрешении, затем рефайнер повышает его до 2K. Он обрабатывает видео фрагментами и использует один шаг denoising для каждого из них. Аудиодорожку на этом этапе модель не меняет.
2K здесь достигается на этапе постобработки: основная модель генерирует видео в меньшем разрешении.
Что показали тесты?
В тестах авторов DreamX-Creator хорошо справляется с временной синхронизацией звука и видео. Версия после RL получила DeSync 0,1351 против 0,2412 у LTX-2.3 с 22 млрд параметров и 0,2708 у MiniMax-H3 с 33 млрд. В этой метрике меньшее значение лучше.
Ранее Alibaba уже усилила оба направления. В августе компания запустила QwenWork — рабочего ИИ-агента для задач с файлами, исследованиями и офисной работой, близкого по формату к ChatGPT Work. В том же месяце Alibaba выпустила Wan 3.0 — видеомодель с генерацией роликов до 30 секунд, нативным звуком и поддержкой текстовых, визуальных, аудио- и видеореференсов.
С lip-sync результаты скромнее. DreamX-Creator получила LSE-C 7,8361 и обошла LTX-2.3 с 7,6768, но уступила MiniMax-H3 с 8,7354. По семантическому соответствию аудио и видео обе крупные модели тоже оказались впереди.
По качеству звука LTX-2.3 и MiniMax-H3 также получили более высокие оценки. Поэтому результаты DreamX-Creator пока скорее показывают сильную A/V-синхронизацию при небольшом размере модели, чем превосходство над более крупными конкурентами в целом.
Почему это важно? DreamX-Creator сочетает нативную генерацию видео и аудио с моделью всего на 7 млрд параметров. Для сравнения: LTX-2.3 использует 22 млрд параметров, MiniMax-H3 — 33 млрд.
С учётом размера модели публикация весов особенно интересна: после релиза сообщество сможет экспериментировать с квантованием, LoRA и интеграциями через ComfyUI.
Ранее Alibaba запустила QwenWork — ИИ-агента для задач с файлами, исследованиями и офисной работой, близкого по формату к ChatGPT Work. В том же месяце Alibaba выпустила Wan 3.0 — видеомодель с генерацией роликов до 30 секунд, нативным звуком и поддержкой текстовых, визуальных, аудио- и видеореференсов.
Итог: DreamX-Creator уместила совместную генерацию видео и звука в 7 млрд параметров и добавила отдельный 2K-рефайнер,






