MiniMax опубликовал веса модели для создания полноценных композиций длиной до пяти минут, которая понимает музыкальную структуру и выдаёт на выходе 32 kHz стерео в формате 16-bit WAV.
Music 3 управляется промптом из текста песни (с тегами вида [Chorus] или [Solo]) и музыкальным описанием (жанр, BPM, тональность, лад и т.д.).
MiniMax советует разбивать промпт на метаданные, детали вокала и аранжировку, но если лень писать руками, можно прогнать запрос через специальный скилл music-caption-rewriter.
Под капотом иерархическая авторегрессионная архитектура из двух уровней. Global LLM отвечает за то, как трек устроен целиком, Local LLM - за то, как он звучит в каждый конкретный момент.
Обычно звук декодируют прямо из дискретных RVQ токенов. Здесь вместо этого модуль синтеза сливает финальные скрытые состояния обеих LLM - они непрерывные, и в них остаётся больше информации об артикуляции вокала, текстуре инструментов и непрерывности во времени.
Дальше поток идёт по цепочке: слияние скрытых состояний → Flow Matching на 2.4B → латент Flow-VAE → декодер Flow-VAE на 123M → 32 kHz стерео. Дискретный декодер токенизатора на инференсе не нужен вовсе.
Flow-VAE взят из MiniMax Speech и переобучен под динамический диапазон и спектр музыки.
Модель запускается в SGLang, HuggingFace Diffusers и ComfyUI.
В полной точности она влезает в 24 GB VRAM, с включённым автоматическим CPU offloading съест около 22 GB.
А если подрубить layer-by-layer streaming для языковой модели, то её вполне можно завести даже на карточках с 8 GB видеопамяти, но придётся ждать результата ощутимо дольше.
🟠 Streaming generation сейчас вообще не поддерживается, модель отдаёт только готовый кусок.🟠 Входной промпт ограничен длиной в 5 000 токенов.🟠 Аудиовывод упирается в потолок из 9 000 акустических фреймов.
@ai_machinelearning_big_data
#AI #ML #TextToMusic #Music3 #MiniMax
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥66👍24👏20❤10👌8🤩5🤷♂1🥰1🤝1