285K subscribers
5.3K photos
1.22K videos
17 files
5.65K links
Погружаемся в машинное обучение и Data Science

Показываем как запускать любые LLm на пальцах.

По всем вопросам - @haarrp

@itchannels_telegram -🔥best channels

Реестр РКН: clck.ru/3Fmqri
Download Telegram
⚡️ MiniMax Music 3: открытая модель генерации музыки с вокалом

MiniMax опубликовал веса модели для создания полноценных композиций длиной до пяти минут, которая понимает музыкальную структуру и выдаёт на выходе 32 kHz стерео в формате 16-bit WAV.

Music 3 управляется промптом из текста песни (с тегами вида [Chorus] или [Solo]) и музыкальным описанием (жанр, BPM, тональность, лад и т.д.).

MiniMax советует разбивать промпт на метаданные, детали вокала и аранжировку, но если лень писать руками, можно прогнать запрос через специальный скилл music-caption-rewriter.


🟡Механика

Под капотом иерархическая авторегрессионная архитектура из двух уровней. Global LLM отвечает за то, как трек устроен целиком, Local LLM - за то, как он звучит в каждый конкретный момент.

🟢Global LLM: Qwen3-8B, у которой на этапе тренировки сделали дотюн эмбеддингов и выходных слоёв на семантические музыкальные токены. Держит структуру трека и кадр за кадром предсказывает первый RVQ codebook - семантический, на 16 384 записи.

🟢Local LLM (0.6B): внутри каждого кадра достраивает оставшиеся 7 акустических кодбуков и возвращает мелкую акустическую детализацию.

Обычно звук декодируют прямо из дискретных RVQ токенов. Здесь вместо этого модуль синтеза сливает финальные скрытые состояния обеих LLM - они непрерывные, и в них остаётся больше информации об артикуляции вокала, текстуре инструментов и непрерывности во времени.

Дальше поток идёт по цепочке: слияние скрытых состояний → Flow Matching на 2.4B → латент Flow-VAE → декодер Flow-VAE на 123M → 32 kHz стерео. Дискретный декодер токенизатора на инференсе не нужен вовсе.

Flow-VAE взят из MiniMax Speech и переобучен под динамический диапазон и спектр музыки.


🟡Доступность

Модель запускается в SGLangHuggingFace Diffusers и ComfyUI.

В полной точности она влезает в 24 GB VRAM, с включённым автоматическим CPU offloading съест около 22 GB.

А если подрубить layer-by-layer streaming для языковой модели, то её вполне можно завести даже на карточках с 8 GB видеопамяти, но придётся ждать результата ощутимо дольше.

🟡Ограничения

🟠Streaming generation сейчас вообще не поддерживается, модель отдаёт только готовый кусок.

🟠Входной промпт ограничен длиной в 5 000 токенов.

🟠Аудиовывод упирается в потолок из 9 000 акустических фреймов.



📌Лицензирование: MiniMax-Music3 Community License


🟡Страница проекта
🟡Веса
🟡Демо
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #TextToMusic #Music3 #MiniMax
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥66👍24👏2010👌8🤩5🤷‍♂1🥰1🤝1