MiniMax пуска MiniMax-Music3: музикален модел с отворени тегла, генериращ завършени петминутни песни от текст на песен и структурирано описание
MiniMax пусна MiniMax-Music3 — модел с отворени тегла за преобразуване на текст в музика. Моделът приема два отделни входа: текст на песен със секционни тагове и подробно описание на музиката. Той връща завършена песен с продължителност до пет минути при една-единствена генерация, като 32 kHz, 16-битов стерео WAV файл. Архитектурата комбинира Hybrid-LM, състоящ се от 8B Global LLM и 0.6B Local LLM, с непрекъснат стек за синтез, изграден върху flow matching и Flow-VAE. Теглата, кодът за инференс и три документирани начина за обслужване бяха публикувани в същия ден.
Може ли да бъде внедрен?
Да, MiniMax публикува използваеми тегла, код за инференс и три документирани начина за обслужване още в първия ден, така че моделът може да бъде внедрен веднага, а не е просто изследователски прототип.
- Ниво на компанията: Индивидуални създатели, независими студиа и екипи от средния пазар могат да го използват директно за своите продукти. Лицензът за общността на MiniMax-Music3 разрешава търговска употреба, но изисква да показвате „MiniMax-Music3“ на видно място в потребителския интерфейс на продукта, а всяка организация, чиито общи годишни приходи от тези продукти надхвърлят 20 милиона щатски долара, трябва предварително да получи отделно писмено разрешение от MiniMax. Всеки, който хоства генериране от трети страни, трябва също да въведе и поддържа мерки за защита срещу генериране на резултати, нарушаващи права.
- Индустрии: Разработка на игри, рекламни и бранд агенции, инструменти за кратки видеоклипове и създатели, електронно обучение, подкастинг, приложения за фитнес и здраве, аудио за физически магазини, както и SaaS решения за музикални технологии.
- Приложения: Фонов музикален съпровод за UGC видеоклипове, адаптивна музика за игри и нива, локализирани рекламни подложки и звуков брандинг, работни и демо записи за автори на песни, генериране на плейлисти според настроението и офлайн пакетно генериране, когато разходите за API на песен са ограничаващ фактор.
Архитектурата
MiniMax-Music3 комбинира йерархичен авторегресивен стек с непрекъснат път за синтез.
Токенизаторът за обучение използва осем слоя на остатъчна векторна квантизация (RVQ). Първият, семантичният кодбук, има 16 384 записа и носи основната музикална семантика и структура. Останалите седем акустични кодбука имат по 1 024 записа и кодират остатъчните детайли. При обучението първо се оптимизира семантичният слой, а след това и осемте слоя съвместно.
Hybrid-LM разделя задачата за моделиране. 8B Global LLM предсказва първия RVQ кодбук кадър по кадър и запазва дългосрочната структура; 0.6B Local LLM предсказва останалите кодбуци във всеки кадър. Картата на модела и лицензът посочват, че Global LLM е инициализиран от Qwen3-8B; публикацията на MiniMax Research посочва Qwen3.5-8B, така че точната базова контролна точка остава неуточнена.
Етапът на синтеза е по-интересният дизайнерски избор. Вместо да декодира от дискретни RVQ токени, MiniMax обединява финалните скрити състояния на двата LLM модела и подава полученото като условие към модул за flow matching с 2.4B параметъра, който преобразува информацията в латентно пространство, декодирано от 123M Flow-VAE, наследен от MiniMax Speech. При инференс дискретният декодер на токенизатора изобщо не се зарежда.
Управление с два входа
Текстът на песента съдържа думите и секционните тагове на отделни редове: [Intro], [Verse], [Pre-Chorus], [Chorus], [Post-Chorus], [Bridge], [Instrumental], [Solo], [Outro]. Отделен Structured Caption съдържа Global Metadata, Vocal Details и Arrangement. MiniMax предлага и умение за агенти music-caption-rewriter, което разширява кратко описание до този формат от три части офлайн.
Интерактивно обяснение
Стартиране
Има три документирани начина. SGLang-Omni е референтният сървър; страницата в GitHub посочва два CUDA графични процесора, като GPU 0 изпълнява Qwen3 и авторегресивното генериране на RVQ, а GPU 1 изпълнява flow matching и DAV декодиране. Модулният pipeline на diffusers се побира в 24 GB VRAM при пълна прецизност, в около 22 GB с автоматично прехвърляне към CPU и до 8 GB с групово прехвърляне на ниво листа. ComfyUI разполага с нативен шаблон Text to Music, използващ преразпределени FP16/INT8 тегла от Comfy-Org.
Основни изводи
- Модел с отворени тегла, който генерира завършени петминутни песни при 32 kHz, 16-битов стерео звук, публикуван на 13 август 2026 г.
- Дизайн Hybrid-LM: 8B Global LLM плюс 0.6B Local LLM, подаващи информация към 2.4B flow matching и 123M Flow-VAE.
- Синтезът се извършва върху обединени непрекъснати скрити състояния, като дискретният декодер на токенизатора се пропуска изцяло.
- Работи на два графични процесора чрез SGLang-Omni, под 24 GB чрез diffusers или с 8 GB при групово прехвърляне.
- Търговската употреба е разрешена при видимо приписване; приходи над 20 милиона щатски долара изискват писмено разрешение.
Разгледайте модела в HF и GitHub хранилището. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.
Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ представяне на продукт ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.