Sakhanda Wire
NVDA $225.58 +0.18% MSFT $481.12 -2.88% GOOGL $343.87 -0.59% META $569.16 -3.51% AMZN $260.34 -0.88%
← До новин

MiniMax випустила MiniMax-Music3: музичну модель із відкритими вагами, що генерує повноцінні п’ятихвилинні пісні за текстом і структурованим описом

MiniMax випустила MiniMax-Music3 — модель перетворення тексту на музику з відкритими вагами. Модель отримує два окремі входи: текст пісні з тегами секцій і детальний опис музики. За одну генерацію вона повертає повністю готову пісню тривалістю до п’яти хвилин у форматі стерео WAV, 32 кГц, 16 біт. Архітектура поєднує Hybrid-LM — глобальну LLM на 8 млрд параметрів із локальною LLM на 0,6 млрд параметрів — із конвеєром безперервного синтезу на основі flow matching і Flow-VAE. Ваги, код інференсу та три задокументовані способи розгортання були випущені того ж дня.

Чи придатна вона для розгортання?

Так, MiniMax опублікувала придатні до використання ваги, код інференсу та три задокументовані способи розгортання в день релізу, тож модель уже можна розгортати, а не сприймати лише як дослідницький прототип.

  • Рівень компаній: окремі автори, незалежні студії та команди середнього бізнесу можуть безпосередньо випускати продукти на її основі. Ліцензія спільноти MiniMax-Music3 дозволяє комерційне використання, але вимагає помітно відображати назву «MiniMax-Music3» в інтерфейсі продукту, а будь-яка організація, чий сукупний річний дохід від таких продуктів перевищує 20 млн доларів США, повинна заздалегідь отримати окремий письмовий дозвіл від MiniMax. Усі, хто надає третім сторонам послуги генерації, також повинні впроваджувати й підтримувати засоби захисту від результатів, що порушують права.
  • Галузі: розробка ігор, рекламні та брендингові агентства, короткі відео й інструменти для авторів, електронне навчання, подкастинг, застосунки для фітнесу та здоров’я, аудіо для роздрібних магазинів і SaaS-рішення у сфері музичних технологій.
  • Застосування: фонова музика для відео, створених користувачами, адаптивна музика для ігор і рівнів, локалізовані рекламні треки та звуковий брендинг, чернеткові й демонстраційні треки для авторів пісень, генерація плейлистів з урахуванням настрою та офлайн-пакетна генерація, коли обмеженням є вартість API на одну пісню.

Архітектура

MiniMax-Music3 поєднує ієрархічний авторегресійний стек із безперервним шляхом синтезу.

Токенізатор, що використовується під час навчання, має вісім шарів залишкового векторного квантування (RVQ). Перший, семантичний кодбук, містить 16 384 елементи та передає основну музичну семантику й структуру. Решта сім акустичних кодбуків мають по 1 024 елементи кожен і кодують залишкові деталі. Під час навчання спочатку оптимізується семантичний шар, а потім усі вісім шарів спільно.

Hybrid-LM розділяє завдання моделювання. Глобальна LLM на 8 млрд параметрів передбачає перший кодбук RVQ покадрово та відповідає за довгострокову структуру; локальна LLM на 0,6 млрд параметрів передбачає решту кодбуків у межах кожного кадру. У картці моделі та ліцензії зазначено, що глобальна LLM ініціалізована на основі Qwen3-8B; у дописі MiniMax Research вказано Qwen3.5-8B, тому точна базова контрольна точка залишається невизначеною.

Етап синтезу є цікавішим архітектурним рішенням. Замість декодування дискретних токенів RVQ MiniMax об’єднує фінальні приховані стани обох LLM і подає їх на модуль flow matching на 2,4 млрд параметрів, який відображає їх у латентний простір, що декодується Flow-VAE на 123 млн параметрів, успадкованим від MiniMax Speech. Під час інференсу дискретний декодер токенізатора взагалі не завантажується.

Керування за допомогою двох входів

Текст пісні містить слова й теги секцій в окремих рядках: [Intro], [Verse], [Pre-Chorus], [Chorus], [Post-Chorus], [Bridge], [Instrumental], [Solo], [Outro]. Окремий структурований опис містить глобальні метадані, деталі вокалу й аранжування. MiniMax також випускає навичку агента music-caption-rewriter, яка офлайн розгортає короткий опис у цей формат із трьох частин.

Інтерактивне пояснення

Запуск

Є три задокументовані способи. SGLang-Omni — референсний сервер; на сторінці GitHub зазначено, що потрібні два графічні процесори CUDA: GPU 0 запускає Qwen3 і авторегресійну генерацію RVQ, а GPU 1 — flow matching і декодування DAV. Модульний конвеєр diffusers працює менш ніж із 24 ГБ VRAM у режимі повної точності, приблизно з 22 ГБ за автоматичного перенесення обчислень на CPU і лише з 8 ГБ за поетапного групового перенесення обчислень на рівні листків. У ComfyUI є нативний шаблон перетворення тексту на музику, що використовує перепаковані ваги FP16/INT8 від Comfy-Org.

Основні висновки

  • Модель із відкритими вагами, що генерує повністю готові п’ятихвилинні пісні у форматі стерео, 32 кГц, 16 біт; випущена 13 серпня 2026 року.
  • Архітектура Hybrid-LM: глобальна LLM на 8 млрд параметрів плюс локальна LLM на 0,6 млрд параметрів, які передають дані на flow matching на 2,4 млрд параметрів і Flow-VAE на 123 млн параметрів.
  • Синтез працює на об’єднаних безперервних прихованих станах, повністю оминаючи дискретний декодер токенізатора.
  • Працює на двох GPU через SGLang-Omni, потребує менш ніж 24 ГБ через diffusers або 8 ГБ із груповим перенесенням обчислень.
  • Комерційне використання дозволене за умови помітного зазначення авторства; за доходу понад 20 млн доларів США потрібен письмовий дозвіл.

Перегляньте модель на HF і репозиторій на GitHub. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабредіту про машинне навчання зі 150 тисячами+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію на GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини