Sakhanda Wire
NVDA $225.58 +0.18% MSFT $481.12 -2.88% GOOGL $343.87 -0.59% META $569.16 -3.51% AMZN $260.34 -0.88%
← К новостям

MiniMax выпустила MiniMax-Music3: музыкальную модель с открытыми весами, генерирующую полноценные пятиминутные песни по тексту и структурированному описанию

MiniMax выпустила MiniMax-Music3 — музыкальную модель с открытыми весами, преобразующую текст в музыку. Модель принимает два отдельных входа: текст песни с тегами секций и подробное описание музыки. За одну генерацию она создает полноценную песню длительностью до пяти минут в формате стерео WAV, 32 кГц, 16 бит. Архитектура объединяет Hybrid-LM — глобальную LLM на 8 млрд параметров и локальную LLM на 0,6 млрд параметров — с непрерывным стеком синтеза на основе flow matching и Flow-VAE. В тот же день были опубликованы веса, код инференса и три документированных способа развертывания.

Готова ли модель к развертыванию?

Да, MiniMax опубликовала рабочие веса, код инференса и три документированных способа развертывания в день релиза, поэтому модель уже готова к использованию, а не является исследовательским прототипом.

  • Уровень компаний: Индивидуальные создатели, независимые студии и команды среднего бизнеса могут напрямую использовать модель в своих продуктах. Лицензия сообщества MiniMax-Music3 разрешает коммерческое использование, но требует размещать обозначение «MiniMax-Music3» на видном месте в интерфейсе продукта. Кроме того, любая организация, чей совокупный годовой доход от таких продуктов превышает 20 млн долларов США, должна предварительно получить отдельное письменное разрешение от MiniMax. Любой, кто предоставляет генерацию третьим лицам, также обязан внедрить и поддерживать меры защиты от создания материалов, нарушающих авторские права.
  • Отрасли: Разработка игр, рекламные и брендинговые агентства, короткие видео и инструменты для создателей контента, электронное обучение, подкастинг, приложения для фитнеса и велнеса, фоновое аудио в розничных магазинах и SaaS-сервисы в сфере музыкальных технологий.
  • Применение: Фоновая музыка для пользовательских видео, адаптивная музыка для игр и уровней, локализованные рекламные композиции и звуковой брендинг, черновые и демоверсии для авторов песен, генерация плейлистов с учетом настроения и пакетная офлайн-генерация, когда стоимость API для каждой песни является ограничивающим фактором.

Архитектура

MiniMax-Music3 сочетает иерархический авторегрессионный стек с непрерывным путем синтеза.

Токенизатор, используемый при обучении, имеет восемь слоев остаточной векторной квантизации (RVQ). Первый, семантический кодбук содержит 16 384 элемента и отвечает за основные музыкальные смыслы и структуру. Оставшиеся семь акустических кодбуков содержат по 1 024 элемента и кодируют остаточные детали. При обучении сначала оптимизируется семантический слой, а затем все восемь слоев совместно.

Hybrid-LM разделяет задачу моделирования. Глобальная LLM на 8 млрд параметров предсказывает первый кодбук RVQ покадрово и отвечает за структуру на дальнем горизонте; локальная LLM на 0,6 млрд параметров предсказывает остальные кодбуки внутри каждого кадра. В карточке модели и лицензии указано, что глобальная LLM инициализируется из Qwen3-8B; в публикации MiniMax Research говорится о Qwen3.5-8B, поэтому точная базовая контрольная точка остается неустановленной.

Стадия синтеза представляет собой более интересное архитектурное решение. Вместо декодирования дискретных токенов RVQ MiniMax объединяет финальные скрытые состояния обеих LLM и передает их в модуль flow matching на 2,4 млрд параметров, который преобразует их в латентное пространство, декодируемое Flow-VAE на 123 млн параметров, унаследованным от MiniMax Speech. При инференсе дискретный декодер токенизатора вообще не загружается.

Управление с помощью двух входов

Текст песни содержит слова и теги секций, каждый на отдельной строке: [Intro], [Verse], [Pre-Chorus], [Chorus], [Post-Chorus], [Bridge], [Instrumental], [Solo], [Outro]. Отдельный структурированный промпт содержит глобальные метаданные, сведения о вокале и аранжировке. MiniMax также поставляет агентский навык music-caption-rewriter, который в офлайн-режиме расширяет краткое описание до этого трехчастного формата.

Интерактивное объяснение

Запуск

Предусмотрено три документированных способа. SGLang-Omni — эталонный сервер; на странице GitHub указано, что требуются два GPU: GPU 0 запускает Qwen3 и авторегрессионную генерацию RVQ, а GPU 1 — flow matching и декодирование DAV. Модульный конвейер diffusers работает менее чем с 24 ГБ видеопамяти при полной точности, примерно с 22 ГБ при автоматической выгрузке на CPU и всего с 8 ГБ при поуровневой групповой выгрузке. В ComfyUI есть встроенный шаблон преобразования текста в музыку с использованием перепакованных весов FP16/INT8 от Comfy-Org.

Основные выводы

  • Модель с открытыми весами, создающая полноценные пятиминутные песни в формате стерео 32 кГц, 16 бит; выпущена 13 августа 2026 года.
  • Архитектура Hybrid-LM: глобальная LLM на 8 млрд параметров и локальная LLM на 0,6 млрд параметров, передающие данные в flow matching на 2,4 млрд параметров и Flow-VAE на 123 млн параметров.
  • Синтез выполняется на объединенных непрерывных скрытых состояниях, полностью обходя дискретный декодер токенизатора.
  • Работает на двух GPU через SGLang-Omni, требует менее 24 ГБ через diffusers или 8 ГБ при групповой выгрузке.
  • Коммерческое использование разрешено при наличии заметного указания авторства; при доходе свыше 20 млн долларов США требуется письменное разрешение.

Ознакомьтесь с моделью на HF и репозиторием GitHub. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему ML-сообществу на Reddit, насчитывающему более 150 тысяч участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? Теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости