Открытые модели генерации музыки, которые можно поднять у себя

ACE-Step запускается меньше чем на 4 ГБ видеопамяти. Таблица требований и лицензий по четырём моделям, разрыв по вокалу, о котором молчат, и четыре случая, где локальный запуск честно обыгрывает подписку.


ACE-Step v1.5 запускается меньше чем на 4 ГБ видеопамяти. В этой цифре вся история открытых музыкальных моделей 2026 года: то, что два года назад требовало дата-центра, теперь помещается в ноутбук, бывший средним на момент покупки.

Дальше о том, что реально работает, какое железо нужно каждой модели и какая строчка в лицензии решает, можно ли продавать то, что получилось. Последнюю часть в обзорах обычно пропускают, а именно у неё есть юридические последствия.

Четыре модели, ради которых стоит освободить диск

МодельПараметрыVRAM (fp16)ДлительностьЧастотаЛицензияСильна в
YuE6B16 ГБ3-4 мин44,1 кГцApache 2.0целые песни с текстом
ACE-Step3.5B8 ГБнастраивается44,1 кГцApache 2.0быстрые итерации, управление стилем
MusicGen Stereo3.3B12 ГБоколо 30 сек32 кГцCC BY-NC 4.0фоновые лупы
Stable Audio Open 1.5~1.1B12 ГБ47 сек44,1 кГцStability Communityсаунд-дизайн, фактуры

Читайте сначала столбец с лицензией.

MusicGen идёт под CC BY-NC 4.0. То есть некоммерчески. Учиться на ней можно, прототипировать можно, выкладывать опыты можно. Поставить её результат в монетизируемое видео или в клиентский проект нельзя. Многие руководства эту строчку пропускают, и это самое дорогое умолчание во всей категории.

YuE и ACE-Step идут под Apache 2.0. Коммерческое использование разрешено. Это и делает их серьёзными вариантами для всех, у кого здесь есть деловой интерес.

Stable Audio Open живёт под общественной лицензией Stability, у которой свои условия и пороги по выручке, и их лучше прочитать, а не додумать.

Начинать стоит с ACE-Step

Не потому, что она безоговорочно выигрывает на слух, а из-за того, что она делает с уже имеющимся у вас железом.

Версия 1.5 запускается локально меньше чем на 4 ГБ видеопамяти и поддерживает Mac, AMD, Intel и CUDA, а это тихо убирает главный барьер: рабочая станция с Nvidia больше не обязательна. И это единственная модель с настоящими режимами правки вместо генерации одним выстрелом:

  • text2music, обычный путь
  • cover, пересинтез нового тембра поверх существующего мелодического скелета
  • repaint, перегенерация выбранного отрезка внутри трека, то есть местный аналог починки одной неудачной секции
  • extract, генеративное разделение на стемы
  • layering, добавление дополняющих инструментов к тому, что уже есть
  • completion, сборка полной аранжировки из одного мотива

Интереснее всего repaint и layering. Они превращают модель из игрового автомата в инструмент, потому что удачное остаётся, а переигрывается только неудачное, и именно такая работа делает коммерческие генераторы дорогими, ведь каждая перегенерация стоит кредитов.

Ещё она умеет обучать LoRA на нескольких ваших песнях. Это самое близкое к персональной модели, что вообще доступно, и оно бесплатно.

Чем приходится платить за локальный запуск

Скажу честно про обмен, потому что энтузиасты на видео о нём молчат.

Вокал. Вот где разрыв. Коммерческие генераторы вложили огромные силы в качество поющего голоса, и открытые модели пока отстают в выразительности и дикции, особенно за пределами английского. В инструментальной музыке разрыв узкий. В ведущем вокале, на котором держится песня, нет.

Удобство. Вам предстоят окружения Python, гигабайты весов и отладка версий CUDA в час ночи. Заложите вечер до того, как получите первый приятный результат.

Скорость итераций. Облачный сервис возвращает два дубля меньше чем за минуту. Локальная генерация на скромном железе медленнее, а медленные попытки меняют манеру работы.

Готовый продукт. Ни библиотеки, ни обмена ссылками, ни мобильного приложения, ни кнопки выгрузки стемов. Вы собираете рабочий процесс, а не открываете его.

Когда локальный запуск действительно правильный ответ

Четыре случая, а вне их облако просто выгоднее.

Объём. Если нужны сотни треков в месяц, поштучная оплата перестаёт иметь смысл раньше, чем счёт за электричество.

Приватность и конфиденциальность. Клиентская работа под соглашением о неразглашении, невыпущенный материал, всё, что нельзя загружать. Здесь локальность не предпочтение, а требование.

Программный доступ. Вам нужен API, и нужно, чтобы он продолжал работать. Учитывая, что публичного API у Suno нет, а сторонние обёртки ломаются по чужому графику релизов, своя модель это устойчивый вариант.

Дообучение. Вам нужна модель, звучащая как ваш собственный каталог. Обучение LoRA на ACE-Step это доступный путь.

Если ничего из этого не про вас, подписка за восемь долларов покупает вокал получше и готовый продукт, и полезнее вам будет сравнение планов.

Порядок установки, который тратит меньше всего времени

  1. Выбирайте по лицензии и железу, а не по демонстрационным роликам. Коммерческий интерес плюс скромная видеокарта указывают на ACE-Step. Целые песни с текстом и 16 ГБ видеопамяти указывают на YuE.
  2. Проверьте, сколько у вас видеопамяти на самом деле. Цифры выше даны для fp16, квантованные сборки идут легче ценой качества.
  3. Сначала попробуйте размещённую демонстрацию. У большинства моделей есть пространство на Hugging Face. Десять минут там скажут, стоит ли результат вечера установки.
  4. И только потом ставьте локально. Идите по репозиторию проекта, а не по ролику полугодовой давности. Область движется быстро, и устаревшие инструкции остаются главной причиной неудач.
  5. Приносите нормальные промпты. Открытые модели отзываются на ту же дисциплину, что и коммерческие: инструменты, десятилетие, характер продакшена, темп. Расплывчатые прилагательные усредняются везде. Формат промпта переносится напрямую, и рецепты из нашего каталога годятся здесь как входные данные.

Что дальше

Открытое поле 2026 года шире четырёх моделей выше: в свежих сравнениях фигурируют DiffRhythm 2, LeVo 2 и HeartMuLa, а архитектуры разошлись по двум лагерям. Один авторегрессионно предсказывает аудиотокены. Второй поручает языковой модели спланировать структуру, а диффузионной отрисовать её.

Практический вывод такой: разрыв с коммерческими инструментами закрывается сначала со стороны инструментальной музыки, а настоящим различием становятся условия лицензии, а не сырое качество. Следите за файлом лицензии в каждом репозитории. Он меняется чаще, чем можно ожидать, и решает, что вам вообще позволено делать со всем сделанным.

Вопросы, которые задают чаще всего

Какой открытый генератор музыки лучший? ACE-Step по доступности и режимам правки, YuE для целых песен с текстом. Обе разрешают коммерческое использование.

Можно запустить генерацию музыки локально? Да. ACE-Step v1.5 работает меньше чем на 4 ГБ видеопамяти на Mac, AMD, Intel и CUDA.

Музыку из открытых моделей можно продавать? Целиком зависит от лицензии. Модели под Apache 2.0, такие как YuE и ACE-Step, это разрешают. MusicGen некоммерческая.

Открытые модели догнали Suno? В инструментальной музыке почти. В ведущем вокале пока нет.

Нужна ли видеокарта Nvidia? Для ACE-Step нет. Другие модели требовательнее.

Это дешевле подписки? Только на объёме. Ниже нескольких сотен треков в месяц подписка выигрывает и по деньгам, и по времени.

Читать дальше