Открытые модели генерации музыки, которые можно поднять у себя
ACE-Step запускается меньше чем на 4 ГБ видеопамяти. Таблица требований и лицензий по четырём моделям, разрыв по вокалу, о котором молчат, и четыре случая, где локальный запуск честно обыгрывает подписку.
ACE-Step v1.5 запускается меньше чем на 4 ГБ видеопамяти. В этой цифре вся история открытых музыкальных моделей 2026 года: то, что два года назад требовало дата-центра, теперь помещается в ноутбук, бывший средним на момент покупки.
Дальше о том, что реально работает, какое железо нужно каждой модели и какая строчка в лицензии решает, можно ли продавать то, что получилось. Последнюю часть в обзорах обычно пропускают, а именно у неё есть юридические последствия.
Четыре модели, ради которых стоит освободить диск
| Модель | Параметры | VRAM (fp16) | Длительность | Частота | Лицензия | Сильна в |
|---|---|---|---|---|---|---|
| YuE | 6B | 16 ГБ | 3-4 мин | 44,1 кГц | Apache 2.0 | целые песни с текстом |
| ACE-Step | 3.5B | 8 ГБ | настраивается | 44,1 кГц | Apache 2.0 | быстрые итерации, управление стилем |
| MusicGen Stereo | 3.3B | 12 ГБ | около 30 сек | 32 кГц | CC BY-NC 4.0 | фоновые лупы |
| Stable Audio Open 1.5 | ~1.1B | 12 ГБ | 47 сек | 44,1 кГц | Stability Community | саунд-дизайн, фактуры |
Читайте сначала столбец с лицензией.
MusicGen идёт под CC BY-NC 4.0. То есть некоммерчески. Учиться на ней можно, прототипировать можно, выкладывать опыты можно. Поставить её результат в монетизируемое видео или в клиентский проект нельзя. Многие руководства эту строчку пропускают, и это самое дорогое умолчание во всей категории.
YuE и ACE-Step идут под Apache 2.0. Коммерческое использование разрешено. Это и делает их серьёзными вариантами для всех, у кого здесь есть деловой интерес.
Stable Audio Open живёт под общественной лицензией Stability, у которой свои условия и пороги по выручке, и их лучше прочитать, а не додумать.
Начинать стоит с ACE-Step
Не потому, что она безоговорочно выигрывает на слух, а из-за того, что она делает с уже имеющимся у вас железом.
Версия 1.5 запускается локально меньше чем на 4 ГБ видеопамяти и поддерживает Mac, AMD, Intel и CUDA, а это тихо убирает главный барьер: рабочая станция с Nvidia больше не обязательна. И это единственная модель с настоящими режимами правки вместо генерации одним выстрелом:
- text2music, обычный путь
- cover, пересинтез нового тембра поверх существующего мелодического скелета
- repaint, перегенерация выбранного отрезка внутри трека, то есть местный аналог починки одной неудачной секции
- extract, генеративное разделение на стемы
- layering, добавление дополняющих инструментов к тому, что уже есть
- completion, сборка полной аранжировки из одного мотива
Интереснее всего repaint и layering. Они превращают модель из игрового автомата в инструмент, потому что удачное остаётся, а переигрывается только неудачное, и именно такая работа делает коммерческие генераторы дорогими, ведь каждая перегенерация стоит кредитов.
Ещё она умеет обучать LoRA на нескольких ваших песнях. Это самое близкое к персональной модели, что вообще доступно, и оно бесплатно.
Чем приходится платить за локальный запуск
Скажу честно про обмен, потому что энтузиасты на видео о нём молчат.
Вокал. Вот где разрыв. Коммерческие генераторы вложили огромные силы в качество поющего голоса, и открытые модели пока отстают в выразительности и дикции, особенно за пределами английского. В инструментальной музыке разрыв узкий. В ведущем вокале, на котором держится песня, нет.
Удобство. Вам предстоят окружения Python, гигабайты весов и отладка версий CUDA в час ночи. Заложите вечер до того, как получите первый приятный результат.
Скорость итераций. Облачный сервис возвращает два дубля меньше чем за минуту. Локальная генерация на скромном железе медленнее, а медленные попытки меняют манеру работы.
Готовый продукт. Ни библиотеки, ни обмена ссылками, ни мобильного приложения, ни кнопки выгрузки стемов. Вы собираете рабочий процесс, а не открываете его.
Когда локальный запуск действительно правильный ответ
Четыре случая, а вне их облако просто выгоднее.
Объём. Если нужны сотни треков в месяц, поштучная оплата перестаёт иметь смысл раньше, чем счёт за электричество.
Приватность и конфиденциальность. Клиентская работа под соглашением о неразглашении, невыпущенный материал, всё, что нельзя загружать. Здесь локальность не предпочтение, а требование.
Программный доступ. Вам нужен API, и нужно, чтобы он продолжал работать. Учитывая, что публичного API у Suno нет, а сторонние обёртки ломаются по чужому графику релизов, своя модель это устойчивый вариант.
Дообучение. Вам нужна модель, звучащая как ваш собственный каталог. Обучение LoRA на ACE-Step это доступный путь.
Если ничего из этого не про вас, подписка за восемь долларов покупает вокал получше и готовый продукт, и полезнее вам будет сравнение планов.
Порядок установки, который тратит меньше всего времени
- Выбирайте по лицензии и железу, а не по демонстрационным роликам. Коммерческий интерес плюс скромная видеокарта указывают на ACE-Step. Целые песни с текстом и 16 ГБ видеопамяти указывают на YuE.
- Проверьте, сколько у вас видеопамяти на самом деле. Цифры выше даны для fp16, квантованные сборки идут легче ценой качества.
- Сначала попробуйте размещённую демонстрацию. У большинства моделей есть пространство на Hugging Face. Десять минут там скажут, стоит ли результат вечера установки.
- И только потом ставьте локально. Идите по репозиторию проекта, а не по ролику полугодовой давности. Область движется быстро, и устаревшие инструкции остаются главной причиной неудач.
- Приносите нормальные промпты. Открытые модели отзываются на ту же дисциплину, что и коммерческие: инструменты, десятилетие, характер продакшена, темп. Расплывчатые прилагательные усредняются везде. Формат промпта переносится напрямую, и рецепты из нашего каталога годятся здесь как входные данные.
Что дальше
Открытое поле 2026 года шире четырёх моделей выше: в свежих сравнениях фигурируют DiffRhythm 2, LeVo 2 и HeartMuLa, а архитектуры разошлись по двум лагерям. Один авторегрессионно предсказывает аудиотокены. Второй поручает языковой модели спланировать структуру, а диффузионной отрисовать её.
Практический вывод такой: разрыв с коммерческими инструментами закрывается сначала со стороны инструментальной музыки, а настоящим различием становятся условия лицензии, а не сырое качество. Следите за файлом лицензии в каждом репозитории. Он меняется чаще, чем можно ожидать, и решает, что вам вообще позволено делать со всем сделанным.
Вопросы, которые задают чаще всего
Какой открытый генератор музыки лучший? ACE-Step по доступности и режимам правки, YuE для целых песен с текстом. Обе разрешают коммерческое использование.
Можно запустить генерацию музыки локально? Да. ACE-Step v1.5 работает меньше чем на 4 ГБ видеопамяти на Mac, AMD, Intel и CUDA.
Музыку из открытых моделей можно продавать? Целиком зависит от лицензии. Модели под Apache 2.0, такие как YuE и ACE-Step, это разрешают. MusicGen некоммерческая.
Открытые модели догнали Suno? В инструментальной музыке почти. В ведущем вокале пока нет.
Нужна ли видеокарта Nvidia? Для ACE-Step нет. Другие модели требовательнее.
Это дешевле подписки? Только на объёме. Ниже нескольких сотен треков в месяц подписка выигрывает и по деньгам, и по времени.