Почему Suno орёт на каждом треке, даже когда я прошу спокойную песню?
Жалоба, которая есть у всех
«На любой запрос про спокойную песню нейросеть выдаёт орущий вокал, quiet vocals игнорируются». «Крик, эскалация громкости и мелизмы, что бы ты ни писал в промпте». «Она просто решает нарастить интенсивность вокала к концу».
Это реальная и самая частая жалоба на вокал в Suno. Ты пишешь quiet vocals, calm, soft — а к последнему припеву певец орёт так, будто здание горит. Разбираем, почему так, и как это чинить.
Почему quiet не работает
Модель читает большую часть промпта как энергию жанра, а не как посекундное правило громкости. Слова emotional, powerful, epic, anthem, chorus, даже build толкают модель к эскалации. Одинокое quiet рядом с ними проигрывает. Плюс у модели сильная установка: песня должна расти — куплет тихий, припев большой. Оставь её без чётких указаний — и она нарастит интенсивность к концу, что бы ни говорило одно прилагательное.
Есть и более глубокая причина. Слова-настроения quiet, soft, calm вообще не маппятся на динамику — Suno их фактически игнорирует, потому что они описывают, что должен почувствовать слушатель, а не что должен сделать голос. На чувство модель отреагировать не может. На технику — может. Поэтому не спорь с ней одним слабым словом. Режиссируй исполнение и фиксируй динамику посекционно.
Описывай манеру, а не настроение
Вместо слова-настроения (calm) описывай физическую вокальную технику. Теги техники — это то, что модель реально умеет исполнять:
[Vocal: restrained, breathy, close-mic, conversational]
[soft head voice]
no belting
spoken-word delivery, almost whispered
low dynamic range, steady
Это работает, потому что описывает как производится голос, а не что должен почувствовать слушатель. «Breathy» и «close-mic» несовместимы с криком — на близком микрофоне не покричишь без клиппинга, и модель это знает. Особенно на v5.5: детальный якорь подачи держится лучше расплывчатого — чем конкретнее техника, тем труднее модели с неё сползти.
Таблица перевода: слово-настроение → тег подачи
У каждого слова-настроения, которое хочется написать, есть конкретный эквивалент подачи. Бери правую колонку — она называет технику, которую модель может исполнить, а не чувство, на которое она махнёт рукой.
| Вы написали (настроение) | Пишите вместо этого (подача / техника) |
|---|---|
| calm / спокойно | restrained, breathy, close-mic, steady |
| quiet / тихо | low dynamic range, soft head voice, near-whisper |
| soft / мягко | breathy, unpushed, conversational |
| gentle / нежно | soft head voice, minimal vibrato, legato |
| intimate / интимно | close-mic, whispered verses, dry vocal |
| tender / трепетно | understated, warm, restrained delivery |
| powerful / мощно | full-chest tone, forward in the mix, sustained (но без belting, если нужен контроль) |
| raw / сыро | dry vocal, no reverb, single close mic |
| mellow / расслабленно | relaxed phrasing, laid-back timing, low intensity |
Обрати внимание, чего в правой колонке нет никогда: прилагательного про эмоцию. Каждая строка — инструкция звукорежиссёра или вокального педагога. restrained и close-mic вытесняют крик так же, как медленный темп вытесняет танцевальный бит — не запретом, а тем, что занимают место.
Фиксируй динамику в каждой секции — работу делает поле Lyrics
Вот механика, которую большинство упускает: аранжировка и подача, вписанные в поле Lyrics, примерно в десять раз сильнее тех же слов в поле Style. Style задаёт глобальное среднее; Lyrics управляет треком посекундно. Динамика — вещь посекционная, значит, её место в Lyrics, тег за тегом.
Не задавай вайб один раз в надежде, что прокатит. Прописывай интенсивность прямо внутри каждого структурного тега, чтобы модели некуда было эскалировать:
[Verse 1 - soft, intimate, breathy]
...
[Chorus - still restrained, no belting, warm]
...
[Verse 2 - same low intensity, conversational]
...
[Outro - fades to near silence, whispered]
Главный приём: припев — это место, где живёт эскалация, поэтому именно там ты пишешь still restrained, no belting. Повторяй ограничение везде, где модель хочет разрастись.
Несколько ограничений в одном теге удобно склеить вертикальной чертой | — так метатеги комбинируются чисто:
[Chorus - restrained | no belting | no melisma | warm]
Одна шапка секции, четыре зафиксированных ограничения, ни одной кучи через запятую, которую модель пролистает. Это та же дисциплина, что в гайде режиссёрская динамика: вписывай арку в секции, а не называй настроение в надежде.
Список слов-провокаторов эскалации
Пройди по промпту и вычисти слова, которые провоцируют крик. Это топливо; их удаление даёт больше, чем любое количество quiet:
- Слова интенсивности:
powerful,epic,explosive,intense,huge,massive - Команды на белтинг:
belting,soaring,wailing,screaming,full-throated,riffs and runs - Слова арки:
build,climax,crescendo,drop,bigger chorus,explosive finale - Гимновые:
anthemic,anthem,stadium,arena,festival - Коварные:
emotional(меняй наtender/understated),passionate(меняй наintimate),energy(меняй наsteady)
Ты не добавляешь «тихо». Ты убираешь топливо. Промпт без единого такого слова не даёт модели, к чему эскалировать.
Два рабочих рецепта спокойного вокала
Рецепт 1 — интимная акустическая баллада
Стиль:
slow acoustic ballad, 70 BPM, close-mic vocals, restrained, breathy, conversational, warm, low dynamic range, no belting, intimate
Шапка lyrics:
[Intro - soft fingerpicked guitar]
[Verse 1 - whispered, close, breathy]
[Chorus - warm, restrained, no belting, no melisma]
[Verse 2 - same intimacy, spoken-word feel]
[Outro - fades to near silence]
Рецепт 2 — spoken-word lo-fi (максимум контроля)
Когда даже сдержанный спетый припев подползает вверх по интенсивности, откажись от пения вовсе и заякорись на разговорной подаче — у неё нет потолка, к которому карабкаться.
Стиль:
lo-fi bedroom pop, 82 BPM, dry close-mic vocal, spoken-word, unprocessed, low dynamic range, tape hiss, no drums swell
Шапка lyrics:
[Verse 1 - spoken, close-mic | breathy | flat delivery]
[Chorus - half-sung | still spoken-feel | no belting | no melisma]
[Verse 2 - same restraint | conversational]
[Outro - trails off | whispered | near silence]
Рецепт 3 — сдержанный инди-фолк
Стиль:
indie folk, 75 BPM, warm female alto, understated, close-mic, soft head voice, steady, no belting, sparse arrangement
Шапка lyrics:
[Verse 1 - soft head voice | minimal vibrato | intimate]
[Chorus - stays understated | no soaring | warm | held notes]
[Bridge - near-whisper | dry vocal]
[Outro - fades, breathy]
Сгенерируй любой из них два-три раза. Suno вероятностна, поэтому сохрани и переиспользуй тот seed/стиль, что ведёт себя правильно — при тюнинге меняй по одному полю за раз, см. гайд про воспроизводимость результата.
Что делать сейчас
- Удали из промпта все слова эскалации по списку-провокаторов выше.
- Замени теги-настроения на теги-подачу из таблицы перевода:
breathy,close-mic,no belting. - Впиши интенсивность в каждую шапку секции в поле Lyrics, особенно в припев — там она в десять раз сильнее. Склеивай ограничения через
|. - Собери и проверь формулировки в конструкторе промптов, а спокойные стили посмотри в каталоге.
Про глубокую механику управления громкостью по ходу песни читай режиссёрскую динамику. Чтобы модель не меняла, кто поёт от дубля к дублю, читай фиксацию вокальной персоны.