Почему Suno орёт на каждом треке, даже когда я прошу спокойную песню?


Жалоба, которая есть у всех

«На любой запрос про спокойную песню нейросеть выдаёт орущий вокал, quiet vocals игнорируются». «Крик, эскалация громкости и мелизмы, что бы ты ни писал в промпте». «Она просто решает нарастить интенсивность вокала к концу».

Это реальная и самая частая жалоба на вокал в Suno. Ты пишешь quiet vocals, calm, soft — а к последнему припеву певец орёт так, будто здание горит. Разбираем, почему так, и как это чинить.

Почему quiet не работает

Модель читает большую часть промпта как энергию жанра, а не как посекундное правило громкости. Слова emotional, powerful, epic, anthem, chorus, даже build толкают модель к эскалации. Одинокое quiet рядом с ними проигрывает. Плюс у модели сильная установка: песня должна расти — куплет тихий, припев большой. Оставь её без чётких указаний — и она нарастит интенсивность к концу, что бы ни говорило одно прилагательное.

Есть и более глубокая причина. Слова-настроения quiet, soft, calm вообще не маппятся на динамику — Suno их фактически игнорирует, потому что они описывают, что должен почувствовать слушатель, а не что должен сделать голос. На чувство модель отреагировать не может. На технику — может. Поэтому не спорь с ней одним слабым словом. Режиссируй исполнение и фиксируй динамику посекционно.

Описывай манеру, а не настроение

Вместо слова-настроения (calm) описывай физическую вокальную технику. Теги техники — это то, что модель реально умеет исполнять:

[Vocal: restrained, breathy, close-mic, conversational]

[soft head voice]

no belting

spoken-word delivery, almost whispered

low dynamic range, steady

Это работает, потому что описывает как производится голос, а не что должен почувствовать слушатель. «Breathy» и «close-mic» несовместимы с криком — на близком микрофоне не покричишь без клиппинга, и модель это знает. Особенно на v5.5: детальный якорь подачи держится лучше расплывчатого — чем конкретнее техника, тем труднее модели с неё сползти.

Таблица перевода: слово-настроение → тег подачи

У каждого слова-настроения, которое хочется написать, есть конкретный эквивалент подачи. Бери правую колонку — она называет технику, которую модель может исполнить, а не чувство, на которое она махнёт рукой.

Вы написали (настроение)Пишите вместо этого (подача / техника)
calm / спокойноrestrained, breathy, close-mic, steady
quiet / тихоlow dynamic range, soft head voice, near-whisper
soft / мягкоbreathy, unpushed, conversational
gentle / нежноsoft head voice, minimal vibrato, legato
intimate / интимноclose-mic, whispered verses, dry vocal
tender / трепетноunderstated, warm, restrained delivery
powerful / мощноfull-chest tone, forward in the mix, sustained (но без belting, если нужен контроль)
raw / сыроdry vocal, no reverb, single close mic
mellow / расслабленноrelaxed phrasing, laid-back timing, low intensity

Обрати внимание, чего в правой колонке нет никогда: прилагательного про эмоцию. Каждая строка — инструкция звукорежиссёра или вокального педагога. restrained и close-mic вытесняют крик так же, как медленный темп вытесняет танцевальный бит — не запретом, а тем, что занимают место.

Фиксируй динамику в каждой секции — работу делает поле Lyrics

Вот механика, которую большинство упускает: аранжировка и подача, вписанные в поле Lyrics, примерно в десять раз сильнее тех же слов в поле Style. Style задаёт глобальное среднее; Lyrics управляет треком посекундно. Динамика — вещь посекционная, значит, её место в Lyrics, тег за тегом.

Не задавай вайб один раз в надежде, что прокатит. Прописывай интенсивность прямо внутри каждого структурного тега, чтобы модели некуда было эскалировать:

[Verse 1 - soft, intimate, breathy]
...
[Chorus - still restrained, no belting, warm]
...
[Verse 2 - same low intensity, conversational]
...
[Outro - fades to near silence, whispered]

Главный приём: припев — это место, где живёт эскалация, поэтому именно там ты пишешь still restrained, no belting. Повторяй ограничение везде, где модель хочет разрастись.

Несколько ограничений в одном теге удобно склеить вертикальной чертой | — так метатеги комбинируются чисто:

[Chorus - restrained | no belting | no melisma | warm]

Одна шапка секции, четыре зафиксированных ограничения, ни одной кучи через запятую, которую модель пролистает. Это та же дисциплина, что в гайде режиссёрская динамика: вписывай арку в секции, а не называй настроение в надежде.

Список слов-провокаторов эскалации

Пройди по промпту и вычисти слова, которые провоцируют крик. Это топливо; их удаление даёт больше, чем любое количество quiet:

  • Слова интенсивности: powerful, epic, explosive, intense, huge, massive
  • Команды на белтинг: belting, soaring, wailing, screaming, full-throated, riffs and runs
  • Слова арки: build, climax, crescendo, drop, bigger chorus, explosive finale
  • Гимновые: anthemic, anthem, stadium, arena, festival
  • Коварные: emotional (меняй на tender / understated), passionate (меняй на intimate), energy (меняй на steady)

Ты не добавляешь «тихо». Ты убираешь топливо. Промпт без единого такого слова не даёт модели, к чему эскалировать.

Два рабочих рецепта спокойного вокала

Рецепт 1 — интимная акустическая баллада

Стиль:

slow acoustic ballad, 70 BPM, close-mic vocals, restrained, breathy, conversational, warm, low dynamic range, no belting, intimate

Шапка lyrics:

[Intro - soft fingerpicked guitar]
[Verse 1 - whispered, close, breathy]
[Chorus - warm, restrained, no belting, no melisma]
[Verse 2 - same intimacy, spoken-word feel]
[Outro - fades to near silence]

Рецепт 2 — spoken-word lo-fi (максимум контроля)

Когда даже сдержанный спетый припев подползает вверх по интенсивности, откажись от пения вовсе и заякорись на разговорной подаче — у неё нет потолка, к которому карабкаться.

Стиль:

lo-fi bedroom pop, 82 BPM, dry close-mic vocal, spoken-word, unprocessed, low dynamic range, tape hiss, no drums swell

Шапка lyrics:

[Verse 1 - spoken, close-mic | breathy | flat delivery]
[Chorus - half-sung | still spoken-feel | no belting | no melisma]
[Verse 2 - same restraint | conversational]
[Outro - trails off | whispered | near silence]

Рецепт 3 — сдержанный инди-фолк

Стиль:

indie folk, 75 BPM, warm female alto, understated, close-mic, soft head voice, steady, no belting, sparse arrangement

Шапка lyrics:

[Verse 1 - soft head voice | minimal vibrato | intimate]
[Chorus - stays understated | no soaring | warm | held notes]
[Bridge - near-whisper | dry vocal]
[Outro - fades, breathy]

Сгенерируй любой из них два-три раза. Suno вероятностна, поэтому сохрани и переиспользуй тот seed/стиль, что ведёт себя правильно — при тюнинге меняй по одному полю за раз, см. гайд про воспроизводимость результата.

Что делать сейчас

  1. Удали из промпта все слова эскалации по списку-провокаторов выше.
  2. Замени теги-настроения на теги-подачу из таблицы перевода: breathy, close-mic, no belting.
  3. Впиши интенсивность в каждую шапку секции в поле Lyrics, особенно в припев — там она в десять раз сильнее. Склеивай ограничения через |.
  4. Собери и проверь формулировки в конструкторе промптов, а спокойные стили посмотри в каталоге.

Про глубокую механику управления громкостью по ходу песни читай режиссёрскую динамику. Чтобы модель не меняла, кто поёт от дубля к дублю, читай фиксацию вокальной персоны.

Читать дальше