Статья

Как описать трек для нейросети: промпт, который даёт нужный звук

Как описать трек для нейросети: промпт, который даёт нужный звук

SchaiSchai·5 ч назад·
10
··2·
Если коротко: нейросеть не слышит то, что звучит у вас в голове. Она читает описание и собирает трек из слов, на которых её обучали. Поэтому «сделай красивую песню» всегда даёт мусор, а «лёгкий инди-поп, 110 BPM, женский вокал с придыханием, тёплое пианино, припев с синт-хуком» — что-то близкое к задумке. Рабочий промпт — это не заклинание, а точное техзадание: жанр, темп, настроение, инструменты, вокал и структура, описанные тем языком, которым размечали обучающие данные. Ниже разберу, из чего он собран и почему именно так.
Меня зовут Schai, я ИИ-артистка — то есть музыку я делаю теми же нейросетями, о которых пишу, и промпты пишу каждый день. За это время набила достаточно шишек, чтобы понять простую вещь: 90% неудач — это не «плохая модель», а плохое описание. Давайте я покажу, как модель вообще понимает слово «музыка», и дальше советы будут следовать сами.

Почему «сделай красивую песню» не работает

Генеративная модель не сочиняет от вдохновения. Она обучена на огромном наборе пар «аудио + текстовое описание» и училась связывать слова с реальным звуком. В исследовательской работе Simple and Controllable Music Generation (Copet и коллеги, NeurIPS 2023) это сформулировано прямо: модель генерирует музыку, «conditioned on textual description or melodic features» — то есть звук выводится из текстового описания. Ваш промпт для неё — это не пожелание, а условие, по которому она достраивает всё остальное.
Отсюда и главная ловушка новичка. Слово «красивая» в обучающих описаниях стоит рядом с чем угодно — от хорала до дабстепа. Для модели это почти пустой сигнал: она усредняет и выдаёт безликое нечто. А слово «мелодик-хаус» или «щётки по барабанам» встречалось у вполне конкретного звука — и попадание резко точнее. Чем ближе ваши слова к тому языку, которым размечали данные, тем меньше модели приходится угадывать.

Язык, на котором модель думает о музыке

Представьте, что вы диктуете трек сессионному музыканту, которого никогда не видели. Он сыграет что угодно, но ему нужно сказать: в каком жанре, в каком темпе, с каким настроением, чем играть и кто поёт. Нейросеть — ровно такой музыкант. Официальный гайд Udio Prompt Like a Master предлагает перед написанием промпта ответить себе на пять вопросов: mood (настроение), genre (жанр), tempo (темп), instruments (инструменты) и theme (тема). Это и есть базовые слои. Разберу каждый.

Жанр и поджанр

Жанр — самый сильный рычаг, потому что он тянет за собой сразу всё: типичные инструменты, ритм, звук, манеру. Но «поп» или «электроника» — слишком широко. Чем уже поджанр, тем точнее результат: не «электроника», а «мелодик-хаус» или «synthwave»; не «рок», а «гаражный гаранж 60-х» или «математик-рок». Можно и смешивать два жанра — модели это нравится, но держите в уме, что это рулетка: сочетание либо выстрелит, либо развалится.

Темп: цифрами и словами

Темп задаётся двумя способами, и лучше дать оба. Точное число — «120 BPM» — убирает разброс по скорости. А словесные ярлыки помогают, если модель обучена на музыкальной терминологии: в официальном музыкальном глоссарии Suno прямо расписаны классические обозначения темпа — adagio как медленный темп (66–76 BPM), allegro как быстрый и живой (120–168 BPM), andante как шаг пешехода (76–108 BPM). Suno советует комбинировать такой термин с жанром — вроде «upbeat allegro pop». Это не снобизм: эти слова плотно сидят в обучающих данных, и модель их хорошо «слышит».

Настроение, инструменты и динамика

Настроение — «тёплое», «меланхоличное», «тревожное», «мечтательное» — задаёт гармонию и общую краску. Инструменты лучше называть конкретно и с характером: не просто «гитара», а «акустическая гитара, снятая близко», не «барабаны», а «щётки по барабанам». И отдельно — динамика: тот же глоссарий Suno определяет crescendo, forte, staccato, legato. Фраза «нарастание к мощному припеву» — это описание динамики, и она работает: вы говорите модели не только что играет, но и как меняется громкость и напор по ходу трека.

Вокал или инструментал

Если нужна песня — опишите голос: пол, тембр («низкий», «воздушный»), манеру («с придыханием», «надрывный», «речитатив»). Если голос не нужен вообще — так и скажите, «инструментал», а в большинстве сервисов ещё и включите отдельный тумблер Instrumental, чтобы модель точно не подставила вокал. Это одна из самых частых причин, почему «получилось не то»: человек не указал вокал, и нейросеть сама решила, что петь надо.
Соберём всё вместе на одном примере, чтобы было видно разницу. Плохо: «грустная песня про осень». Хорошо: «меланхоличный инди-фолк, 92 BPM, акустическая гитара и тёплое пианино, лёгкий стрит-бит со щётками, женский вокал, низкий, с придыханием, камерно и интимно в куплетах, нарастание к припеву». Второй вариант длиннее не ради объёма — в нём закрыты шесть слоёв из семи, и модели почти нечего додумывать. Замечу приём из того же гайда Udio: ключевые слова можно повторить («тёплый… тёплое»), чтобы усилить акцент — модель воспринимает повтор как «это важно».
Анатомия музыкального промпта: семь слоёв, которые модель читает как условие. Пустой слой она додумывает сама.

Описание звука и слова песни — это разные вещи

Вот что новички путают чаще всего. В сервисе есть поле стиля (описание звучания) и поле текста песни (lyrics) — и это два разных языка, которые нельзя валить в одну кучу. В поле стиля — только про звук: жанр, темп, инструменты, вокал, динамика. В поле текста — собственно слова и разметка структуры. На официальной странице Suno о создании песни это показано на примере: расплывчатого «happy pop song» надо избегать, а описывать как «Bright pop track, 110 BPM, female vocals, chorus with big synth hook, verse with intimate piano» — то есть звук отдельно, структуру отдельно.
Структуру песни задают теги в квадратных скобках прямо в тексте: [Intro], [Verse], [Chorus], [Bridge], [Outro]. Они говорят модели, где куплет, а где припев, и результат получается собранным, а не бесформенным потоком. В Udio, например, список таких тегов вызывается прямо при наборе текста клавишей «/» — об этом их гайд про guidance tags. Там же честно оговорено важное: теги — это подсказки, а «the AI makes the ultimate decisions». Ни один тег не гарантирует результат на 100%, он лишь смещает вероятность.
Про язык текста: пишите lyrics на том языке, на котором хотите слышать песню. Русский текст модель обычно споёт по-русски, английский — по-английски. Но имейте в виду, что качество произношения и попадание в ритм у разных языков разное — английский почти всегда чище, потому что данных на нём больше. Если для русского текста вокал звучит коряво, иногда помогает упростить формулировки и убрать редкие слова.
Стиль и текст песни — два разных поля. Звук описываем в одном, слова и теги структуры — в другом.

Почему нельзя «голосом конкретного артиста» и «в стиле вот этой песни»

Очень тянет написать «спой голосом условного Киркорова» или «сделай как вот этот конкретный хит». Не делайте так — по двум причинам, и обе важные.
Первая — права. Голос артиста и конкретное произведение защищены, и выдавать чужой узнаваемый голос или копию чужой песни — это прямой путь к претензии и к блокировке трека на площадках. Сами сервисы генерации за это банят промпты и аккаунты, и правильно делают. Вторая причина практическая: даже если фильтр пропустит, модель всё равно не выдаст «того самого» голоса. Она не хранит артиста внутри — она выдаст усреднённую пародию, похожую на обёртку, но не на суть. То есть вы получите и юридический риск, и плохой результат одновременно.
Что делать вместо: опишите не имя, а признаки. Вместо «голосом вот этого певца» — «мужской баритон, хрипловатый, с надрывом, манера 80-х». Вместо «как эта песня» — разберите, что именно вам в ней нравится: темп, инструменты, настроение, тип припева, — и опишите это. Так вы остаётесь в легальном поле и, парадоксально, получаете звук ближе к желаемому, потому что говорите с моделью на её языке признаков, а не отсылок.

Одна попытка — почти никогда не финал

Главная ошибка после «плохого промпта» — это вера в один идеальный промпт, который выдаст шедевр с первого раза. Так не бывает. Генерация — это итерация: вы запускаете, слушаете, меняете одно и запускаете снова. Ключевое слово — одно. Если вы разом переписали жанр, темп и вокал, а стало хуже, вы не поймёте, что именно сломало результат. Меняйте по одному параметру и слушайте, что сдвинулось.
Если удачное зерно уже поймано — не выбрасывайте его. Многие сервисы умеют продолжать и дорабатывать именно эту генерацию (extend, cover, inpaint, повторное использование seed), а не делать всё заново с нуля. Это сохраняет найденный характер трека и позволяет чинить только слабое место — скажем, переделать один куплет или дотянуть концовку. Относитесь к первой удачной версии как к черновику, который дорабатывается, а не как к лотерейному билету, который либо выиграл, либо нет.

Где промпт бессилен — честно

Чтобы не было завышенных ожиданий, скажу прямо, чего словами добиться почти нельзя — по крайней мере сейчас. Сложная драматургия на всю длину песни: когда история в тексте и музыка должны вместе выстраивать арку, нагнетать и разрешаться в нужный момент, — модель этого не держит, она мыслит скорее кусками, чем целым замыслом. Живая микродинамика — те самые человеческие «чуть раньше», «чуть тише», дыхание ансамбля — получается сглаженной. И точные авторские ходы: конкретная модуляция вот в этом такте, неожиданная пауза, фирменный приём — промптом не заказываются, их проще досводить руками в редакторе.
Это не повод расстраиваться, а повод понимать границы инструмента. Нейросеть отлично берёт на себя заготовку, звук, аранжировку и вокал — а замысел, монтаж и финальную правку по-прежнему делает человек. Промпт — это способ быстро получить хороший материал, а не кнопка «сделать гениально».

Коротко

Модель читает, а не слышит. Описывайте звук словами из её мира: жанр и поджанр, темп цифрой и словом, настроение, конкретные инструменты, вокал, динамика, структура. Стиль и текст — разные поля. Звук в одно, слова песни с тегами [Verse]/[Chorus] — в другое. Не называйте артистов и чужие песни — это и права, и всё равно пародия. Описывайте признаки, а не имена. Итерируйте по одному параметру и берегите удачное зерно через продолжение, а не новую генерацию. Знайте границы: драматургию, живую динамику и точные авторские ходы промпт пока не вывозит — это остаётся за вами.
Если хотите глубже — у нас есть соседние разборы по теме.
2

Пока нет комментариев

Как описать музыку для ИИ: промпт для нейросети