Как сделать песню нейросетью: от текста до готового трека
Запросы «нейросеть музыка» и «создать музыку нейросеть» набирают десятки тысяч показов в месяц, но большинство гайдов останавливается на «напишите промпт и слушайте». Показываем рабочий порядок для тех, кто делает музыку не для развлечения, а под конкретное видео: от выбора жанра до стемов и ручной доводки.

В статье
Я делаю треки нейросетью не для развлечения, а потому что клиентскому видео нужна музыка под конкретный тайминг, и держать композитора на каждый ролик не наймёшь. Ниже - рабочий порядок: что решить до генерации, как писать описание стиля, как подавать текст песни, сколько попыток обычно уходит и где заканчивается нейросеть и начинается ручная работа. Без восторгов от первой удачной генерации - только то, что реально экономит время.
Что решить до генерации
Частая ошибка - открыть генератор и сразу писать в поле описания что-то вроде «крутая песня для видео». Модель отработает запрос буквально, и результат будет ни о чём конкретном. Прежде чем писать промпт, стоит зафиксировать четыре вещи.
- Жанр. Не «музыка», а конкретно: синти-поп, лоу-фай хип-хоп, акустика, оркестровый эпик. Чем точнее жанр, тем меньше нейросеть угадывает за вас.
- Темп. Даже приблизительно - медленный, средний, быстрый - уже сильно сужает результат. Для видео с монтажной нарезкой это едва ли не важнее жанра.
- Настроение. Одно-два слова: тревожное, тёплое, торжественное, ностальгическое. Настроение определяет аранжировку сильнее, чем список инструментов.
- Язык. Русский, английский или без слов вообще. Модель поддерживает русский язык и умеет петь на нём, но если это не указать явно, генератор может выбрать язык сам.
Эти четыре решения стоит принять до того, как открывать генератор, а не по ходу дела - иначе вы будете переписывать промпт по кругу, тратя кредиты на угадывание, а не на результат.
Как писать описание стиля
Описание стиля - это не творческое сочинение, а список конкретных характеристик через запятую: жанр, темп, настроение, ключевые инструменты, при необходимости референс по звучанию. Например: синти-поп, средний темп, тёплое ностальгическое настроение, аналоговые синтезаторы, живые барабаны, женский вокал. Чем конкретнее формулировка, тем предсказуемее результат - расплывчатые прилагательные без существительных модель интерпретирует по-своему.
Отдельно стоит указывать то, чего не должно быть: без агрессивных электронных элементов, без хора, без резких переходов. Отрицательные указания работают хуже положительных, но иногда это единственный способ отсечь то, что модель выдаёт по умолчанию для жанра.
Как подавать текст песни и размечать куплет и припев
Если нужен трек с осмысленным текстом, а не инструментал, текст лучше готовить заранее и подавать целиком, а не надеяться, что генератор сочинит что-то подходящее сам. Разметка структуры - куплет, припев, бридж - помогает модели держать форму и не сваливаться в одну бесконечную часть без выраженного рефрена.
Практика простая: перед каждым блоком текста ставится обозначение - куплет 1, припев, куплет 2, припев, бридж, финальный припев. Строки внутри блока пишутся с явным разбиением, чтобы было понятно, где кончается одна фраза и начинается следующая. Если нужен именно рефрен, который повторяется несколько раз с одинаковым текстом, припев стоит буквально продублировать в каждом месте, где он должен звучать - иначе модель может сочинить новый вариант вместо повтора старого.
Сколько попыток обычно нужно
На практике редко получается забрать первую генерацию как готовый результат. Одна генерация выдаёт сразу две версии трека и стоит примерно 5 кредитов, поэтому пробовать разные формулировки описания стиля не так дорого, как кажется: 50 кредитов бесплатного тарифа - это около 10 попыток в день, а на Pro с 2 500 кредитами в месяц счёт идёт на сотни.
Рабочий порядок - зафиксировать текст песни и не трогать его, а варьировать между попытками только описание стиля. Так проще понять, что именно меняет звучание: не текст и не структура, а формулировка стиля. Обычно подходящий вариант находится за три-пять генераций, если жанр и настроение определены заранее, и за существенно большее число попыток, если формулировка стиля расплывчатая.
Стемы - и что с ними делать
Когда трек устраивает по форме, но не устраивает по балансу - вокал слишком громкий, барабаны слишком тихие под конкретную сцену - выручают стемы. На платных тарифах доступен экспорт до 12 отдельных дорожек в WAV: вокал, барабаны, бас и так далее отдельно. Это открывает доработку, недоступную при работе с одним сведённым файлом.
Для видео стемы особенно полезны там, где музыка должна уступать место закадровому голосу или синхронной речи: вокальную дорожку можно приглушить или убрать вовсе, оставив только инструментальную подложку, без повторной генерации всего трека. Дальше это уже обычная работа в монтажной программе - подвинуть громкость, поставить автоматизацию под конкретные сцены.
Ремиксы, каверы и загрузка своего аудио
Не всегда трек нужно создавать с нуля. Suno принимает загрузку своего аудио - до 8 минут на бесплатном тарифе и до 30 минут на Premier - и умеет делать из него ремиксы и каверы. Для клиентской работы это полезно, когда у заказчика уже есть черновая гитарная партия или диктофонная запись мелодии: не нужно пересказывать идею текстом, можно загрузить исходник и попросить модель переработать его в нужном стиле.
Разметка на куплет и припев работает и здесь: если загруженный материал уже имеет форму песни, стоит явно указать, где в исходнике куплет, а где припев, чтобы модель не перепутала порядок при обработке. Для инструментальных треков без текста эта разметка, конечно, не нужна.
Voices, Custom Models и My Taste - когда они пригодятся
9 сентября 2026 Suno сменила модель на v6, обученную заново на лицензированной музыке. Платным тарифам достались флагманская v6 и более непредсказуемая v6-wild, бесплатному - быстрая v6-mini. Вместе с прошлым обновлением в сервисе остались три функции, которые меняют рабочий процесс при регулярной работе: Voices позволяет использовать собственный голос после проверки - удобно, если для серии роликов нужен один и тот же узнаваемый вокал, а не новый голос в каждой генерации. Custom Models дают возможность настроить модель под свой стиль звучания. My Taste подстраивает генерацию под вкус конкретного пользователя, если вы работаете с сервисом регулярно и накопили историю удачных треков.
Для разовой задачи эти функции не критичны - обычного описания стиля и текста песни достаточно. Они начинают иметь смысл, когда музыка нужна не один раз, а как элемент фирменного звучания на серии видео: тогда Voices и Custom Models экономят время на подборе звучания заново для каждого нового ролика.
Где заканчивается нейросеть и начинается ручная работа
Нейросеть закрывает написание музыки и текста, аранжировку, вокал. Она не закрывает точную подгонку под тайминг видео - обрезка и растяжка всё равно делаются руками в монтажной программе, финальный баланс громкости с остальным звуком ролика, и решение о том, подходит ли настроение трека сцене - это решает человек, который видит готовый монтаж, а не только слышит трек в отрыве от картинки.
Практический совет из клиентской работы: генерировать трек стоит после того, как хотя бы черновой монтаж готов, а не до него. Тогда понятно, какая длина нужна, где должен быть акцент и должен ли припев совпадать с конкретным кадром. Музыка под готовую нарезку почти всегда звучит увереннее, чем нарезка под музыку, сделанную заранее.
Если нужны права на использование
Если трек делается для клиентского проекта, а не для себя, генерировать его стоит сразу на платном тарифе - у бесплатного плана нет коммерческих прав вообще, и апгрейд после генерации их не даёт задним числом на уже сделанные треки. Рублями подписку можно оформить через агрегатор SYNTX: проверьте наличие нужной модели в каталоге до оплаты, состав каталога время от времени меняется. Подробный разбор тарифов, скачиваний и работы с правами - в статье про скачивание Suno.
Частые вопросы
С чего начать, если раньше не делал музыку нейросетью?
С четырёх решений до генерации: жанр, темп, настроение, язык. Дальше - конкретное описание стиля через запятую, без общих фраз вроде «крутая музыка». Если нужен текст песни, готовить его заранее и подавать целиком, с разметкой на куплет и припев.
Сколько попыток нужно, чтобы получить готовый трек?
На практике - от трёх до пяти генераций при заранее определённом жанре и настроении, и заметно больше, если формулировка стиля расплывчатая. Одна генерация выдаёт две версии и стоит около 5 кредитов, так что перебор вариантов обходится недорого.
Как правильно разметить текст на куплет и припев?
Перед каждым блоком текста ставится обозначение - куплет 1, припев, куплет 2 и так далее. Если припев должен звучать несколько раз с одинаковым текстом, его нужно продублировать в каждом месте повтора, иначе модель может сочинить новый вариант вместо повтора старого.
Что делать, если вокал перекрывает закадровый голос в видео?
Экспортировать стемы - до 12 отдельных дорожек WAV на платных тарифах - и приглушить или убрать вокальную дорожку, оставив инструментал. Это быстрее, чем перегенерировать весь трек заново.
Можно ли получить полностью готовый трек без ручной доводки?
Форму и звучание нейросеть закрывает полностью. Точную подгонку под тайминг видео, баланс с остальным звуком ролика и решение, подходит ли настроение конкретной сцене, всё равно берёт на себя человек в монтажной программе.
Нужен ли платный тариф для коммерческого использования?
Да. Коммерческих прав на бесплатном тарифе нет вообще, и апгрейд после генерации не даёт их задним числом на уже сделанные треки. Если трек для клиентского проекта, генерировать его нужно сразу на платном тарифе.
Умеет ли нейросеть писать песни на русском языке?
Да, модель поддерживает русский язык и умеет петь на нём. Это стоит явно указать в описании при генерации, иначе язык может выбраться не тот, что нужен.
Нужен ролик или AI-система под задачу?
Текст: Артем Шуткин, студия AIVFX