·
Промпты для нейросетей: как писать, чтобы получалось с первого раза
Источник изображения: AI-генерация AIVFX (Seedream 5 Pro)

Промпты для нейросетей: как писать, чтобы получалось с первого раза

В поиске это слово чаще всего набирают как «промты» - без второй «п». Пишется правильно «промпты», но суть от написания не меняется: это текстовое задание нейросети. И почти всегда, когда генерация выходит не такой, как в голове, дело не в модели. Дело в том, что задание было размытым.

Ниже - рабочая схема: как собрать промпт для картинки, как переписать его под видео, что делать с негативом и как не сжечь весь лимит генераций за вечер.

Почему не получается с первого раза

Есть три типовые причины, и они повторяются у всех.

  • Модель не знает, что главное. Если в промпте двадцать равнозначных деталей, она выберет главное сама. Скорее всего, не то.
  • Внутри промпта конфликт. «Мягкий рассеянный свет» и «жёсткие контрастные тени» в одной строке - это спор, который модель разрешит случайным образом.
  • Правится всё разом. Не понравился кадр, вы меняете свет, ракурс и одежду одной пачкой. Стало хуже. Что именно сломало - неизвестно.
Промпт - это не заклинание и не список тегов. Это короткое техзадание, которое читает исполнитель без права переспросить.

Структура промпта для картинки

Порядок частей важен: почти все модели дают больше веса тому, что стоит в начале. Рабочая последовательность выглядит так.

  1. Субъект. Кто или что в кадре. Одним понятным существительным с парой уточнений.
  2. Действие или поза. Что он делает прямо сейчас. Одно действие, не три.
  3. Окружение. Где это происходит и в какое время суток.
  4. Свет. Один источник и его характер: мягкий из окна слева, жёсткий контровой, тёплый вольфрам.
  5. Оптика и композиция. Крупность плана, фокусное расстояние, глубина резкости.
  6. Стиль и настроение. Палитра, фактура, эмоция.
  7. Технические параметры. Формат кадра и прочие флаги - всегда в самом конце.

Свежие модели вроде Nano Banana Pro от Google понимают обычную человеческую речь и не нуждаются в наборе тегов вроде «8k, masterpiece, trending on artstation». Пишите полными предложениями, как бы вы объясняли задачу фотографу. Подробнее про особенности этой модели мы разбирали в гайде по Nano Banana Pro.

В Midjourney логика ближе к описанию сцены плюс параметры в конце строки: формат кадра, сила стилизации, исключения. Точный синтаксис флагов меняется от версии к версии, поэтому актуальный список лучше сверять в официальной документации, а не по чужим статьям годичной давности.

Пример 1: кадр с нуля

Close-up portrait of a middle-aged barista in a small city coffee shop, holding a warm ceramic cup with both hands, soft window light from the left, shallow depth of field, warm amber and charcoal palette, 50mm lens, subtle film grain, calm and slightly tired expression.

Почему работает: один герой, одно действие, один источник света, одна палитра, одна оптика. Настроение в конце, а не в начале. Нет ни одного взаимоисключающего требования. Модели буквально не остаётся места для самодеятельности.

Пример 2: правка готового кадра

Replace the plain grey background with a softly blurred workshop interior at dusk. Keep the person, their pose, clothing, facial features and the direction of light exactly as they are. Match the new background colour temperature to the existing warm key light.

Почему работает: здесь есть то, что чаще всего забывают, - фраза о сохранении. «Замени фон» разрешает модели переделать вообще всё. «Замени фон, оставь лицо, позу, одежду и направление света без изменений» сужает задачу до одной операции. При редактировании держитесь правила: одно изменение за один заход.

Рабочее место с несколькими вариантами одного кадра на экране
Один и тот же промпт с меняющейся по одному параметру строкой даёт понятную серию вариантов вместо случайного набора картинок · Источник: AI-генерация AIVFX (Seedream 5 Pro)

Промпт для видео пишется по другой логике

Главная ошибка новичка - взять удачный промпт для картинки и отдать его видеомодели. Не сработает, потому что видеомодель спрашивает не «что в кадре», а «что меняется».

Особенно это заметно в режиме image-to-video, когда вы отдаёте модели готовый кадр. Внешность, свет и композиция уже заданы картинкой. Если вы повторите их в тексте, вы создадите второй набор инструкций, который начнёт спорить с первым, и герой поплывёт. В image-to-video описывайте только движение: что делает субъект, что делает камера, что остаётся неподвижным.

У Kling есть своя рекомендуемая структура из пяти частей: субъект, движение субъекта, сцена, язык камеры, свет и атмосфера. Seedance от ByteDance описывает похожую шестишаговую формулу: субъект, действие, окружение, камера, стиль, ограничения, с ориентиром примерно на 60-100 слов. MiniMax H3 генерирует картинку и звук в одном проходе, поэтому в промпт добавляется ещё один слой - аудио: реплики в кавычках, звуки действий, окружающий шум и музыка. Разбор этой модели у нас в гайде по MiniMax H3, а сравнение самих моделей между собой - в обзоре нейросетей для видео.

Пример 3: оживление готового кадра

Slow push-in on the barista. She lifts the cup, takes one sip, then lowers it. Steam drifts upward. The background stays soft and static. Handheld micro-drift, no cuts.

Почему работает: одно движение камеры вместо четырёх, одно осмысленное действие героя с началом и концом, отдельно сказано, что должно остаться неподвижным. Ни слова про внешность и свет - это уже есть в исходной картинке.

Если модель умеет в звук, туда же добавляется аудиослой отдельной строкой: «quiet cafe ambience, one ceramic clink, no dialogue, no music». Называйте звуки явно, иначе микс будет случайным.

Что делать с негативом

Негативный промпт - это список того, чего в кадре быть не должно. У части сервисов под него отдельное поле, у части он задаётся флагом внутри строки. Работает он лучше всего на артефактах, а не на смысле.

  • Хорошо убирает: размытие, искажения, лишние пальцы и конечности, водяные знаки, случайный текст, дрожание.
  • Плохо убирает: то, чего вы и не просили. Писать «no cars», когда машин в промпте нет, бессмысленно - вы только подсвечиваете модели слово «cars».
  • Не место для стиля. Негатив не сделает картинку красивее, он лишь отсекает брак.

Базовый набор для видео обычно один и тот же: blur, distortion, warped fingers, extra limbs, text, watermark. Его можно один раз сохранить и вставлять во все генерации.

Правило одной переменной

Это самый недооценённый приём. Меняйте в промпте одну вещь за один заход. Свет. Или ракурс. Или палитру. Но не всё сразу.

Причина простая: генерация - процесс со случайной составляющей. Если вы поменяли три параметра и стало лучше, вы не знаете, какой из них помог, и повторить успех не сможете. Меняя по одному, вы за пять итераций получаете набор из пяти рабочих настроек, который дальше применяете к любому кадру.

Практический совет: держите промпт в текстовом файле, а не в поле ввода сервиса. Так видно историю правок и легко откатиться на удачную версию.

Как не сливать деньги на генерациях

Видеогенерация стоит в разы дороже картинки и считает дольше. Отсюда простой порядок работы.

  1. Сначала доводите статичный кадр в модели для изображений, пока он не устроит полностью: композиция, герой, свет, палитра.
  2. Только потом отдаёте этот кадр в видеомодель в режиме image-to-video.
  3. В видеопромпте описываете исключительно движение и камеру.
  4. Если движение не получилось, правите только его. Возвращаться к картинке уже не нужно.

Так дорогих попыток нужно меньше, а результат стабильнее: видеомодели не приходится придумывать внешность героя заново на каждом запуске. Весь пайплайн разобран в статье как сделать AI-видео, а бесплатные лимиты есть, например, в Kling.

Типичные ошибки

  • Список тегов вместо описания. Современные модели читают связный текст лучше, чем гирлянду из запятых.
  • Мусорные усилители. «8k, ultra detailed, masterpiece, award winning» почти ничего не добавляют, но забирают внимание модели.
  • Два взаимоисключающих требования. Мягкий свет и жёсткие тени, широкий план и крупный портрет, статичная камера и облёт.
  • Три движения камеры в одном коротком клипе. Наезд, облёт и панорама за пять секунд - гарантированная каша.
  • Описание внешности в image-to-video. Дублирует то, что уже есть в кадре, и вызывает дрейф лица.
  • Правка десяти вещей одной фразой. Особенно больно в редактировании изображений: невозможно понять, какая из правок всё сломала.
  • Отсутствие фразы о сохранении. Без «оставь лицо и позу без изменений» модель считает, что ей разрешили переделать всё.
  • Длина ради длины. Промпт на 300 слов обычно работает хуже плотных 60-100.

Короткий чек-лист

  1. Один герой, одно действие, один источник света.
  2. Главное - в начале, технические параметры - в конце.
  3. Для видео описываем изменения, а не картинку.
  4. Негатив только про артефакты.
  5. Одна правка за итерацию.
  6. Сначала кадр, потом движение.

Если хочется разобраться в этом системно, а не по обрывкам, у нас есть обучение AI-видео с разбором на своих задачах.

Частые вопросы

Как правильно - «промты» или «промпты»?

Грамотно - «промпты», от английского prompt. Написание «промты» закрепилось в поиске и в разговорной речи, ошибкой в переписке это никто не считает. На результат генерации написание не влияет никак.

На каком языке писать промпт - на русском или английском?

Крупные модели понимают русский, но обучались в основном на английских описаниях, поэтому английский обычно даёт более предсказуемый результат, особенно в терминах оптики и света. Практичный вариант: думать на русском, а финальный промпт переводить, сверяя профессиональные термины.

Какой длины должен быть промпт?

Для видео хороший ориентир - примерно 60-100 слов. Для картинки чуть свободнее, но принцип тот же: лучше плотный абзац без воды, чем простыня. Каждое лишнее требование размывает вес остальных.

Нужен ли негативный промпт всегда?

Нет. Он полезен там, где модель регулярно даёт один и тот же брак: искажённые пальцы, дрожание, водяные знаки. Если конкретной проблемы нет, длинный негатив не улучшит кадр, а иногда мешает.

Почему один и тот же промпт даёт разные результаты?

В генерации есть случайная составляющая, поэтому два запуска одного текста дают разные кадры. Именно поэтому важно менять по одному параметру: иначе разницу между «повезло» и «промпт стал лучше» не отличить.

Можно ли переносить промпт из одной нейросети в другую?

Смысловая часть переносится нормально: субъект, действие, свет, камера. А вот технические флаги и служебный синтаксис у каждого сервиса свои, их придётся переписывать. Промпт для картинки в видеомодель напрямую не переносится вообще - это разные задачи.

С чего начать, если генерация вообще не похожа на задуманное?

Сократите промпт до трёх строк: кто, что делает, какой свет. Получите приемлемую основу и уже потом добавляйте детали по одной. Чинить перегруженный промпт правками почти всегда дольше, чем собрать его заново с короткого ядра. Бесплатно потренироваться можно, например, в Seedance.

Нужна AI-система или видео для вашего бизнеса?

Опишите задачу — вернёмся с предложением и оценкой в течение дня.

Обсудить задачу