Промпт для видео

Обновлено

Скачать Markdown

В видео к описанию кадра добавляется развитие во времени: что происходит, в каком порядке и как при этом ведёт себя камера. Обычно достаточно порядка событий; точные секунды понимают не все модели — об этом ниже. Промпт, который хорошо работает для изображения, для видео обычно недостаточен — он описывает состояние, а не изменение.

Что добавить к описанию сцены

Движение субъекта. Не «человек идёт», а что именно и как: какой частью тела, с какой скоростью, с каким усилием. «Медленно поднимает руку», «резко поворачивает голову».

Поведение камеры. Стоит неподвижно, следует за героем, наезжает, отъезжает, облетает. Термины киноязыка модели понимают: medium shot, close-up, slow push-in, tracking shot, fixed shot.

Развитие во времени. Что в начале, что в середине, чем заканчивается.

Звук, если модель его генерирует: реплики, звуковые эффекты, фоновая среда.

Раскадровка вместо прозы

Сложную сцену лучше разложить на кадры, а не описывать сплошным текстом. Формат понимают и Seedance 2.0, и Kling 3.0:

Shot 1, wide shot of a truck driver at dawn, cinematic handheld.
Shot 2, macro shot of hands on the steering wheel.
Shot 3, close-up of a weathered photograph on the passenger seat.

Одно движение камеры на кадр. Наезд, отъезд и панорама одновременно ломают стабильность изображения.

Seedance 2.5 понимает и второй способ разметки — по времени. Годятся интервалы (0-3 seconds… 3-7 seconds…), отдельные моменты («быстрый переход влево на пятой секунде») и относительные указания («через три секунды после того, как он замер»). Шаг разметки — целая секунда, доли модель не различает.

Два правила при разметке по времени. Интервалы идут подряд, без пропусков: дыра вида «0–3 с… 5–6 с» сбивает модель. И на каждый интервал приходится столько событий, сколько в него реально помещается — пустой интервал модель заполнит отсебятиной, переполненный нарежет лишними склейками или выбросит часть задуманного. Для частых повторяющихся движений разметка по времени не годится вовсе: «мотает головой три раза в секунду» не отрабатывается.

Раскадровка на входе: лист или ключевые кадры

Раскадровку можно не описывать словами, а подать изображением. Seedance 2.5 Reference различает два способа, и строгость у них разная.

Лист с раскадровкой — несколько клеток на одном изображении. Модель читает его как общий план сюжета, а не как точный образец: композиция и детали кадров в результате будут своими. Годится до пятнадцати клеток, и лучше работает простой линейный набросок — без заливки, без подписей поверх изображения.

Ключевые кадры — каждый кадр отдельным изображением, поданным по порядку. Здесь совпадение с исходниками заметно строже. В промпте это открывается прямой фразой:

Use Images 1 to 7 in order as keyframes.

Если важно, чтобы кадр в результате действительно совпал с задуманным, выбирайте второй способ.

Держите сцену выполнимой

Всё, что вы описали, должно уместиться в выбранную длительность. Сюжет на минуту, втиснутый в пять секунд, превращается в мельтешение. Плавные непрерывные движения выходят лучше резких: спринт, прыжки и кувырки моделям даются плохо.

Точное количество предметов и людей модели не удерживают — «десять щенков» превратятся в неопределённое количество. Сложная физика тоже: отскок мяча, траектория броска.

Эмоция через физику

Абстракции вроде «грустная девушка» модель понимает слабо. Описывайте телом: опущенная голова, подрагивающие плечи, покрасневшие глаза, пальцы теребят край одежды.

Где модели расходятся

Точное время. Kling 3.0 понимает указания вида «на четвёртой секунде» и «в последние три секунды» — они есть в примерах официального руководства. Seedance 2.0 от жёстких секунд наоборот плывёт: там работают только номера кадров, а ритм лучше оставить модели. Seedance 2.5 это различие снял — руководство прямо противопоставляет версии и разрешает разметку по целым секундам.

Подробность движения. Seedance 2.0 просит разбирать действие по частям тела, с амплитудой и скоростью. Seedance 2.5 просит обратного: общее описание («несколько подходов с высоким подъёмом колена», «обе стороны сходятся в ближнем бою»), а подробно — только два-три запоминающихся движения. Расписывать там каждое одинаково дотошно вредно.

Плотность. Kling 3.0 рассчитан на длинные подробные режиссёрские описания. Kling 2.6 и 2.5 Turbo — наоборот, на простые слова и короткие конструкции. Это разные требования у одного бренда, и версия здесь важнее названия.

Люди в кадре. Модерация Seedance часто отклоняет референсы с людьми. Для видео с реальными людьми надёжнее Kling 3.0.

Речь

Реплики привязываются к персонажу. У Kling 3.0 — прямо в тексте:

Mom (softly, in a surprised tone): I didn't expect this at all.

У Veo 3.1 — с именем и ремаркой, реплика в кавычках. У Seedance 2.0 для реплик отведены фигурные скобки, а для субтитров — отдельные скобки, и язык реплики называется явно.

В примерах руководства Seedance 2.5 реплика написана иначе — простой строкой с именем говорящего: Dialogue (elderly woman): "Fly safe, my child.". При этом официальный навык ByteDance для 2.5 прежний набор скобок сохраняет, то есть работают оба способа. Скобки размечают тип содержимого — реплику, музыку, звуковой эффект, — а именованная строка удобнее, когда говорящих несколько.

Языки речи у моделей разные, и это единственное место, где ошибка не видна до конца генерации. Подробности — в статье На каком языке писать промпт.

Незаказанные субтитры и логотипы

Видеомодели дорисовывают то, чего не просили: субтитры под репликой, логотип чужой платформы, вотермарку. Полностью это не отключается, но вероятность снижают три вещи, и руководство Seedance перечисляет их вместе:

  • прямой запрет в промпте — no subtitles, do not generate a watermark, do not generate a logo. Это тот случай, когда отрицание работает лучше положительной формулировки;
  • чистые входные материалы: если на референсе есть текст и он не нужен, уберите его заранее отдельной генерацией;
  • горизонтальный кадр — в вертикальном субтитры появляются заметно чаще. Если формат позволяет, снимайте горизонтально и обрежьте потом.

У Seedance 2.5 запрет распространяется и на звук: no BGM, no audio, only environmental sounds and action sounds — документированные формулировки.

Продление и склейка

Продлевают и склеивают ролики сами модели, а не Строфи: у части видео-моделей есть вариант, который принимает готовый ролик и дописывает продолжение. При продлении качество накапливает искажения: после нескольких итераций лица идут пятнами. Стык кадров даёт заметный рывок.

Сколько роликов принимает вход, зависит от версии: Seedance 2.0 Reference — три клипа общей длительностью до пятнадцати секунд, и это же её предел на склейку. Seedance 2.5 Reference принимает до десяти клипов и до тридцати секунд суммарно; отдельного предела именно на склейку её руководство не называет.