Промпт для видео
Обновлено
В видео к описанию кадра добавляется развитие во времени: что происходит, в каком порядке и как при этом ведёт себя камера. Обычно достаточно порядка событий; точные секунды понимают не все модели — об этом ниже. Промпт, который хорошо работает для изображения, для видео обычно недостаточен — он описывает состояние, а не изменение.
Что добавить к описанию сцены
Движение субъекта. Не «человек идёт», а что именно и как: какой частью тела, с какой скоростью, с каким усилием. «Медленно поднимает руку», «резко поворачивает голову».
Поведение камеры. Стоит неподвижно, следует за героем, наезжает, отъезжает, облетает. Термины киноязыка модели понимают: medium shot, close-up, slow push-in, tracking shot, fixed shot.
Развитие во времени. Что в начале, что в середине, чем заканчивается.
Звук, если модель его генерирует: реплики, звуковые эффекты, фоновая среда.
Раскадровка вместо прозы
Сложную сцену лучше разложить на кадры, а не описывать сплошным текстом. Формат понимают и Seedance 2.0, и Kling 3.0:
Shot 1, wide shot of a truck driver at dawn, cinematic handheld.
Shot 2, macro shot of hands on the steering wheel.
Shot 3, close-up of a weathered photograph on the passenger seat.
Одно движение камеры на кадр. Наезд, отъезд и панорама одновременно ломают стабильность изображения.
Seedance 2.5 понимает и второй способ разметки — по времени. Годятся интервалы (0-3 seconds… 3-7 seconds…), отдельные моменты («быстрый переход влево на пятой секунде») и относительные указания («через три секунды после того, как он замер»). Шаг разметки — целая секунда, доли модель не различает.
Два правила при разметке по времени. Интервалы идут подряд, без пропусков: дыра вида «0–3 с… 5–6 с» сбивает модель. И на каждый интервал приходится столько событий, сколько в него реально помещается — пустой интервал модель заполнит отсебятиной, переполненный нарежет лишними склейками или выбросит часть задуманного. Для частых повторяющихся движений разметка по времени не годится вовсе: «мотает головой три раза в секунду» не отрабатывается.
Раскадровка на входе: лист или ключевые кадры
Раскадровку можно не описывать словами, а подать изображением. Seedance 2.5 Reference различает два способа, и строгость у них разная.
Лист с раскадровкой — несколько клеток на одном изображении. Модель читает его как общий план сюжета, а не как точный образец: композиция и детали кадров в результате будут своими. Годится до пятнадцати клеток, и лучше работает простой линейный набросок — без заливки, без подписей поверх изображения.
Ключевые кадры — каждый кадр отдельным изображением, поданным по порядку. Здесь совпадение с исходниками заметно строже. В промпте это открывается прямой фразой:
Use Images 1 to 7 in order as keyframes.
Если важно, чтобы кадр в результате действительно совпал с задуманным, выбирайте второй способ.
Держите сцену выполнимой
Всё, что вы описали, должно уместиться в выбранную длительность. Сюжет на минуту, втиснутый в пять секунд, превращается в мельтешение. Плавные непрерывные движения выходят лучше резких: спринт, прыжки и кувырки моделям даются плохо.
Точное количество предметов и людей модели не удерживают — «десять щенков» превратятся в неопределённое количество. Сложная физика тоже: отскок мяча, траектория броска.
Эмоция через физику
Абстракции вроде «грустная девушка» модель понимает слабо. Описывайте телом: опущенная голова, подрагивающие плечи, покрасневшие глаза, пальцы теребят край одежды.
Где модели расходятся
Точное время. Kling 3.0 понимает указания вида «на четвёртой секунде» и «в последние три секунды» — они есть в примерах официального руководства. Seedance 2.0 от жёстких секунд наоборот плывёт: там работают только номера кадров, а ритм лучше оставить модели. Seedance 2.5 это различие снял — руководство прямо противопоставляет версии и разрешает разметку по целым секундам.
Подробность движения. Seedance 2.0 просит разбирать действие по частям тела, с амплитудой и скоростью. Seedance 2.5 просит обратного: общее описание («несколько подходов с высоким подъёмом колена», «обе стороны сходятся в ближнем бою»), а подробно — только два-три запоминающихся движения. Расписывать там каждое одинаково дотошно вредно.
Плотность. Kling 3.0 рассчитан на длинные подробные режиссёрские описания. Kling 2.6 и 2.5 Turbo — наоборот, на простые слова и короткие конструкции. Это разные требования у одного бренда, и версия здесь важнее названия.
Люди в кадре. Модерация Seedance часто отклоняет референсы с людьми. Для видео с реальными людьми надёжнее Kling 3.0.
Речь
Реплики привязываются к персонажу. У Kling 3.0 — прямо в тексте:
Mom (softly, in a surprised tone): I didn't expect this at all.
У Veo 3.1 — с именем и ремаркой, реплика в кавычках. У Seedance 2.0 для реплик отведены фигурные скобки, а для субтитров — отдельные скобки, и язык реплики называется явно.
В примерах руководства Seedance 2.5 реплика написана иначе — простой строкой с именем говорящего: Dialogue (elderly woman): "Fly safe, my child.". При этом официальный навык ByteDance для 2.5 прежний набор скобок сохраняет, то есть работают оба способа. Скобки размечают тип содержимого — реплику, музыку, звуковой эффект, — а именованная строка удобнее, когда говорящих несколько.
Языки речи у моделей разные, и это единственное место, где ошибка не видна до конца генерации. Подробности — в статье На каком языке писать промпт.
Незаказанные субтитры и логотипы
Видеомодели дорисовывают то, чего не просили: субтитры под репликой, логотип чужой платформы, вотермарку. Полностью это не отключается, но вероятность снижают три вещи, и руководство Seedance перечисляет их вместе:
- прямой запрет в промпте —
no subtitles,do not generate a watermark,do not generate a logo. Это тот случай, когда отрицание работает лучше положительной формулировки; - чистые входные материалы: если на референсе есть текст и он не нужен, уберите его заранее отдельной генерацией;
- горизонтальный кадр — в вертикальном субтитры появляются заметно чаще. Если формат позволяет, снимайте горизонтально и обрежьте потом.
У Seedance 2.5 запрет распространяется и на звук: no BGM, no audio, only environmental sounds and action sounds — документированные формулировки.
Продление и склейка
Продлевают и склеивают ролики сами модели, а не Строфи: у части видео-моделей есть вариант, который принимает готовый ролик и дописывает продолжение. При продлении качество накапливает искажения: после нескольких итераций лица идут пятнами. Стык кадров даёт заметный рывок.
Сколько роликов принимает вход, зависит от версии: Seedance 2.0 Reference — три клипа общей длительностью до пятнадцати секунд, и это же её предел на склейку. Seedance 2.5 Reference принимает до десяти клипов и до тридцати секунд суммарно; отдельного предела именно на склейку её руководство не называет.