Несколько изображений на входе

Обновлено

Скачать Markdown

Когда на вход блока подано несколько изображений, модель должна понять, какую роль играет каждое: откуда взять человека, откуда одежду, откуда стиль. Само по себе это из изображений не следует — роли задаёт промпт. Что вообще принимают на вход разные модели, собрано в статье Что подавать на вход генерации.

Адресация по порядку

Изображения нумеруются в том порядке, в каком подключены к блоку. В промпте на них ссылаются по номеру:

Replace the subject in Image 1 with the subject from Image 2, keeping the
lighting and background of Image 1.

Порядок соединений и есть порядок референсов. Номера самих соединений в интерфейсе не подписаны — рядом со входом виден только счётчик подключённых изображений. Поэтому, если результат перепутал источники, надёжнее всего отключить входы и подключить их заново в нужной последовательности. Как устроены соединения, разобрано в статье Соединения между блоками.

Больше референсов не значит лучше

Ниже — рекомендации из руководств самих разработчиков моделей, а не пределы Строфи: сколько изображений примет конкретный блок, показывает счётчик рядом со входом. Почти везде рекомендуемое число заметно ниже технического максимума:

МодельПределы
Nano Banana Proдо 6 объектов, до 5 персонажей, до 3 стилевых референсов
Nano Banana 2до 10 объектов, до 4 персонажей
Nano Banana 2 Liteдо 14 объектов, консистентность персонажа не поддержана
Nano Bananaлучше всего с тремя изображениями
Seedreamдо 14 (Seedream 5.0 Pro — до 10)
Veo 3.1до 3
Grok Imagineдо 3 при редактировании
Seedance 2.0 Referenceдо 9 изображений и 3 роликов
Seedance 2.5 Referenceдо 30 изображений, 10 роликов и 10 звуковых отрывков

Руководство Seedance прямо предупреждает: если забить лимит до отказа, модель перестаёт понимать приоритеты. Для Seedance 2.0 там же назван рекомендованный набор — четыре-пять материалов: одно-два изображения персонажа, одна сцена, одно видео с нужным движением камеры, одна звуковая дорожка.

У Seedance 2.5 рекомендации даны не по числу файлов, а по числу героев: до восьми, если герой задан изображением, и до пяти, если голосом или роликом. Дальше доходит и до двенадцати, но стабильность падает и попытку приходится повторять. Ролики и звуковые отрывки, с которых снимается образец, лучше держать в пределах пяти-десяти секунд — на длинных модель сбивается.

Консистентность персонажа

Чтобы персонаж не менялся от кадра к кадру, дайте отдельный портрет крупным планом с нейтральным выражением и отдельный снимок в полный рост, а самый важный референс поставьте в промпте первым.

Разворотные листы персонажа — набор ракурсов на одном изображении — для Seedance 2.0 противопоказаны: модель принимает разные ракурсы за разных людей и может нарисовать в кадре двойника. Seedance 2.5 их принимает, но с оговоркой: до пяти героев одинаково работают и один ракурс, и несколько, а если героев больше — надёжнее по одному ракурсу на изображение, чем несколько ракурсов на одном. Остальное про описание движения и кадра — в статье Промпт для видео.

Привязку пишут в промпте, а не на изображении

Подписать имя героя прямо поверх его изображения и дальше ссылаться на это имя в тексте — приём, который не работает: модель путает героев и рисует лишних. Связь «кто есть кто» задаётся только текстом промпта, по номерам входов.

Когда героев несколько, перечислите соответствия по одному, списком:

Images 1-2 are Character 1 and correspond to Audio 1;
Images 3-4 are Character 2 and correspond to Audio 2.

И скажите, что именно берётся с каждого материала: «Refer to Image 1 for lighting and filters», «Refer to the action of casting the spell in Video 1». Если материал сам по себе точен, пересказывать его содержание словами не нужно — достаточно сослаться и добавить, что порядок должен совпасть с исходником.

Стиль отдельно от содержания

Если один референс задаёт содержание, а другой — манеру рисунка, скажите это прямо: «Apply the style of Image 2 to the scene in Image 1». Без такого указания модель смешает оба источника.