Несколько изображений на входе
Обновлено
Когда на вход блока подано несколько изображений, модель должна понять, какую роль играет каждое: откуда взять человека, откуда одежду, откуда стиль. Само по себе это из изображений не следует — роли задаёт промпт. Что вообще принимают на вход разные модели, собрано в статье Что подавать на вход генерации.
Адресация по порядку
Изображения нумеруются в том порядке, в каком подключены к блоку. В промпте на них ссылаются по номеру:
Replace the subject in Image 1 with the subject from Image 2, keeping the
lighting and background of Image 1.
Порядок соединений и есть порядок референсов. Номера самих соединений в интерфейсе не подписаны — рядом со входом виден только счётчик подключённых изображений. Поэтому, если результат перепутал источники, надёжнее всего отключить входы и подключить их заново в нужной последовательности. Как устроены соединения, разобрано в статье Соединения между блоками.
Больше референсов не значит лучше
Ниже — рекомендации из руководств самих разработчиков моделей, а не пределы Строфи: сколько изображений примет конкретный блок, показывает счётчик рядом со входом. Почти везде рекомендуемое число заметно ниже технического максимума:
| Модель | Пределы |
|---|---|
| Nano Banana Pro | до 6 объектов, до 5 персонажей, до 3 стилевых референсов |
| Nano Banana 2 | до 10 объектов, до 4 персонажей |
| Nano Banana 2 Lite | до 14 объектов, консистентность персонажа не поддержана |
| Nano Banana | лучше всего с тремя изображениями |
| Seedream | до 14 (Seedream 5.0 Pro — до 10) |
| Veo 3.1 | до 3 |
| Grok Imagine | до 3 при редактировании |
| Seedance 2.0 Reference | до 9 изображений и 3 роликов |
| Seedance 2.5 Reference | до 30 изображений, 10 роликов и 10 звуковых отрывков |
Руководство Seedance прямо предупреждает: если забить лимит до отказа, модель перестаёт понимать приоритеты. Для Seedance 2.0 там же назван рекомендованный набор — четыре-пять материалов: одно-два изображения персонажа, одна сцена, одно видео с нужным движением камеры, одна звуковая дорожка.
У Seedance 2.5 рекомендации даны не по числу файлов, а по числу героев: до восьми, если герой задан изображением, и до пяти, если голосом или роликом. Дальше доходит и до двенадцати, но стабильность падает и попытку приходится повторять. Ролики и звуковые отрывки, с которых снимается образец, лучше держать в пределах пяти-десяти секунд — на длинных модель сбивается.
Консистентность персонажа
Чтобы персонаж не менялся от кадра к кадру, дайте отдельный портрет крупным планом с нейтральным выражением и отдельный снимок в полный рост, а самый важный референс поставьте в промпте первым.
Разворотные листы персонажа — набор ракурсов на одном изображении — для Seedance 2.0 противопоказаны: модель принимает разные ракурсы за разных людей и может нарисовать в кадре двойника. Seedance 2.5 их принимает, но с оговоркой: до пяти героев одинаково работают и один ракурс, и несколько, а если героев больше — надёжнее по одному ракурсу на изображение, чем несколько ракурсов на одном. Остальное про описание движения и кадра — в статье Промпт для видео.
Привязку пишут в промпте, а не на изображении
Подписать имя героя прямо поверх его изображения и дальше ссылаться на это имя в тексте — приём, который не работает: модель путает героев и рисует лишних. Связь «кто есть кто» задаётся только текстом промпта, по номерам входов.
Когда героев несколько, перечислите соответствия по одному, списком:
Images 1-2 are Character 1 and correspond to Audio 1;
Images 3-4 are Character 2 and correspond to Audio 2.
И скажите, что именно берётся с каждого материала: «Refer to Image 1 for lighting and filters», «Refer to the action of casting the spell in Video 1». Если материал сам по себе точен, пересказывать его содержание словами не нужно — достаточно сослаться и добавить, что порядок должен совпасть с исходником.
Стиль отдельно от содержания
Если один референс задаёт содержание, а другой — манеру рисунка, скажите это прямо: «Apply the style of Image 2 to the scene in Image 1». Без такого указания модель смешает оба источника.