1. Не пишите, чего не хотите
«Без бороды», «никаких очков», «не менять фон» — модель считывает сам объект и тянется его нарисовать. Отрицание работает хуже прямого описания: вместо «без софтбокса в кадре» опишите свет, который хотите получить.
Промт — вещь переносимая: та же структура работает и в других моделях. А вот мелочи формулировок у каждой модели свои, и стоят они дорого — испорченным кадром. Ниже восемь правил, каждое из которых у нас появилось после конкретной поломки в продовых генерациях.
Дословных промптов мы не публикуем: в наших сценах промт уже настроен под сохранение лица и применяется автоматически, когда вы загружаете фото. Правила ниже — то, что действительно стоит знать, если пишете промт сами.
«Без бороды», «никаких очков», «не менять фон» — модель считывает сам объект и тянется его нарисовать. Отрицание работает хуже прямого описания: вместо «без софтбокса в кадре» опишите свет, который хотите получить.
Упоминание софтбокса, стойки или кольцевой лампы регулярно приводит к тому, что прибор оказывается в кадре. Описывайте результат — направление, мягкость и температуру света, — а не то, чем он поставлен.
Если задать в промте цвет, длину или причёску, модель перестаёт брать их с референса, и сходство рассыпается. То же с возрастом: он читается с лица. Оставляйте эти поля пустыми, когда важно узнавание.
Формулировки вроде natural skin texture дают высыпания, а «свежесть кожи» — россыпь родинок. Рабочая замена — smooth editorial skin с указанием плёнки и зерна: фактура появляется от носителя, а не от слова «текстура».
«Первый референс — женщина слева, второй — ребёнок впереди». Без явной привязки модель усредняет лица и выдаёт двух похожих незнакомцев вместо конкретных людей.
Сцены «я и я в детстве» собираются только вторым референсом с детской фотографией. Попытка получить ребёнка из взрослого селфи текстом заканчивается чужим лицом.
Фото «в телефоне», зеркальное селфи, кадр в рамке — модель дорисовывает статусбар и кнопки. Помогает прямое требование: в выдаче только само изображение, без интерфейса, рамок и водяных знаков.
Для этой модели описание на русском не хуже английского — переводить не нужно. Разница появляется на других семействах моделей, где английский заметно стабильнее.
По одной сцене из каждой подборки: как описан кадр и что берётся с вашей фотографии.

Кадр держится на трёх решениях: тёмная студия, ч/б проекция детского портрета во всю стену и одетая в чёрное фигура перед ней — героиня стоит в профиль перед собственным детским снимком.

Кадр держится на строгом строе: все лица в профиль смотрят влево и выстроены по убыванию возраста, слегка перекрывая друг друга.

Эффект строится на перекрытии: мужчина ближе к камере, женщина за его правым плечом, его голова закрывает половину её лица — в кадре остаются ровно две половинки.

Родственная схожесть подчёркивается геометрией: обе строго в профиль, дочка впереди и ниже, мама сзади и выше — линии лба, носа и подбородка идут параллельно.

Молодой мужчина в темно-сером пиджаке и черной футболке шагает по тротуару с кофе и портфелем.

Кадр держится на строгом строе: все лица в профиль смотрят влево и выстроены по убыванию возраста, слегка перекрывая друг друга.

Фэшн-минимализм: две фигуры в полный рост на белом бесшовном фоне, весь кадр держится на контрасте чёрного оверсайза и белой футболки.
Это текстовое описание кадра, по которому модель собирает изображение: свет, композиция, оптика, стиль обработки и то, что нужно сохранить с загруженной фотографии. Чем конкретнее описан свет и построение кадра, тем меньше модель импровизирует.
Структура — да: свет, кадр, стиль и требование сохранить лицо понимают все современные модели. Детали расходятся: где-то лучше работает английский, где-то иначе реагируют на длину описания. Универсального текста, одинаково хорошего везде, не существует.
Да, для этого их и собирали: у каждой сцены на странице есть кнопка запуска, промт уже настроен и применяется автоматически — нужно только загрузить фото. Копировать и вставлять текст никуда не нужно.
На отдельном инструменте: загружаете изображение — ИИ описывает его готовым промтом на русском и английском. Это обратная задача к генерации и удобна, когда нравится чужой кадр и хочется понять, из чего он собран.