9 мин·20 сентября 2026 г.·Герман Розовик

Один и тот же герой в двадцати клипах: как удержать лицо и одежду в серии

Краткий ответ

Серия из двадцати роликов держится на одном герое, и без референса лица нейросеть выдаёт двадцать разных людей: похожих по описанию, но чужих друг другу. «Нейросеть видео человека» ищут 4 519 раз в месяц, «нейросеть лицо человека видео» — ещё 3 200, и за большей частью этих запросов стоит одна беда: в третьем клипе у героя другое лицо, в пятом другая куртка. Лечится это не длинным промптом, а листом персонажа — набором картинок и описанием, которые у нас идут первым этапом в каждом пакете роликов. Ниже — как собрать его самому, куда загружать и где предел.

Один и тот же герой в двадцати клипах: как удержать лицо и одежду в серии
01

Почему нейросеть каждый раз рисует нового человека

01.1

Текстовый промпт — это описание, а не человек

«Мужчина сорока лет, борода, серое худи» подходит миллионам лиц, и при каждой генерации модель выбирает новое из этого множества. Одежда и свет ведут себя так же: «серое худи» в одном кадре с капюшоном, в другом с молнией, а «дневной свет» то из окна, то сверху.

01.2

В видео это усиливается

Даже если вы стартуете с картинки, лицо за несколько секунд «уплывает»: меняется форма глаз, линия волос, особенно на поворотах головы и когда руки у лица. Модель дорисовывает то, чего не видела, и дорисовывает по-своему.

01.3

Отсюда правило

Постоянство даёт не слово, а якорь — картинка, которую модель видит при каждой генерации. Всё остальное в этой статье — про то, как этот якорь сделать и не потерять.

02

Лист персонажа: что в нём и почему он первым

02.1

Лист персонажа — это папка и одна страница текста

В папке: канонический портрет анфас при ровном свете; три ракурса — три четверти слева, справа и профиль; фигура в полный рост в той одежде, в которой герой будет всю серию; крупные планы деталей — очки, татуировка, логотип на груди.

02.2

На странице — «паспорт»

Возраст, телосложение, причёска и цвет волос, цвет глаз, одежда с точными цветами, чего герой никогда не носит. Этот блок копируется в каждый промпт целиком, а не пересказывается по памяти.

02.3

Порядок важен

Сначала портрет, и только один: генерируем двадцать-тридцать вариантов, выбираем, дальше он неприкасаем. Ракурсы и фигуру получаем уже из него, по референсу, а не новым текстовым промптом. Только после этого — первый кадр видео.

У нас лист персонажа — первый этап в каждом пакете роликов, и он утверждается с клиентом до первой секунды видео. Поэтому персонаж и стиль собираются один раз на серию, а не пересобираются под каждый ролик.

Хотите попробовать по ходу чтения? Инструменты из статьи — в один клик.

03

Как собрать лист персонажа самому за вечер

03.1

Шаг первый — портрет

Один промпт, двадцать-тридцать генераций, выбор одного. Смотрите не на «красиво», а на приметы: их должно быть две-три, чтобы модели было за что держаться — форма носа, седина в бороде, шрам у брови. Гладкое лицо без примет теряется первым.

03.2

Шаг второй — ракурсы по референсу

Загружаете портрет как изображение-референс и просите «того же человека, та же одежда, вид три четверти». Так же — профиль, фигура, детали. Всё в одну папку.

03.3

Шаг третий — обученный персонаж

В Higgsfield есть Soul ID: загружаете полтора-два десятка фотографий одного лица — своих или сгенерированных на первых двух шагах — и сервис обучает персонажа, которого дальше можно вызывать в картинках и видео внутри того же кабинета без повторной загрузки референса. Если фотографий одного лица мало, сначала доберите их из портрета. В SYNTX под ту же задачу — модели с генерацией по референсу, инструкции к ним в базе знаний на русском.

03.4

Шаг четвёртый — паспорт текстом и проверка

Сгенерируйте три случайных кадра с героем и положите рядом с портретом. Узнаёте с первого взгляда — лист готов.

04

Одежда, свет и фон — второй слой

04.1

Лицо — половина дела

Серии чаще разваливаются на одежде: сегодня куртка тёмно-синяя, завтра чёрная, послезавтра с другим воротником. Решение — «униформа»: один комплект на всю серию или два, названных по именам («рабочий», «выходной»), и точные цвета в паспорте.

04.2

Свет описываем одинаково в каждом промпте

«мягкий дневной свет слева», «тёплая лампа сверху». Один и тот же «объектив» — например, 35 мм — держит пропорции лица. Фон задаём палитрой из двух-трёх цветов, а не перечислением предметов: предметы модель расставит по-своему, палитру удержит.

04.3

И главное для видео

Не «текст → видео», а «картинка → видео». Сначала генерируете стоп-кадр с героем в нужной сцене по референсу, проверяете лицо и одежду, и только потом анимируете этот кадр. Так модель стартует с правильного лица, а не придумывает его.

05

Как проверять серию и что делать с браком

05.1

После каждого клипа — три стоп-кадра

Начало, середина, конец. Кладёте рядом с каноническим портретом и сверяете разрез глаз, переносицу, линию волос, цвет одежды. Не «похоже в целом», а по пунктам: глаз замыливается уже к пятому ролику.

05.2

Правила, которые снижают брак

Короткие клипы держат лицо лучше длинных; резкие повороты головы и руки у лица — главные источники «другого человека»; если кадр уплыл, перегенерируйте с тем же референсом и тем же стартовым кадром, а не с новым промптом. Брак нормален: на один принятый клип уходит несколько попыток, и это закладывают во время заранее.

Так устроен и наш сериал с маскотами для Tap Beer: три персонажа, у каждого закреплённый облик, характер и голос, и серия работает потому, что персонажи собраны один раз, а дальше меняются только сцены. У маскотов для СИБУР тот же принцип: персонажа можно поставить в любую сцену и переписать реплику без пересборки.

06

Где предел самостоятельного пути и когда звать студию

06.1

Самому реально

Один вымышленный герой или маскот, одна одежда, короткие клипы, минимум взаимодействий с предметами. Это закрывает серию «эксперт говорит в камеру» или «персонаж показывает продукт».

06.2

Сложнее, когда герой — реальный человек

Нужны права на образ, а сходство с конкретным лицом — задача нейроаватара с записью лица и голоса, а не генерации по описанию; чем аватар отличается, мы писали в статье «Что такое нейроаватар». Трудно держатся два героя в одном кадре, текст на одежде и упаковке, продукт с точной этикеткой. Какую модель брать под какую задачу — в статье «Какую нейросеть выбрать для видео».

У нас это 20 роликов за 120 000 ₽ и 10 дней: лист персонажа — первый этап, раскадровка согласуется до генерации, брак остаётся на нашей стороне. В проекте от 600 000 ₽ персонажа рисует иллюстратор под бренд, с исследованием аудитории, и он становится частью фирменного стиля, а не только серии.

Частые вопросы

Что спрашивают до заказа — с ответами, которые мы даём на брифе.

Как сделать, чтобы нейросеть рисовала одного и того же человека?

Собрать лист персонажа: один канонический портрет, три ракурса, фигура в полный рост и текстовый паспорт с точными цветами одежды. Дальше генерировать только по референсу, а видео делать из картинки, а не из текста.

Можно ли использовать лицо реального человека в видео нейросетью?

Только своё или по письменному согласию. Для реального человека надёжнее нейроаватар: запись лица и голоса один раз, дальше новые видео из текста. Генерация «похожего» человека по описанию сходства не даст.

Какая нейросеть держит лицо в видео лучше?

Та, которой можно дать референс персонажа, а не только текст: в Higgsfield это обученный персонаж Soul ID, в агрегаторах — модели с генерацией по референсу. Сравнивать нужно на своём герое: три кадра рядом с портретом.

Сколько попыток нужно на один клип серии?

Несколько на каждый принятый: брак на лицах и одежде — нормальная часть процесса. Снижают его короткие клипы, старт с проверенного стоп-кадра, отказ от резких поворотов головы и рук у лица.

Где это сделать самому

Инструменты, в которых собирается то, о чём статья: что делает хорошо, чего от него не ждать — и кнопка, чтобы попробовать на своей задаче.

100+ нейросетей в Telegram и на сайте по одной подписке

SYNTX

Тексты, картинки, видео и музыка в одном Telegram-боте и веб-приложении: ChatGPT, Gemini, Kling, Veo, Sora, Suno и ещё сотня моделей по одной подписке. База знаний с инструкциями на русском.

  • Одна подписка вместо десятка сервисов — тексты, картинки, видео, музыка
  • Работает прямо в Telegram, ничего устанавливать не нужно
  • Библиотека трендов: повторить популярный эффект в несколько кликов
  • База знаний на русском — инструкции по каждой модели

Это подписка, а не оплата за использование: если генераций мало, посчитайте, окупится ли месяц.

Попробовать SYNTX
Кино-ролики из картинки и текста

Higgsfield

Картинки, видео и голос из текста или по референсу; движения камеры и стили для роликов, апскейл, редактирование. Веб и мобильное приложение.

  • Движения камеры и кинематографичные пресеты для коротких роликов
  • Картинка → видео: продукт и композиция остаются вашими
  • Голос, апскейл и редактирование в том же кабинете, веб и мобильное приложение

Сильная сторона — кинематографичные короткие ролики; длинные сцены и точный текст в кадре — не его задача.

Попробовать Higgsfield

Похожая задача? План и расчёт за 24 часа

Расскажите, что нужно сделать. Подскажем, хватит ли пакета с фиксированной ценой или это проект от 600 000 ₽, и вернёмся с планом.