Один и тот же герой в двадцати клипах: как удержать лицо и одежду в серии
Серия из двадцати роликов держится на одном герое, и без референса лица нейросеть выдаёт двадцать разных людей: похожих по описанию, но чужих друг другу. «Нейросеть видео человека» ищут 4 519 раз в месяц, «нейросеть лицо человека видео» — ещё 3 200, и за большей частью этих запросов стоит одна беда: в третьем клипе у героя другое лицо, в пятом другая куртка. Лечится это не длинным промптом, а листом персонажа — набором картинок и описанием, которые у нас идут первым этапом в каждом пакете роликов. Ниже — как собрать его самому, куда загружать и где предел.

Почему нейросеть каждый раз рисует нового человека
Текстовый промпт — это описание, а не человек
«Мужчина сорока лет, борода, серое худи» подходит миллионам лиц, и при каждой генерации модель выбирает новое из этого множества. Одежда и свет ведут себя так же: «серое худи» в одном кадре с капюшоном, в другом с молнией, а «дневной свет» то из окна, то сверху.
В видео это усиливается
Даже если вы стартуете с картинки, лицо за несколько секунд «уплывает»: меняется форма глаз, линия волос, особенно на поворотах головы и когда руки у лица. Модель дорисовывает то, чего не видела, и дорисовывает по-своему.
Отсюда правило
Постоянство даёт не слово, а якорь — картинка, которую модель видит при каждой генерации. Всё остальное в этой статье — про то, как этот якорь сделать и не потерять.
Лист персонажа: что в нём и почему он первым
Лист персонажа — это папка и одна страница текста
В папке: канонический портрет анфас при ровном свете; три ракурса — три четверти слева, справа и профиль; фигура в полный рост в той одежде, в которой герой будет всю серию; крупные планы деталей — очки, татуировка, логотип на груди.
На странице — «паспорт»
Возраст, телосложение, причёска и цвет волос, цвет глаз, одежда с точными цветами, чего герой никогда не носит. Этот блок копируется в каждый промпт целиком, а не пересказывается по памяти.
Порядок важен
Сначала портрет, и только один: генерируем двадцать-тридцать вариантов, выбираем, дальше он неприкасаем. Ракурсы и фигуру получаем уже из него, по референсу, а не новым текстовым промптом. Только после этого — первый кадр видео.
У нас лист персонажа — первый этап в каждом пакете роликов, и он утверждается с клиентом до первой секунды видео. Поэтому персонаж и стиль собираются один раз на серию, а не пересобираются под каждый ролик.
Хотите попробовать по ходу чтения? Инструменты из статьи — в один клик.
Как собрать лист персонажа самому за вечер
Шаг первый — портрет
Один промпт, двадцать-тридцать генераций, выбор одного. Смотрите не на «красиво», а на приметы: их должно быть две-три, чтобы модели было за что держаться — форма носа, седина в бороде, шрам у брови. Гладкое лицо без примет теряется первым.
Шаг второй — ракурсы по референсу
Загружаете портрет как изображение-референс и просите «того же человека, та же одежда, вид три четверти». Так же — профиль, фигура, детали. Всё в одну папку.
Шаг третий — обученный персонаж
В Higgsfield есть Soul ID: загружаете полтора-два десятка фотографий одного лица — своих или сгенерированных на первых двух шагах — и сервис обучает персонажа, которого дальше можно вызывать в картинках и видео внутри того же кабинета без повторной загрузки референса. Если фотографий одного лица мало, сначала доберите их из портрета. В SYNTX под ту же задачу — модели с генерацией по референсу, инструкции к ним в базе знаний на русском.
Шаг четвёртый — паспорт текстом и проверка
Сгенерируйте три случайных кадра с героем и положите рядом с портретом. Узнаёте с первого взгляда — лист готов.
Одежда, свет и фон — второй слой
Лицо — половина дела
Серии чаще разваливаются на одежде: сегодня куртка тёмно-синяя, завтра чёрная, послезавтра с другим воротником. Решение — «униформа»: один комплект на всю серию или два, названных по именам («рабочий», «выходной»), и точные цвета в паспорте.
Свет описываем одинаково в каждом промпте
«мягкий дневной свет слева», «тёплая лампа сверху». Один и тот же «объектив» — например, 35 мм — держит пропорции лица. Фон задаём палитрой из двух-трёх цветов, а не перечислением предметов: предметы модель расставит по-своему, палитру удержит.
И главное для видео
Не «текст → видео», а «картинка → видео». Сначала генерируете стоп-кадр с героем в нужной сцене по референсу, проверяете лицо и одежду, и только потом анимируете этот кадр. Так модель стартует с правильного лица, а не придумывает его.
Как проверять серию и что делать с браком
После каждого клипа — три стоп-кадра
Начало, середина, конец. Кладёте рядом с каноническим портретом и сверяете разрез глаз, переносицу, линию волос, цвет одежды. Не «похоже в целом», а по пунктам: глаз замыливается уже к пятому ролику.
Правила, которые снижают брак
Короткие клипы держат лицо лучше длинных; резкие повороты головы и руки у лица — главные источники «другого человека»; если кадр уплыл, перегенерируйте с тем же референсом и тем же стартовым кадром, а не с новым промптом. Брак нормален: на один принятый клип уходит несколько попыток, и это закладывают во время заранее.
Так устроен и наш сериал с маскотами для Tap Beer: три персонажа, у каждого закреплённый облик, характер и голос, и серия работает потому, что персонажи собраны один раз, а дальше меняются только сцены. У маскотов для СИБУР тот же принцип: персонажа можно поставить в любую сцену и переписать реплику без пересборки.
Где предел самостоятельного пути и когда звать студию
Самому реально
Один вымышленный герой или маскот, одна одежда, короткие клипы, минимум взаимодействий с предметами. Это закрывает серию «эксперт говорит в камеру» или «персонаж показывает продукт».
Сложнее, когда герой — реальный человек
Нужны права на образ, а сходство с конкретным лицом — задача нейроаватара с записью лица и голоса, а не генерации по описанию; чем аватар отличается, мы писали в статье «Что такое нейроаватар». Трудно держатся два героя в одном кадре, текст на одежде и упаковке, продукт с точной этикеткой. Какую модель брать под какую задачу — в статье «Какую нейросеть выбрать для видео».
У нас это 20 роликов за 120 000 ₽ и 10 дней: лист персонажа — первый этап, раскадровка согласуется до генерации, брак остаётся на нашей стороне. В проекте от 600 000 ₽ персонажа рисует иллюстратор под бренд, с исследованием аудитории, и он становится частью фирменного стиля, а не только серии.
Частые вопросы
Что спрашивают до заказа — с ответами, которые мы даём на брифе.
Как сделать, чтобы нейросеть рисовала одного и того же человека?
Собрать лист персонажа: один канонический портрет, три ракурса, фигура в полный рост и текстовый паспорт с точными цветами одежды. Дальше генерировать только по референсу, а видео делать из картинки, а не из текста.
Можно ли использовать лицо реального человека в видео нейросетью?
Только своё или по письменному согласию. Для реального человека надёжнее нейроаватар: запись лица и голоса один раз, дальше новые видео из текста. Генерация «похожего» человека по описанию сходства не даст.
Какая нейросеть держит лицо в видео лучше?
Та, которой можно дать референс персонажа, а не только текст: в Higgsfield это обученный персонаж Soul ID, в агрегаторах — модели с генерацией по референсу. Сравнивать нужно на своём герое: три кадра рядом с портретом.
Сколько попыток нужно на один клип серии?
Несколько на каждый принятый: брак на лицах и одежде — нормальная часть процесса. Снижают его короткие клипы, старт с проверенного стоп-кадра, отказ от резких поворотов головы и рук у лица.
Как это выглядит на практике




CLYOVO маскот
Tap Beer
Tap Beer New York & Miami · Paulaner





CLYOVO маскот
СИБУР
СИБУР · внутренний курс по ИИ





CLYOVO ролик
Snickers
Snickers · креативный концепт-ролик
Где это сделать самому
Инструменты, в которых собирается то, о чём статья: что делает хорошо, чего от него не ждать — и кнопка, чтобы попробовать на своей задаче.
SYNTX
Тексты, картинки, видео и музыка в одном Telegram-боте и веб-приложении: ChatGPT, Gemini, Kling, Veo, Sora, Suno и ещё сотня моделей по одной подписке. База знаний с инструкциями на русском.
- Одна подписка вместо десятка сервисов — тексты, картинки, видео, музыка
- Работает прямо в Telegram, ничего устанавливать не нужно
- Библиотека трендов: повторить популярный эффект в несколько кликов
- База знаний на русском — инструкции по каждой модели
Это подписка, а не оплата за использование: если генераций мало, посчитайте, окупится ли месяц.
Попробовать SYNTXHiggsfield
Картинки, видео и голос из текста или по референсу; движения камеры и стили для роликов, апскейл, редактирование. Веб и мобильное приложение.
- Движения камеры и кинематографичные пресеты для коротких роликов
- Картинка → видео: продукт и композиция остаются вашими
- Голос, апскейл и редактирование в том же кабинете, веб и мобильное приложение
Сильная сторона — кинематографичные короткие ролики; длинные сцены и точный текст в кадре — не его задача.
Попробовать HiggsfieldПохожая задача? План и расчёт за 24 часа
Расскажите, что нужно сделать. Подскажем, хватит ли пакета с фиксированной ценой или это проект от 600 000 ₽, и вернёмся с планом.