Как сделать ИИ-аватар самому и на каком ролике он себя выдаст
Для своего ИИ-аватара нужны две-три минуты видео на смартфон в ровном свете и несколько минут чистого голоса — дальше ролики собираются из текста, без съёмки. Запись и первая сборка занимают вечер; ещё один вечер уйдёт на то, чтобы забраковать первые ролики, и это нормально. Ниже — что именно записать, где собрать аватара и четыре типовые причины брака: руки, зубы, взгляд и интонация чтеца. Отдельно — на каком ролике аватар выдаст себя даже при хорошем исходнике.
Что записать: две минуты видео и проба голоса
Запрос «ии аватар» набирают почти пять тысяч раз в месяц, «как сделать ии аватар» — около трёхсот. Студия и оператор не понадобятся. Исходник — две-три минуты видео на смартфон: вы сидите или стоите, смотрите в камеру, говорите что угодно, иногда киваете и делаете паузы с закрытым ртом. Из этих пауз модель возьмёт «состояние покоя» — как вы выглядите, когда молчите.
Свет важнее камеры: окно сбоку или лампа перед лицом, без резких теней и солнца в спину. Фон однотонный, в кадре ничего не двигается. Одежда без мелкого узора — полоска потом рябит. Руки спокойно или ниже кадра.
Голос записывайте отдельно, в тихой комнате, на расстоянии ладони от микрофона телефона, и говорите так, как объясняете клиенту, а не так, как читают вслух. Сколько минут нужно, заранее не скажу: сначала короткая проба. Соберите клон, послушайте его на реальном тексте — если тембр ловится и темп ваш, хватит; если голос плывёт, допишите, уже понимая, что именно не так.
Где собрать аватара и сколько ждать
Аватара собирают в сервисах с моделями «видео по лицу» и клоном голоса. Проще начать с агрегатора: там несколько таких моделей рядом, и один исходник можно прогнать через две-три и сравнить. Загружаете видео, отдельно — запись голоса, ждёте. Первая сборка самая долгая: модель изучает лицо с разных углов. Потом каждый новый ролик — это вставленный текст и несколько минут ожидания.
Интерфейс у большинства таких моделей английский, и описание сцены тоже лучше писать на английском — попробовать в SYNTX, где всё собрано в Telegram и на сайте и есть инструкции на русском. Режим выбирайте «по видео», а не «по фото»: говорящий снимок годится для пробы, но у него одна маска и нет вашей мимики — разница описана в статье про то, как оживить фото нейросетью.
Текст для первого ролика — 30–40 секунд речи, короткие предложения, числа словами.
Хотите попробовать по ходу чтения? Инструменты из статьи — в один клик.
Причина брака первая: руки и зубы
Первое, на чём ловят аватара, — руки
Если в исходнике вы активно жестикулировали, модель попытается повторить движение в новом ролике: пальцы сливаются, кисть на секунду теряет форму, ладонь проходит сквозь другую.
Лечится это на записи, а не на монтаже
Руки лежат спокойно или остаются ниже кадра, план — по грудь. Если жест нужен, пусть он будет в начале и в конце ролика, а не на каждой фразе.
Вторая проблема — зубы
На широкой улыбке в исходнике модель запоминает ряд зубов и потом дорисовывает его на любом открытом рте: зубов становится больше, чем нужно, или они меняют форму между кадрами. Улыбайтесь в исходнике сдержанно, с почти закрытым ртом. В готовом ролике проверяйте кадры на звуках «а» и «э» — там рот открыт сильнее всего. Если зубы «едут», пересоберите ролик из другого фрагмента исходника, где улыбки меньше.
Причина брака вторая: взгляд и интонация чтеца
Взгляд мимо камеры выдаёт аватара даже при идеальном лице
Ошибка появляется на записи: вы смотрите на экран телефона, а не в объектив, и пара сантиметров разницы превращается в «человек смотрит куда-то вбок». Отметьте объектив маленькой наклейкой и говорите ей.
Интонация — второй маркер
Клон голоса учится не только тембру, но и тому, как вы читали: если запись шла в ритме диктора, все ролики будут звучать как объявление в вагоне. Записывайте голос как разговор — с паузами, с вопросительной интонацией там, где вопрос, с ускорением на второстепенном. Помогает не читать с листа, а пересказывать написанное.
Третья мелочь, о которой забывают
Аббревиатуры и цифры. «ООО», «НДС», «1 250 ₽» модель прочтёт как получится. Пишите словами: «тысяча двести пятьдесят рублей».
На каком ролике аватар выдаст себя даже при хорошем исходнике
Аватар держится на коротких спокойных информационных роликах
Ответ на вопрос клиента за 40 секунд, новость об изменении в услуге, урок из серии. Проваливается он на трёх вещах. Длинный монолог одним планом — минута-полторы без смены кадра, — и зритель успевает разглядеть, что плечи слишком ровные, а моргание слишком регулярное. Эмоции — смех, злость, удивление — модель играет плохо, получается маска. И импровизация: живой сбивчивый текст с междометиями у клона звучит неестественно ровно.
Так был собран аватар для эксперта по монтажу в CapCut
Исходники записали один раз, дальше — серия мини-уроков по 30–60 секунд, одна тема на ролик, единая структура «что делаем → как → типичная ошибка», экран монтажа в кадре, аватар во врезке или на вступлении. Он объясняет, а не ведёт шоу, и в этом формате его не разглядывают. Подробнее — в кейсе.
Правило простое
Если ролик держится на харизме, снимайте живьём. Если на содержании — аватар справится.
Что проверить перед публикацией
Права. Своё лицо и свой голос вы можете клонировать без чьего-либо разрешения. Чужие — только с письменным согласием человека, и сотрудника компании это касается тоже; подробнее — в статье про клонирование голоса. Если ролик рекламный, на него распространяются правила маркировки рекламы независимо от того, живой в кадре человек или аватар.
Перед выкладкой прогоните ролик по короткому списку
Губы на звуках «б», «п», «м» должны смыкаться — если рот открыт на слове «мама», липсинк не сошёлся. Последняя секунда: аватар часто замирает или дёргается перед концом — обрежьте. Фон не должен «дышать» вокруг головы. Субтитры обязательны: многие смотрят без звука.
Про зрителей
Скрывать, что это аватар, я смысла не вижу, но и объявлять об этом в каждом ролике не нужно — достаточно одной фразы в описании канала.
Когда самому не стоит и когда звать студию
Один аватар для пробы, ролик для своей страницы, десять ответов на частые вопросы — делайте сами: вечер записи, вечер сборки. Самостоятельный путь заканчивается там, где начинается серия: двадцать роликов в одном стиле, с одной обложкой, под план публикаций, с текстами, которые кто-то должен написать и вычитать. Там брак стоит дорого — не деньгами, а временем.
В пакет нейроаватара START за 120 000 ₽ входят создание аватара, клон голоса, сценарии и 20 видео за 14 дней; инструкцию по записи присылаем заранее, первую пробу голоса слушаем вместе. Понять, ваш ли это формат вообще, поможет статья о том, кому нужен нейроаватар.
Съёмка исходников на студии, аватары для нескольких спикеров, серия под бренд с исследованием аудитории — это уже большой проект от 600 000 ₽, где съёмку, графику и контент-план мы делаем сами.
Частые вопросы
Что спрашивают до заказа — с ответами, которые мы даём на брифе.
Сколько видео нужно, чтобы сделать ИИ-аватар?
Две-три минуты видео на смартфон в ровном свете: вы говорите в камеру, делаете паузы с закрытым ртом, слегка двигаете головой. Для голоса — отдельная запись в тихой комнате; сколько именно минут, покажет короткая проба, которую вы соберёте первой.
Можно ли сделать ИИ-аватар из одной фотографии?
Для пробы — да, сервис оживит снимок за несколько минут. Для регулярных роликов — нет: у аватара из фото одна маска, нет вашей мимики и состояния покоя, и через 20 секунд это заметно. Для контента нужен исходник по видео.
Почему у ИИ-аватара плывут руки и зубы?
Модель повторяет то, что видела в исходнике. Активная жестикуляция превращается в сливающиеся пальцы, широкая улыбка — в лишние или меняющие форму зубы. Лечится на записи: руки спокойно, улыбка сдержанная, план по грудь.
Нужно ли говорить зрителям, что в ролике аватар?
Скрывать нет смысла: одной фразы в описании канала достаточно. Если ролик рекламный, его нужно маркировать по общим правилам — живой человек в кадре или аватар, значения не имеет. Правила площадок по пометкам сгенерированного контента меняются, проверьте перед выкладкой.
Как это выглядит на практике

CLYOVO аватар
CapCut Expert
Эксперт по видеомонтажу

CLYOVO аватар
ООО Стандарт
ООО Стандарт · переработка и утилизация
на сайт
CLYOVO аватар
FORCELAB
FORCELAB · международный бренд
Где это сделать самому
Инструменты, в которых собирается то, о чём статья: что делает хорошо, чего от него не ждать — и кнопка, чтобы попробовать на своей задаче.
SYNTX
Тексты, картинки, видео и музыка в одном Telegram-боте и веб-приложении: ChatGPT, Gemini, Kling, Veo, Sora, Suno и ещё сотня моделей по одной подписке. База знаний с инструкциями на русском.
- Одна подписка вместо десятка сервисов — тексты, картинки, видео, музыка
- Работает прямо в Telegram, ничего устанавливать не нужно
- Библиотека трендов: повторить популярный эффект в несколько кликов
- База знаний на русском — инструкции по каждой модели
Это подписка, а не оплата за использование: если генераций мало, посчитайте, окупится ли месяц.
Попробовать SYNTXHiggsfield
Картинки, видео и голос из текста или по референсу; движения камеры и стили для роликов, апскейл, редактирование. Веб и мобильное приложение.
- Движения камеры и кинематографичные пресеты для коротких роликов
- Картинка → видео: продукт и композиция остаются вашими
- Голос, апскейл и редактирование в том же кабинете, веб и мобильное приложение
Сильная сторона — кинематографичные короткие ролики; длинные сцены и точный текст в кадре — не его задача.
Попробовать HiggsfieldПохожая задача? План и расчёт за 24 часа
Расскажите, что нужно сделать. Подскажем, хватит ли пакета с фиксированной ценой или это проект от 600 000 ₽, и вернёмся с планом.