Дипфейк на видеозвонке. Что попросить сделать собеседника, чтобы нейросеть себя выдала
Мы собираем нейроаватаров за деньги, и у меня есть список мест, где нейросеть до сих пор промахивается на наших же роликах: поворот головы в профиль, рука у лица, очки. На видеозвонке это три просьбы, которые занимают десять секунд и не требуют никаких программ. Ни одна из них не даёт стопроцентной гарантии: хороший дипфейк на хорошем канале может пройти, а живой человек на плохой связи выглядит подозрительно. Но подделка в реальном времени ломается именно в этих точках, и ниже я объясняю почему.

Откуда я знаю, где ломается
Так было и на аватарах для конференции, и на амбассадоре бренда, который говорит на двух языках: чем ближе кадр к говорящей голове, тем чище результат; чем больше движения и предметов у лица, тем больше правок.
Каждый аватар, который мы сдаём клиенту, проходит согласование
Человек смотрит своё сгенерированное лицо и ищет, где оно не он. За десятки роликов эти места повторяются. Аватар отлично держит фронтальный план и разговор в камеру, но стоит ему повернуться боком, поднять руку к лицу или надеть очки — появляются артефакты, которые мы правим или вырезаем при монтаже.
У нас на это есть монтаж и несколько дублей
У мошенника на видеозвонке ничего этого нет: замена лица идёт в реальном времени, кадр за кадром, без права переснять. Поэтому всё, что мы прячем в монтаже, на звонке можно вытащить наружу простой просьбой.
Как устроен дипфейк в реальном времени
Схема такая. Камера снимает лицо мошенника. Программа находит лицо в кадре, определяет положение глаз, носа, рта. Нейросеть, заранее обученная на фотографиях и видео жертвы — вашего начальника, сына, партнёра, — рисует его лицо поверх лица мошенника с той же мимикой. Результат склеивается с фоном и отдаётся в виртуальную камеру, которую Zoom, Telegram или другой мессенджер видят как обычную веб-камеру. Голос обрабатывается отдельно, тоже в реальном времени; про это у нас есть статья о клонировании голоса.
Слабое место — обучающие данные
Модель училась в основном на фронтальных фото: лицо в камеру, ничего не перекрывает, свет ровный. Профиль, руки у лица, очки в таких данных редкость. Когда мошенник делает то, чего модель почти не видела, ей нечего подставить, и она либо тянет старое лицо на новое положение, либо мигает исходным.
Плюс задержка
Каждый кадр обрабатывается за доли секунды, и при резком движении маска отстаёт от головы.
Просьба первая: повернитесь в профиль
Скажите: «Поверните голову вбок, посмотрите на стену». Не на сорок пять градусов — на девяносто, чтобы в камеру смотрело ухо.
Что происходит с подделкой: на профиль модель обучена хуже всего, потому что таких снимков жертвы у мошенника почти нет. Маска либо остаётся полуфронтальной, и лицо выглядит плоским, как приклеенное; либо на повороте проскакивает настоящее лицо; либо граница между щекой и фоном начинает дрожать. Отдельно смотрите на ухо и линию носа сбоку: у живого человека они не меняются, у подделки могут поплыть за секунду.
Живой человек на плохой связи при повороте просто размажется на пару кадров и вернётся чётким. Подделка вернётся с другим лицом или с заметной сшивкой. Если сомнение осталось, попросите повернуться медленно и в другую сторону: чем дольше лицо в профиль, тем дольше видны артефакты.
Просьба вторая: проведите рукой по лицу
Скажите: «Проведите ладонью по лицу, как будто умываетесь». Медленно, от лба к подбородку.
Это проверка на перекрытие
Модель рисует лицо целиком, а рука — посторонний объект, который должен быть поверх лица. Подделка ошибается двумя способами. Первый: рука проходит, а лицо просвечивает сквозь неё — пальцы становятся полупрозрачными, и под ними виден нос или глаз. Второй: маска на секунду исчезает под рукой, там мелькают чужие черты, а потом лицо собирается обратно с задержкой.
На наших роликах это правило монтажа
Жест у лица либо не даём аватару вообще, либо режем в момент, когда рука уже отошла. На звонке резать нечем.
Если собеседник отказывается или отшучивается, это само по себе не улика
Живые люди тоже не любят странных просьб. Но если он делает вид, что не услышал, и возвращает разговор к срочности перевода, это уже второй признак.
Просьба третья: снимите или наденьте очки
Скажите: «Снимите очки на секунду» или, наоборот, «Наденьте очки». Подойдут любые, даже солнечные.
Если очков под рукой нет, есть четвёртая просьба, которую советуют и специалисты по безопасности: «Повторите за мной фразу» — любую, случайную. Клон голоса в реальном времени и синхронизация губ отстают на доли секунды; на быстрой чужой фразе рот и звук расходятся заметнее, чем в заготовленной речи.
Очки для подделки — сразу две проблемы
Оправа пересекает лицо, и на границе стекла и щеки видно, где заканчивается маска: линия оправы рвётся, утолщается, исчезает на пару кадров при движении. Стёкла отражают свет комнаты и экрана, а модель этот блик не рисует, потому что не знает, что у мошенника перед лицом. В итоге очки либо без бликов вовсе, либо с бликом, который не двигается вместе с головой.
Все просьбы вместе занимают меньше двадцати секунд
Живой человек удивится и сделает. Подделка сделает не то или уйдёт от разговора.
Если сомнение осталось
По сообщениям СМИ, в Гонконге сотрудник финансового отдела крупной компании перевёл мошенникам около 25 миллионов долларов после видеоконференции, в которой все «руководители» были сгенерированы. Никто не попросил никого повернуться в профиль.
Правило одно
По видеозвонку деньги не переводят. Ни начальнику, ни сыну, ни партнёру, каким бы срочным ни был повод. Завершите звонок и перезвоните сами по номеру из своей записной книжки — не по тому, с которого звонили. Для семьи заведите кодовое слово, о котором не знает никто снаружи. Для бизнеса — регламент: любая платёжка, инициированная звонком или сообщением, подтверждается вторым каналом, и бухгалтер вправе задержать её без объяснений.
И оговорка, которую я повторю
Эти признаки не детектор. Технологии меняются быстро, и то, на чём подделка ломается на дату публикации, через год может держаться лучше. Просьбы дают паузу и повод перепроверить, а не приговор. Паузы обычно достаточно: мошенник работает на срочности, и любой перенос разговора ему невыгоден.
Где аватар видно и почему мы это не прячем
Технически наш нейроаватар и дипфейк мошенника — родственники: и то и другое рисует лицо нейросетью. Разница в согласии и в подписи. Мы делаем аватара только самого заказчика, по его материалам и с его письменным согласием, и клиент сам утверждает каждый ролик. Голос клонируем тоже только его владельцу.
Второе: аватар у нас подписан как аватар. Там, где артефакты неизбежны — тот же профиль или жест у лица, — мы строим кадр так, чтобы этого движения не было, а не дорисовываем реальность. Зритель знает, что перед ним цифровая версия эксперта. Так работают аватары для конференции, которые мы делали: они выступают вместо человека, но не вместо его согласия.
Если вам нужен такой ведущий для роликов, обучалок или соцсетей, у нас это пакет нейроаватар START — 20 роликов за 120 000 ₽. Для бренда с исследованием аудитории и амбассадором на нескольких языках — проект от 600 000 ₽.
Частые вопросы
Что спрашивают до заказа — с ответами, которые мы даём на брифе.
Как понять, что на видеозвонке дипфейк?
Попросите собеседника повернуть голову в профиль на девяносто градусов, провести ладонью по лицу и снять или надеть очки. Подделка в реальном времени плохо держит профиль, перекрытия и оправу: маска дрожит, просвечивает или на секунду показывает другое лицо. Стопроцентной гарантии нет, поэтому любую просьбу о деньгах перепроверяйте звонком по своему номеру.
Можно ли подделать лицо на видеозвонке в реальном времени?
Да. Программа находит лицо в кадре, нейросеть подменяет его лицом другого человека кадр за кадром и отдаёт картинку в виртуальную камеру, которую мессенджер видит как обычную. Голос подменяется отдельно. Слабые места — положения, которых мало в обучающих данных: профиль, руки у лица, очки.
Что делать, если по видео звонит «начальник» и просит срочно перевести деньги?
Не переводить. Завершить звонок и перезвонить самому по номеру из своей книжки, а не по тому, с которого звонили. В компании — оформить правило: платёж по звонку подтверждается вторым каналом, и бухгалтер может задержать его без объяснений.
Нейроаватар и дипфейк — это одно и то же?
Технология похожая: лицо и голос рисует нейросеть. Разница в согласии: аватар делают самому человеку по его материалам, он утверждает каждый ролик, и аватар подписан как цифровая версия. Дипфейк мошенника использует чужое лицо без ведома владельца.
Как это выглядит на практике

CLYOVO аватар
WMT AI
WMT AI · конференция «ИИшница»

CLYOVO аватар
FORCELAB
FORCELAB · международный бренд

CLYOVO аватар
ООО Стандарт
ООО Стандарт · переработка и утилизация
на сайтПохожая задача? План и расчёт за 24 часа
Расскажите, что нужно сделать. Подскажем, хватит ли пакета с фиксированной ценой или это проект от 600 000 ₽, и вернёмся с планом.