8 мин·20 сентября 2026 г.·Герман Розовик

Почему нейросеть не может написать слово в кадре и как сделать надпись в ролике

Краткий ответ

Буквы в нейросетевом видео плывут потому, что модель рисует форму букв, не зная их, и любая надпись накладывается уже в монтажке поверх кадра. «AI видео текст» ищут 1 670 раз в месяц, «нейросети видео сделать текст» — ещё 393, и почти всегда за этим стоит одна сцена: просили название кафе на вывеске, получили кашу из знаков. Рабочих способов три: плашка в монтажном редакторе, пустая вывеска в кадре плюс слой с текстом и короткая латиница, если надпись обязана быть частью картинки. Ниже — как сделать каждый и что проверить перед публикацией.

Почему нейросеть не может написать слово в кадре и как сделать надпись в ролике
01

Почему нейросеть не умеет писать

Видеомодель училась на миллионах роликов, где есть вывески, ценники и упаковки. Она запомнила, как выглядит надпись: ряд знаков одной высоты, контраст с фоном, ритм пробелов. Но алфавита у неё нет. Для модели слово «Кофейня» — не семь конкретных букв, а текстура «здесь что-то написано», и она честно рисует похожую текстуру.

Дальше хуже: видео — это двадцать четыре и больше кадров в секунду, и каждый следующий кадр модель дорисовывает с опорой на предыдущий, но не копирует его. Поэтому надпись, которая на первом кадре почти читалась, к третьей секунде меняет буквы, теряет одну, удваивает другую. Человек замечает это мгновенно, потому что чтение — автоматический навык.

С кириллицей всё заметнее: её в обучающих данных меньше, чем латиницы. На дату публикации новые модели стали лучше держать короткие слова латиницей, но ни одна из тех, что мы пробовали, не даёт гарантии с русским словом длиннее четырёх-пяти букв. Проверьте на своей: сгенерируйте ролик с одной надписью и остановите его на трёх кадрах. Если хотя бы один расходится с остальными, читайте дальше про слой.

02

Способ первый: плашка в монтажке

02.1

Самый надёжный и самый быстрый путь

Генерируете кадр без всякого текста, а название, цену и призыв ставите поверх в монтажном редакторе — в мобильных CapCut, VN или InShot, на компьютере — в бесплатном DaVinci Resolve. Это те же инструменты, где вы всё равно будете резать ролик и подкладывать музыку.

02.2

Плашка — цветная или полупрозрачная подложка под текст

Она решает главную проблему нейросетевого кадра: там всё движется и переливается, и текст без подложки теряется через секунду. Три правила: один шрифт на весь ролик, размер такой, чтобы читалось с телефона на вытянутой руке, и контраст — тёмный текст на светлой плашке или наоборот, без белого по светлому небу.

В вертикальном формате 9:16 держите текст в средней трети кадра: сверху и снизу его закроют интерфейс площадки, аватарка и кнопки. Так устроен и наш промо-ролик реферальной программы такси: два формата, 9:16 и 1:1, и в каждом условия оффера стоят отдельным слоем, который переставляли под кадр, а не генерировали заново.

Хотите попробовать по ходу чтения? Инструменты из статьи — в один клик.

03

Способ второй: пустая вывеска плюс слой

Если по сюжету надпись должна быть частью сцены — на фасаде, на коробке, на экране ноутбука, — просите нейросеть нарисовать пустое место под неё. В промпте это «blank sign», «empty signboard», «plain white label», «no text». Модель охотно рисует чистую поверхность: это проще, чем буквы.

Дальше в редакторе кладёте текст на эту поверхность. Если камера в кадре неподвижна, хватит статичного слоя с лёгким наклоном в перспективе. Если камера едет, включайте трекинг: в CapCut и DaVinci Resolve он есть, слой прилипает к объекту и движется вместе с ним. Работает не идеально: на резком повороте или когда вывеску перекрывает прохожий, слой поплывёт. Поэтому движение камеры в таких сценах лучше заказывать плавное и короткое.

Движения камеры удобно перебирать в Higgsfield: у него много готовых пресетов наезда и проезда, а точный текст в кадре — не его сильная сторона, так что вывеску там лучше сразу заказывать пустой. Если хочется сравнить, как одну и ту же пустую вывеску рисуют разные модели, проще всего сделать это в SYNTX, где они собраны в одном месте.

04

Способ третий: латиница и короткие слова

04.1

Бывает, что слой не спасает

Надпись должна быть на мятой упаковке, на изогнутой кружке, на футболке бегущего человека. Тогда остаётся просить модель нарисовать текст самой — и повышать шансы.

04.2

Шансы повышают три вещи

Латиница вместо кириллицы: короткое латинское слово из четырёх-шести букв новые модели держат заметно лучше. Кавычки в промпте: «a mug with the text LATTE printed on it» в кавычках работает лучше, чем «кружка с надписью». И количество попыток: генерируйте четыре-шесть вариантов одного кадра и выбирайте тот, где буквы держатся все секунды, а не только на превью.

04.3

Есть обходной путь через картинку

Модели, которые рисуют статичные изображения, справляются с текстом лучше видеомоделей. Сгенерируйте кадр с надписью как картинку, проверьте каждую букву, а потом оживите его в режиме «картинка → видео» с минимальным движением камеры. Первый кадр останется тем, что вы утвердили; дальше следите: на длинных планах буквы всё равно могут поехать, поэтому план — три-пять секунд. Для русского названия это сегодня самый рабочий способ оставить его внутри сцены.

05

Что проверить перед публикацией

05.1

Смотрите ролик на телефоне, не на мониторе

Там он и будет жить. Остановите в трёх местах — начало, середина, конец — и прочитайте каждую надпись вслух. Если глаз спотыкается, зритель разбираться не будет, он свайпнет.

05.2

Проверьте, что текст не залезает в зоны интерфейса

В вертикальном видео это верхние и нижние 15–20 % кадра. Проверьте контраст на самом светлом и самом тёмном фоне ролика, потому что нейросетевой кадр часто меняет яркость от секунды к секунде. Проверьте орфографию и цифры: цена, телефон, адрес — три места, где ошибка стоит дороже всего ролика.

05.3

Субтитры — тоже текстовый слой, и к ним те же правила

Автосубтитры в редакторах хорошо распознают речь, но путают имена, названия и термины: пройдитесь по ним руками. И если ролик рекламный и пойдёт в платное продвижение, ему нужна маркировка — как её оформить, мы писали в статье про erid и маркировку рекламы.

06

Когда хватит своих рук, а когда звать студию

06.1

Один ролик с одной надписью — задача на вечер

Кадр без текста, плашка в редакторе, проверка на телефоне. Этого достаточно, чтобы анонсировать акцию или новое меню. Если хочется понять, как вообще устроена сборка ролика из текста, у нас есть отдельная инструкция — «Видео нейросетью из текста».

06.2

Студия нужна, когда роликов не один, а серия

Плашки должны быть в одном стиле, субтитры — на каждом, обложки — под каждую площадку, а формулировки — согласованы с юристом и маркетологом. У нас это пакет 20 рекламных роликов без съёмки за 120 000 ₽: обложки и субтитры входят в цену, а текст в кадре мы всегда ставим слоем, не доверяя его модели. Отдельный фирменный стиль плашек и шрифтов в пакет не входит; в проекте от 600 000 ₽ мы делаем его сами вместе с брендом и исследованием аудитории.

Частые вопросы

Что спрашивают до заказа — с ответами, которые мы даём на брифе.

Почему нейросеть не может написать текст в видео?

Видеомодель знает, как выглядит надпись, но не знает алфавита: она рисует текстуру «здесь что-то написано», а не конкретные буквы. Каждый следующий кадр дорисовывается заново, поэтому надпись меняется от секунды к секунде. Кириллицу модели держат хуже латиницы, потому что её меньше в обучающих данных.

Как добавить текст в видео, сделанное нейросетью?

Сгенерируйте кадр без текста и положите надпись поверх в монтажном редакторе — CapCut, VN, InShot или DaVinci Resolve. Используйте плашку-подложку, один шрифт на весь ролик и держите текст в средней трети вертикального кадра. Это самый надёжный способ.

Какая нейросеть умеет писать текст на русском в видео?

На дату публикации ни одна не делает это стабильно: короткие латинские слова у новых моделей получаются чаще, русские — редко. Если надпись должна быть частью сцены, сгенерируйте её картинкой, проверьте буквы и оживите в режиме «картинка → видео» коротким планом.

Как сделать вывеску с названием кафе в нейросетевом ролике?

Попросите модель нарисовать пустую вывеску («blank sign, no text»), а название добавьте слоем в редакторе — с трекингом, если камера движется. Движение камеры заказывайте плавное и короткое, иначе слой поплывёт.

Как это выглядит на практике

Где это сделать самому

Инструменты, в которых собирается то, о чём статья: что делает хорошо, чего от него не ждать — и кнопка, чтобы попробовать на своей задаче.

100+ нейросетей в Telegram и на сайте по одной подписке

SYNTX

Тексты, картинки, видео и музыка в одном Telegram-боте и веб-приложении: ChatGPT, Gemini, Kling, Veo, Sora, Suno и ещё сотня моделей по одной подписке. База знаний с инструкциями на русском.

  • Одна подписка вместо десятка сервисов — тексты, картинки, видео, музыка
  • Работает прямо в Telegram, ничего устанавливать не нужно
  • Библиотека трендов: повторить популярный эффект в несколько кликов
  • База знаний на русском — инструкции по каждой модели

Это подписка, а не оплата за использование: если генераций мало, посчитайте, окупится ли месяц.

Попробовать SYNTX
Кино-ролики из картинки и текста

Higgsfield

Картинки, видео и голос из текста или по референсу; движения камеры и стили для роликов, апскейл, редактирование. Веб и мобильное приложение.

  • Движения камеры и кинематографичные пресеты для коротких роликов
  • Картинка → видео: продукт и композиция остаются вашими
  • Голос, апскейл и редактирование в том же кабинете, веб и мобильное приложение

Сильная сторона — кинематографичные короткие ролики; длинные сцены и точный текст в кадре — не его задача.

Попробовать Higgsfield

Похожая задача? План и расчёт за 24 часа

Расскажите, что нужно сделать. Подскажем, хватит ли пакета с фиксированной ценой или это проект от 600 000 ₽, и вернёмся с планом.