Почему нейросеть не может написать слово в кадре и как сделать надпись в ролике
Буквы в нейросетевом видео плывут потому, что модель рисует форму букв, не зная их, и любая надпись накладывается уже в монтажке поверх кадра. «AI видео текст» ищут 1 670 раз в месяц, «нейросети видео сделать текст» — ещё 393, и почти всегда за этим стоит одна сцена: просили название кафе на вывеске, получили кашу из знаков. Рабочих способов три: плашка в монтажном редакторе, пустая вывеска в кадре плюс слой с текстом и короткая латиница, если надпись обязана быть частью картинки. Ниже — как сделать каждый и что проверить перед публикацией.

Почему нейросеть не умеет писать
Видеомодель училась на миллионах роликов, где есть вывески, ценники и упаковки. Она запомнила, как выглядит надпись: ряд знаков одной высоты, контраст с фоном, ритм пробелов. Но алфавита у неё нет. Для модели слово «Кофейня» — не семь конкретных букв, а текстура «здесь что-то написано», и она честно рисует похожую текстуру.
Дальше хуже: видео — это двадцать четыре и больше кадров в секунду, и каждый следующий кадр модель дорисовывает с опорой на предыдущий, но не копирует его. Поэтому надпись, которая на первом кадре почти читалась, к третьей секунде меняет буквы, теряет одну, удваивает другую. Человек замечает это мгновенно, потому что чтение — автоматический навык.
С кириллицей всё заметнее: её в обучающих данных меньше, чем латиницы. На дату публикации новые модели стали лучше держать короткие слова латиницей, но ни одна из тех, что мы пробовали, не даёт гарантии с русским словом длиннее четырёх-пяти букв. Проверьте на своей: сгенерируйте ролик с одной надписью и остановите его на трёх кадрах. Если хотя бы один расходится с остальными, читайте дальше про слой.
Способ первый: плашка в монтажке
Самый надёжный и самый быстрый путь
Генерируете кадр без всякого текста, а название, цену и призыв ставите поверх в монтажном редакторе — в мобильных CapCut, VN или InShot, на компьютере — в бесплатном DaVinci Resolve. Это те же инструменты, где вы всё равно будете резать ролик и подкладывать музыку.
Плашка — цветная или полупрозрачная подложка под текст
Она решает главную проблему нейросетевого кадра: там всё движется и переливается, и текст без подложки теряется через секунду. Три правила: один шрифт на весь ролик, размер такой, чтобы читалось с телефона на вытянутой руке, и контраст — тёмный текст на светлой плашке или наоборот, без белого по светлому небу.
В вертикальном формате 9:16 держите текст в средней трети кадра: сверху и снизу его закроют интерфейс площадки, аватарка и кнопки. Так устроен и наш промо-ролик реферальной программы такси: два формата, 9:16 и 1:1, и в каждом условия оффера стоят отдельным слоем, который переставляли под кадр, а не генерировали заново.
Хотите попробовать по ходу чтения? Инструменты из статьи — в один клик.
Способ второй: пустая вывеска плюс слой
Если по сюжету надпись должна быть частью сцены — на фасаде, на коробке, на экране ноутбука, — просите нейросеть нарисовать пустое место под неё. В промпте это «blank sign», «empty signboard», «plain white label», «no text». Модель охотно рисует чистую поверхность: это проще, чем буквы.
Дальше в редакторе кладёте текст на эту поверхность. Если камера в кадре неподвижна, хватит статичного слоя с лёгким наклоном в перспективе. Если камера едет, включайте трекинг: в CapCut и DaVinci Resolve он есть, слой прилипает к объекту и движется вместе с ним. Работает не идеально: на резком повороте или когда вывеску перекрывает прохожий, слой поплывёт. Поэтому движение камеры в таких сценах лучше заказывать плавное и короткое.
Движения камеры удобно перебирать в Higgsfield: у него много готовых пресетов наезда и проезда, а точный текст в кадре — не его сильная сторона, так что вывеску там лучше сразу заказывать пустой. Если хочется сравнить, как одну и ту же пустую вывеску рисуют разные модели, проще всего сделать это в SYNTX, где они собраны в одном месте.
Способ третий: латиница и короткие слова
Бывает, что слой не спасает
Надпись должна быть на мятой упаковке, на изогнутой кружке, на футболке бегущего человека. Тогда остаётся просить модель нарисовать текст самой — и повышать шансы.
Шансы повышают три вещи
Латиница вместо кириллицы: короткое латинское слово из четырёх-шести букв новые модели держат заметно лучше. Кавычки в промпте: «a mug with the text LATTE printed on it» в кавычках работает лучше, чем «кружка с надписью». И количество попыток: генерируйте четыре-шесть вариантов одного кадра и выбирайте тот, где буквы держатся все секунды, а не только на превью.
Есть обходной путь через картинку
Модели, которые рисуют статичные изображения, справляются с текстом лучше видеомоделей. Сгенерируйте кадр с надписью как картинку, проверьте каждую букву, а потом оживите его в режиме «картинка → видео» с минимальным движением камеры. Первый кадр останется тем, что вы утвердили; дальше следите: на длинных планах буквы всё равно могут поехать, поэтому план — три-пять секунд. Для русского названия это сегодня самый рабочий способ оставить его внутри сцены.
Что проверить перед публикацией
Смотрите ролик на телефоне, не на мониторе
Там он и будет жить. Остановите в трёх местах — начало, середина, конец — и прочитайте каждую надпись вслух. Если глаз спотыкается, зритель разбираться не будет, он свайпнет.
Проверьте, что текст не залезает в зоны интерфейса
В вертикальном видео это верхние и нижние 15–20 % кадра. Проверьте контраст на самом светлом и самом тёмном фоне ролика, потому что нейросетевой кадр часто меняет яркость от секунды к секунде. Проверьте орфографию и цифры: цена, телефон, адрес — три места, где ошибка стоит дороже всего ролика.
Субтитры — тоже текстовый слой, и к ним те же правила
Автосубтитры в редакторах хорошо распознают речь, но путают имена, названия и термины: пройдитесь по ним руками. И если ролик рекламный и пойдёт в платное продвижение, ему нужна маркировка — как её оформить, мы писали в статье про erid и маркировку рекламы.
Когда хватит своих рук, а когда звать студию
Один ролик с одной надписью — задача на вечер
Кадр без текста, плашка в редакторе, проверка на телефоне. Этого достаточно, чтобы анонсировать акцию или новое меню. Если хочется понять, как вообще устроена сборка ролика из текста, у нас есть отдельная инструкция — «Видео нейросетью из текста».
Студия нужна, когда роликов не один, а серия
Плашки должны быть в одном стиле, субтитры — на каждом, обложки — под каждую площадку, а формулировки — согласованы с юристом и маркетологом. У нас это пакет 20 рекламных роликов без съёмки за 120 000 ₽: обложки и субтитры входят в цену, а текст в кадре мы всегда ставим слоем, не доверяя его модели. Отдельный фирменный стиль плашек и шрифтов в пакет не входит; в проекте от 600 000 ₽ мы делаем его сами вместе с брендом и исследованием аудитории.
Частые вопросы
Что спрашивают до заказа — с ответами, которые мы даём на брифе.
Почему нейросеть не может написать текст в видео?
Видеомодель знает, как выглядит надпись, но не знает алфавита: она рисует текстуру «здесь что-то написано», а не конкретные буквы. Каждый следующий кадр дорисовывается заново, поэтому надпись меняется от секунды к секунде. Кириллицу модели держат хуже латиницы, потому что её меньше в обучающих данных.
Как добавить текст в видео, сделанное нейросетью?
Сгенерируйте кадр без текста и положите надпись поверх в монтажном редакторе — CapCut, VN, InShot или DaVinci Resolve. Используйте плашку-подложку, один шрифт на весь ролик и держите текст в средней трети вертикального кадра. Это самый надёжный способ.
Какая нейросеть умеет писать текст на русском в видео?
На дату публикации ни одна не делает это стабильно: короткие латинские слова у новых моделей получаются чаще, русские — редко. Если надпись должна быть частью сцены, сгенерируйте её картинкой, проверьте буквы и оживите в режиме «картинка → видео» коротким планом.
Как сделать вывеску с названием кафе в нейросетевом ролике?
Попросите модель нарисовать пустую вывеску («blank sign, no text»), а название добавьте слоем в редакторе — с трекингом, если камера движется. Движение камеры заказывайте плавное и короткое, иначе слой поплывёт.
Как это выглядит на практике




AI-промо реферальной программы
Везучая Трёшка
Везучая Трёшка · служба такси





CLYOVO ролик
Snickers
Snickers · креативный концепт-ролик






AI-промо
Танцевальный батл
Танцевальный батл · ивент-индустрия
Где это сделать самому
Инструменты, в которых собирается то, о чём статья: что делает хорошо, чего от него не ждать — и кнопка, чтобы попробовать на своей задаче.
SYNTX
Тексты, картинки, видео и музыка в одном Telegram-боте и веб-приложении: ChatGPT, Gemini, Kling, Veo, Sora, Suno и ещё сотня моделей по одной подписке. База знаний с инструкциями на русском.
- Одна подписка вместо десятка сервисов — тексты, картинки, видео, музыка
- Работает прямо в Telegram, ничего устанавливать не нужно
- Библиотека трендов: повторить популярный эффект в несколько кликов
- База знаний на русском — инструкции по каждой модели
Это подписка, а не оплата за использование: если генераций мало, посчитайте, окупится ли месяц.
Попробовать SYNTXHiggsfield
Картинки, видео и голос из текста или по референсу; движения камеры и стили для роликов, апскейл, редактирование. Веб и мобильное приложение.
- Движения камеры и кинематографичные пресеты для коротких роликов
- Картинка → видео: продукт и композиция остаются вашими
- Голос, апскейл и редактирование в том же кабинете, веб и мобильное приложение
Сильная сторона — кинематографичные короткие ролики; длинные сцены и точный текст в кадре — не его задача.
Попробовать HiggsfieldПохожая задача? План и расчёт за 24 часа
Расскажите, что нужно сделать. Подскажем, хватит ли пакета с фиксированной ценой или это проект от 600 000 ₽, и вернёмся с планом.