Генерация видео по тексту: гайд по описанию, звуку и цене
Пошаговый гайд по text-to-video: структура описания кадра из пяти слоёв, склейка сцен, звук и липсинк по моделям, порядок цен и честный разбор, когда лучше взять image-to-video.
Генерация видео по тексту, или text-to-video, сокращённо t2v, значит, что нейросеть строит ролик с нуля по словесному описанию: без исходной фотографии и без чужого клипа-референса, только фраза о том, что должно происходить в кадре. Запрос «генерация видео по тексту» набирает в Яндексе больше 2 тысяч показов в месяц, а более широкий «нейросеть для генерации видео» почти 13 тысяч (Wordstat, июль 2026): аудитория выросла настолько, что t2v из демо-фичи стал рабочим инструментом для роликов, которые раньше снимали с камерой в руках.
Я прогнал через t2v не один десяток описаний, прежде чем понял: разница между случайным роликом и рабочим кадром решается не выбором модели, а структурой текста. В этом гайде разбираю, как эта структура строится, что можно склеить в сцену длиннее одного клипа, у каких моделей есть звук и где текстовая генерация проигрывает фото-референсу.
Коротко: кому нужна генерация видео по тексту
T2v незаменим там, где нет и не должно быть исходного кадра: атмосферные b-roll вставки для бренд-ленты, тизеры без съёмочной группы, абстрактный фон под рекламный баннер, короткие сцены для сторис. Если у вас уже есть фото товара или человека и нужно просто добавить движение, это другая задача: image-to-video, i2v, мы разбирали её отдельно в гайде как оживить фото нейросетью. T2v работает с чистого листа, и в этом его сила и его главное ограничение одновременно: сцену придётся описать полностью, а не подправить готовую.
Как модель получает ролик из текста
Устройство пайплайна проще, чем кажется со стороны. Модель сначала разбирает описание на смысловые блоки: кто в кадре, что происходит, как ведёт себя камера. Затем она генерирует не отдельные кадры по очереди, а сразу видеопоследовательность, где кадры связаны во времени: так модель удерживает форму объекта, направление движения и освещение от первой секунды до последней. На финальном проходе видео апскейлится до целевого разрешения, а у моделей с аудиомодулем параллельно рождается звуковая дорожка, синхронизированная с движением в кадре.
Отсюда вытекает практическое следствие: у t2v нет опорного кадра, который бы фиксировал внешность героя или форму предмета. Всё, что вы не описали словами, модель придумывает сама, и придумывает по-разному от попытки к попытке. Поэтому структура описания решает больше, чем выбор модели.
Пять слоёв описания: сцена, субъект, камера, свет, стиль
Рабочая формула держится на пяти слоях. Пропустите один, и модель заполнит пробел на свой вкус, обычно не в вашу пользу.
Сцена: место и время действия одним коротким предложением. «Каменная столешница в утреннем свете» работает лучше, чем просто «стол», потому что закрывает вопрос о материале, освещении и времени суток разом.
Субъект и действие: кто или что в кадре и какое одно действие происходит. Одно, не два. «Флакон стоит неподвижно, рядом поднимается пар» модель понимает, «флакон крутится, а сзади плывут облака и меняется свет» почти наверняка развалит сцену на середине.
Камера: у операторской лексики нет двусмысленности, и модели ей обучены лучше, чем бытовым описаниям вроде «покажи красиво». Рабочий словарь: наезд (push-in, медленное приближение), отъезд (pull-back, камера отдаляется и раскрывает сцену), панорама (pan, поворот влево-вправо без смещения точки), облёт (orbit, камера обходит объект по дуге), тревеллинг (dolly, камера едет вбок или вперёд вместе с точкой съёмки), статика (locked, камера неподвижна). Один тип движения на клип, два одновременно почти всегда ломают геометрию сцены.
Свет и настроение: источник света плюс эмоциональный тон одной фразой. «Тёплый боковой свет из окна, спокойное настроение» против «драматичный контровой свет, напряжение» дают заметно разную картинку при одинаковой сцене.
Стиль: жанр и характер отделки картинки. «Минималистичная рекламная съёмка», «документальная зернистость», «кинематографичный тил-оранж»: стиль держит модель в рамках, иначе она подмешивает случайную стилистику из обучающих данных.
Сколько длится ролик и как собрать сцену длиннее
Одна генерация редко превышает 15 секунд: у Veo 3.1 предел 8 секунд, у Kling 3 и Wan 2.7 до 15. Для более длинного ролика есть два рабочих способа. Первый: продление, когда модель берёт последние кадры готового клипа и достраивает следующий сегмент, у Kling 3 так можно дотянуть ролик до трёх минут шагами по 5 или 10 секунд. Второй: явное указание первого и последнего кадра, frame-to-frame, когда вы задаёте, с чего сцена начинается и чем заканчивается, а модель генерирует переход между ними. Эту функцию поддерживают все три флагмана по-разному: Wan 2.7 умеет управлять первым и последним кадром из коробки, Veo 3.1 называет это «frames to video» и принимает пару кадров вместо референс-изображений, у Kling 3 функция называется start/end frame и работает через тот же принцип интерполяции.
Практический вывод: длинный ролик почти всегда собирается из коротких сегментов на монтаже, а не рождается одной генерацией. Планируйте сцену заранее как последовательность клипов по 5–10 секунд, и склейка выйдет чище, чем попытка выжать из модели один долгий кадр.
Звук и синхронизация губ: у кого что
Три флагмана обращаются со звуком по-разному, и разница ощутимая. Kling 3 в версии Omni генерирует аудио прямо из текстового описания вместе с картинкой, включая липсинк на пяти языках: английском, китайском, японском, корейском и испанском (по заявлению Kuaishou при запуске модели в феврале 2026 года). Veo 3.1 тоже создаёт звук нативно, вплоть до диалогов с движением губ, но в официальной документации Google прямо указано: короткие реплики и стабильная синхронизация речи всё ещё «область активной доработки», то есть липсинк срабатывает не всегда точно и результат стоит проверять на выходе. Wan 2.7 добавляет звук опционально и не претендует на диалоги, зато держит цену ниже.
Если ролик держится на диалоге персонажа, точная синхронизация губ по тексту всё ещё капризная задача. Для говорящего персонажа с предсказуемым результатом обычно эффективнее выделенный инструмент под аватары, разбор моделей и разницы с t2v в гайде ИИ-аватар для видео.
Порядок цен за секунду
Официального единого прайса на рынке нет: каждый провайдер считает по-своему, а розничная цена зависит от разрешения, звука и режима качества. По данным API-агрегаторов на июль 2026 года (fal.ai, WaveSpeed) вилка выглядит так: облегчённые тиры без звука укладываются в 3–5 центов за секунду видео, средний сегмент держится около 10–17 центов, а флагманский режим с 4K и синхронным звуком доходит до 30–40 центов за секунду. Kling 3 в базовом режиме ближе к нижней границе, Veo 3.1 в полном качестве со звуком к верхней.
У Gemini Omni Flash логика другая: цена фиксируется за одну генерацию независимо от длины ролика в пределах лимита, а не считается на каждую секунду. Это не эксклюзивная технология, тот же апстрим у некоторых провайдеров дешевле, но для планирования бюджета такая модель удобнее классического per-second счётчика: короткий тизер и более длинный клип в рамках одного запроса обходятся одинаково. В каталоге InPersona эта модель доступна вместе с Kling 3, Veo 3.1 и Wan 2.7 (дефолт для видео) под одним балансом, без отдельной подписки на каждый сервис.
Типичные фейлы t2v и как их лечить
- Морфинг героя и предметов. Без опорного кадра модель заново придумывает внешность в каждом сегменте. Лечение: закрепить описание внешности в первых словах и не менять формулировку между попытками; для героя, который повторяется из ролика в ролик, надёжнее identity-референс или переход на i2v.
- Пальцы и кисти рук. Жестикуляция остаётся слабым местом почти у всех моделей. Лечение: не просить активные жесты, держать руки в статичном положении или за кадром.
- Желейная физика. Ткань, волосы, жидкость двигаются неестественно, будто под водой. Лечение: явно описывать среду («воздух неподвижен», «без ветра») и снижать интенсивность движения в настройках.
- Подмена декорации в середине клипа. Ближе ко второй половине ролика модель иногда «теряет» сцену и меняет фон. Лечение: одно действие и одна локация на клип, для смены декорации отдельный сегмент.
- Камера не двигается, хотя должна. Если движение камеры не прописано явно, часть моделей выдаёт статичный кадр с покадровой анимацией внутри. Лечение: всегда указывать хотя бы одно действие камеры из операторского словаря.
- Текст и логотипы рассыпаются. Надписи, которые нужно получить читаемыми, в t2v почти всегда выходят с ошибками в буквах. Лечение: не полагаться на модель для текста в кадре, добавлять его на монтаже поверх готового клипа.
Три рецепта, которые работают
Продуктовый ролик 5–10 секунд
Формула: неподвижный или почти неподвижный товар в кадре, одно мягкое движение (лёгкий пар, блик, покачивание ткани) и один наезд или отъезд камеры. Пример описания: «Флакон духов на каменной столешнице, лёгкий пар поднимается рядом, камера медленно наезжает, тёплый боковой свет, минималистичная рекламная съёмка». Такой ролик собирается за один прогон и подходит под видеообложку карточки или короткий рекламный тизер.
Атмосферный b-roll
Формула та же, но без товара в кадре: сцена работает на настроение бренда, а не на демонстрацию продукта. Пример: «Мокрая улица вечером, отражения неоновых вывесок в лужах, камера медленно панорамирует слева направо, холодный синий свет, кинематографичная зернистость». Такие клипы закрывают паузы между продуктовыми кадрами в ленте и держат внимание дольше статики.
Анимация логотипа
Здесь честность важнее эффектности: t2v плохо рендерит точный текст и геометрию логотипа, поэтому просить модель «нарисовать наш логотип и оживить его» почти гарантированно даёт брак в буквах. Рабочая схема другая: генерируете абстрактный фон с движением под характер бренда, «частицы света медленно собираются в центре кадра, камера статична, тёмный фон, минималистичный стиль», а сам логотип накладываете поверх готового клипа в редакторе как отдельный слой. Результат выглядит собранным, а буквы остаются четкими, потому что их не рисовала нейросеть.
Когда генерация видео по тексту не подходит
Если в ролике должен быть конкретный товар, с его формой, цветом и упаковкой, t2v не годится: модель не отталкивается от вашего реального продукта и каждый раз придумывает похожий, но другой предмет. Маркетплейсы требуют, чтобы товар в карточке совпадал с реальным по цвету, форме и размеру, и генерация с нуля этого не гарантирует. Правильный инструмент здесь image-to-video, когда движение достраивается поверх настоящего фото товара: рецепт разобран в гайде оживить фото нейросетью.
Ещё три случая, где текстовая генерация проигрывает: сложная хореография с несколькими взаимодействующими персонажами (геометрия тел разваливается почти всегда), герой, который должен выглядеть идентично в десятке роликов без специальной identity-тренировки, и любая сцена, где важна юридически точная демонстрация реального объекта или процесса. Живая съёмка или i2v от настоящего кадра в этих случаях надёжнее.
Какой моделью генерировать видео по тексту
Подробное сравнение Veo, Kling, Wan и Seedance по критериям движения, консистентности и доступности в России собрано в пилларе нейросеть для видео 2026. Отдельный разбор Kling 3 с фокусом на нативный 4K и мультишот-режим здесь: Kling 3 и генерация видео в 4K. Все модели из этого гайда, включая Wan 2.7 как модель по умолчанию, доступны в каталоге InPersona в режимах t2v, i2v и v2v под одним балансом.
FAQ
Чем text-to-video отличается от image-to-video?
T2v строит ролик с нуля по описанию, i2v достраивает движение поверх готового фото. T2v даёт больше свободы в сцене, i2v даёт предсказуемый результат, потому что герой и композиция уже зафиксированы кадром.
Сколько стоит сгенерировать один ролик по тексту?
Порядок цен у большинства провайдеров, от 3–5 центов за секунду в лёгком режиме до 30–40 центов за секунду во флагманском со звуком и 4K. У моделей с фиксированной ценой за генерацию, например Gemini Omni Flash, длина ролика в пределах лимита на итоговую стоимость не влияет.
Можно ли получить в ролике читаемый текст или логотип?
Стабильно нет: буквы почти всегда рассыпаются или искажаются. Логотип и подписи надёжнее добавить поверх готового клипа на монтаже, а не просить модель нарисовать их напрямую.
Нужно ли писать описание на английском?
Необязательно. Крупные модели 2026 года, включая Veo, Kling и Wan, понимают запрос на русском, хотя операторские термины вроде push-in или pan иногда срабатывают точнее на английском, потому что их больше в обучающих данных.
Как сделать ролик длиннее лимита одной генерации?
Двумя способами: продлить готовый клип, взяв его последний кадр стартом для следующего сегмента, либо изначально задать первый и последний кадр сцены, если модель поддерживает такой режим (Kling 3, Veo 3.1, Wan 2.7 умеют оба варианта). Итоговый ролик почти всегда собирается монтажом из нескольких сегментов.
Чеклист перед генерацией
- В описании закрыты все пять слоёв: сцена, субъект и действие, камера, свет и настроение, стиль.
- Одно главное действие и одно движение камеры на клип, не два.
- Прописано, что должно оставаться неподвижным.
- Для ролика длиннее лимита заранее выбран способ склейки: продление или первый/последний кадр.
- Если нужен диалог или звук, модель выбрана заранее (Kling 3 Omni или Veo 3.1), а не после генерации.
- Точный товар в кадре не доверен t2v: для реального продукта используется i2v от фото.
- Текст и логотип не встроены в промпт, а добавляются на монтаже.
- Первый прогон короткий и дешёвый, финальное разрешение поднимается только на утверждённом варианте.
Генерация видео по тексту хорошо снимает нагрузку там, где съёмочной группы никогда и не было: атмосферные вставки, тизеры, абстрактный фон под бренд-контент. Если хотите собрать такой ролик и сразу сравнить, как одно и то же описание выглядит в разных моделях, в InPersona Kling 3, Veo 3.1, Wan 2.7 и Gemini Omni Flash работают в одном окне, под одним балансом, без отдельной подписки на каждый сервис.