Как создать видео в Veo 3.1

Veo 3.1 — видеомодель Google, та самая, о которой чаще всего спрашивают: она делает говорящего человека в кадре и держит русскую речь. В студии Genosai она живёт в трёх версиях — Lite, Fast и Quality, — и цена между младшей и старшей отличается больше чем в восемь раз. В этом уроке я прогнал один и тот же запрос через все три, сверил произнесённый текст через распознавание речи и проверил кликами, что влияет на цену: длительность ролика не влияет вообще, а разрешение меняет счёт в разы. Разбираем, какую версию брать под какую задачу. Урок 33 бесплатного видеокурса по нейросетям Genosai, 11:47 минут записи в живом кабинете.

Содержание

Видеоурок целиком

Как создать видео в Veo 3.1 — пошаговый гайд, промты и референсы — 11:47

Урок открыт без регистрации. Ниже — то же самое текстом: что разбирается, какие настройки нажимаются и сколько стоит каждый шаг.

Тайм-коды урока

Обзор урока

Какую версию Veo брать — Lite, Fast или Quality? Самый частый вопрос. В списке они стоят подряд, названия ничего не объясняют, а счёт за один и тот же восьмисекундный ролик отличается в восемь раз. Давайте разбираться — по кнопкам и по результату.

Veo 3.1 сделали в Google, и это одна из немногих видео-моделей, которая уверенно говорит по-русски. Проверять будем не по описаниям на сайте, а руками: один и тот же запрос уйдёт на все три версии, я сниму с роликов звук и через распознавание речи сверю, что героиня произнесла на самом деле. Потом разберём все три режима генерации — и тот, ради которого модель берут для рекламы. А по дороге покажу две настройки в форме, на которых люди молча теряют деньги.

Урок снят в живом кабинете Genosai: на экране те же кнопки и те же цены, которые вы увидите у себя после входа. Ничего не смонтировано задним числом — все результаты в кадре получены прямо во время записи.

Возможности и что вы научитесь делать

Как это выглядит по шагам

Открываем «Видео», выбираем Veo 3.1 Lite. Форма короткая: поле промпта, режим генерации, соотношение сторон, три разрешения — 720p, 1080p и 4K — и три кнопки длительности: четыре, шесть и восемь секунд. Внизу кнопка «Создать», и на ней сразу видна цена — тридцать токенов.

Здесь текст, который я уже вписал в поле «Промпт», — читаю дословно то, что у вас на экране. Продавщица в фартуке смотрит в камеру и говорит по-русски, чётко и дружелюбно: «Эта кружка держит тепло сорок минут. Проверено — кофе не остывает». Светлая кухня, мягкий дневной свет, кадр по пояс, губы точно совпадают с речью. Именно этот запрос, слово в слово, пойдёт на все три версии.

Прежде чем нажать «Создать», разберёмся с настройками. Первая — длительность. Переключаю на четыре секунды. Смотрите на кнопку «Создать»: тридцать токенов.

Теперь восемь секунд. Цена — те же тридцать токенов. И на шести тоже тридцать. Длительность у Veo вообще не влияет на стоимость: вы платите за факт генерации, а не за секунды. Вывод простой и денежный: брать четыре секунды бессмысленно, всегда ставьте восемь — получите вдвое больше материала за те же деньги.

А вот вторая настройка, и она на цену влияет. Разрешение. Сейчас выбрано 720p, на кнопке тридцать токенов. Запомните это число.

Переключаю на 1080p. Промпт тот же, длительность та же, поменял ровно одну кнопку — и на «Создать» уже тридцать пять токенов. То есть Full HD дороже всего на пять токенов. Это тот случай, когда экономить незачем: качество заметно выше, а переплата копеечная.

А теперь 4K. Сто пятьдесят токенов вместо тридцати — ровно в пять раз. Тот же промпт, та же длительность, изменилась одна кнопка. Вот где по-настоящему прячутся деньги: не в секундах, а в разрешении. Практика простая — работайте в 1080p, а 4K берите, только если ролик реально пойдёт на большой экран.

Сведём в одну табличку, каждую цифру я проверил кликом в студии. Lite: тридцать, тридцать пять и сто пятьдесят. Fast: шестьдесят, шестьдесят пять и сто восемьдесят. Quality: двести пятьдесят, двести пятьдесят пять и триста семьдесят. Закономерность одна на все три версии: переход с 720p на 1080p стоит копейки, а 4K — это скачок в разы.

Чтобы сравнение было честным, ставлю всем трём версиям одинаковые условия: 720p, восемь секунд, тот самый запрос про кружку. Жму «Создать» — сначала на Lite, потом ровно так же на Fast и на Quality. Смотрим и слушаем, что получилось.

Младшая версия. Человек в кадре живой, речь есть, губы двигаются в такт. Картинка при этом проще: фон читается как типовая кухня, детали мягкие. Для черновика и для проверки идеи — более чем достаточно.

Средняя версия, вдвое дороже. Картинка стала собраннее, движения спокойнее, кожа и ткань выглядят достовернее. Это уже уровень, который не стыдно поставить в сторис или в карточку товара.

И старшая. Разница видна в деталях: живая мимика, аккуратные пальцы на кружке, честный свет из окна, проработанный задний план. Именно за эти детали и берут восьмикратную цену — а не за саму способность сделать говорящего человека.

Теперь честная проверка, а не «на слух вроде по-русски». Я снял звук со всех трёх роликов и прогнал через распознавание речи. Первая фраза — «Эта кружка держит тепло сорок минут» — распозналась дословно во всех трёх версиях. То есть русский Veo действительно держит, и это редкость среди видео-моделей.

А дальше все три споткнулись в одном и том же месте — на стыке со второй фразой. Вместо «проверено, кофе не остывает» распознавание услышало обрывки: у Lite «проверено, гиридлете кофе не остывает», у Fast «проверена вина, двядя», у Quality «проверено, и гавата кофе не остывает». Заметьте: ошибка одинаковая у всех, значит дело не в версии, а в длине текста. Практический вывод: одна короткая реплика на ролик. Нужен длинный текст — режьте на несколько роликов по фразе.

Дальше в уроке ещё 10 шагов: остальные режимы, сравнение версий и разбор ошибок. Всё это показано в ролике выше — тайм-коды ниже помогут перейти сразу к нужному месту.

Пример запроса

Самая частая ошибка — описание из двух слов. Сравните. Так делать не стоит:

красивая картинка

А так модель понимает задачу и повторяет её из раза в раз:

Портрет молодой женщины у окна кафе, мягкий дневной свет, естественная кожа, неглубокая резкость, фотореализм

Порядок слов внутри описания почти не влияет, а вот конкретика влияет сильно: объект, обстановка, время суток, свет, ракурс и стиль. Удачное описание стоит сохранить кнопкой рядом с полем ввода — потом его можно подставить одним кликом и поменять только детали.

Сколько это стоит

И честная арифметика. Семь роликов по восемь секунд обошлись в пятьсот восемьдесят токенов, и двести пятьдесят из них — один-единственный на старшей версии. Рабочий ролик с говорящим человеком, русской речью и вашим товаром в кадре стоит шестьдесят токенов на Fast. И два правила на память: длительность цену не меняет — всегда берите восемь секунд, а разрешение меняет, и переход с 720p на 1080p стоит копейки, тогда как 4K умножает счёт в разы.

В уроке валюта названа кредитами — это то же самое, что токены в кабинете. Один токен равен одному рублю. Цена конкретной работы всегда написана прямо на кнопке запуска, до того как вы её нажали, а неизрасходованный баланс не сгорает.

Сравнение студий и агентов

Разница между студией и агентом — ключевая мысль всего курса. Студия даёт инструмент: вы сами придумываете идею, сами пишете описание и сами собираете куски в целое. Это дешевле и полностью под вашим контролем. Агент даёт готовый продукт: описываете задачу словами, он задаёт вопросы, показывает план и смету, а потом выполняет всю цепочку сам.

Практическое правило простое. Нужен один элемент — идите в студию. Нужен готовый материал под задачу — идите к агенту. Разница в цене есть, но она заметно меньше разницы в сэкономленном времени.

Кому пригодится

Урок для тех, кто выбирает модель под задачу и не хочет платить за перебор. После него понятно, чем эта нейросеть отличается от соседних в списке, на чём она сильна и где её брать не стоит. Это экономит больше всего токенов: самая частая трата новичка — не дорогая генерация, а десять дешёвых, запущенных не на той модели.

Отдельно урок полезен тем, кто делает картинки на поток: карточки товара, обложки, иллюстрации к постам и статьям. Там разница в цене между моделями складывается в заметные суммы за месяц, а качество на однотипных задачах отличается меньше, чем кажется по обзорам.

Ограничения и советы новичку

Описание из двух слов. Нейросеть не угадывает контекст: чем конкретнее задача, тем ближе результат. Работающая формула для картинки — что в кадре, где и когда происходит, какой свет, какой стиль, какие детали. Слова «качественно» и «красиво» можно смело выбрасывать, они не добавляют ничего.

Проверка текста на глаз. Любые надписи, которые нейросеть рисует внутри картинки, нужно перечитывать: даже сильные модели путают буквы в русских словах. Это разобрано в уроке про ChatGPT Image 2 — пока это единственная модель, которой можно доверить точный текст на макете.

Дорогой первый заход. Черновик всегда дешевле гонять на облегчённой модели и в невысоком разрешении, а хорошее качество включать, когда composition уже устраивает.

Как повторить у себя

Порядок для первого раза такой. Зарегистрируйтесь по почте или войдите одной кнопкой через Яндекс либо ВКонтакте — второй способ быстрее, пароль придумывать не нужно. Стартовые токены начислятся автоматически, их хватает, чтобы попробовать несколько генераций и ничего не платить.

Откройте нужную вкладку и повторяйте за уроком шаг в шаг, не меняя настроек. Когда результат совпадёт с тем, что в видео, начинайте подставлять свою задачу — так сразу видно, какая именно правка на что влияет. Готовые файлы никуда не денутся: всё, что вы создали, лежит в истории генераций с поиском по описанию и стоимостью каждой работы.

Ждать у экрана не нужно. Всё считается на сервере: вкладку можно закрыть и заняться другими делами, готовый файл придёт в историю и в уведомления.

С чем сравнить

Видео-моделей в студии несколько, и берут их под разные задачи. Соседний разбор — в уроке про Seedance 2. Соседний разбор — в уроке про Kling 3.0. Соседний разбор — в уроке про Hailuo 2.3. Цены и режимы у них отличаются сильно, так что перед платной генерацией стоит сверить хотя бы две.

Что смотреть дальше

Курс собран по порядку, от простого к сложному, но каждый урок самодостаточен.

Полное оглавление всех уроков — на странице бесплатного курса по нейросетям. Там же текстовая инструкция по кабинету и разбор того, чем студии отличаются от ИИ-агентов.

Если по этой теме нужен не разовый результат, а поток, начните с двух вещей. Первое — урок про фото-студию: там разобрана формула описания, которая работает во всех студиях сервиса. Второе — урок про ИИ-агентов: он объясняет, когда задачу выгоднее отдать агенту целиком, а когда собрать руками в студии и заплатить меньше.

И общий совет по курсу: не смотрите всё подряд. Возьмите блок, который нужен сейчас — фото-модели, видео, тексты, музыку или агентов, — пройдите его с повторением в своём кабинете, и только потом переходите к следующему. Так уроки складываются в навык, а не в список просмотренного.

FAQ

Сколько стоит урок?

Нисколько. Весь курс бесплатный: ролик каждого урока встроен прямо в страницу и продублирован текстом, смотреть можно без регистрации. Платить нужно только за собственные генерации в сервисе, и то после того, как закончатся стартовые токены.

Нужен ли опыт работы с нейросетями?

Нет. Уроки рассчитаны на человека, который открывает сервис впервые: показано, куда нажимать, что писать в описании и где смотреть цену до запуска.

Обязательно ли смотреть курс по порядку?

Не обязательно. Каждый урок самодостаточен, но первые уроки объясняют устройство кабинета и токены — с ними дальше проще.

Сколько идёт этот урок?

11:47 минут. Если повторять за ним в своём кабинете, закладывайте вдвое больше: генерации считаются на сервере от нескольких секунд до минуты.

Нужен ли VPN или зарубежная карта?

Нет. Genosai работает из России напрямую, интерфейс на русском, оплата обычной российской картой, отдельная подписка на каждую нейросеть не нужна.

Урок не устареет после обновления сервиса?

Интерфейс меняется постепенно, а логика остаётся: выбрать модель, описать задачу, проверить цену на кнопке, запустить. Когда изменения заметные, урок переснимается.

Попробовать Genosai в Genosai