Как сделать говорящее видео из одной фотографии
Видеоаватар Genosai превращает фотографию человека в говорящий ролик: персонаж произносит ваш текст с движением губ и мимикой. Голос генерирует сама видеомодель, отдельная озвучка и микрофон не нужны. Длинный текст агент сам делит на сцены и склеивает в один файл.
Обновлено: 31 июля 2026 г.
- Ни камеры, ни микрофона — Нужна одна фотография и текст. Снимать себя, ставить свет и записывать голос не требуется.
- Голос внутри видеомодели — Персонажа озвучивает та же модель, что рисует видео. Отдельно заказывать дикторов или писать звук не нужно.
- Ролик любой длины — Одна сцена — до пятнадцати секунд, но длинный текст агент делит по законченным фразам и склеивает в один файл.
- Аватар можно нарисовать — Своего фото нет — опишите внешность, и студия создаст персонажа. Он останется одинаковым во всех ваших роликах.
- Одна смета на весь пакет — Стоимость всех сцен, музыки и финальной склейки показывается сразу после брифа, до начала работы.
- Хронометраж считает агент — Длину сцен он выводит из текста по скорости речи и показывает расчёт построчно. Секунды называть не нужно.
Пошаговая инструкция
1. Шаг 1. Заводим аккаунт
Откройте сайт Genosai и зарегистрируйтесь по почте или через быстрый вход. Регистрация бесплатная, карту привязывать не нужно. Новым пользователям начисляется небольшой стартовый баланс кредитов, чтобы попробовать сервис.
2. Шаг 2. Заходим в студию
После входа вы попадаете в студию — это ваше рабочее место. Наверху есть вкладка «Агенты». Нажмите на неё: здесь живут готовые помощники, каждый под свою задачу.
3. Шаг 3. Находим Видеоаватар
В галерее агентов выберите категорию «Видео» или введите в поиске слово «аватар». Нажмите на карточку с говорящей головой — откроется чат. Каждый агент работает в отдельном диалоге и помнит только свою задачу.
4. Шаг 4. Присылаем текст и формат
Агент спросит три вещи: текст, который персонаж произнесёт дословно, формат — вертикальный 9:16 или горизонтальный 16:9, и нужна ли музыкальная подложка. Всё можно прислать одним сообщением.
5. Шаг 5. Прикладываем фото
Нажмите скрепку и выберите снимок: человек анфас, лицо хорошо видно, взгляд в камеру, ровный свет. Профиль, групповые фото и тёмные очки не подойдут. Своего фото нет — опишите внешность, и студия нарисует аватара на утверждение.
Лицо должно быть видно анфас. От качества снимка напрямую зависит, насколько правдоподобно будут двигаться губы.
6. Шаг 6. Смотрим расчёт хронометража
Агент посчитает длину сам: речь идёт примерно по тринадцать символов в секунду. Он покажет расчёт построчно — «Сцена 1 — 118 символов ≈ 10 секунд». Секунды называть не нужно, а чтобы ролик стал короче, сокращают текст.
7. Шаг 7. Проверяем баланс кредитов
Кредиты — это внутренняя валюта сервиса, ими оплачивается генерация. Баланс виден в шапке студии, там же кнопка пополнения. Видео тратит заметно больше кредитов, чем картинки, поэтому загляните сюда до запуска.
8. Шаг 8. Подтверждаем смету
Смета здесь одна на весь пакет сразу: все сцены, музыка по желанию и финальная склейка. Это удобно — итоговая сумма видна до начала работы. Пока вы не нажали «Подтвердить», не списывается ничего.
Подтверждение принимает система, а не агент. Нажмите кнопку на карточке или напишите одно слово «подтверждаю».
9. Шаг 9. Ждём сцены
После подтверждения студия снимает сцены по очереди. Каждая считается несколько минут: модель одновременно рисует кадры и синхронизирует губы с речью. Вкладку можно закрыть и вернуться позже, работа не прервётся.
10. Шаг 10. Забираем готовый ролик
Монтажная склеит сцены в один файл и пришлёт его в чат. Нажмите на ролик, чтобы открыть на весь экран и скачать. Если какая-то сцена не понравилась, скажите словами — агент пересоздаст только её по отдельной смете.
Что делает агент
Видеоаватар Genosai превращает фотографию человека в говорящий ролик. Вы присылаете снимок и текст, а на выходе получаете видео, где персонаж произносит ваши слова — с движением губ, мимикой и голосом.
Голос здесь генерирует сама видеомодель вместе с изображением. Это важно понимать сразу: отдельной озвучки, выбора дикторов и записи с микрофона в этом агенте нет и не будет. Модель сама решает, как звучит персонаж, исходя из его внешности и текста. Если вам нужен конкретный голос или своя запись, это другая задача и другой инструмент.
Фото может быть вашим или созданным. Если снимка нет, скажите, как должен выглядеть персонаж, — студия нарисует аватара по описанию, покажет на утверждение и дальше будет использовать его.
Одна сцена длится не больше пятнадцати секунд, но длина ролика не ограничена: длинный текст агент сам делит на смысловые куски, снимает по сцене на каждый и склеивает в один файл. Формат — вертикальный 9:16 или горизонтальный 16:9.
Кому подходит
Экспертам, которые ведут соцсети, но не хотят или не могут сниматься. Записать видео мешает многое: нет света, нет времени, неудобно дома, не нравится собственный голос. Здесь достаточно одной фотографии.
Тем, кто делает контент на потоке: анонсы, ответы на вопросы, короткие советы. Текст пишется за пять минут, ролик собирается без камеры и монтажа.
Компаниям — для обращений, инструкций и приветственных видео на сайте. Онлайн-школам — для уроков и объявлений. Тем, кто ведёт несколько языков: текст меняется, персонаж остаётся тем же.
И отдельно — тем, кому нужен вымышленный ведущий. Аватар можно нарисовать с нуля, и он не будет ни на кого похож, зато останется одинаковым во всех роликах.
Что нужно подготовить заранее
Подготовка занимает пару минут, но экономит переписку.
Первое — текст. Именно тот, что персонаж произнесёт, дословно. Не тезисы и не план, а готовая речь. Пишите так, как говорите вслух: короткими фразами, без сложных придаточных и без сокращений вроде «т.д.» — модель проговорит их буквально.
Второе — фотография. Человек в кадре анфас, лицо хорошо видно, взгляд в камеру, ровный свет. Групповые снимки, профиль и фото в тёмных очках не подойдут. Если своего фото нет, приготовьте описание внешности будущего аватара.
Третье — формат. Вертикальный 9:16 для Reels, Shorts и сторис, горизонтальный 16:9 для сайта и YouTube.
Четвёртое — нужна ли музыкальная подложка. Если да, скажите настроение или стиль, агент предложит два варианта на выбор.
Про длину подсказка: речь идёт со скоростью примерно тринадцать символов в секунду. Текст до ста восьмидесяти символов — это одна сцена. Тысяча символов — примерно полторы минуты готового ролика. Считать самому не нужно, агент посчитает и покажет расчёт, но прикинуть объём заранее полезно.
Если текста ещё нет, его удобно написать у копирайтера или собрать сценарий у сценариста Reels и Shorts, а сюда принести готовую речь.
Пошаговый разбор диалога
Ниже реальная последовательность реплик, чтобы вы понимали, чего ждать.
Агент: Привет! Я — Видеоаватар Genosai: превращаю фото в говорящий ролик. Персонаж сам произнесёт ваш текст — голос генерирует видеомодель, отдельная озвучка не нужна. Чтобы начать, пришлите текст, формат и фото (или референс для аватара).
Вы: Фото прикладываю. Формат вертикальный. Текст: «Друзья, в четверг разбираем, как считать себестоимость товара на маркетплейсе. Покажу свою таблицу и три ошибки, из-за которых продавцы работают в минус. Ссылка на регистрацию в закреплённом сообщении.» Музыку не надо.
Агент: Фото принял. Считаю хронометраж: Сцена 1 — 118 симв. ≈ 10 сек. Сцена 2 — 112 симв. ≈ 10 сек. Сцена 3 — 62 симв. ≈ 6 сек.
Три сцены, итого около двадцати шести секунд. Смотрите смету — она одна на весь пакет, включая финальную склейку. До подтверждения не спишется ничего.
Вы: А можно короче?
Агент: Сокращаю текст, хронометраж пересчитается автоматически. Вариант: «В четверг разбираем себестоимость товара на маркетплейсе. Покажу таблицу и три ошибки, из-за которых продавцы работают в минус. Регистрация в закрепе.» Это две сцены, около восемнадцати секунд. Подходит?
Вы: Да, подтверждаю.
Агент: Запускаю сцены… Готово, монтажная склеила ролик. Держите файл.
Обратите внимание на две вещи. Секунды у вас никто не спрашивает — длину агент считает сам из текста, и чтобы сделать ролик короче, сокращают именно текст. И смета здесь одна на весь пакет сразу, а не по этапам: так удобнее, видно итоговую сумму до начала работы.
Сколько это стоит
Фиксированной цены нет. Стоимость зависит от количества сцен, их длины, от того, рисуем ли мы аватара с нуля, и заказана ли музыка. Финальная склейка тоже входит в смету отдельной строкой, цена у неё фиксированная и небольшая.
Смета одна на весь пакет и показывается сразу после брифа. Это удобно: вы видите полную сумму до того, как что-либо запустится.
Переписка стоит копейки — править текст, сокращать и переписывать можно сколько угодно. Кредиты уходят только на генерацию. Видео дороже картинок в разы, потому что модель рисует десятки кадров в секунду плюс синхронизирует губы с речью.
Главный рычаг экономии здесь — длина текста. Ролик из двух сцен стоит вдвое дешевле ролика из четырёх. Если сумма великовата, сокращайте речь: агент пересчитает хронометраж и смету.
Пока вы не нажали «Подтвердить», с баланса не списывается ничего.
Частые ошибки новичков
Просят выбрать голос или прислать свою озвучку. В этом агенте такой возможности нет: голос неотделим от видео, его генерирует та же модель. Это не ограничение настроек, а устройство технологии.
Присылают тезисы вместо речи. Агент произнесёт ровно то, что вы написали. План из пунктов превратится в зачитывание пунктов вслух.
Прикладывают неудачное фото: профиль, групповой снимок, тёмные очки, лицо в тени. Модели нужно видеть лицо анфас, иначе губы будут двигаться неправдоподобно.
Оставляют в тексте сокращения, цифры и латиницу. «В 2 раза», «ул.», «HR» модель проговорит буквально или странно. Пишите словами: «в два раза», «улица», «эйчар».
Пытаются задать длину в секундах. Длину определяет текст, а не пожелание. Хотите короче — сокращайте речь.
Заказывают один длинный монолог на три минуты. Технически это соберётся, но смотреть говорящую голову дольше минуты тяжело. Лучше разбить на несколько роликов.
Чем этот способ удобнее, чем делать самому
Можно взять видеомодель напрямую и попробовать оживить фото. Но тогда придётся самому считать, сколько секунд занимает каждая фраза, резать текст по смыслу так, чтобы куски не обрывались на середине мысли, следить за пределом в пятнадцать секунд на сцену и потом склеивать файлы.
Агент делает это арифметически: считает символы, делит текст по законченным фразам, назначает длительность каждой сцене и сам собирает финальный файл.
Второе преимущество — предсказуемость расходов. Смета одна и показывается до начала работы, а не накапливается по ходу. Вы заранее видите, во что обойдётся ролик, и можете сократить текст, пока это ничего не стоит.
С какими агентами сочетается
Говорящий ролик обычно часть более крупной задачи, поэтому рядом работают другие помощники.
Текст для аватара удобно собрать у копирайтера, а короткий сценарий под ленту — у сценариста Reels и Shorts. Подпись к публикации напишет SMM-пост, письмо для рассылки — email-рассылка.
Если нужен не говорящий человек, а рекламный ролик о товаре, посмотрите видеорежиссёра — он делает полноценный ролик из фотографии продукта. Для живой рекламы «как снял покупатель» подойдёт UGC-видеореклама, а для обучающего формата — обучающее видео. Хороший портрет для аватара можно сделать через деловой портрет.
Полный список помощников с описаниями собран на странице все агенты — там же видно, какие из них работают с видео, а какие с текстом и картинками.
FAQ
Можно ли выбрать голос или прислать свою озвучку
Нет. Голос неотделим от видео: его генерирует та же модель, которая рисует персонажа, исходя из внешности и текста. Выбора дикторов, загрузки своей записи и работы с микрофоном в этом агенте не существует. Это устройство технологии, а не настройка.
Какое фото подойдёт
Человек анфас, лицо хорошо видно, взгляд в камеру, ровный свет, без тёмных очков. Профиль, групповые снимки и фотографии в тени не годятся: модели нужно видеть лицо, иначе губы будут двигаться неправдоподобно.
Что если своей фотографии нет
Опишите, как должен выглядеть персонаж, и студия нарисует аватара, покажет на утверждение и дальше будет использовать его. Такой персонаж не похож ни на кого конкретного и остаётся одинаковым во всех ваших роликах.
Как задать длину ролика
Никак напрямую — длину определяет текст. Речь идёт примерно по тринадцать символов в секунду, и агент считает хронометраж сам. Чтобы ролик стал короче, сокращают речь, а не называют секунды.
Какой длины бывает ролик
Одна сцена — не больше пятнадцати секунд, но общая длина не ограничена: длинный текст делится по законченным фразам и склеивается в один файл. Тысяча символов — это примерно полторы минуты готового видео.
Почему нельзя писать сокращения и цифры
Модель проговаривает текст буквально. «В 2 раза», «ул.» и латиница вроде HR прозвучат странно или неправильно. Пишите словами: «в два раза», «улица», «эйчар».
Сколько это стоит в деньгах
Фиксированной цены нет: сумма зависит от количества сцен, их длины, от того, рисуем ли мы аватара, и заказана ли музыка. Смета одна на весь пакет и показывается до начала работы, деньги списываются только после подтверждения.