Seedance 2.5 в Genosai: ролик до 30 секунд, который говорит вашим голосом

Обновлено: 14 августа 2026 г.

Seedance 2.5 в Genosai: ролик до 30 секунд, который говорит вашим голосом

Seedance 2.5 в Genosai: ролик до 30 секунд, который говорит вашим голосом

Ребят, у нас в Студии появилась Seedance 2.5 — свежий флагман ByteDance. Главное отличие от всего, что было раньше: модель принимает не только текст и одну картинку, а сразу пачку референсов — фотографии, видео и вашу собственную звукозапись — и собирает из них цельную сцену.

Ролик до 30 секунд одним проходом

Длительность — от 4 до 30 секунд. Это не склейка из кусочков по пять секунд: сцена держится целиком, герой не «плывёт» и не меняет лицо к концу ролика. Форматы — 16:9, 9:16, 1:1, 4:3, 3:4, 21:9 и адаптивный, разрешение 480p или 720p.

Ваш голос в кадре

Запишите себя на телефон, приложите файл (MP3 или WAV, до 30 секунд) — и герой заговорит этим голосом, попадая в артикуляцию. Липсинк работает больше чем на десяти языках, включая русский. Звуковых дорожек можно приложить до десяти, суммарно до 30 секунд.

Один нюанс: аудио-референс работает только вместе с фото- или видео-референсом. Звук сам по себе — ещё не сцена, модели нужно понимать, кто именно говорит.

До 30 фотографий как референс

Лицо героя, костюм, продукт, локация, стиль кадра — всё это можно показать картинками, а не выписывать словами в промпте. Модель удерживает всё принесённое согласованным на протяжении всего ролика, а не только первые пару секунд. Для брендового контента это ключевое: логотип, персонаж и упаковка остаются узнаваемыми все 30 секунд.

Видео-референсы — и они же дешевле

До десяти видео, каждое от 2 до 30 секунд, суммарно до 30 секунд. Так переносится то, что словами почти не описать: манера движения, походка, траектория камеры. Приятный побочный эффект — с видео-референсом генерация стоит заметно дешевле.

Сколько стоит

РежимТокенов за секунду
480p22
720p50
480p с видео-референсом14
720p с видео-референсом30

Десятисекундный ролик в 720p — 500 токенов, он же с видео-референсом — 300.

С чего начать

Модель не из дешёвых, поэтому схема та же, что и всегда: сначала черновик на 4–5 секунд в 480p, проверяете, что герой и сцена собрались как надо, и только потом гоняете полную длину в 720p. Референсы при этом стоит давать не «на всякий случай», а по делу: одно фото на внешность, одно видео на движение, одна дорожка на голос — так модель понимает задачу точнее, чем от тридцати похожих картинок.

Подробный разбор возможностей — на странице модели. Попробовать — в Студии.

Все статьи блога Genosai