Seedance 2.5 в Genosai: ролик до 30 секунд, который говорит вашим голосом
Обновлено: 14 августа 2026 г.
Seedance 2.5 в Genosai: ролик до 30 секунд, который говорит вашим голосом
Ребят, у нас в Студии появилась Seedance 2.5 — свежий флагман ByteDance. Главное отличие от всего, что было раньше: модель принимает не только текст и одну картинку, а сразу пачку референсов — фотографии, видео и вашу собственную звукозапись — и собирает из них цельную сцену.
Ролик до 30 секунд одним проходом
Длительность — от 4 до 30 секунд. Это не склейка из кусочков по пять секунд: сцена держится целиком, герой не «плывёт» и не меняет лицо к концу ролика. Форматы — 16:9, 9:16, 1:1, 4:3, 3:4, 21:9 и адаптивный, разрешение 480p или 720p.
Ваш голос в кадре
Запишите себя на телефон, приложите файл (MP3 или WAV, до 30 секунд) — и герой заговорит этим голосом, попадая в артикуляцию. Липсинк работает больше чем на десяти языках, включая русский. Звуковых дорожек можно приложить до десяти, суммарно до 30 секунд.
Один нюанс: аудио-референс работает только вместе с фото- или видео-референсом. Звук сам по себе — ещё не сцена, модели нужно понимать, кто именно говорит.
До 30 фотографий как референс
Лицо героя, костюм, продукт, локация, стиль кадра — всё это можно показать картинками, а не выписывать словами в промпте. Модель удерживает всё принесённое согласованным на протяжении всего ролика, а не только первые пару секунд. Для брендового контента это ключевое: логотип, персонаж и упаковка остаются узнаваемыми все 30 секунд.
Видео-референсы — и они же дешевле
До десяти видео, каждое от 2 до 30 секунд, суммарно до 30 секунд. Так переносится то, что словами почти не описать: манера движения, походка, траектория камеры. Приятный побочный эффект — с видео-референсом генерация стоит заметно дешевле.
Сколько стоит
| Режим | Токенов за секунду |
|---|---|
| 480p | 22 |
| 720p | 50 |
| 480p с видео-референсом | 14 |
| 720p с видео-референсом | 30 |
Десятисекундный ролик в 720p — 500 токенов, он же с видео-референсом — 300.
С чего начать
Модель не из дешёвых, поэтому схема та же, что и всегда: сначала черновик на 4–5 секунд в 480p, проверяете, что герой и сцена собрались как надо, и только потом гоняете полную длину в 720p. Референсы при этом стоит давать не «на всякий случай», а по делу: одно фото на внешность, одно видео на движение, одна дорожка на голос — так модель понимает задачу точнее, чем от тридцати похожих картинок.
Подробный разбор возможностей — на странице модели. Попробовать — в Студии.