Seedance 2.5 в Genosai: ролик до 30 секунд, который говорит вашим голосом
Обновлено: 14 августа 2026 г.
<h1>Seedance 2.5 в Genosai: ролик до 30 секунд, который говорит вашим голосом</h1>
<p>Ребят, у нас в Студии появилась Seedance 2.5 — свежий флагман ByteDance. Главное отличие от всего, что было раньше: модель принимает не только текст и одну картинку, а сразу пачку референсов — фотографии, видео и вашу собственную звукозапись — и собирает из них цельную сцену.</p>
<h2>Ролик до 30 секунд одним проходом</h2>
<p>Длительность — от 4 до 30 секунд. Это не склейка из кусочков по пять секунд: сцена держится целиком, герой не «плывёт» и не меняет лицо к концу ролика. Форматы — 16:9, 9:16, 1:1, 4:3, 3:4, 21:9 и адаптивный, разрешение 480p или 720p.</p>
<h2>Ваш голос в кадре</h2>
<p>Запишите себя на телефон, приложите файл (MP3 или WAV, до 30 секунд) — и герой заговорит этим голосом, попадая в артикуляцию. Липсинк работает больше чем на десяти языках, включая русский. Звуковых дорожек можно приложить до десяти, суммарно до 30 секунд.</p>
<p>Один нюанс: аудио-референс работает только вместе с фото- или видео-референсом. Звук сам по себе — ещё не сцена, модели нужно понимать, кто именно говорит.</p>
<h2>До 30 фотографий как референс</h2>
<p>Лицо героя, костюм, продукт, локация, стиль кадра — всё это можно показать картинками, а не выписывать словами в промпте. Модель удерживает всё принесённое согласованным на протяжении всего ролика, а не только первые пару секунд. Для брендового контента это ключевое: логотип, персонаж и упаковка остаются узнаваемыми все 30 секунд.</p>
<h2>Видео-референсы — и они же дешевле</h2>
<p>До десяти видео, каждое от 2 до 30 секунд, суммарно до 30 секунд. Так переносится то, что словами почти не описать: манера движения, походка, траектория камеры. Приятный побочный эффект — с видео-референсом генерация стоит заметно дешевле.</p>
<h2>Сколько стоит</h2>
<table> <thead> <tr><th>Режим</th><th>Токенов за секунду</th></tr> </thead> <tbody> <tr><td>480p</td><td>22</td></tr> <tr><td>720p</td><td>50</td></tr> <tr><td>480p с видео-референсом</td><td><strong>14</strong></td></tr> <tr><td>720p с видео-референсом</td><td><strong>30</strong></td></tr> </tbody> </table>
<p>Десятисекундный ролик в 720p — 500 токенов, он же с видео-референсом — 300.</p>
<h2>С чего начать</h2>
<p>Модель не из дешёвых, поэтому схема та же, что и всегда: сначала черновик на 4–5 секунд в 480p, проверяете, что герой и сцена собрались как надо, и только потом гоняете полную длину в 720p. Референсы при этом стоит давать не «на всякий случай», а по делу: одно фото на внешность, одно видео на движение, одна дорожка на голос — так модель понимает задачу точнее, чем от тридцати похожих картинок.</p>
<p>Подробный разбор возможностей — <a href="/seedance-2-5">на странице модели</a>. Попробовать — <a href="/studio">в Студии</a>.</p>