Wan 3.0 в Genosai — 30 секунд видео со звуком от Alibaba

Wan 3.0 — новая флагманская видеомодель Alibaba, доступная в Genosai. Она генерирует связный ролик длительностью от 2 до 30 секунд одним проходом, создаёт звуковую дорожку и речь вместе с картинкой, принимает до 10 изображений-референсов и удерживает героя и продукт узнаваемыми на протяжении всей сцены. В Genosai модель работает онлайн — без аккаунта разработчика, VPN и настройки API, от 8 кредитов за секунду.

Обновлено: 31 августа 2026 г.

Содержание

Что такое Wan 3.0

Wan 3.0 — флагманская видеомодель Alibaba, разработанная той же командой Tongyi, что делает открытую линейку Wan и языковые модели Qwen. Публичная бета открылась 6 августа 2026 года на Alibaba Cloud Model Studio, а официальный запуск состоялся 24 августа — на следующий день после того, как Alibaba привлекла 10,2 миллиарда долларов на развитие ИИ-направления. Уже за время беты модель успели обкатать в производстве короткометражных драм, рекламе, туристических промо и музыкальных клипах.

Главный козырь Wan 3.0 — длина и связность сцены. Модель выдаёт до 30 секунд видео одним проходом, вдвое больше, чем предыдущая Wan 2.7, и при этом держит героя, продукт и окружение узнаваемыми от первого кадра до последнего. Звук — шумы, музыка и многоязычная речь — генерируется вместе с картинкой, а не накладывается потом. По уровню детализации лиц, читаемости интерфейсов и стабильности движения это один из самых сильных релизов лета 2026 года.

В Genosai модель работает онлайн: не нужны аккаунт разработчика Alibaba Cloud, ключи API или VPN. Вы открываете видеостудию в браузере, описываете сцену по-русски или по-английски — и получаете готовый ролик со звуком. Тарификация посекундная, от 8 кредитов за секунду.

Возможности

Wan 3.0 закрывает типовые задачи короткого видеопроизводства — от черновика идеи до вертикального ролика с озвучкой. Вот что модель умеет в Genosai.

Длинная связная сцена

Слайдер длительности — от 2 до 30 секунд с шагом в секунду. Большинство моделей ограничены 8–15 секундами за проход: Veo 3.1 — 8 секунд, Kling 3.0 — 15. Тридцатисекундная сцена без склеек — редкость, которую кроме Wan 3.0 в Genosai умеет только Seedance 2.5. Для двухсекундных тестов идеи есть другой полюс слайдера: такой черновик в 480p стоит всего 16 кредитов.

Референсы героя и продукта

В режиме референсов модель принимает до 10 изображений за генерацию. У Alibaba эта технология называется Omni-Reference: персонаж, товар или декорация, заданные картинками, остаются собой в каждом кадре — серия планов читается как один материал, а не набор случайных дублей. Для брендового контента это ключевая функция: логотип и продукт не «плывут» от сцены к сцене.

Звук и речь в один проход

Звуковая дорожка генерируется вместе с видео: городской шум, потрескивание печи, фоновая музыка, реплики героев. Речь многоязычная — включая русский: короткая говорящая сцена получается целиком за одну генерацию, без отдельной озвучки и монтажа. Если звук не нужен, он отключается тумблером — на цену это не влияет, зато результат предсказуемее для беззвучных лент.

Первый и последний кадр

Классический режим кадровых ограничений: загружаете стартовое изображение, при желании — финальное, и модель строит плавный переход между ними. Удобно для оживления статичных кадров, зацикленных клипов и точного контроля композиции. Пропорции в этом режиме лучше оставлять в положении adaptive — их задаёт сама картинка.

Аудиореференсы и форматы

Помимо картинок модель принимает до 5 аудиофайлов суммарной длительностью до 15 секунд — голос или музыку, на которые должна опираться звуковая дорожка ролика. Так удобно задавать тембр диктора или настроение фоновой музыки, не описывая их словами. Форматы кадра — 16:9, 4:3, 1:1, 3:4, 9:16 и adaptive, когда модель сама подбирает пропорции под сцену и загруженные референсы: для вертикальных лент выбирайте 9:16, для обзоров и презентаций — классический 16:9.

Примеры и промпты

Ниже — реальные генерации: промпт и ролик, который Wan 3.0 сделала по нему в Genosai с первого раза, без выбора из вариантов. Все три примера — дешёвые черновики в 480p.

Кинематографичная городская сцена со звуком дождя, 16:9, 8 секунд:

Ночной мегаполис под дождём: неоновые вывески отражаются в мокром асфальте, мимо камеры проезжает жёлтое такси, брызги из-под колёс в замедленной съёмке, кинематографичный вид, плавный проезд камеры вперёд. Звук: шум дождя, далёкий гул города.

Ночной город под дождём, 16:9, 8 секунд — сгенерировано в Genosai.io моделью Wan 3.0

Речь на русском языке, сгенерированная вместе с видео, 16:9, 8 секунд:

Уютная кухня утром, пожилой пекарь в фартуке достаёт из печи противень с круассанами, смотрит в камеру, улыбается и говорит по-русски: «Свежее — только из печи!». Тёплый свет, лёгкий пар над выпечкой. Звук: голос пекаря, потрескивание печи.

Пекарь с репликой на русском, 16:9, 8 секунд — сгенерировано в Genosai.io моделью Wan 3.0

Вертикальный продуктовый ролик для соцсетей, 9:16, 6 секунд:

Вертикальный ролик для соцсетей: капля мёда медленно стекает по стопке пышных панкейков, макросъёмка, мягкий утренний свет из окна, глубина резкости, аппетитная реклама завтрака. Звук: лёгкая фоновая музыка.

Мёд и панкейки, 9:16, 6 секунд — сгенерировано в Genosai.io моделью Wan 3.0

Несколько правил, которые улучшают результат. Описывайте сцену конкретно: субъект, действие, свет, движение камеры и отдельно — звук, который хотите услышать. Для роликов длиннее 10 секунд расписывайте действие по отрезкам времени, иначе модель может «зациклить» середину. Реплики героев берите в кавычки и указывайте язык — так речь совпадает с артикуляцией заметно точнее.

Как пользоваться в Genosai

Запуск не требует настройки: всё происходит в браузере.

  1. Войдите в аккаунт Genosai и откройте видеостудию.
  2. В списке моделей выберите Wan 3.0.
  3. Выберите режим: текст в видео, первый и последний кадр или референсы.
  4. Опишите сцену и звук, при необходимости загрузите изображения и аудио.
  5. Задайте длительность слайдером, разрешение и формат кадра, затем запустите генерацию.
  6. Скачайте ролик или уточните промпт и перегенерируйте.

Стоимость генерации

Тарификация посекундная и зависит от разрешения: 8 кредитов за секунду в 480p, 16 — в 720p, 32 — в 1080p. Пятисекундный черновик в 480p стоит 40 кредитов, восьмисекундный — 64, а полный 30-секундный ролик в 1080p — 960 кредитов. Для сравнения: официальный API Alibaba берёт 5, 10 и 20 центов за секунду — тарифы Genosai на 20 процентов ниже. Точная стоимость показывается на кнопке перед запуском каждой генерации, актуальные пакеты кредитов — в разделе Тарифы. Стартовые кредиты после регистрации позволяют попробовать модель бесплатно, пополнение доступно российскими картами без VPN.

Практичная стратегия — отлаживать композицию и ритм на черновиках в 480p, а финальную версию собирать в 1080p: тот же промпт, вчетверо дороже, но только один раз.

Сравнение

Против Seedance 2.5: обе модели выдают 30 секунд одним проходом со звуком. Seedance берёт количеством референсов (до 50 файлов, включая видео) и монтажными функциями, Wan 3.0 — более низкой ценой черновиков: 8 кредитов за секунду в 480p против 22 у Seedance. Если нужен дешёвый длинный черновик или продуктовый ролик с парой референсов — начните с Wan 3.0; если проект держится на десятках референсов и правках по таймкодам — берите Seedance.

Против Kling 3.0: Kling ограничен 15 секундами, но силён в динамике движения и мультишотах. Против Veo 3.1 Fast: Veo делает эффектные 8-секундные клипы с озвучкой, но 8 секунд — потолок. Когда сцене нужно «дышать» дольше — сторителлинг, обзор товара, туристическое промо — Wan 3.0 выигрывает за счёт длины и цены. А для мультимодальных сцен с видеовходом посмотрите на Gemini Omni 1.1 Flash.

Ограничения и советы

Сама модель Alibaba принимает ещё и видео, веб-страницы, PDF и презентации как источники сцены, но в Genosai эти входы пока не выведены: доступны текст, первый и последний кадр, до 10 изображений и до 5 аудиофайлов. Видеореференсы не подключены осознанно — провайдер тарифицирует их по сумме длительностей входа и выхода, и честно показать такую цену на кнопке пока нельзя. Режим интеллектуальной длительности, когда модель сама решает, сколько должен идти ролик, тоже остался за бортом — длительность задаётся слайдером явно.

Практические советы: помните, что первый и последний кадр несовместимы с референсами — это разные сцены провайдера, студия подскажет. Аудиореференс без визуального модель не принимает: добавьте хотя бы одну картинку. Реплики на русском пишите в кавычках прямо в промпте. И начинайте с коротких черновиков в 480p — они в четыре раза дешевле финала и почти всегда достаточны, чтобы понять, куда движется сцена. Релиз свежий, лимиты могут уточняться — ориентируйтесь на фактический результат в студии.

FAQ

Что такое Wan 3.0 и кто её разработал?

Wan 3.0 — флагманская видеомодель Alibaba, вышедшая в публичную бету 6 августа 2026 года и официально запущенная 24 августа. Главные отличия — ролики до 30 секунд одним проходом, мультимодальные референсы и звук с речью, генерируемые вместе с картинкой. В Genosai она доступна онлайн без настройки API.

Чем Wan 3.0 отличается от Wan 2.7?

Вдвое большая длительность одним проходом (30 секунд против 15), консистентность героя и продукта между кадрами благодаря режиму референсов, интеллектуальный подбор длительности и более стабильная генерация лиц, интерфейсов и текстур.

Какой длины ролик умеет делать Wan 3.0?

От 2 до 30 секунд одним проходом — длительность задаётся слайдером с шагом в секунду. Это одна из двух моделей в Genosai, которые выдают 30-секундную связную сцену без склеек, вторая — Seedance 2.5.

Умеет ли Wan 3.0 генерировать звук и русскую речь?

Да. Звуковая дорожка — шумы, музыка и речь — создаётся в одном проходе с видео, речь работает на нескольких языках, включая русский. Звук можно отключить тумблером, если нужна только картинка.

Сколько стоит генерация Wan 3.0 в Genosai?

8 кредитов за секунду в 480p, 16 — в 720p и 32 — в 1080p. Пятисекундный черновик в 480p обойдётся в 40 кредитов, а 30-секундный ролик в 1080p — в 960. Это на 20 процентов ниже официального тарифа API Alibaba.

Какие форматы кадра поддерживаются?

16:9, 4:3, 1:1, 3:4, 9:16 и автоматический режим adaptive, когда модель сама подбирает пропорции под содержание сцены и референсы. Закрыты и YouTube, и вертикальные Reels с Shorts.

Можно ли использовать видео и документы как референсы?

Сама модель Alibaba принимает видео, PDF и презентации как источники, но в Genosai эти режимы пока не выведены: доступны текст, первый и последний кадр, до 10 изображений и до 5 аудиофайлов. Набор входов будет расширяться.

Попробовать Wan 3.0 в Genosai