Все статьи
Wan 3.0 в Gensta: как создавать видео до 30 секунд со звуком

Wan 3.0 в Gensta: как создавать видео до 30 секунд со звуком

Wan 3.0 доступна в Gensta для видео по тексту, анимации первого или первого и последнего кадров и работы с мультимодальными референсами. Разбираем настройки, ограничения, цену и промпты.

Wan 3.0 доступна в Gensta

Wan 3.0 доступна в публичном генераторе Gensta. Можно выбрать модель и запустить видео по тексту, видео из изображения (первый или первый и последний кадр) и видео по мультимодальным референсам.

В текущей интеграции Gensta: разрешения 480p, 720p и 1080p; длительность 5, 10, 15, 20 или 30 секунд; синхронизированный звук (можно отключить без изменения цены); опциональный режим глубокого мышления для сложных промптов (цена та же, генерация дольше). Для одного задания — до 10 изображений, 5 видео и 5 аудио, всего до 20 файлов.

У WaveSpeed / Alibaba для режима референсов действуют отдельные лимиты: сумма входных видео не больше 15 секунд, сумма входных аудио не больше 15 секунд, и при видеореференсах сумма входного видео плюс длительность результата не больше 30 секунд. Форма Gensta сейчас проверяет сумму входных видео до 15 секунд и длительность каждого аудиофайла; она пока не уменьшает доступный хронометраж результата автоматически.

Alibaba Cloud публикует Wan 3.0 как единую модель для текста, кадров и мультимодальных входов. Документы, веб-страницы, отдельное редактирование и продолжение в публичном интерфейсе Gensta для Wan 3.0 пока не вынесены как отдельные режимы.

Попробовать Wan 3.0 в Gensta

Что официально умеет Wan 3.0

Официальный API описывает три основных способа начать генерацию. В режиме text-to-video достаточно текстового режиссёрского задания. В image-to-video одно изображение задаёт первый кадр, а пара изображений может зафиксировать первый и последний кадры. В reference-based generation изображения, видео и аудио используются не как буквальное начало ролика, а как материалы для внешности героев, предметов, пространства, движения и звука.

Без входного видео Wan 3.0 создаёт ролики длительностью от 2 до 30 секунд и поддерживает 480P, 720P и 1080P при 30 кадрах/с. При видеореференсах действует дополнительное правило: суммарная длительность входных видео плюс длительность результата не должна превышать 30 секунд. Alibaba описывает совместную генерацию видеоряда, диалога, фоновой музыки и звуковых эффектов. В официальном API звук можно включать и выключать; изменение этой настройки само по себе не меняет vendor-тариф.

Для мультимодального задания документация разрешает до 10 изображений, 5 видео и 5 аудиофрагментов. Суммарная длительность видеореференсов — не более 15 секунд; для аудиореференсов действует такой же суммарный предел. Ограничение «входное видео + результат ≤ 30 секунд» применяется одновременно. Alibaba также поддерживает файл или ссылку на веб-страницу и описывает редактирование и продолжение видео. Это возможности vendor workflow, а не обещание, что каждый из этих входов уже появится в Gensta.

Какие режимы и лимиты доступны в Gensta

На 2026-08-28 в Gensta для Wan 3.0 открыты три режима: видео по тексту, видео из одного или двух кадров и видео по мультимодальным референсам. Интерфейс предлагает 480p / 720p / 1080p, длительности 5–30 секунд, звук и глубокое мышление. Максимум одного задания: до 10 фото, 5 видео, 5 аудио, всего до 20 файлов. Сумма входных видео ограничена 15 секундами, сумма входных аудио — тоже 15 секундами, а входное видео вместе с результатом должно укладываться в 30 секунд; эти правила проверяет и форма, и сервер перед списанием. Видеореференс влияет на цену: его секунды тарифицируются по той же ставке, что и секунды результата.

Параметры могут измениться, поэтому перед генерацией проверяйте итоговую форму и сумму списания.

Как выбрать режим: текст, первый кадр или референсы

Видео по тексту подходит для свободной сцены, когда важнее идея, действие и камера, чем точное совпадение с готовым персонажем или товаром. В промпте задайте формат, хронометраж, место, героя, последовательность действий, движение камеры и звук.

Один первый кадр полезен, когда композиция уже найдена: например, есть предметная фотография, иллюстрация или портрет, для которого у вас есть необходимые права и законное основание; получите согласие человека, когда это требуется применимым законодательством и правилами сервиса. В таком задании не нужно подробно повторять то, что уже видно на изображении. Лучше описать, что начинает двигаться, как меняется свет, куда идёт камера и чем заканчивается сцена.

Первый и последний кадры подходят для управляемого перехода. Они задают две точки, но не объясняют путь между ними — эту роль выполняет промпт. Чем реалистичнее переход между композициями, тем меньше модели приходится «изобретать» недостающую геометрию.

Режим референсов нужен для сложного задания, где разные материалы выполняют разные роли. Официальный Alibaba API использует обозначения Image 1, Video 1 и Audio 1; текущий интерфейс Gensta вставляет @Image1, @Video1 и @Audio1. Точный синтаксис, который реально проходит через provider integration, нужно опубликовать только после day-zero проверки запроса. До неё безопаснее словами назначать роли материалам по порядку и не давать двум файлам противоречащие указания об одном объекте.

Читать далее

Пять промптов для Wan 3.0

Ниже — пять рабочих шаблонов промптов под режимы Wan 3.0. Это стартовые рецепты, а не гарантия идеального первого кадра: при сложной сцене обычно помогает короткая проба на 5–10 секундах, затем удлинение.

1. Вертикальная реклама товара, 30 секунд — text-to-video 30-second vertical 9:16 product film, grounded studio realism. 0–6s: a sealed matte-white box stands on a pale stone table; slow push-in, soft room tone. 6–13s: the lid opens and a dark-green travel bottle rises into a narrow beam of warm light; one clean mechanical click. 13–21s: three match cuts show the same bottle in a train compartment, on a mountain path and beside a laptop; preserve its exact shape, cap and label placement. 21–27s: return to the table as a hand picks up the bottle; natural grip and believable shadows. 27–30s: stable centered hero shot with two seconds of stillness. No on-screen text, no extra products, no changing logo, no watermark. Audio: restrained electronic pulse, room tone and precise object sounds, no voiceover.

2. Ночная история с одним героем — text-to-video 30-second cinematic 16:9 short, natural motion, coherent night lighting. 0–8s: a bicycle courier waits under a closed cinema marquee in light rain; wide shot slowly moves to medium. 8–17s: a paper ticket slides from beneath the door; the courier notices it, picks it up and hears a projector start inside. 17–25s: the marquee lights turn on one row at a time while the camera makes a slow half-circle; keep the courier's jacket, bicycle and face consistent. 25–30s: the cinema door opens into warm light, but the camera stays outside as the courier steps in. Audio: rain, distant traffic, paper movement, projector hum, no dialogue.

3. Оживление предметного фото — first-frame image-to-video Use the uploaded image as the exact first frame. Keep the sneaker's proportions, materials, stitching, sole pattern and color unchanged. Over 10 seconds, the camera performs a slow 25-degree orbit while a narrow band of light travels from heel to toe. Fine dust lifts from the surface and settles naturally; the sneaker itself does not deform or rotate. End on a three-quarter close-up with the logo area fully visible. Neutral studio sound, a soft fabric movement and one subtle bass hit; no speech, no text, no duplicated shoe.

4. Переход между двумя кадрами — first-and-last-frame image-to-video Use the first uploaded image as the exact opening frame and the second uploaded image as the exact final frame. Create a physically plausible 15-second transition between them. 0–5s: the empty daylight café remains still as the camera begins a slow forward move. 5–11s: evening arrives through continuous changes in outside light; staff enter naturally and set the tables without popping into existence. 11–15s: guests settle into the positions shown in the second uploaded image and the camera reaches its final mark. Preserve architecture, table layout and lens perspective. Audio evolves from quiet daytime room tone to a warm evening crowd; no abrupt cuts.

5. Герой, товар, движение и музыка из разных референсов — reference-to-video Create a 20-second 9:16 social video. Use the first reference image for the actor's face, hairstyle and jacket only; do not copy its background. Use the second reference image for the exact bottle shape, cap and label colors. Use the first reference video for the pace and direction of the handheld camera, not the actor's identity. Use the first audio reference for rhythm and instrumental mood; do not copy any speech. For a 20-second result, all video references together must be no longer than 10 seconds so that input-video duration plus output remains within 30 seconds. 0–7s: the actor enters a bright corner shop and takes the bottle from a refrigerator. 7–15s: follow at shoulder height as the actor walks outside and opens it; maintain face and product identity. 15–20s: one sip, a brief natural reaction, then a stable product close-up. Preserve realistic hands, bottle geometry and ambient light. No subtitles, no extra labels, no duplicated objects.

Wan 3.0 или Seedance 2.5: сравнение без победителя

По текущей конфигурации Gensta обе модели публичны и рассчитаны на видео по тексту, одному или двум кадрам и мультимодальным референсам, длительность до 30 секунд и генерацию звука. Для Wan 3.0 тридцатисекундный максимум безусловен только без входного видео; при видеореференсах WaveSpeed требует «input video + output ≤ 30 секунд».

Сравнение текущих публичных конфигураций Gensta: • Публичный статус: Wan 3.0 — доступна; Seedance 2.5 — доступна. • Режимы: обе — t2v, i2v, ref2v. • Длительность: Wan 3.0 — 5, 10, 15, 20, 30 секунд; Seedance 2.5 — 5, 8, 10, 15, 20, 30 секунд. • Разрешение: Wan 3.0 — 480p, 720p, 1080p; Seedance 2.5 — 480p, 720p, 1080p и 4K в интеграции Gensta. • Звук: у обеих есть переключатель. • Лимиты референсов: Wan 3.0 — 10 изображений + 5 видео + 5 аудио, 20 файлов суммарно; Seedance 2.5 — 9 изображений + 3 видео + 3 аудио, 15 файлов суммарно. • Анализ промпта: у Wan 3.0 есть переключатель глубокого мышления; в публичном конфиге sd25_ws такого переключателя нет. • Сопоставимые данные Gensta о качестве: нет ни для одной модели.

Таблица сравнивает текущие конфигурации Gensta на 28 августа 2026 года, а не нативные пределы моделей у вендоров. Качество на одинаковом входе не тестировалось.

Мы пока не знаем, какая модель лучше сохранит лицо, форму товара, ритм диалога или физику движения на одинаковом входе. Такой вывод возможен только после сопоставимого теста. До этого выбирайте модель под задачу и лимиты, а не по обещанию «лучше».

Читать гайд по AI-видео

Ограничения и практические советы

Длинный ролик и большое число референсов увеличивают не только контроль, но и число возможных конфликтов. Особенно внимательно проверяйте мелкий текст, точные логотипы, сложные руки, одновременную речь нескольких героев, резкую смену геометрии и несовместимые визуальные референсы.

Практичный порядок: сначала короткий t2v или i2v на 720p / 5–10 секунд, затем first+last frame, затем референсы. Для ref2v заранее следите за суммой длительности входного видео и результата. Если нужен точный брендовый текст или юридически значимая подпись — добавляйте их в постобработке, а не полагайтесь только на генерацию.

Как начать с Wan 3.0 в Gensta

Откройте генератор видео, выберите Wan 3.0 и начните с короткого ролика 5–10 секунд на 720p — так проще проверить композицию и звук. Для фото→видео опишите движение и изменение кадра, а не то, что уже видно на снимке. Для референсов явно ссылайтесь на файлы в промпте и следите за суммарной длительностью входного видео.

Базовая ориентировочная цена для конфигурации «видео из изображения, 720p, 5 секунд» — около 200 кредитов (по текущему тарифу Gensta). Звук и глубокое мышление в этой модели цену не меняют, а видеореференс меняет: его секунды считаются по той же ставке, что и секунды результата. Перед запуском ориентируйтесь на сумму в форме: тариф может обновиться.

Попробовать Wan 3.0 в Gensta

Частые вопросы о Wan 3.0

Wan 3.0 уже доступна в Gensta?

Да. Wan 3.0 доступна в публичном выборе Gensta. Открыты режимы текст→видео, изображение→видео и референсы. Актуальные настройки и цену смотрите в форме перед запуском.

Какие режимы Wan 3.0 доступны в Gensta?

На 2026-08-28 доступны текст→видео, изображение→видео (один или два кадра) и мультимодальные референсы. Документы, веб-ссылки, отдельное редактирование и продолжение как отдельные публичные режимы Wan 3.0 в Gensta пока не вынесены.

Wan 3.0 действительно создаёт 30-секундные видео?

Да, в Gensta для Wan 3.0 можно выбрать до 30 секунд во всех публичных режимах. Без видеореференса это обычный лимит длительности результата. С видеореференсами WaveSpeed требует: суммарная длительность входного видео плюс длительность результата ≤ 30 секунд. Форма считает это сама: как только добавлено видео, в списке длительностей остаются только те варианты, которые вместе с ним укладываются в 30 секунд.

Какие разрешения поддерживает Wan 3.0?

Официальная документация и текущий контур Gensta указывают 480p, 720p и 1080p. Не следует обещать 2K или 4K без отдельного официального режима и проверки.

Можно ли использовать фото, видео и аудио одновременно?

Да. В Gensta можно сочетать до 10 изображений, 5 видео и 5 аудио. WaveSpeed ограничивает сумму видео и сумму аудио 15 секундами и требует, чтобы входное видео плюс результат укладывались в 30 секунд. Gensta проверяет все три правила: сумму видео (15 секунд), сумму аудио (15 секунд) и «входное видео + результат ≤ 30 секунд». Первые два не дают загрузить лишний файл, третье убирает недопустимые длительности из списка, а сервер повторяет проверку перед списанием кредитов.

Можно ли передать Wan 3.0 документ или ссылку на сайт?

Vendor API Alibaba поддерживает файл или веб-ссылку. Текущая интеграция Gensta принимает только изображения, видео и аудио, поэтому документы и ссылки нельзя обещать пользователям Gensta.

Сколько будет стоить Wan 3.0 в Gensta?

Ориентир на 2026-08-28: базовая конфигурация «видео из изображения, 720p, 5 секунд» в форме показывает около 200 кредитов. Звук и глубокое мышление в этой модели цену не меняют. Видеореференс — меняет: секунды входного видео тарифицируются как секунды результата, поэтому 5-секундный референс к 5-секундному ролику на 720p стоит уже около 400 кредитов. Перед запуском смотрите сумму в форме: тариф может обновиться.

Wan 3.0 лучше Seedance 2.5?

У нас нет сопоставимого Gensta-теста, поэтому победителя называть нельзя. Обе модели доступны в Gensta и рассчитаны на длинное видео, звук и референсы, но отличаются разрешениями и лимитами интеграции. Качество нужно сравнивать на одинаковых заданиях.

Источники и методика

Материал основан на официальной документации Alibaba Cloud и актуальной конфигурации Gensta на 2026-08-28. Отдельный сравнительный benchmark с Seedance 2.5 пока не публиковался; промпты в статье — рабочие шаблоны, а не гарантия результата. Перед генерацией проверяйте режимы, лимиты и цену в живой форме.

Все статьи