Все статьи
Wan 3.0 в Gensta: как создавать видео до 30 секунд со звуком

Wan 3.0 в Gensta: как создавать видео до 30 секунд со звуком

Wan 3.0 доступна в Gensta для видео по тексту, анимации первого или первого и последнего кадров и работы с мультимодальными референсами. Разбираем настройки, ограничения, цену и промпты.

Wan 3.0 доступна в Gensta

Wan 3.0 доступна в публичном генераторе Gensta. Можно выбрать модель и запустить видео по тексту, видео из изображения (первый или первый и последний кадр) и видео по мультимодальным референсам.

В текущей интеграции Gensta: разрешения 480p, 720p и 1080p; длительность 5, 10, 15, 20 или 30 секунд; синхронизированный звук (можно отключить без изменения цены); опциональный режим глубокого мышления для сложных промптов (цена та же, генерация дольше). Для одного задания — до 10 изображений, 5 видео и 5 аудио, всего до 20 файлов. Для видеореференсов действует лимит суммарной длительности входного видео; вместе с длительностью результата ориентируйтесь на ограничение, которое показывает форма (официальный API Alibaba: input-video + output ≤ 30 секунд).

Alibaba Cloud публикует Wan 3.0 как единую модель для текста, кадров и мультимодальных входов. Документы, веб-страницы, отдельное редактирование и продолжение в публичном интерфейсе Gensta для Wan 3.0 пока не вынесены как отдельные режимы.

Попробовать Wan 3.0 в Gensta

Что официально умеет Wan 3.0

Официальный API описывает три основных способа начать генерацию. В режиме text-to-video достаточно текстового режиссёрского задания. В image-to-video одно изображение задаёт первый кадр, а пара изображений может зафиксировать первый и последний кадры. В reference-based generation изображения, видео и аудио используются не как буквальное начало ролика, а как материалы для внешности героев, предметов, пространства, движения и звука.

Без входного видео Wan 3.0 создаёт ролики длительностью от 2 до 30 секунд и поддерживает 480P, 720P и 1080P при 30 кадрах/с. При видеореференсах действует дополнительное правило: суммарная длительность входных видео плюс длительность результата не должна превышать 30 секунд. Alibaba описывает совместную генерацию видеоряда, диалога, фоновой музыки и звуковых эффектов. В официальном API звук можно включать и выключать; изменение этой настройки само по себе не меняет vendor-тариф.

Для мультимодального задания документация разрешает до 10 изображений, 5 видео и 5 аудиофрагментов. Суммарная длительность видеореференсов — не более 15 секунд; для аудиореференсов действует такой же суммарный предел. Ограничение «входное видео + результат ≤ 30 секунд» применяется одновременно. Alibaba также поддерживает файл или ссылку на веб-страницу и описывает редактирование и продолжение видео. Это возможности vendor workflow, а не обещание, что каждый из этих входов уже появится в Gensta.

Какие режимы и лимиты доступны в Gensta

На 2026-08-28 в Gensta для Wan 3.0 открыты три режима: видео по тексту, видео из одного или двух кадров и видео по мультимодальным референсам. Интерфейс предлагает 480p / 720p / 1080p, длительности 5–30 секунд, звук и глубокое мышление. Максимум одного задания: до 10 фото, 5 видео, 5 аудио, всего до 20 файлов; суммарные лимиты длительности входных видео и аудио — до 15 секунд каждый тип в текущей конфигурации.

Параметры могут измениться, поэтому перед генерацией проверяйте итоговую форму и сумму списания.

Как выбрать режим: текст, первый кадр или референсы

Видео по тексту подходит для свободной сцены, когда важнее идея, действие и камера, чем точное совпадение с готовым персонажем или товаром. В промпте задайте формат, хронометраж, место, героя, последовательность действий, движение камеры и звук.

Один первый кадр полезен, когда композиция уже найдена: например, есть предметная фотография, иллюстрация или портрет, для которого у вас есть необходимые права и законное основание; получите согласие человека, когда это требуется применимым законодательством и правилами сервиса. В таком задании не нужно подробно повторять то, что уже видно на изображении. Лучше описать, что начинает двигаться, как меняется свет, куда идёт камера и чем заканчивается сцена.

Первый и последний кадры подходят для управляемого перехода. Они задают две точки, но не объясняют путь между ними — эту роль выполняет промпт. Чем реалистичнее переход между композициями, тем меньше модели приходится «изобретать» недостающую геометрию.

Режим референсов нужен для сложного задания, где разные материалы выполняют разные роли. Официальный Alibaba API использует обозначения Image 1, Video 1 и Audio 1; текущий интерфейс Gensta вставляет @Image1, @Video1 и @Audio1. Точный синтаксис, который реально проходит через provider integration, нужно опубликовать только после day-zero проверки запроса. До неё безопаснее словами назначать роли материалам по порядку и не давать двум файлам противоречащие указания об одном объекте.

Читать далее

Пять промптов для Wan 3.0

Ниже — пять рабочих шаблонов промптов под режимы Wan 3.0. Это стартовые рецепты, а не гарантия идеального первого кадра: при сложной сцене обычно помогает короткая проба на 5–10 секундах, затем удлинение.

1. Вертикальная реклама товара, 30 секунд — text-to-video 30-second vertical 9:16 product film, grounded studio realism. 0–6s: a sealed matte-white box stands on a pale stone table; slow push-in, soft room tone. 6–13s: the lid opens and a dark-green travel bottle rises into a narrow beam of warm light; one clean mechanical click. 13–21s: three match cuts show the same bottle in a train compartment, on a mountain path and beside a laptop; preserve its exact shape, cap and label placement. 21–27s: return to the table as a hand picks up the bottle; natural grip and believable shadows. 27–30s: stable centered hero shot with two seconds of stillness. No on-screen text, no extra products, no changing logo, no watermark. Audio: restrained electronic pulse, room tone and precise object sounds, no voiceover.

2. Ночная история с одним героем — text-to-video 30-second cinematic 16:9 short, natural motion, coherent night lighting. 0–8s: a bicycle courier waits under a closed cinema marquee in light rain; wide shot slowly moves to medium. 8–17s: a paper ticket slides from beneath the door; the courier notices it, picks it up and hears a projector start inside. 17–25s: the marquee lights turn on one row at a time while the camera makes a slow half-circle; keep the courier's jacket, bicycle and face consistent. 25–30s: the cinema door opens into warm light, but the camera stays outside as the courier steps in. Audio: rain, distant traffic, paper movement, projector hum, no dialogue.

3. Оживление предметного фото — first-frame image-to-video Use the uploaded image as the exact first frame. Keep the sneaker's proportions, materials, stitching, sole pattern and color unchanged. Over 10 seconds, the camera performs a slow 25-degree orbit while a narrow band of light travels from heel to toe. Fine dust lifts from the surface and settles naturally; the sneaker itself does not deform or rotate. End on a three-quarter close-up with the logo area fully visible. Neutral studio sound, a soft fabric movement and one subtle bass hit; no speech, no text, no duplicated shoe.

4. Переход между двумя кадрами — first-and-last-frame image-to-video Use the first uploaded image as the exact opening frame and the second uploaded image as the exact final frame. Create a physically plausible 15-second transition between them. 0–5s: the empty daylight café remains still as the camera begins a slow forward move. 5–11s: evening arrives through continuous changes in outside light; staff enter naturally and set the tables without popping into existence. 11–15s: guests settle into the positions shown in the second uploaded image and the camera reaches its final mark. Preserve architecture, table layout and lens perspective. Audio evolves from quiet daytime room tone to a warm evening crowd; no abrupt cuts.

5. Герой, товар, движение и музыка из разных референсов — reference-to-video Create a 20-second 9:16 social video. Use the first reference image for the actor's face, hairstyle and jacket only; do not copy its background. Use the second reference image for the exact bottle shape, cap and label colors. Use the first reference video for the pace and direction of the handheld camera, not the actor's identity. Use the first audio reference for rhythm and instrumental mood; do not copy any speech. For a 20-second result, all video references together must be no longer than 10 seconds so that input-video duration plus output remains within 30 seconds. 0–7s: the actor enters a bright corner shop and takes the bottle from a refrigerator. 7–15s: follow at shoulder height as the actor walks outside and opens it; maintain face and product identity. 15–20s: one sip, a brief natural reaction, then a stable product close-up. Preserve realistic hands, bottle geometry and ambient light. No subtitles, no extra labels, no duplicated objects.

Wan 3.0 или Seedance 2.5: сравнение без победителя

По текущей конфигурации Gensta обе модели рассчитаны на видео по тексту, одному или двум кадрам и мультимодальным референсам, длительность до 30 секунд и генерацию звука. Для Wan 3.0 тридцатисекундный максимум безусловен только без входного видео; при видеореференсах действует сумма «input video + output ≤ 30 секунд». Разница сейчас прежде всего в статусе и доступных настройках: Seedance 2.5 уже показывается пользователям Gensta, а Wan 3.0 ещё скрыта и не прошла публичный smoke test.

Сравнение текущих конфигураций Gensta: • Публичный статус: Wan 3.0 — готовится, пользователем не выбирается; Seedance 2.5 — доступна. • Режимы: Wan 3.0 — t2v, i2v, ref2v запланированы; Seedance 2.5 — t2v, i2v, ref2v публично. • Длительность: Wan 3.0 — 5, 10, 15, 20, 30 секунд по плану, при видеореференсах сумма входного видео и результата не больше 30 секунд; Seedance 2.5 — 5, 8, 10, 15, 20, 30 секунд. • Разрешение: Wan 3.0 — 480p, 720p, 1080p по плану; Seedance 2.5 — 480p, 720p, 1080p и 4K в интеграции Gensta. • Звук: Wan 3.0 — переключатель запланирован; Seedance 2.5 — публичный переключатель. • Лимиты референсов: Wan 3.0 — план 10 изображений + 5 видео + 5 аудио, 20 файлов суммарно; Seedance 2.5 — 9 изображений + 3 видео + 3 аудио, 15 файлов суммарно. • Анализ промпта: Wan 3.0 — переключатель запланирован; в публичном конфиге sd25_ws такого переключателя нет. • Сопоставимые данные Gensta о качестве: нет ни для одной модели.

Таблица сравнивает текущие конфигурации Gensta на 27 августа 2026 года, а не нативные пределы моделей у вендоров. Wan 3.0 ещё не опубликована в Gensta. Качество на одинаковом входе не тестировалось.

Мы пока не знаем, какая модель лучше сохранит лицо, форму товара, ритм диалога или физику движения на одинаковом входе. Такой вывод возможен только после сопоставимого теста, где сохраняются все первые попытки, настройки, стоимость, время и ошибки. До этого практический выбор прост: для генерации в Gensta сейчас используйте доступную модель; Wan 3.0 оценивайте после публичного запуска и проверки.

Читать гайд по AI-видео

Ограничения и практические советы

Длинный ролик и большое число референсов увеличивают не только контроль, но и число возможных конфликтов. Особенно внимательно проверяйте мелкий текст, точные логотипы, сложные руки, одновременную речь нескольких героев, резкую смену геометрии и несовместимые визуальные референсы.

Практичный порядок: сначала короткий t2v или i2v на 720p / 5–10 секунд, затем first+last frame, затем референсы. Для ref2v заранее следите за суммой длительности входного видео и результата. Если нужен точный брендовый текст или юридически значимая подпись — добавляйте их в постобработке, а не полагайтесь только на генерацию.

Как начать с Wan 3.0 в Gensta

Откройте генератор видео, выберите Wan 3.0 и начните с короткого ролика 5–10 секунд на 720p — так проще проверить композицию и звук. Для фото→видео опишите движение и изменение кадра, а не то, что уже видно на снимке. Для референсов явно ссылайтесь на файлы в промпте и следите за суммарной длительностью входного видео.

Базовая ориентировочная цена для конфигурации «видео из изображения, 720p, 5 секунд» — около 200 кредитов (по текущему тарифу Gensta). Звук и глубокое мышление в этой модели цену не меняют. Перед запуском ориентируйтесь на сумму в форме: тариф может обновиться.

Попробовать Wan 3.0 в Gensta

Частые вопросы о Wan 3.0

Wan 3.0 уже доступна в Gensta?

Да. Wan 3.0 доступна в публичном выборе Gensta. Открыты режимы текст→видео, изображение→видео и референсы. Актуальные настройки и цену смотрите в форме перед запуском.

Какие режимы Wan 3.0 доступны в Gensta?

На 2026-08-28 доступны текст→видео, изображение→видео (один или два кадра) и мультимодальные референсы. Документы, веб-ссылки, отдельное редактирование и продолжение как отдельные публичные режимы Wan 3.0 в Gensta пока не вынесены.

Wan 3.0 действительно создаёт 30-секундные видео?

Да, в Gensta для Wan 3.0 можно выбрать до 30 секунд во всех публичных режимах. Без видеореференса это обычный лимит длительности результата. С видеореференсами действует общий лимит: суммарная длительность входного видео плюс длительность результата — ориентируйтесь на проверку формы (официальный API Alibaba: ≤ 30 секунд).

Какие разрешения поддерживает Wan 3.0?

Официальная документация и текущий контур Gensta указывают 480p, 720p и 1080p. Не следует обещать 2K или 4K без отдельного официального режима и проверки.

Можно ли использовать фото, видео и аудио одновременно?

Официальный reference-based режим допускает сочетание этих типов материалов: до 10 изображений, 5 видео и 5 аудиофрагментов. У видео и аудио есть суммарные лимиты длительности по 15 секунд; кроме того, входное видео вместе с результатом должно укладываться в 30 секунд. Плановый контур Gensta повторяет ограничения по количеству файлов, но итоговые лимиты длительности видео и аудио должны быть подтверждены или реализованы до публичного запуска.

Можно ли передать Wan 3.0 документ или ссылку на сайт?

Vendor API Alibaba поддерживает файл или веб-ссылку. Текущая интеграция Gensta принимает только изображения, видео и аудио, поэтому документы и ссылки нельзя обещать пользователям Gensta.

Сколько будет стоить Wan 3.0 в Gensta?

Публичная цена ещё не подтверждена. В текущем коде базовая конфигурация 720p на 5 секунд рассчитана как 200 кредитов, но эту цифру нельзя считать финальным тарифом до совпадения публичной формы, фактического списания и production-конфига. После запуска ориентируйтесь на цену, которую показывает форма до генерации.

Wan 3.0 лучше Seedance 2.5?

У нас пока нет сопоставимого Gensta-теста, поэтому победителя называть нельзя. Обе модели рассчитаны на длинное видео, звук и референсы, но отличаются текущим статусом, разрешениями и лимитами интеграции. Качество нужно сравнивать на одинаковых заданиях после запуска Wan 3.0.

Источники и методика

Материал основан на официальной документации Alibaba Cloud и актуальной конфигурации Gensta на 2026-08-28. Отдельный сравнительный benchmark с Seedance 2.5 пока не публиковался; промпты в статье — рабочие шаблоны, а не гарантия результата. Перед генерацией проверяйте режимы, лимиты и цену в живой форме.

Все статьи