限时立省 30%!领取优惠
Artificial Analysis 含音频文生视频榜单第 1(2026 年 9 月)

Wan 3.0:创作完整场景,声音同步到位

写一句描述、上传首帧,或提供多份参考素材,即可生成最长 30 秒的视频,包含对白、音乐和与语音同步的口型。

试试 Agent 模式NEW

用对话描述想法,继续调整创作。

试试 Agent
上传必填
起始帧
结束帧
  • 图片:JPG、PNG 或 WebP
时长(秒)5s
2s16s30s

生成预览

5s Living Oil Painting | 16:9 | Impressionist Post-Painterly Texture | Sea-Cliff Wind and Scattering Blossoms FIRST FRAME: strictly preserve the reference image's original composition, palette, and brushwork. Nothing is re-rendered as photoreal — the animation must look like an oil painting in motion, visible impasto strokes and palette-knife ridges holding their identity as they move. SUBJECT: young dark-haired woman in a sage-olive long-sleeved blouse with a patterned sash, head tilted down and to her right, eyes lowered, expression calm and inward. Both bare forearms lift toward a great bundle of white chrysanthemum blooms breaking apart in the air before her. Face structure, hair mass, sleeve folds, and skin tone stay consistent throughout.
官方样片

看看 Wan 3.0 官方演示

片段来自 Alibaba 官方发布演示,展示连续长镜头、角色表演和电影感场面。

一个连贯的长镜头

小天使沿云中的螺旋阶梯向上攀爬,镜头连续不断,展示模型擅长的长镜头连贯性。

生成长镜头
小天使沿云中的大理石螺旋阶梯攀爬,Wan 3.0 连续长镜头

贯穿场景的角色表演

风格化角色夜里翻找冰箱,表情、动作和光线在整个场景中保持一致。

让角色动起来
Wan 3.0 AI 视频演示:风格化角色在夜间打开冰箱

游戏过场般的大场面

灯笼照亮的遗迹、巨大的石佛和一名武者,由模型直接生成 30 秒电影感片段。

创作电影感场景
Wan 3.0 视频生成演示:灯笼照亮的遗迹中,武者站在巨大的石佛前

Wan 3.0 是什么?

Wan 3.0 是 Alibaba 的一体化视频模型,将文生视频、图生视频、参考素材驱动生成、编辑和延长整合在同一个模型中。输入一句描述或首帧,即可生成最长 30 秒、最高 1080p 的视频。原生音频让对白、音效和背景音乐与画面同时生成,角色口型也随台词变化。截至 2026 年 9 月,它以 Elo 1,242 位列 Artificial Analysis 文生视频(含音频)榜单第 1,领先 Gemini Omni Flash 和 MiniMax H3 Max。

生成参数

用 Wan 3.0 调整场景所需的参数

  • 一次生成 2 到 30 秒

    按整秒选择时长,默认为 5 秒,也可让模型根据动作自动决定长度。

  • 最高 1080p,30 FPS

    先用 480p 反复试稿,满意后以 1080p 生成;所有视频均为固定 30 FPS。

  • 原生声音

    对白、环境音效和音乐与画面同时生成,角色口型随台词变化。

  • 五种画幅,或自动适配

    可选 16:9、4:3、1:1、3:4 或 9:16,也可保留自动适配。

  • 最多 20 份参考素材

    组合图片、视频和音频,甚至 PDF、幻灯片或网页,让模型根据这些素材构建场景。

  • 编辑与延长

    替换元素、调整画面风格、改写角色台词,或向视频前后延长,总时长最长 30 秒。

使用步骤

如何用 Wan 3.0 生成 AI 视频

  1. 1

    描述场景

    写下发生什么,也可以上传首帧、尾帧或参考素材。

  2. 2

    设置画幅

    选择 2–30 秒、480p 到 1080p,以及 16:9 到 9:16 的画幅,也可以让模型自动决定时长。

  3. 3

    连声音一起生成

    视频返回时已包含人声、音效和音乐。可以直接保留,也可以修改台词或继续延长。

使用场景

团队如何使用 Wan 3.0

过去需要多种工具配合的工作,现在可以一次生成。

  • 广告团队

    从一份需求出发,生成含画面、旁白和音乐的完整 30 秒广告,再逐版调整。

  • 产品营销

    用一张主视觉图生成视频:产品图作为开场,再由模型让画面动起来。

  • 教育与讲解

    将 PDF、幻灯片或网页变成带旁白的讲解视频,无需先画分镜。

  • 社交创作者

    生成 9:16 竖屏场景,对白自带声音、口型同步,可用于信息流内容。

  • 故事与游戏团队

    保持角色一致,逐镜头搭建电影感片段,再逐场景延长。

代际变化

Wan 3.0 与上一代 Wan 有何区别

根据 Alibaba 发布公告,对比 Wan 2.7 API 系列的变化。

本站提供Wan 3.0一体化的新一代开始生成Wan 2.7上一代 API 系列
单次最长时长最长 30 秒最长 15 秒
模型形态一个模型完成参考驱动、编辑、生成和延长分散在独立模型中
输入文字与首尾帧,以及最多 20 份参考素材,包括文档和网页输入类型较少
价格

Wan 3.0 积分价格

订阅可为账号补充积分:$19.90 包含 1,000 积分,可生成约 25 段 5 秒草稿,或 6 段 10 秒 720p 视频。

限时优惠30%

限时优惠,立省 30%!

07天00时00分00秒
Loading…
常见问题

关于 Wan 3.0 的常见疑问

一次生成,完整场景,声音到位。

保留满意的版本,改写台词,延长结尾。写下提示词,开始你的第一个场景。