做个产品演示视频还得搭摄影棚、排拍摄?万相的最新视频模型直接把文档和参考图变成 30 秒成片,主打”稳定、真实、有质感”。今天上线的它把单次生成拉到 30 秒,还首次吃进了 PPT 和 PDF。我把它和几个主流模型摆在一起,看它能不能真的进生产流程。
产品概述
万相 Wan3.0 是阿里巴巴的视频生成大模型,2026 年 8 月 24 日正式上线。此前的公测从 8 月 6 日启动,十余天里以”天”为单位持续迭代,核心升级集中在生成时长、万能创作、全能参考、真实世界还原四个维度,最刺眼的数字是单次可生成 30 秒原生视频,同时首次支持 doc、xls、ppt、pdf、md 等文档格式直接作为输入。
官网:https://wan.video | 体验入口:阿里云百炼 / 万相官网 / 千问 AI 平台 / 千问 App / 万镜一刻 / 堆友 / IF STUDIO

核心功能
前面聊了它是什么,接下来仔细看看 Wan3.0 到底把哪些能力塞进了这一次更新里。
30 秒原生视频是这次最硬的指标。以往多数模型单次只能出 5 到 10 秒,叙事刚起头就断了,长一点的镜头只能靠后期硬拼。Wan3.0 把上限拉到 30 秒,且强调人物、车辆、环境在整段里高度一致。
文档直转是另一个差异化卖点。它首次支持把 PPT、PDF、Word 这类文件直接喂进去,模型会解析文档结构和内容,再据此生成对应画面。这对做培训材料、产品介绍的人很实用。
“Omni-Creation”万能创作最多能吃进 20 个参考素材,包括复杂文档和网页解析。多图融合可以无缝拼合最多 9 张图,顺序叙事则能生成最多 12 张连贯图像,且保持风格和主体一致。
文字渲染支持 12 种语言的长文本,图表、公式、信息图都能比较好地生成。精确色彩控制让你可以指定色彩分布,肖像定制则从骨相到眼神细节做出差异化真人面孔。

交互式编辑是容易被忽略的亮点。它支持框选局部做像素级对齐修改,也支持指令式和参考式编辑。沉浸音效则补齐了 AI 视频长期缺失的真实听感一环。
上手体验
聊完功能,最想知道的肯定是实际用起来什么感觉,尤其它主打的”不抽卡”到底成不成立。
入口很顺。打开万相官网或阿里云百炼,选文生视频或图生视频,上传文档、参考图或直接写提示词,点生成即可。网页端基本零配置,不需要本地显卡,对普通创作者非常友好。
第一感受是”稳”。参与测试的企业用户反复提到三个词:“稳定、真实、有质感”。在一段高速追车戏的样例里,模型能读懂参考素材、处理长时序叙事,30 秒内人物车辆环境一致,不用反复抽卡调参。
走 API 路线的开发者,流程是典型的异步任务模型:提交任务和参考素材,拿到任务 ID 后轮询或等回调,生成完再到对象存储取片。这条链路对批量生产很关键。

真人质感是它想啃下的硬骨头。官方强调”千人千面”,刻画五官和皮肤细节,微表情和肢体动作彼此联动。样例里女孩的眼球反射、毛发、白纱和水面光泽同框出现,冷灰蓝调全程守住,皮肤没有塑料化。
当然也不是没门槛。要让成片达标,提示词功力仍然重要,参考图给得越准,一致性越好。长片 30 秒对完整短剧仍偏短,更长的叙事还得靠顺序叙事或后期拼接。
使用技巧
很多人不知道,Wan3.0 真正提高效率的关键不在生成按钮,而在输入阶段的准备。下面这几条从实测里摸出来的门道,能帮你明显少走弯路。
用 PPT 或文档当底稿。既然它支持解析 doc、ppt、pdf,就别只丢一句提示词,把结构化的内容喂进去,模型对画面逻辑的理解会准很多。
多给参考图堆一致性。人物脸、产品外观、Logo 这类要稳定的元素,尽量用多参考图明确锁定,比纯文本描述靠谱得多。
善用框选交互式编辑。局部不满意别整段重生成,框选那一小块下指令改,省时也更可控。
长叙事拆成 12 图顺序生成。要讲完整故事,先规划分镜,用顺序叙事保证风格和主体连贯,再合成。
色彩和文字用指令显式控。需要特定色调或画面里带文字,直接在提示词里写清色彩分布和文案,别指望它自己猜。
竞品对比
光看自家宣传不够,把它和市面上几个主流模型摆到一起,才知道 30 秒和文档直转到底值不值钱。以下价格截至 2026 年 8 月,具体以各厂商官网实时显示为准。
| 模型 | 核心定位 | 文生/图生 | 参考能力 | 原生音频 | 单次最长 | 价格定位 |
|---|---|---|---|---|---|---|
| 万相 Wan3.0 | 文档直转长片 | 文+图 | 20 素材 / 9 图融合 | 有(沉浸音效) | 30 秒 | 0.3/0.6/1.2 元/秒 |
| 可灵 Kling 2.1 | 物理真实感标杆 | 文+图 | 参考图驱动 | 无(2.1 版) | 10 秒 | 订阅 $6.99 起 |
| Google Veo 3 | 原生音效标杆 | 文+图 | 最多 3 图(3.1) | 有 | 8 秒 | AI Ultra $249.9/月 |
| OpenAI Sora 2 | 叙事连贯最佳 | 文(为主) | 参考帧 | 有 | 20 秒 | ChatGPT Pro $200/月 |
| Runway Gen-4 | 角色参考最稳 | 图+文 | 强参考系统 | 无 | 10 秒 | $12/月起 |
数据截至 2026 年 8 月,价格随厂商调整,以各官网实时显示为准。
横向看,Wan3.0 在单次时长上断崖领先,30 秒是其他闭源模型的两到四倍。文档直转更是独一份,目前没有对手把 PPT、PDF 直接当输入做成核心能力。
音频这条线有意思:Veo 3 和 Sora 2 都有原生音效,可灵 2.1、Runway 仍靠后期补。Wan3.0 的沉浸音效算是补上了这环,但具体音质仍需实测。

可灵 2.1 的物理真实感和运动稳定性仍是写实场景的强项,水、火、布料的运动很自然。Sora 2 的叙事连贯和多角度一致性被公认更好。Runway 的参考系统和相机控制最适合品牌一致性创作。
用户反馈
模型的成色,最终要听真用的人怎么说,我整理了企业用户和创作者两边的声音。
正面反馈高度集中在”稳”。大量参与测试的企业用户把”稳定、真实、有质感”挂在嘴边,尤其是角色、道具、声音、空间关系这些细粒度维度能稳定保持,对追求产能的团队很关键。
短剧团队给近景特写打出好评,说人脸细节还原精准、成片稳定可用率高。广告团队则认可商品外观、Logo、材质的高度统一,口播也自然流畅,成品接近真实广告拍摄水准。
负面声音主要在成本和上限。按秒计费在 1080P 档达到 1.2 元/秒,长片积少成多不算便宜,对高频量产团队是一笔要算清的账。
30 秒上限也被反复提及。它比过去长很多,但对完整剧情、课程、纪录片仍不够,更长的片子还得靠顺序叙事或后期拼接,没真正做到”一次到底”。
部分刚接入的第三方平台在初期出现排队。这是扩张期的常见阵痛,但随着算力铺开通常会缓解,是否影响你的节奏要看上线时点。
多维评分
把前面这些拆成八个固定维度,挨个打分,看看综合到底落在什么水位。
| 维度 | 权重 | 星级 | 一句话解读 |
|---|---|---|---|
| 功能完整性 | 20% | ★★★★★ | 文档直转、多参考、音效、编辑全覆盖 |
| 易用性 | 15% | ★★★★☆ | 网页零配置,提示词仍要功力 |
| 性能表现 | 15% | ★★★★☆ | 30 秒长片与一致性是硬实力 |
| AI 能力 | 15% | ★★★★★ | 多模态与真实还原领先同代 |
| 价格合理性 | 10% | ★★★☆☆ | 按秒计费长片成本偏高 |
| 生态集成 | 10% | ★★★★☆ | 百炼/千问/多平台已铺开 |
| 文档与支持 | 10% | ★★★☆☆ | 新上线,文档体系待补全 |
| 更新频率 | 5% | ★★★★★ | 公测期以天为单位迭代 |
加权后综合约 4.2 / 5(84 分)。扣分的重灾区是价格门槛和 nascent 的文档体系,强项则是功能广度和迭代速度。
优缺点
优点很清晰:30 秒原生长片断崖领先;文档直转是独门能力;跨镜头一致性和真人质感突出;沉浸音效补齐听感;多参考和框选编辑把可控性拉满。
缺点也得摆明白:按秒计费在高位档偏贵;30 秒对长内容仍不够;成片质量依赖提示词和参考图功力;更长的叙事暂时还得靠拼接或顺序生成。
适用人群
不是所有人都该冲,我把适配度最高的人群排了个序,对号入座更省心。
短视频和广告团队最该试。商品外观、口播、Logo 要稳定,又要快速出片,Wan3.0 的一致性和文档直转正好对口。
短剧和影视预演团队也高度匹配。近景特写和长时序叙事的稳定性,能直接压低分镜和预演的成本。
企业和文旅宣传部门值得关注。把汇报 PPT、讲解文档直接转成视频,降低了非专业团队的视频生产门槛。
普通创作者和开发者也能用。前者靠网页零门槛上手,后者走百炼 API 把生成塞进自己的生产管线。
定价方案
价格这部分得算细,按秒计费的水面下藏着真实的成本结构,别被”限时折扣”带节奏。
| 档位 | 标准价(元/秒) | 限时 7 折(8/24 至 9/23,元/秒) |
|---|---|---|
| 480P | 0.30 | 0.21 |
| 720P | 0.60 | 0.42 |
| 1080P | 1.2 | 0.84 |
数据截至 2026 年 8 月 24 日阿里云百炼与千问 AI 平台显示,优惠窗口到 9 月 23 日截止。
换算一下感知更直观:一段 30 秒 720P 成片,标准价 18 元,折后 12.6 元。对偶尔产出的团队能接受,但对日更、量产的账号,按月流水摊下来不是小数。
截至 2026 年 8 月,横向比,它比可灵按条订阅贵、比 Veo 3 的 $249.9/月订阅便宜,定位在”按量付费、用多少算多少”的中段。预算敏感型可以先用 480P 试产,定稿再上 1080P。
常见问题
最后集中回答几个高频疑问,帮你快速判断这款模型适不适合放进自己的工作流。
Q1:Wan3.0 和普通视频模型最大的区别是什么?
A1:最大区别是 30 秒原生长片加文档直转。 它单次能出 30 秒且跨镜头一致,还能直接吃 PPT、PDF 生成视频,目前没有对手把这两点同时做成核心能力。
Q2:没有本地显卡能用吗?
A2:完全可以,网页端零配置。 打开万相官网或阿里云百炼即可生成,不用本地算力,普通创作者也能直接上手。
Q3:支持和哪些平台对接?
A3:官方与第三方都已铺开。 万相官网、阿里云百炼、千问全端、万镜一刻、堆友、IF STUDIO 可直接用,Flova、Libtv、美图等也已完成接入。
Q4:文档直转支持哪些格式?
A4:支持 doc、xls、ppt、pdf、md 五类。 模型会解析文档结构与内容再生成画面,适合培训材料、产品介绍这类结构化内容。
Q5:生成一段视频要多少钱?
A5:按秒计费,标准价 0.3/0.6/1.2 元每秒。 截至 2026 年 8 月,8 月 24 日至 9 月 23 日有限时 7 折,折后 0.21/0.42/0.84 元每秒,长片建议先算清成本。
Q6:30 秒够拍完一个完整故事吗?
A6:对多数短片够,长内容仍需拼接。 30 秒已是闭源模型里的上限,但完整短剧、课程、纪录片还得靠顺序叙事或后期衔接。
Q7:和 Sora 2、Veo 3 比谁更强?
A7:各有侧重,不在同一维度。 Wan3.0 强在时长与文档直转,Sora 2 叙事连贯更好,Veo 3 原生音效更成熟,按场景选比硬比高低更实际。
Q8:有原生音频吗?
A8:有,叫沉浸音效。 它补齐了 AI 视频长期缺失的真实听感,但具体音质和可控性仍需真人实测来判断。
Q9:企业怎么批量接入?
A9:走阿里云百炼 API 异步任务。 提交任务和参考素材后拿任务 ID,轮询或等回调取片,适合把生成嵌进自有生产管线。
Q10:不支持哪些场景?
A10:超长叙事和极致低成本暂不适用。 30 秒上限、按秒计费、以及对提示词功力的依赖,决定了它暂时不是长剧集和极限预算场景的最优解。
结尾
Wan3.0 不是又一个”参数更猛”的模型,它把”稳定、真实、有质感”当成了产品目标,这恰恰是过去 AI 视频最被人诟病的地方。30 秒长片和文档直转两个能力,确实戳中了企业生产的真实痛点。
它当然不完美。按秒计费在中高位档不便宜,30 秒对长内容还是短,提示词和参考图功力依旧决定下限。但作为今天刚上线的版本,迭代速度和生态铺开速度都很快。
如果你做的是广告、短剧预演、企业宣传这类”要稳定出片”的活,现在就去万相官网或阿里云百炼试一段,趁着 7 折窗口把成本结构摸清楚,比看十篇评测都实在。

