跳转到主要内容
AI 视频

Wan 3.0 到底开放了什么?官方能力、开源边界与 30 秒工作流

Wan 3.0 已提供官方托管调用,但 API 可用不等于代码和权重已公开;本文给出证据边界、时长计算和完整异步生成验收流程。

15 分钟阅读
读者确认 Wan 3.0 官方托管能力、开源边界和 30 秒工作流

如果你只想先得到结论:截至 2026 年 8 月 30 日,Wan 3.0 已有阿里云百炼官方托管调用路径,文档列出的模型包括 wan3.0-videowan3.0-video-prime;但“有官方 API”不等于“Wan 3.0 的推理代码和模型权重已经公开”。当日可见的 AlibabaCloud-Official/Wan3.0 仓库主分支只有 README 和 Apache 2.0 LICENSE,未见推理代码、依赖清单或权重文件。

“最长 30 秒”同样有条件:不带输入视频时,输出时长可设为 2–30 秒;带输入视频时,输入视频时长与输出视频时长之和不能超过 30 秒。 所以一段 8 秒参考视频并不能再换来 30 秒输出,理论上可分配给输出的上限是 22 秒。

这篇指南解决三个连续问题:现在官方到底支持什么,所谓“开源”具体覆盖什么,以及怎样在不误读时长和素材限制的前提下完成一次可保存、可检查的托管生成。

先用 30 秒做采用判断

你要确认的问题当前有证据支持的答案现在该怎么做
能不能通过官方渠道调用?可以走阿里云百炼托管模型;地区、账号权限与实际可用状态仍需在自己的控制台确认先选定区域与工作空间,再从同区域官方文档复制端点
能不能在本地下载 Wan 3.0 权重运行?截至核验日,公开官方仓库与官方模型目录中未确认到 Wan 3.0 推理代码或权重不要按“已经开源权重”规划本地部署;等待官方模型卡、文件与权重许可证
Apache 2.0 是否覆盖模型权重?许可证约束仓库中实际分发的作品;仓库里没有出现的权重不能仅凭 LICENSE 推定已获许可审核具体文件、来源和对应许可证,不只看仓库名称
能不能生成 30 秒视频?可以,但视频输入会占用同一个 30 秒总预算先算 输出上限 = 30 - 输入视频总时长,再设置 duration
结果是否会一直在线?官方指南说明返回的 MP4 URL 有效期为 24 小时任务成功后立即下载到自己的持久存储,并记录验收结果

读者能把官方托管能力、公开仓库和未发布权重分开判断

官方能力:确认“能做什么”,也确认“怎样才能做”

官方 Wan 3.0 视频生成 API 参考 把它定义为 All-in-One 托管视频生成模型。能力范围不只文生视频,还包括首帧图生视频、首尾帧图生视频、参考生成、视频编辑与续写。可用输入类型包括文本,以及 first_framelast_framereference_imagereference_videoreference_audio、文件和公开链接等媒体形式。

不过,“支持多模态”不是“任何素材都能随意混装”。准备请求前,至少要同时检查以下边界:

  • 参考图最多 10 张;
  • 参考视频最多 5 个,合计时长不超过 15 秒;
  • 参考音频最多 5 个,合计时长不超过 15 秒;
  • 首帧/尾帧模式与参考、文件或链接模式存在互斥规则;
  • 每类媒体还有格式、体积、尺寸、页数与公网可访问性要求;
  • duration 默认值是 5,设为 -1 表示智能时长,而不是固定 30 秒。

官方文档列出 480P、720P 与 1080P 输出,并说明成功结果为 30fps MP4。不要把第三方页面的“原生 4K”直接写进采购或制作规格:本轮可核验的官方资料不足以支持这个结论。

阿里云在发布页中展示了原生音画、长叙事、多镜头与一致性等能力,并宣传最多 20 个多模态参考素材。这些内容可以说明产品定位,却不是对你的角色、字幕、道具连续性或音画同步的独立验收。官方自己的 Wan 3.0 发布文章 也明确提到,音频质感与画面文字渲染准确度仍有改进空间。

还有一个容易忽略的状态差异

核验时,官方 API 参考仍标注 “Currently in preview”,而模型发布页称 API 已正式开放。两份官方材料的措辞并不完全一致。因此,不能把“所有账号、所有区域都已正式可用”当成前提,更不能由此推导统一 SLA。

稳妥做法是:在实际账号中确认模型是否可选、端点所属区域、工作空间权限和账单状态。创建任务使用的模型、API Key 与端点必须属于同一区域。

开源边界:LICENSE 不是权重发布证明

判断一个视频模型是否“已开源”,至少要分别回答四个问题:

  1. 是否有公开仓库?
  2. 仓库是否包含可运行的推理代码和依赖?
  3. 是否有可下载的模型权重与模型卡?
  4. 代码和权重分别适用什么许可证与使用限制?

Wan 3.0 目前只能对第一个问题给出有限的“是”。在 2026 年 8 月 30 日对 AlibabaCloud-Official/Wan3.0 主分支的公开树进行核验时,结果只有 README.mdLICENSE 两个文件:没有推理脚本、依赖清单、checkpoint、tag 或 release asset。Wan-Video 的公开 GitHub 组织列表中也未见 Wan 3.0 代码或权重仓库;Wan-AI 的 Hugging Face 公开模型目录中,当日同样没有匹配 Wan3 或 Wan3.0 的模型 ID。

仓库中的 Apache License 2.0 适用于该仓库实际分发的作品,并附带通知、署名等条件,也不授予商标权。它不能自动延伸到仓库没有分发的模型权重或推理代码。这不是法律意见,而是避免把“仓库有开源许可证”误写成“所有 Wan 3.0 工件均已按同一许可证发布”。

上述结论是一个有日期的公开观察,不是对未来的永久判断。阿里巴巴是否会发布 Wan 3.0 推理代码、权重、单独的权重许可证、硬件需求或本地运行流程,目前仍属未知。以后若出现新仓库或模型卡,应重新核对文件本身,而不是沿用本文日期下的缺席观察。

第三方生成器不能补上这段证据

搜索结果里有大量名称相近的 “Wan 3.0” 在线生成器。它们可以是体验入口,但页面上的“官方”“开源”“4K”或“无需 GPU”不等于官方模型工件已经公开,也不能证明后台调用的就是同一版本。

采用第三方服务前,至少询问:服务提供方是谁、底层模型 ID 是什么、请求发送到哪个区域、素材保留多久、输出能否商用、失败如何退款、是否能导出原始 MP4。回答不透明时,把它视为第三方托管产品,而不是 Wan 3.0 官方开源发行版。

30 秒多模态工作流:先预算,再提交

真正可靠的流程不是“把素材全部丢进去,时长拉满”,而是先把目标、素材角色和时长约束变成一张任务单,再进入异步 API。

第 1 步:把 30 秒变成可计算的预算

先统计请求中所有输入视频的实际时长,记为 V。按官方规则:

text
无输入视频:2 ≤ 输出时长 ≤ 30 有输入视频:输入视频总时长 V + 输出时长 ≤ 30 同时还要满足:参考视频数量 ≤ 5,且 V ≤ 15

由此得到 输出时长上限 = 30 - V

输入视频总时长可设置的输出上限一个合理用途
0 秒30 秒只用文字、图片与音频规划完整短片
6 秒24 秒用短动作片段约束运动,其余时长生成新镜头
12 秒18 秒让参考视频承担较多节奏信息,压缩生成段落
15 秒15 秒使用允许的参考视频总时长上限,输出最多再分配 15 秒

这里的输入视频预算与参考音频上限不是一回事。参考音频最多 5 个、总计不超过 15 秒;不要自行假定它一定会被延长到整个输出,也不要把它当成额外的视频时长额度。

第 2 步:先写验收标准,再写提示词

在调用之前,给这条任务写出可观察的通过条件。例如:

  • 主角服装、道具和空间方向在三个镜头中不发生关键跳变;
  • 片长为 24 秒,16:9,目标分辨率 1080P;
  • 0–8 秒建立人物与场景,8–18 秒完成动作,18–24 秒收束;
  • 台词内容与人物身份一致,关键字幕后期添加,不把模型内生文字当成唯一交付;
  • 出现多余肢体、道具消失、说话对象错位或音画明显脱节即判失败。

这样做的意义是把“电影感”“一致性好”转换成能逐项检查的结果。尤其是字幕和音频质感,官方已经提示仍有改进空间,重要文字更适合留给后期排版。

第 3 步:给每份素材一个明确角色

素材越多,不一定越可控。先决定每份输入解决什么问题:

  • first_frame:锁定开场画面;
  • last_frame:只有需要明确落点时才使用;
  • reference_image:固定人物、商品、服装或场景外观;
  • reference_video:提供动作、镜头节奏或空间运动参照;
  • reference_audio:提供人声、音乐或声音参考;
  • prompt:说明镜头顺序、动作因果、情绪与必须保留的约束。

不要在没有核对互斥规则时,同时塞入首尾帧、参考视频、文件和链接。先按 API 参考 检查当前模式支持的组合,再检查每个 URL 是否能被服务端公开访问。

下面这份任务单适合在真正构造请求前使用;它是规划模板,不冒充可直接复制的 API JSON:

yaml
model: wan3.0-video region: <与 API Key 和端点一致> output: duration: 24 resolution: 1080P ratio: "16:9" inputs: prompt_role: <镜头顺序、动作、声音和禁止项> first_frame: <可选;公开可访问 URL> reference_images: <0-10 张,每张写明约束对象> reference_videos: <0-5 个;本例合计 6 秒> reference_audio: <0-5 个;合计不超过 15 秒> acceptance: - <镜头连续性检查> - <角色与道具检查> - <音画与文字检查> - <文件可播放、时长、分辨率和帧率检查>

第 4 步:按官方示例创建异步任务

Wan 3.0 的官方托管流程是异步的:先创建任务,拿到 task_id,再查询任务状态。这里不硬编码端点主机名,因为不同区域和工作空间可能不同;最安全的做法是从目标区域的最新官方文档复制请求示例,并只替换模型、媒体、时长、分辨率、比例和提示词等必要字段。

提交前做最后一次机器可检查的预检:

text
[ ] model、API Key、endpoint 在同一区域 [ ] 输入视频总时长 + duration ≤ 30 [ ] 图片、视频、音频数量与总时长未超限 [ ] 媒体组合没有触发模式互斥 [ ] 所有媒体 URL 可由服务端访问,格式与尺寸符合文档 [ ] 已记录任务输入摘要、提交时间和预期验收标准

如果 API 返回参数错误,不要立刻删素材碰运气。先按顺序核对:媒体类型名称、互斥组合、URL 可访问性、输入视频总时长、duration、区域一致性。这样能把“模型效果不好”与“请求根本不合法”区分开。

第 5 步:轮询、下载,并做两层验收

拿到 task_id 后,以合理间隔轮询,不要把创建请求重复提交成多个任务。成功后立即下载 MP4:官方 生成指南 说明结果 URL 仅保留 24 小时。

先做文件层验收:

  • 文件能完整下载并解码;
  • 容器为 MP4,帧率与文档说明一致;
  • 实际时长、分辨率和画幅符合请求;
  • 保存文件哈希、task_id、模型 ID、区域和生成时间,便于追溯。

再做内容层验收:按第 2 步逐项检查人物、道具、空间、动作、音画和文字,不要只凭“第一眼好看”放行。真实 30 秒输出的一致性、延迟、失败率与字幕准确性未在本轮独立测试,供应商案例也不能替代你自己的代表性素材验收。

读者能按输入视频时长计算输出预算,并完成提交、轮询、保存与验收

什么时候该用官方托管,什么时候该等待权重

如果目标是尽快验证多模态 30 秒短片,并且可以接受素材上传到指定区域的托管服务,那么官方 API 是当前证据最清晰的路径。先用一组不敏感、可重复的代表性素材完成小规模验收,再决定是否进入正式生产。

如果硬性要求是离线部署、自主管理权重、审计推理代码、固定特定许可证,或在内网处理敏感素材,那么当前公开证据还不足以把 Wan 3.0 选为已具备本地交付条件的方案。等待并核验官方权重文件、模型卡、推理仓库和对应许可证,比依据第三方页面提前做算力预算更稳妥。

最后记住这条判断链:API 文档证明托管能力,仓库文件证明实际公开内容,许可证只覆盖实际分发的作品,而生成质量必须由你的素材验收。 把这四层分开,Wan 3.0 的采用决策就不会被“官方”“开源”或“30 秒”三个醒目词带偏。

#Wan 3.0#AI 视频#多模态#API#开源
分享文章: