AI资讯 / 产业

产业 / 媒体

支持文本、图片与文档生成最长30秒AI视频

The Decoder

阿里巴巴视频生成模型Wan3.0正式进入公测阶段,相较前代Wan2.5,最大视频时长从15秒翻倍至30秒,并新增对PDF、网页、PowerPoint等文档格式的输入支持。用户单次提示词可同时包含最多10张图片、5段视频和5段音频,模型还会根据提示内容自动推荐最佳视频时长,并提供视频延长工具。在画面一致性方面,Wan3.0针对AI视频常见的人脸变形、界面漂移等问题进行了专项优化,能够更稳定地保留参考素材中的角色、道具与空间布局。定价方面,标准版1080p每秒0.2美元,30秒完整视频约需6美元。阿里巴巴将Wan3.0的应用场景定位为影视制作、短剧创作、营销视频生成以及自动驾驶与机器人仿真训练等领域。与此同时,阿里巴巴正大举押注AI基础设施,最新季度利润同比下滑75%,并在香港发起港股史上最大规模股票增发以筹集AI投资资金。

阿里巴巴旗下视频生成模型Wan3.0于2026年8月正式开放公测。与上一代Wan2.5相比,Wan3.0最显著的升级是将最大视频时长从15秒延长至30秒,同时大幅扩展了输入格式的兼容范围。除常规的文本和图片外,用户现在可以直接上传PDF文档、网页链接以及PowerPoint演示文稿作为生成素材,将静态内容转化为动态视频。

在多模态输入能力上,Wan3.0支持文本、图像、视频与音频的同步处理。单次提示词最多可包含10张图片、5段视频片段和5段音频素材,为复杂创作场景提供了充足的素材整合空间。此外,模型内置智能推荐功能,可根据用户的提示内容自动建议最合适的视频时长,并配备视频延长工具,方便对已有视频进行续接扩展。

AI生成视频长期面临画面漂移和细节失真的问题,尤其在人脸和用户界面等精细区域表现明显。Wan3.0针对这一痛点进行了专项优化,通过更严格地锚定参考素材中的角色外观、道具形态和空间布局关系,力求在整段视频中保持视觉元素的高度一致性,从而提升生成内容的可用性。

Wan3.0提供标准版和Prime两个服务层级,目前标准版享有七折优惠。以1080p分辨率为例,标准版每秒视频定价0.2美元,生成一段30秒完整视频约需6美元;Prime版速度更快,同等规格费用为8.4美元。用户可通过wan.video官网、阿里云模型工作室或Qwen Cloud API三种渠道访问该服务。

阿里巴巴为Wan3.0规划了广泛的商业应用场景,涵盖影视制作提速、短剧与社交媒体内容创作、企业营销与培训视频生成,以及为自动驾驶和机器人系统提供仿真训练数据等方向。这一布局折射出阿里巴巴在AI领域的全面加码战略——公司刚刚完成港股史上最大规模股票增发以筹集AI投资资金,最新季度净利润也因AI支出大幅攀升而同比下滑75%。

要点

  • Wan3.0将AI视频生成时长上限翻倍至30秒,并首次支持PDF、PPT、网页等文档格式直接作为输入源。
  • 模型支持多模态混合输入,单次可处理最多10张图片、5段视频和5段音频,并针对人脸和界面的画面一致性问题进行了专项优化。
  • 标准版1080p定价每秒0.2美元,30秒视频约6美元,通过官网、阿里云及API三种渠道均可访问。
  • 阿里巴巴将Wan3.0定位于影视、营销、自动驾驶仿真等多元场景,显示其AI商业化布局的纵深扩展。
  • 大规模AI投入已对财务产生显著压力,阿里巴巴最新季度利润同比下滑75%,并发起港股史上最大规模增发融资。
查看原始来源

原始标题:Alibaba's Wan3.0 generates AI videos up to 30 seconds long from text, images, and documents

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。