今天下午刷到一条消息:阿里 Wan 3.0 正式上线了。单次 30 秒原生视频,还支持直接传 PPT、Word、PDF 进去生成视频——你没看错,扔一个 PPT 进去,它给你吐出一段视频。
我第一反应是:这玩意跟 Seedance 2.5 有什么区别?后来又看到 FLUX 3 上个月也发了,MiniMax H3 开源了。一周之内,四五个模型扎堆出来。这不是巧合。
先说说今天上线的 Wan 3.0 到底做了什么。
单次 30 秒原生生成,这个不是最意外的——Seedance 2.5 已经做到了。真正让我觉得有意思的是它支持文档输入。你丢一个 .docx 或者 .pptx 进去,它能理解里面的文字和排版逻辑,然后生成对应的视频内容。这个场景太直接了——企业里做汇报、做产品介绍,以前要写脚本、找素材、剪辑,现在一步到位。当然,效果好不好另说,我还没拿到实测资格,但方向是对的。
然后你再往前看两周。8 月 20 号,Black Forest Labs 发布了 FLUX 3,主打 20 秒原生音视频同步生成。20 秒不算长,但关键是"原生音视频同步"——画面和声音是同一个模型、同一轮推理生成的,不是后期拼上去的。这个技术门槛比大部分人想象的高得多。
为什么"原生同步音频"突然成了主旋律
如果你在过去一年里用过任何 AI 视频工具,大概率遇到过这个问题:角色嘴在动,声音晚半秒;环境音和画面氛围对不上。原因很简单——以前的视频模型是先出画面,再用另一个模型配音,两套系统各自为政,最后硬拼在一起。
2026 年 8 月的这批发布,有一个明确的共性:大家都在往"统一多模态生成"的方向走。
FLUX 3 是第一个把这件事做出来的。它的架构里,视频和音频的 latent 空间是共享的——生成视频帧的同时,同一套模型也在生成对应的音频信号。这跟以前的"先画后贴"有本质区别。MiniMax H3 开源的时候也强调了这一点,它支持文本、图像、视频、音频四种模态统一输入,原生输出带立体声的 2K 视频。
阿里 Wan 3.0 没公开太多架构细节,但从它支持文档输入这个能力来看,它的多模态理解层应该也做了统一处理——不然不可能理解一个 .pptx 里的多页内容和排版逻辑再转成视频叙事。
这个趋势背后的驱动力其实很朴素:用户不关心你的模型是分两步还是三步,他们只关心音画是不是同步、角色是不是漂移、能不能直接拿来用。以前靠后处理勉强能糊弄,但到了商业化阶段,糊弄不过去了。
另一个值得聊的事:中国模型为什么霸榜了
彭博社 8 月 9 号发了一篇文章,说 Artificial Analysis 的文生视频排行榜前十名里,九个是中国模型。可灵 AI、Seedance 2.5、MiniMax H3 占了前三。
我读到这个数据的时候愣了一下,然后去翻了翻榜。确实如此,唯一的非中国模型是 Google 的 Veo 3.1,排在第四。
这个格局是怎么形成的?我觉得有三件事起了作用。
第一是场景驱动。中国的短视频和直播生态全球最卷,对 AI 视频的需求不是"能不能生成",而是"能不能用"。快手做可灵不是为了炫技,是因为它有几亿用户每天在刷短视频,需要更低成本的视频生产工具。需求倒逼技术迭代,这个逻辑在 AI 视频领域特别明显。
第二是开源策略。MiniMax H3 开源了,MAGI-2 也开源了。有开发者直接拿 H3 的权重在本地搭视频生成服务,社区反馈一上来,bug 修得快,文档补得勤。这个循环在闭源模型里不存在。
第三是成本控制。Bloomberg 那篇文章也提到了,中国模型的 API 价格大概是美国同行的三分之一到五分之一。Seedance 2.5 生成一段 30 秒视频的成本不到 0.5 美元,而 Runway 的 Gen-3 要 2 美元以上。价格差到这个程度,用户自然会投票。
但这里有个问题我一直在想:调用量和用户量领先,不等于技术领先。中国模型在短视频、直播、电商这些场景里确实用得好,但在电影级制作、长叙事、物理世界模拟这些高难度场景上,差距还在。Veo 3.1 在物理规律的理解上明显比大多数中国模型强——你让它生成一个杯子从桌上掉下来碎掉,它知道碎片的运动轨迹;中国模型偶尔还会出现"杯子碎了但碎片飘在空中"这种物理错误。
从"能生成"到"可工程化",中间差了多远
8 月的这波发布,最让我兴奋的不是哪个模型性能更强,而是整个行业正在从"能生成"走向"可工程化"。
什么叫"可工程化"?三个标准:
第一,结果可预期。以前你给同一个 prompt 跑两次,出来的视频可能完全不一样——镜头、角色、风格全变。现在的模型在一致性上做了大量工作。Wan 3.0 号称在角色、道具、空间关系上可以稳定保持,Seedance 2.5 支持最多 50 个多模态参考素材。意思是你告诉模型"主角长这样",它就不会在下一帧换张脸。
第二,流程可集成。Wan 3.0 支持文档输入,意味着它可以嵌入到现有的企业工作流里。你不需要学新工具,不需要写 prompt 工程,把 PPT 丢进去就行。ComfyUI 甚至出了 MCP 接口,让 AI agent 可以直接调用本地的 ComfyUI 工作流——这对开发者来说意味着什么?意味着你可以把视频生成写进 CI/CD pipeline 里。
第三,成本可接受。前面说了价格,但真正关键的不是单次生成的价格,而是"生成到你满意的价格"。以前生成一段 10 秒的视频,你可能要跑 20 次才能挑到满意的,实际成本是标价的 20 倍。现在模型质量上来了,成功率高了,反复重试的成本降了。这才是真正的"成本可接受"。
还差最后一块拼图
看完 8 月所有发布,我脑子里冒出一个问题:AI 视频生成的"工程化"已经走了九十九步,但最后一步——可控性——还没人真正走完。
什么是可控性?就是你告诉模型"第三秒到第五秒之间,镜头从特写拉远到中景,背景从白天变成黄昏,主角的表情从惊讶变成微笑",它真的能做到。现在的模型,你给它一个 prompt 描述"一个悲伤的早晨",它能生成一段不错的视频,但你想精确控制每一帧的构图和情绪,做不到。
这跟语言模型不一样。语言模型你写 prompt 可以精确控制输出,因为 token 是离散的。视频的像素空间是连续的,控制粒度天然就粗。所以下一步的关键技术突破,我觉得不是"生成更长的视频"(30 秒已经够用了),也不是"生成更清晰的视频"(1080p 大多数场景够了),而是"生成你可以精确控制的视频"。
你觉得这个方向对了还是错了?或者说,AI 视频生成的下一个分水岭,会在哪里?欢迎在评论区聊聊。