在2026云栖大会上,阿里巴巴 ATH 事业群技术副总裁、淘天集团首席科学家郑波拆解了当下多模态生成 AI 的行业变革趋势,同时公开了阿里巴巴全模态生成模型的最新迭代成果与未来技术蓝图。
阿里巴巴 ATH 事业群技术副总裁、淘天集团首席科学家郑波
从图像、音乐、虚拟世界到智能视频创作,阿里 AI 正在打破各类模态壁垒,朝着统一全模态生成模型全速进化,将改写内容创作行业的底层逻辑。
01 多模态 AI 质变:从生成内容,到创造沉浸式体验
当下的多模态生成领域,正在发生三大核心变革,AI 早已跳出单一内容生成的局限,迈入全新发展阶段。
首先,文本、图像、视频、声音、空间能力加速协同融合,行业正式告别单模态单点能力,进入多模态一体化发展时代。
其次,AI 不再只是机械生成内容,而是能够读懂人类创作意图,打造完整沉浸式视听交互体验,完成了从浅层内容生成到深层体验塑造的跨越。
最后,多模态 AI 走出实验室,深度落地广告、影视、游戏、电商等实景场景,成为全网内容生产的全新基建。
如今 AI 生成内容的真实度,已经达到人类难以分辨的水准。ACM 通信研究数据显示,人类识别 AI 生成内容的平均准确率仅为 51.2%,识别概率基本等同于抛硬币。
技术迭代的同时,市场规模也在爆发式增长。数据显示,63% 的视频营销人员已常态化使用 AI 视频工具,预计 2030 年,AI 图像、视频生成市场规模将达到608 亿美元。
郑波表示,传统内容创作链路冗长,从想法到落地存在极高门槛。而全模态生成 AI 的核心价值,就是大幅降低想象落地成本,让创意直接转化为可看、可听、可交互的体验,未来体验供给将呈指数级增长,边际成本无限趋近于零。
02 阿里巴巴全模态生成模型迭代:覆盖图像、音乐、虚拟世界、视频全场景
经过多年布局,阿里已搭建起完整的全模态生产体系,拥有 Qwen‑Image(图像生成)、Wan/Happy Horse(视频生成)、Happy Shrimp(音乐生成)、Happy Oyster(世界模型) 等多款核心模型,覆盖不同创作场景与用户需求。
在本次云栖大会上,多款模型迎来重磅升级。
Qwen‑Image 3.1:可直接商用的生产力级图像生成工具
全新升级的 Qwen‑Image 3.1,主打生产力落地,生成内容不仅画面精美,更具备精准的信息理解、排版设计与专业认知能力,成品可直接上线交付。
郑波重点讲解了Qwen‑Image 3.1在商业、创意、学术、消费四个典型场景的应用能力。
例如服饰海报,这款模型能够精准复刻、批量生成统一风格套图,还能根据剧情自动生成含画面、对白、镜头语言的电影分镜脚本。
针对学术原理示意图、主题海报、长图文排版等专业场景,模型也能精准理解核心逻辑,实现高密度信息的分层排版,重点清晰、观感专业。
除基础生成能力外,模型的智能编辑与空间推理能力大幅提升。支持图片风格改写、元素替换、3D 多角度造型生成,还能基于单张图片推演周边环境,生成可 360 度观看的全景沉浸式画面。
Happy Shrimp 1.1:零基础也能创作专业歌曲
继 7 月推出初代音乐模型后,阿里正式发布 Happy Shrimp 1.1 版本,实现了音乐创作能力的全方位升级。
新版本支持百余种曲风、十余种流行音乐风格,可独立完成人声歌曲、纯音乐的全流程创作,相比 1.0 版本有四大核心突破:
旋律记忆点更强,音乐性与稳定性显著提升;
人声表现更鲜活,唱法多元,情绪表达精准可控;
深度理解创作意图,复杂指令遵循度大幅优化;
多语言演唱发音清晰,改善错字、含混问题。
这款模型实现了普惠与专业双向适配。对专业创作者而言,它是可精细化调控的工业级音乐生产工具;对普通用户来说,无需乐理、无需乐器,一句话就能将创意变成完整歌曲。
Happy Oyster 2.0 Preview:逼近真实的实时交互虚拟世界
AI 的核心进化方向,不止是内容生成,更是理解世界、交互世界。本次亮相的 Happy Oyster 2.0 Preview 版本,让 AI 虚拟世界的真实度、稳定性、交互性实现跨越式升级。
首先是物理规则写实化,虚拟场景中的物体运动轨迹、碰撞、飞溅效果,完全贴合现实物理规律,告别 “虚假仿真”。
其次是世界记忆更稳定,依托 3D 增强型时空记忆技术,模型可将场景、物体、运动轨迹统一映射至三维空间,即便切换镜头、视角,场景位置、形态也不会错乱。
最后是交互实时化,通过 AI 扩散模型与策略训练方案优化,用户操作后的虚拟世界反馈更快、延迟更低,无限逼近真实实时交互体验。
同时,阿里联合北大、南大等高校,搭建世界模型评估标准体系,为行业发展统一评判尺度。
03 视频 AI 迈入新时代:从素材生成到自主智能创作
作为多模态赛道竞争最激烈的领域,视频生成 AI 在半年内完成了多轮迭代,郑波清晰梳理了行业演进路径。
行业早期处于基础验证阶段,核心目标是解决视频生成的画质、流畅度问题;今年上半年,行业迈入多模态生成阶段,模型可融合文字、图片、音视频多维度信息创作,这也是目前主流用户的核心使用场景。
而当下,视频 AI 正在迈入全新的智能化创作阶段。
全新的智能化视频生成模型,不再是简单拼接素材片段,而是具备完整的创作思维:能够读懂核心创作目标,理解故事叙事逻辑与镜头语言,可自动拆解剧情、设计分镜、搭配角色场景,完成全流程视频创作。
郑波表示,阿里视频生成模型将持续朝着时长更长、结果更可控、叙事更完整、创作更智能四大方向进化:长时间内容保持画面一致性、精准掌控全量创作元素、完整还原剧情情绪、深度匹配用户创作意图,打造具备 “导演思维” 的 AI 模型。
他正式预告,阿里全新升级的视频大模型,将于今年 11 月正式上线,进一步解锁 AI 智能创作的全新能力边界。
04 预判:3 年内,全模态统一 AI 模型将诞生
郑波给出了自己对 AI 行业未来的判断:当下所有细分模态模型,都只是阶段性过渡产品。
未来三年内,行业将诞生原生全模态统一生成模型。
这并非图像、视频、音乐等多类模型的简单功能拼接,而是单一模型原生具备全维度能力,可统一完成内容生成、世界理解、场景交互。
届时,AI 创作将打破模态壁垒,技术规模化落地难度大幅降低。行业也将完成从 “生成内容” 到 “理解世界”、从 “分散模型” 到 “统一架构”、从 “单一内容” 到 “全域体验” 的终极蜕变。