短视频自十几年前诞生以来内容创作不断优化,大量网民在此类APP花费的时间也在不断增加,但是下一代内容平台还会只是“更短、更快、更高清的视频”吗?
我不太这样认为。
过去二十多年,互联网内容经历了从网站、博客、论坛,到微博、朋友圈,再到短视频和直播的变化。表面上看,是内容载体换了;更深一层看,是人们表达和消费内容的方式变了。
我们已经从“读别人写的东西”,走到了“看别人拍的东西”。
下一步,也许是直接进入别人创造的世界。
从网页到短视频,变化的不只是内容格式
2000 年前后,很多人上网是为了浏览门户网站、论坛和博客。
那个阶段,互联网更像一个巨大的信息公告栏。网站负责生产和整理内容,用户主要负责阅读。
博客兴起之后,普通人也可以拥有自己的页面。后来微博、朋友圈和社交平台把发布内容变得更简单:写几句话,配一张图片,就可以参与讨论。
短视频的爆发又往前走了一步。
智能手机降低了拍摄成本,4G 网络解决了视频传输,推荐算法让内容更容易找到观众。以前需要专业设备和剪辑团队才能完成的视频,后来一个人拿手机就能做出来。
所以,互联网内容的每次升级,背后都离不开一个条件:
创作成本下降了。
当更多人能创作,平台上才会出现更多内容;当内容足够多,新的分发和消费方式才会出现。
3D 内容的普及,也可能遵循同样的规律。
3D 内容的门槛,为什么比视频高这么多?
视频主要是一种线性的观看体验。
它当然复杂,但创作者只需要保证镜头、声音和叙事能够按照预定顺序播放。观众看到的内容,大体也是创作者提前决定好的。
3D 内容不一样。
如果用户可以进入一个场景,那么场景里的东西就不能只“看起来像真的”,还要能够运行:
- 角色要能移动;
- 摄像机要能控制;
- 物体要有碰撞关系;
- 任务要有触发条件;
- 交互要有反馈;
- 场景要能保持连贯;
- 游戏还要经过测试、优化和发布。
做一张游戏概念图并不难。
做一个真的可以玩的游戏,难得多。
它需要美术、程序、策划、技术美术、测试等多个环节一起工作。一个人即使有很好的创意,也经常会卡在“不会把它做出来”这一步。
这也是为什么,3D 游戏和互动内容长期以来主要由专业团队生产。
图片来源:SEELE AI 公开展示的《Shattered Front》游戏画面。
Seele Agent 更像是今天正在发生的变化
我现在参与的是 Seele Agent 生成 3D 游戏内容的相关工程。我的工作重点在 Unreal,但从整个产品方向来看,Unreal 只是其中一个具体的技术入口,并不能代表全部。
今天更现实的变化,不是世界模型已经完全成熟,而是 Agent 开始能够调用不同的工具和游戏引擎,帮助用户把一个想法逐步变成可运行的 3D 内容。
用户可以先描述一个方向:
我想做一款俯视角Roguelite:玩家在黑暗雨林中抵御不断涌现的敌人,在战斗间隙选择强化能力,最终挑战boss逃出生天。
接下来,Agent 需要处理的就不只是“生成一张雨林生存的图片”,还包括场景、角色、敌人、交互、规则和运行环境。
这类工作可能会涉及不同的引擎、资产工具、脚本和发布流程。对于用户来说,重要的不是底层到底使用哪一个引擎,而是能不能少面对一些重复性的搭建工作,把注意力放回到创意和体验本身。
从我自己的工程经历来看,真正难的地方也不是让 AI 偶尔生成一个漂亮场景,而是让生成结果能够运行、能够被检查、能够继续修改,最后成为一个可以交付的内容。
现在是 Agent 生产,未来才是世界模型成为主力
这里需要区分两个阶段。
当前更接近“Agent + 游戏引擎”的阶段。
Agent 理解用户意图,再调用建模、编程、关卡、资产和引擎工具,把内容组织成一个可以运行的项目。引擎仍然承担渲染、碰撞、物理、输入和运行时等重要工作。
这条路线已经可以解决很多实际问题,尤其适合快速做原型、验证玩法、制作小型作品和尝试不同创意。
但它仍然受到传统生产流程的约束。AI 需要理解引擎,调用工具,处理项目文件,再通过多轮操作把内容拼起来。
未来的世界模型,则可能进一步改变这件事。
今年 4 月百度云游戏广州大会的公开分享,以及随后公开报道中的相关采访,都提到了 Seele AI 对 3D 多模态模型和世界模型的探索。报道中也明确区分了当前阶段与未来阶段:现阶段仍然需要依托 Unity、Unreal Engine 等引擎完成很多运行和交互工作;世界模型成熟之后,才有可能减少对传统引擎生产链的依赖。
这不是“现在已经完全实现了”,而是一条逐步推进的技术路线。
按照公开信息所表达的方向,未来几年世界模型会继续解决几个关键问题:
- 生成内容的空间一致性;
- 视觉表现和物理规律的统一;
- 场景状态的持续记忆;
- 更长时间的连续交互;
- 世界在用户行为下的动态变化。
如果这些能力逐渐成熟,3D 内容的生产方式就可能发生一次真正的变化。
现在是 Agent 帮你调用工具搭建世界。未来,世界模型可能直接理解并生成一个能够持续运行的世界。
为什么“世界模型”比“生成模型”更接近下一代内容?
生成一张图片,重点是画面是否成立。
生成一段视频,重点是画面能否连续变化。
生成一个世界,模型还需要理解这个世界中的规律。
它不仅要知道“这是火”,还要知道火会燃烧、会发光、会产生温度,靠近它的人会受到影响。
它不仅要知道“这是一个房间”,还要知道门在哪里、墙是什么、桌子能不能被推动,以及玩家离开房间后,房间里的状态是否应该继续保持。
这也是世界模型最难的地方:它需要把视觉、空间、时间和物理关系放在一起处理。
所以,世界模型并不是简单地把图片和视频生成能力叠加起来。
它最终要生成的是一套可以继续变化的状态。
未来的平台,可能推荐的是“世界”
今天的平台推荐一条视频、一篇帖子或一场直播。
未来的平台可能推荐另一种内容:
- 一个五分钟可以体验完的小游戏;
- 一段可以自由探索的剧情;
- 一座能够参观的虚拟城市;
- 一个由用户自己设计的社交空间;
- 一个会根据玩家行为发生变化的世界。
用户打开内容后,不一定是从头看到尾,而是进入其中,自己决定去哪里、做什么、和谁互动。
这会改变很多平台机制。
推荐算法推荐的,可能不只是“你喜欢看的内容”,还包括“你可能愿意进入的世界”。
收藏不再只是保存一个链接,而是保存一个还想回去继续玩的空间。
评论也不只是文字留言,还可能包含路线、玩法、角色设定和二次创作。
创作者的收益,也不一定只来自播放量。互动时长、用户付费、虚拟物品、作品授权和社区运营,都可能成为新的收入方式。
这不会只属于传统游戏
游戏只是最容易理解的切入口,因为游戏天然具备角色、规则、目标和反馈。
但当 3D 内容生产成本降下来之后,很多内容都可能变成可交互的:
- 一部可以参与剧情的动画;
- 一座可以自由游览的城市;
- 一场能够进入其中的演出;
- 一个用于教育和培训的模拟环境;
- 一个用于建筑展示和虚拟制作的数字空间;
- 一个可以和用户一起成长的品牌世界。
到那个时候,用户可能不会特别在意它究竟属于游戏、动画还是社交产品。
他只会问:
这个内容值不值得我进去?
AI 不会让创作者消失,但会改变创作者的工作方式
公开报道中,王诗沐提到过一个很重要的判断:AI 不会简单地让游戏人下岗,真正发生的更可能是岗位和生产方式迁移。
我很认同这一点。
如果 AI 能够处理更多重复的搭建工作,创作者反而有机会把时间放在更重要的事情上:
- 设计一个真正有意思的玩法;
- 找到作品独特的表达方式;
- 判断一个生成结果是否值得保留;
- 让内容拥有自己的价值观;
- 持续和 AI 沟通、修改和试错。
未来的创作者,可能不再只被定义为程序、美术或策划,而是一个能够提出想法、组织资源、判断结果并完成作品的人。
这也是 3D 内容生产真正有想象力的地方。
它不只是帮助专业团队降低重复劳动,也可能让更多原本没有完整开发能力的人,第一次拥有把创意做出来的机会。
从“观看内容”到“进入内容”
短视频把内容消费变得更快。
Agent 正在把 3D 内容生产变得更容易。
而当世界模型逐渐成熟之后,内容本身可能会变成一个可以持续运行、持续变化、持续被探索的世界。
这条路不会在一夜之间完成。
未来几年,Agent 和各种游戏引擎仍然会是重要的生产方式;世界模型则会逐渐补上空间理解、物理一致性和长时间交互这些能力。
所以我现在更愿意把它理解成一个连续的过程:
今天,用户通过 Agent 调用工具,搭建一个 3D 内容。
明天,用户可能直接描述一个想法,让系统生成一个完整的可交互世界。
互联网内容的下一次变化,未必是让我们看到更多东西,而是让我们有机会真正走进去。
如果想体验公开的 AI 3D 内容创作流程,可以访问:
SEELE AI Workspace
如果你更关注 AI 开发游戏,也可以查看:
SEELE AI 游戏创作页面