news 2026/8/25 17:06:06

从 JEPA 演进到 WAM:LeWorldModel 与 Fast-WAM 的一条连续技术脉络

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
从 JEPA 演进到 WAM:LeWorldModel 与 Fast-WAM 的一条连续技术脉络

0. 简介

2026 年 3 月到 4 月,世界模型方向连续出现了两组放在一起看才真正有意思的信号。第一组来自 JEPA 路线本身:从 V-JEPA 2、LeJEPA、Causal-JEPA、LeWorldModel、V-JEPA 2.1 到 ThinkJEPA,这条原本常被当作“抽象表征学习方法”的路线,开始明显分叉成动态视觉先验、轻量潜空间 world model、dense grounding 与长时语义推理等不同分支。第二组则来自一场更直接的方法论碰撞:2026 年 3 月 13 日公开的LeWorldModel与 3 月 17 日公开的Fast-WAM,几乎在同一时间把“world model 的价值到底留在训练时还是推理时”这个问题摆到了台面上。

如果说第一组信号回答的是“JEPA 这条线现在到底走到了哪”,那么第二组信号回答的就是“当 JEPA 式 latent world model 与大视频 backbone 的 WAM 正面对上时,真正的分歧在哪里”。LeWorldModel 更接近 JEPA 系的潜空间世界模型,强调稳定表征学习、rollout 和 goal-conditioned planning;Fast-WAM 则属于机器人控制中的世界动作模型,强调视频建模怎样在训练阶段塑造更强的内部表示,并在部署时尽量避免昂贵的显式未来生成。把它们放在一起看,会发现当前具身 world model 已经开始分成两种互补倾向:一种继续把 world model 当作推理时可查询的潜空间模拟器,另一种则把 world model 当作训练阶段塑造表征的机制,部署时尽量退到后台。

因此,本文真正要回答的不只是“LeWorldModel 和 Fast-WAM 谁更强”,也不是“JEPA 算不算 world model”,而是三个更关键的问题:JEPA 为什么重新回到具身主线;它现在已经分叉成了哪些真正不同的系统角色;以及 world model 的价值究竟应该更多保留在推理时,还是应该在训练时被吸收到参数里。为了回答这些问题,本文将从四个层次展开。第一部分先给出一个尽量清晰的世界模型分类,把“动作条件世界模型”“视频世界模型”“联合世界-动作模型”放到统一框架里解释。第二部分梳理 JEPA 的演进,并补上它在 2026 年前后出现的三条新分叉。第三部分再详细拆解 LeWorldModel 与 Fast-WAM 的方法、实验与实现流程。最后一部分则把两篇论文重新放回同一张图里,讨论它们共同指向的研究判断:世界建模最有价值的部分,往往不是把未来画出来,而是把物理结构学进去,并在系统中放到最合适的那一层。

1. 为什么世界模型重新成为机器人研究的核心议题

机器人控制从来不是简单的分类任务。一个系统如果只是把视觉输入直接映射为动作,它当然也可以在很多封闭场景中表现不错,但它对环境的理解往往是局部、短程和脆弱的。一旦任务跨越更长时间尺度,或者需要在未见过的场景里快速适应,这类“直接策略”就会暴露出明显局限:模型会做出合理动作,但未必知道动作将如何改变环境,更谈不上在内部推演不同方案的后果。

这正是世界模型被重新重视的原因。所谓世界模型,本质上是学习一个关于环境动态的内部表示。这个表示既可以是像素级未来视频,也可以是潜空间中的状态转移;既可以只建模观测如何变化,也可以同时建模动作、奖励乃至目标。对机器人来说,世界模型的价值至少体现在三个方面。第一,它让系统能够在执行前进行内部推演,而不是完全依赖在线试错。第二,它能把海量无标签视频或弱标签轨迹转化为关于物理世界的先验,从而缓解机器人数据昂贵的问题。第三,它让控制问题从“看到什么就做什么”转变为“基于世界如何演化来决定做什么”,这会直接改变系统的泛化方式。

过去几年,视频生成模型和视觉表征学习的快速进展,使这条路再次具备现实可行性。早期世界模型经常因为建模能力太弱、长程误差积累太快、数据规模太小而无法落地;但今天,视频主干模型、离线轨迹数据、扩散模型、表征学习和具身基准都比早期成熟得多。这也是为什么 2025 到 2026 年间,机器人世界模型论文开始集中爆发,且不同路线之间的差异越来越值得被认真区分。

2. 先分类:世界模型不止一种,LeWorldModel 与 Fast-WAM 也不在同一类里

如果不先分类,很容易把所有“能预测未来”的模型都混在一起,最后既看不清方法差异,也很难判断一篇论文真正解决了什么问题。结合近年的机器人研究和公开综述,可以把当前主流世界模型大致分成三类,再额外补充一个三维场景方向。

2.1 动作条件世界模型

这一类是最经典、也最“正统”的世界模型形式。它建模的是在当前观测和动作条件下,未来状态将如何变化。形式上,可以写成:

p ( o t + 1 : t + H ∣ o ≤ t , a t : t + H − 1 ) p(o_{t+1:t+H} \mid o_{\le t}, a_{t:t+H-1})p(ot+1:t+Hot,at:t+H1)

如果模型不直接预测像素,而是在潜空间中建模,则对应为:

p ( z t + 1 : t + H ∣ z ≤ t , a t : t + H − 1 ) p(z_{t+1:t+H} \mid z_{\le t}, a_{t:t+H-1})p(zt+1:t+Hzt,at:t+H1)

这类方法最贴近控制理论和基于模型的强化学习,也最强调“动作会如何改变世界”。其代表工作包括 Dreamer 系列、V-JEPA 2、RISE,以及很多 latent dynamics + MPC 的规划方法。它们的优点在于形式清晰、目标明确,天然适合做 roll-out、规划和 model predictive control;缺点则在于长期滚动误差极易累积,对动作标签和高质量轨迹依赖较强,而且一旦 roll-out 时长变长,预测偏差就可能迅速放大。

从研究传统上看,LeWorldModel 基本落在这一类内部。它虽然采用 JEPA 式潜空间训练,而不是像素重建,但推理接口依然是典型的 latent planning:先编码当前观测和目标观测,再在潜空间里对动作序列做优化搜索。因此,它属于动作条件世界模型中的潜空间规划分支,而不是直接输出动作的控制策略。

2.2 视频世界模型

第二类世界模型把重点放在未来视频生成上。它们并不总是显式建模动作条件,有些甚至主要依赖大规模互联网视频做预训练,然后再通过少量机器人数据配合一个逆动力学模型把动作恢复出来。其基本思路可以理解为两步:先预测未来视觉轨迹,再从连续观测之间反推出可能的机器人动作。

第 1 步:

p ( v t + 1 : t + T ∣ c o n t e x t ) p(v_{t+1:t+T} \mid context)p(vt+1:t+Tcontext)

第 2 步:

p ( a t : t + H − 1 ∣ v t : t + T ) p(a_{t:t+H-1} \mid v_{t:t+T})p(at:t+H1vt:t+T)

这一类方法的关键优势在于可以最大化利用视频数据,因为未来视频建模本身不要求每条数据都带动作标签。典型工作包括 DreamGen、LingBot-VA,以及一些以视频生成模型为核心、后接逆动力学或动作恢复模块的系统。它们通常拥有很强的视觉先验,能覆盖更丰富的现实场景,也更容易从互联网视频中获益;但它们同样面临一个老问题:未来视频虽然可以生成,但“从视频恢复可执行动作”本身并不简单,而且显式视频生成的推理成本往往很高。

2.3 联合世界-动作模型,也就是 WAM

第三类是近两年具身控制中最受关注的一条路线,即 World Action Models,WAM。这类方法不再把“预测未来视频”和“生成动作”拆成两个几乎独立的模块,而是尝试在统一框架中联合建模未来视觉演化与动作序列。最粗略地说,它建模的是:

p ( v t + 1 : t + T , a t : t + H − 1 ∣ o t , l ) p(v_{t+1:t+T}, a_{t:t+H-1} \mid o_t, l)p(vt+1:t+T,at:t+H1ot,l)

或者在一些实现中,视频 token 与动作 token 在同一个扩散或去噪框架中被共同预测。DreamZero 和 Fast-WAM 都属于这一类,只是它们对“推理时是否要显式解码未来视频”给出了不同程度的回答。

WAM 之所以吸引人,是因为它试图兼得两边的优势。一方面,它保留了世界模型从视频建模中学习物理与时间结构的能力;另一方面,它又不像传统视频世界模型那样必须先完整生成未来视频再恢复动作,而是可以把动作预测做得更直接。问题也恰恰出在这里:过去很多 WAM 把“训练时的视频协同建模”和“测试时的显式未来想象”绑在一起,因此很难判断模型变强到底是哪一环起了作用。Fast-WAM 的核心贡献,就是第一次比较系统地把这两个因素分开讨论。

2.4 三维世界模型是一个并行扩展方向

除了上面三类以外,还存在一个不断升温的方向,即 3D 世界模型。它们不满足于在 2D 图像或视频层面表示环境,而是直接学习三维场景表示、点云动态或几何一致的世界演化。这一方向与本文主线并不完全重合,但值得指出的是,很多 3D 世界模型实际上同样会借鉴 JEPA 的思想,即尽量在抽象表征空间里预测结构变化,而不是做逐点重建。PointWorld、Marble 等工作,可以视为把世界建模从 2D 感知进一步推进到几何层的平行分支。

3. 用一张表看清三条主线

路线代表建模对象典型接口代表工作主要优势主要问题
动作条件世界模型状态或潜状态转移latent rollout + MPC / planningDreamer、V-JEPA 2、LeWorldModel、RISE物理因果关系清晰,适合规划长时误差积累,依赖动作标签
视频世界模型未来视频生成视频后再恢复动作DreamGen、LingBot-VA能最大化利用无动作视频数据推理慢,动作恢复有歧义
联合世界-动作模型 WAM未来视频与动作联合建模统一生成或共享主干DreamZero、Fast-WAM同时吸收视频建模与动作学习收益训练与推理因素容易耦合

从这张表可以看出,LeWorldModel 与 Fast-WAM 在比较对象上并不对称。前者更像是在改进动作条件世界模型内部的“表征学习与稳定训练”问题,后者则是在质疑 WAM 这条线中一个非常流行的设计假设。因此,把两篇论文放在同一篇文章里,不是因为它们是同类模型,而是因为它们分别代表了当前世界模型研究中两个最关键的技术争点:潜空间怎么学稳,未来想象是否真的要在测试时显式发生。

4. JEPA 为什么重要:它不是“少生成一点”,而是改变了预测发生的空间

JEPA 的核心思想不是“少生成一点”,而是把预测从像素空间转移到抽象表征空间。传统生成式自监督学习往往要求模型重建像素、patch 或 token,也就是尽可能还原原始输入的细节。JEPA 则认为,这种训练目标把过多算力浪费在和下游决策无关的细节上。模型真正需要学习的,不是每个像素如何复原,而是哪些抽象因素能够支配未来状态变化。

因此,JEPA 把学习问题改写成了“在表征空间预测表征”。给定上下文观测,编码器先提取抽象特征;预测器再根据当前特征去预测未来或被遮挡区域的目标特征;模型损失发生在这个抽象空间里,而不是回到像素空间逐点对齐。这样做有两个直接好处。第一,模型会更倾向于保留语义上和动力学上重要的结构,而不是被纹理、颜色和高频噪声牵着走。第二,训练成本更低,因为不需要昂贵的像素级解码过程。

但这条路一开始也有一个几乎决定成败的问题:表征坍塌。如果目标只是“让预测表征接近目标表征”,那么最容易的作弊方式,就是把所有输入都映射到差不多的常数向量。这样损失照样可以变小,但模型再也没有区分能力。此后几乎所有 JEPA 路线的演进,某种意义上都可以被理解为:一边证明“在表征空间预测未来”确实是值得走的路,一边不断寻找更稳定、更一般化的抗坍塌机制。

下面这段极简伪代码可以帮助理解 JEPA 的本质。它并不对应某一篇具体论文的原始实现,只是把思想压缩成最小可理解单元:上下文编码器负责提取当前特征,目标编码器负责生成监督信号,预测器则在抽象空间里做对齐。

defjepa_step(context_view,target_view,context_encoder,target_encoder,predictor):z_ctx=context_encoder(context_view)withtorch.no_grad():z_tgt=target_encoder(target_view)z_pred=predictor(z_ctx)return((z_pred-z_tgt)**2).mean()

真正困难的部分当然不在这四行代码,而在于如何让z_ctxz_tgt既不坍塌,又保留足够多的动态结构。也正因此,JEPA 的历史不能只看“有哪些应用”,还必须看它是如何一层层处理这个稳定性问题的。

5. JEPA 的演进史:从理论主张到视频规划,再到端到端世界模型

5.1 概念阶段:从“不要重建像素”到“在抽象空间预测未来”

JEPA 最早的重要意义,不在于它一开始就拿下了多少 benchmark,而在于它明确提出了一个与主流生成范式不同的研究纲领:预测应当发生在抽象表征空间,而不是发生在像素空间。这背后对应的是 LeCun 对感知与智能关系的长期判断,即真正支撑规划和物理理解的,不是细枝末节的重建能力,而是稳定、可组合、可外推的世界表示。

这一阶段的工作主要是在理论层面和结构层面提出 JEPA、层级 JEPA 等设想,试图说明如果模型拥有多时间尺度、多层级的潜空间表示,那么它就更可能承载长程预测与计划。虽然这些工作离现实机器人系统还有距离,但它们为后面的 I-JEPA 和 V-JEPA 划定了一个很明确的方向:世界模型不必先学会“生成得很像”,而应先学会“理解得足够抽象”。

5.2 I-JEPA:JEPA 在图像上的第一次大规模落地

2023 年的I-JEPA是 JEPA 真正完成工程落地的关键一步。它的核心贡献不是发明了复杂的新模块,而是证明了在不依赖手工数据增强、不做像素重建的前提下,模型依然可以学到高质量图像语义表征。训练时,I-JEPA 会在图像中采样上下文区域和多个目标区域,上下文编码器只看可见部分,目标编码器生成目标区域的抽象表征,预测器则基于上下文去预测目标区域在表征空间中的表示。

这一步的重要性在于,它把 JEPA 从“一个听起来很有道理的思想”变成了“在大规模图像预训练上可以工作的路线”。I-JEPA 还展示了一个后续影响很大的判断:如果掩码区域足够大、上下文与目标不重叠,那么模型会被迫学习全局语义,而不是依赖局部像素插值来作弊。也就是说,JEPA 不只是把损失挪到了潜空间,它同时把“预测什么”这件事设计成了一个必须理解结构才能完成的任务。

5.3 V-JEPA:JEPA 进入视频,世界模型意味开始显现

到 2024 年的V-JEPA,JEPA 的重点已经从图像表征学习推进到时空动态学习。视频相比静态图像,真正难的地方在于不仅信息量更大,而且未来存在时间因果与运动不确定性。传统像素重建式视频模型虽然也能学习时空结构,但代价高昂,而且很容易把容量耗在视觉细节上。V-JEPA 的贡献是证明:视频表征预测本身就可以成为独立且有效的自监督目标

V-JEPA 在训练时大量掩蔽视频中的时空块,让模型只根据少量上下文去预测目标块的表征。为了防止模型通过相邻帧做简单插值,掩码会穿透整个时间维度,从而迫使模型学习更真实的动态结构。这一步非常关键,因为从这里开始,JEPA 已经不再只是“一个高效的视觉预训练方法”,而是逐渐具备了世界模型的味道。模型虽然不显式生成未来视频,但它必须在内部形成对世界动态的抽象理解,才能把未来的表征预测对。

5.4 V-JEPA 2:从表征学习走向动作条件规划

真正让 JEPA 进入机器人语境的里程碑,是V-JEPA 2。这篇工作把 JEPA 不只是当作一个视频理解 backbone,而是明确朝着“理解、预测与规划”三合一的方向推进。它不再只关心“未来表征能不能预测对”,而是进一步把动作条件和目标导向的规划问题纳入框架,展示出一定程度的零样本机器人规划能力。

从研究意义上说,V-JEPA 2 做了两件事。第一,它让 JEPA 和“动作条件世界模型”真正接轨,不再只是自监督表征学习。第二,它证明了潜空间世界模型不一定需要回到像素空间才能为控制服务,潜空间本身就可以成为规划发生的场所。LeWorldModel 后面会沿着这条路继续向前,但它关注的焦点已经不是“JEPA 能不能规划”,而是“JEPA 端到端从像素学出来时,到底如何稳定训练”。

5.5 LeWorldModel:JEPA 演进中的一个分水岭

LeWorldModel 之所以重要,不只是因为它是一篇 2026 年的新论文,而是因为它正面处理了 JEPA 路线最顽固的问题:从像素端到端训练时的表征坍塌与训练不稳定。过去许多 JEPA 世界模型都需要 EMA 目标编码器、stop-gradient、复杂的多项损失、甚至外部预训练编码器来“扶着走”;LeWorldModel 则尝试把这个问题重新数学化,只保留“下一步特征预测”和“潜空间高斯正则”两个核心目标。

这意味着 JEPA 的演进,到 LeWorldModel 这里出现了一个明显的研究重心变化。早期路线主要在证明“抽象空间预测是可行的”;中期路线在扩展到视频、动作与规划;而 LeWorldModel 所代表的新阶段,开始更强调如何用足够简单而稳定的机制,把 JEPA 真正变成一个端到端世界模型基础范式。

5.6 2026 年之后的三条分叉:JEPA 不再只是 V-JEPA 2

如果今天还把 JEPA 理解成“V-JEPA 2 那条线的延长版”,已经不够了。2026 年前后的新工作更重要的变化,是 JEPA 从单一视频表征路线,分化成了几条系统位置不同的技术支线。

第一条分叉,是把 JEPA 当作具身系统里的动态视觉先验。这条线以 V-JEPA 2 为分水岭,但重点已经不再只是“能不能做一个机器人 demo”,而是互联网视频中学到的动态抽象能否变成 VLA、policy 或 imitation learning 的上游先验。ACT-JEPA、VLA-JEPA、JEPA-VLA、EmbodiSwap 这类工作,本质上都在强调同一件事:仅有 image-language 或 image-SSL 特征,对具身控制来说仍然太静态;系统需要某种 video predictive embedding,去补上动作后果建模这块短板。换句话说,JEPA 在具身里最先稳定落地的角色,很可能不是“大一统 agent”,而是 agent 栈前端的一层 dynamics prior。

第二条分叉,是把 JEPA 继续往真正可训练、可部署的 world model 结构推进。这条线上的代表不只包括 LeWorldModel,还包括更偏训练理论的 LeJEPA、引入对象级 latent intervention 的 Causal-JEPA,以及把双曲几何与多步视觉规划结合起来的 GeoWorld。它们共同回答的是另外一类问题:如果 JEPA 不再只被看作表示学习,而是要真正成为 planner 背后的世界模型,那么它能否摆脱过多 heuristics、学到对象级交互、并在计算成本和复现稳定性上更接近可部署系统。LeWorldModel 在这里的重要性,不只是它跑得轻,而是它第一次让“端到端 JEPA world model”这件事看起来像一个能被系统工程吸收的形态。

第三条分叉,是把 JEPA 从“会预测”继续推向“会定位、会交互、会和高层语义推理拼接”的表征层。V-JEPA 2.1 的 dense predictive loss、deep self-supervision 和 image-video unified tokenizer,解决的是 JEPA 早期一个很现实的问题:如果 latent world model 只擅长全局语义,却不擅长 dense、space-aware、interaction-sensitive 的表征,那么它离真实操作仍然很远。ThinkJEPA 则更进一步,明确把 dense physical prediction 和 VLM thinker 组合起来,让 JEPA 负责高频物理动态,VLM 负责长时语义与知识引导。这意味着 JEPA 正在从“一个会预测的视频 backbone”,走向“能和高层 reasoning 模块形成稳定分工的底层预测层”。

把这三条分叉放在一起看,JEPA 的身份已经变了。它不再只是一个单点方法名,而更像是一层latent predictive substrate:有时位于 VLA 前端,有时位于 planner 背后,有时又作为 dense/3D/语义推理模块的底层预测层。也正因为这样,今天再谈 JEPA,已经不能只停在 I-JEPA、V-JEPA、V-JEPA 2 那条单线时间轴上。

6. LeWorldModel:把“稳定训练 JEPA 世界模型”这件事做成了

LeWorldModel 的关键贡献,是把“从原始像素稳定训练 JEPA 世界模型”这件事真正做成。LeWorldModel 的标题非常直白:Stable End-to-End Joint-Embedding Predictive Architecture from Pixels。它关心的重点不是让模型规模更大,而是把“从像素到潜空间、再到世界动态”的全过程做得尽量简单和稳定。论文采用的是离线、无奖励、任务无关的数据设定,只使用观测序列和动作序列进行训练。模型本体由两个部分组成:一个视觉编码器e n c θ enc_\thetaencθ,把每一帧图像o t o_tot映射到潜表示z t z_tzt;一个动力学预测器p r e d ϕ pred_\phipredϕ,根据当前潜表示和动作a t a_tat预测下一时刻的潜表示z ^ t + 1 \hat{z}_{t+1}z^t+1

从结构上看,这其实非常朴素:

z t = e n c θ ( o t ) z_t = enc_\theta(o_t)zt=encθ(ot)

z ^ t + 1 = p r e d ϕ ( z t , a t ) \hat{z}_{t+1} = pred_\phi(z_t, a_t)z^t+1=predϕ(zt,at)

如果只做到这一步,问题并不难;真正难的是,只优化下一步预测误差时,模型极易把所有输入压缩到近乎恒定的表征,也就是前面提到的 collapse。LeWorldModel 的关键做法,是在预测损失之外加入SIGReg,把潜表示约束为接近各向同性高斯分布。它不是简单做 batch normalization 意义上的白化,而是把高维表征投影到大量随机方向上,并在这些一维投影上做统计正则,从而逼迫潜空间保留多样性和结构性。

这种设计的意义在于,它把过去大量启发式稳定技巧压缩成了一个更像目标函数本身组成部分的正则项。论文强调,LeWorldModel 的有效超参数几乎只剩一个主要权重λ \lambdaλ,而不再需要围绕多个损失项反复配平。对于研究者而言,这点非常重要,因为很多 JEPA 或 latent world model 论文的复现困难,往往并不来自主干网络本身,而恰恰来自那些为防坍塌而加上的附加机制过多、耦合太强。

LeWorldModel 的训练目标可以概括为:

L = L pred + λ ⋅ S I G R e g ( Z ) L = L_{\text{pred}} + \lambda \cdot SIGReg(Z)L=Lpred+λSIGReg(Z)

其中,L pred L_{\text{pred}}Lpred是下一步潜表示预测误差,S I G R e g ( Z ) SIGReg(Z)SIGReg(Z)用于约束潜表示张量的分布。把这件事写成代码,逻辑其实非常清楚。下面这段 PyTorch 风格代码不是官方仓库逐行复制,而是根据论文训练目标整理出的最小骨架,足以看清方法到底在做什么。

importtorchimporttorch.nn.functionalasFdeflewm_loss(encoder,predictor,obs,actions,lambda_sigreg,sigreg_fn):""" obs: [B, T, C, H, W] actions: [B, T, A] """z=encoder(obs)# [B, T, D]z_pred=predictor(z,actions)# [B, T, D]pred_loss=F.mse_loss(z_pred[:,:-1],z[:,1:])reg_loss=0.0fortinrange(z.shape[1]):reg_loss=reg_loss+sigreg_fn(z[:,t,:])reg_loss=reg_loss/z.shape[1]returnpred_loss+lambda_sigreg*reg_loss

需要强调的是,LeWorldModel 的推理接口并不是“直接输出动作”,而是“在潜空间里做规划”。在测试时,系统会先把当前观测o 1 o_1o1和目标观测o g o_gog分别编码为z 1 z_1z1z g z_gzg,再对候选动作序列进行 rollout,使预测到的末端潜状态尽量接近目标潜状态。论文使用的是 CEM,也就是 Cross-Entropy Method。换句话说,LeWorldModel 在运行时仍然把世界模型保留在控制环里,让模型辅助搜索动作,而不是提前蒸馏成一个简单策略头。

defplan_with_cem(encoder,predictor,obs0,goal_obs,horizon,action_dim,num_iters=5,num_samples=256,elite_ratio=0.1):z0=encoder(obs0)zg=encoder(goal_obs)mean=torch.zeros(horizon,action_dim,device=z0.device)std=torch.ones(horizon,action_dim,device=z0.device)for_inrange(num_iters):samples=mean+std*torch.randn(num_samples,horizon,action_dim,device=z0.device)costs=[]foriinrange(num_samples):z=z0.clone()fortinrange(horizon):z=predictor.step(z,samples[i,t])costs.append(((z-zg)**2).sum())costs=torch.stack(costs)elite_num=max(1,int(num_samples*elite_ratio))elite_idx=torch.topk(-costs,k=elite_num).indices elite=samples[elite_idx]mean=elite.mean(dim=0)std=elite.std(dim=0).clamp_min(1e-4)returnmean

从结果上看,LeWorldModel 最醒目的不是某一个 benchmark 的单点分数,而是它在低成本条件下取得的整体平衡。论文和项目页都给出了一个非常有辨识度的数字:在使用约 1500 万参数模型的情况下,它能在多个 2D 与 3D 控制环境中保持竞争力,并将规划时间相比 DINO-WM 加速到约48 倍这说明如果潜空间学得足够稳、表征足够紧凑,那么世界模型的实用性并不一定依赖于极其庞大的基础模型。

…详情请参照古月居

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/25 17:04:42

CLI命令行界面:从基础原理到高效开发与运维实践

1. 从“图形化”到“命令行”:为什么说CLI是效率的终极形态如果你还在用鼠标点点点,在层层叠叠的菜单里寻找一个功能,或者被某个软件突然改版的界面搞得晕头转向,那你可能真的需要停下来,重新认识一下你面前的电脑了。…

作者头像 李华
网站建设 2026/8/25 17:00:16

解决Redis局域网内不能访问的问题(Windows/Linux/虚拟机)

最近在使用Redis,出现局域网 不能访问的问题(Windows/Linux),解决办法如下:Windows环境:1.关闭bind 127.0.0.1或者,改为0.0.0.02.检查redis的配置文件,是否开启的保护模式&#xff1…

作者头像 李华
网站建设 2026/8/25 16:58:08

Win10/Win11系统Pads安装与卡死问题终极解决指南

1. 项目概述:一次搞定Pads安装与卡死顽疾在电子设计自动化(EDA)领域,Mentor Graphics(现为Siemens EDA)的Pads系列软件是许多硬件工程师和PCB设计者的老朋友。它以其相对友好的学习曲线和强大的功能&#x…

作者头像 李华
网站建设 2026/8/25 16:53:34

LLM-Agent如何重塑信息不对称市场:博弈、挑战与多智能体模拟

1. 当AI智能体踏入信息不对称的市场:一场全新的博弈最近和几个做量化交易和策略研究的朋友聊天,话题总绕不开一个词:AI Agent。大家不再只是讨论哪个大模型(LLM)的API更便宜、哪个的上下文更长,而是开始琢磨…

作者头像 李华
网站建设 2026/8/25 16:51:07

AI Agent安全治理:基于执行边界与证据链的动态防护体系

1. 项目概述:当智能体开始“自我进化”,我们如何确保安全?最近在跟几个做AI Agent(智能体)的朋友聊天,大家不约而同地提到了一个共同的焦虑:现在的Agent越来越“聪明”,不仅能执行任…

作者头像 李华