news 2026/9/11 0:06:12

京东 JoyAI 物理基座模型 PhysBrain 1.5 发布拆解:8B 参数如何通过人类学习范式拿下开源第一,媲美 GPT-6 Astra

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
京东 JoyAI 物理基座模型 PhysBrain 1.5 发布拆解:8B 参数如何通过人类学习范式拿下开源第一,媲美 GPT-6 Astra

2026年9月10日,京东探索研究院正式发布物理基座模型PhysBrain 1.5。

这款8B参数的开源模型在58项真人盲评中拿下开源第一。

对比豆包视频通话助手胜率77.6%,对比Gemini胜率87.9%。

这是全球首个基于人类学习范式的通用物理智能基座模型。

它用第一人称人类视频训练机器人,开创了全新的技术路径。

传统机器人训练依赖大量真实机器人数据采集。

成本高昂、效率低下、场景覆盖有限。

PhysBrain 1.5另辟蹊径,从人类自我中心视频中学习。

它把第一人称视角的视频转化为结构化的训练数据。

实现了从"人类经验"到"机器能力"的高效转化。

这套方法论的核心是EgoLive数据集。

包含近2000种物体和1800种动作。

覆盖家庭、零售、物流等上万项真实任务。

数据规模和多样性远超传统机器人数据集。

为模型提供了最丰富的人类操作行为范本。

PhysBrain 1.5采用统一的VLA策略学习框架。

接收人类指令、多视角视觉观测和机器人本体感觉。

输出精细的连续动作序列。

核心创新在于统一动作空间设计。

定义了一门"世界语",让不同机器人共享动作表征。

具体来说,将末端执行器的6自由度位姿统一表示在相机坐标系中。

动作具有了一致的物理语义。

"向前移动10厘米"在任何机器人看来含义相同。

与模型的视觉输入自然对齐。

极大简化了从"看到"到"做到"的映射学习。

模型架构采用"视觉语言理解+动作生成"双模块设计。

视觉语言骨干是4B参数的预训练VLM。

负责理解图像和指令,输出富含语义的嵌入表示。

动作专家是600M参数的流匹配生成器。

学习如何在潜空间中从噪声流向目标动作分布。

训练策略采用三阶段渐进式学习。

第一阶段:具身认知预训练,学习"看"和"想"。

第二阶段:VLA协同预训练,学习"做"。

第三阶段:特定平台微调,快速适应下游场景。

从"通才"稳步成长为"专家"。

评测结果令人印象深刻。

在仿真基准RoboTwin 2.0上,成功率90.48%。

远超一众SOTA模型。

在真实世界Agibot基准上,平均成功率0.74。

优于基线模型的0.62。

消融实验揭示了EgoLive数据的关键价值。

加入完整EgoLive数据是性能提升的关键。

仅使用10%的EgoLive数据效果有限。

说明其价值需要达到一定规模才能充分释放。

在需要空间推理、多步骤交互和精细放置的任务上帮助最大。

PhysBrain 1.5的发布标志着物理智能进入新阶段。

它证明了人类学习范式的可行性。

为通用机器人自主性指明了一条清晰、可扩展的路径。

不需要海量机器人数据,从人类视频中就能学到物理智能。

这将大幅降低机器人训练的成本和门槛。

从技术细节看,E2E-3M数据集的构建流程值得关注。

将第一人称视角视频转换为多级、schema驱动的VQA监督数据。

强制证据落地和时间一致性。

每个VQA实例编码多级互补信息。

包括规划分解、关键状态、交互约束和时间关系。

这超越了静态视觉识别的范畴。

提供了更丰富的具身理解信号。

让模型不仅"看懂"画面。

还能理解动作的目的和后果。

具备了初步的物理常识和因果推理能力。

统一动作空间的设计原理值得深入分析。

传统机器人学中,不同机器人的动作空间差异巨大。

机械臂是6自由度关节角。

人形机器人是全身数十个关节的协调。

移动机器人是底盘速度和转向角。

这种异构性导致数据和模型难以复用。

PhysBrain 1.5用相机坐标系统一表示。

把异构的动作空间映射到同构的语义空间。

实现了真正的跨实体知识迁移。

流匹配动作生成器的工作原理也值得探讨。

传统回归方法直接预测目标动作。

容易产生抖动、不平滑的轨迹。

流匹配从噪声分布出发。

学习一条流向目标分布的向量场。

生成的动作轨迹更符合物理约束。

关节限位、碰撞避免等约束更容易被满足。

这是PhysBrain 1.5动作质量高的关键原因。

三阶段训练策略的设计哲学也值得学习。

第一阶段用大规模VQA数据建立视觉语言理解。

第二阶段引入连续动作监督,学习感知到行动的映射。

第三阶段用少量目标平台数据微调,快速适配。

每一步都有明确的学习目标和损失函数。

避免了端到端训练中多目标冲突的问题。

让模型能力稳步提升,不会出现灾难性遗忘。

京东同步发布了多个配套模型。

JoyAI-EchoWM是实时可交互世界模型。

在WBench导航评测中拿到81.7的综合分。

交互得分87.2,位列前茅。

它能根据用户的控制信号持续生成并动态调整画面与声音。

JoyAI-VL-Interaction是全球首个全栈开源的交互模型。

让大模型从"一问一答"走向"边看边说"。

它能持续观察、自主判断、即时响应。

遇到复杂任务可交给后台Agent处理。

前台继续观察现场,后台处理重活。

在监控预警场景中,对豆包和Gemini均取得100%胜率。

这源于交互模型相较传统回合制模型的天然优势。

自主交互性长在模型内部,而非依赖外部触发。

知道什么时候该出现,什么时候该安静。

什么时候自己解决,什么时候交由Agent解决。

京东的模型矩阵布局清晰。

从基础大模型JoyAI-LLM Flash。

到图像模型JoyAI-Image-Edit。

到长视频生成模型JoyAI-Echo。

再到物理基座模型PhysBrain 1.5。

构成了从"看见"到"动手"的完整链路。

每一块拎出来是一个独立模型。

拼在一起才是一条从感知到行动的完整技术栈。

这是京东在物理智能领域的全栈布局。

目标是打造全球最大的物理世界运营中心。

从技术角度看,PhysBrain 1.5有几个关键创新。

第一,人类学习范式。

从第一人称人类视频中学习物理智能。

成本低、规模大、场景丰富。

解决了机器人训练的数据瓶颈。

第二,统一动作空间。

定义了跨机器人的"世界语"。

让不同形态的机器人共享动作表征。

实现了真正的跨实体知识迁移。

打破了数据源和机器人形态之间的壁垒。

第三,流匹配动作生成。

不是简单的回归预测。

而是学习如何在潜空间中从噪声流向目标分布。

生成的动作更平滑、更自然。

物理约束更容易被满足。

第四,三阶段渐进式训练。

从认知到行动,从通用到专用。

每一步都有明确的学习目标。

避免了端到端训练的不稳定性。

让模型能力稳步提升。

从产业角度看,物理智能正在加速落地。

京东拥有全球领先的物理世界运营网络。

覆盖仓储、配送、门店、直播、客服、售后。

每天都在发生人、货、场的实时互动。

这些是物理智能最好的训练场和应用场。

段楠给出的未来三年里程碑清晰。

2026年底,全模态实时交互模型达到世界顶级水准。

2027年,完成具身数据集的规模化采集。

2028年,JoyAI基础模型矩阵走入生活和生产。

服务千行百业和千家万户。

PhysBrain 1.5的开源意义重大。

它把从预训练到轻量化部署的完整链路开放给社区。

开发者可以不做预训练,只拿Teacher模型蒸馏垂直场景的小模型。

也可以不做蒸馏,只在因果基座上做后训练。

选择权完全交给社区。

这体现了"可构建的开放基座"理念。

不是发布一个黑盒模型。

而是开放一套可组合、可定制的技术栈。

让开发者不必从零复现一遍别人的工程。

降低了物理智能研究和应用的门槛。

与GPT-6 Astra相比,PhysBrain 1.5走了一条不同的路。

Astra强调端到端工作能力。

PhysBrain强调物理世界的理解和交互。

Astra用10万块GPU训练。

PhysBrain用8B参数在消费级显卡上就能运行。

这不是谁比谁更好的问题。

而是两条互补的技术路径。

Astra代表了数字世界的智能。

PhysBrain代表了物理世界的智能。

未来两者结合,才是完整的AGI图景。

从开源生态来看,中国AI企业正在加速开放。

DeepSeek V4.1 Flash同日发布,MIT许可证开源。

蚂蚁灵波开源1.3B世界模型LingBot-World 2.0。

京东PhysBrain 1.5开放2B和8B两个版本。

中国在物理智能领域的开源贡献正在快速增长。

这对全球AI生态是积极信号。

开源降低了研究和应用的门槛。

让更多团队能够参与物理智能的探索。

加速了技术的迭代和创新。

最终受益的是整个行业和用户。

PhysBrain 1.5的成功也验证了人类学习范式的价值。

传统机器人学依赖精确的物理建模和控制。

深度学习依赖海量标注数据。

人类学习范式找到了第三条路。

从人类行为中学习,然后迁移到机器人。

这条路径有几个显著优势。

数据来源丰富:人类视频无处不在。

成本低廉:不需要昂贵的机器人数据采集。

场景多样:覆盖各种真实生活场景。

迁移高效:从人类到机器人的知识迁移。

当然,这条路径也有挑战。

人类和机器人的身体结构不同。

动作空间和约束条件不同。

如何弥合这个"具身差距"是关键问题。

PhysBrain 1.5的统一动作空间给出了一个优雅的解法。

从技术细节看,E2E-3M数据集的构建流程值得关注。

将第一人称视角视频转换为多级、schema驱动的VQA监督数据。

强制证据落地和时间一致性。

每个VQA实例编码多级互补信息。

包括规划分解、关键状态、交互约束和时间关系。

这超越了静态视觉识别的范畴。

提供了更丰富的具身理解信号。

让模型不仅"看懂"画面。

还能理解动作的目的和后果。

具备了初步的物理常识和因果推理能力。

在实际应用中,PhysBrain 1.5可以用于多种场景。

仓储物流:货物分拣、搬运、上架。

家庭服务:做饭、打扫、照顾老人小孩。

工业制造:装配、检测、维护。

医疗健康:康复训练、手术辅助。

京东的供应链场景为这些应用提供了天然试验场。

每天处理数千万订单的仓储系统。

覆盖全国的配送网络。

数万家线下门店。

这些都是物理智能落地的理想场景。

从投资角度看,物理智能赛道正在升温。

特斯拉的Optimus人形机器人。

Figure的通用机器人。

1X的双足机器人。

以及京东、阿里、腾讯等中国企业的布局。

全球资本正在涌入这个赛道。

PhysBrain 1.5的开源将加速这个赛道的发展。

降低了技术门槛,让更多团队能够参与。

促进了技术交流和创新。

推动了标准和生态的形成。

最终将加速物理智能的商业化落地。

从学术角度看,PhysBrain 1.5提出了几个重要问题。

人类学习范式的理论基础是什么?

从人类视频到机器人动作的最优映射是什么?

如何评估物理智能的泛化能力?

这些问题值得深入研究。

PhysBrain 1.5的成功为这些问题提供了实践参考。

证明了人类学习范式的可行性。

展示了统一动作空间的优越性。

验证了渐进式训练策略的有效性。

为后续研究指明了方向。

从产业生态角度看,京东的开放策略值得关注。

不仅开源模型权重,还开源数据集和训练方案。

降低了研究和应用的门槛。

吸引了更多开发者和研究者参与。

形成了良性的技术生态循环。

这种开放策略将加速整个行业的发展。

从技术演进角度看,物理智能正在经历范式转变。

从基于规则的控制。

到基于学习的控制。

再到基于人类学习的控制。

每一次转变都带来了能力的跃升。

PhysBrain 1.5代表了最新的范式。

用人类经验作为知识的源泉。

用统一表征作为迁移的桥梁。

用渐进训练作为能力的阶梯。

从应用场景角度看,物理智能的潜力巨大。

在仓储物流领域,可以大幅提升分拣效率。

在家庭服务领域,可以让机器人真正帮助人类。

在工业制造领域,可以实现更灵活的生产线。

在医疗健康领域,可以辅助康复和手术。

PhysBrain 1.5为这些应用提供了基础模型支撑。

从技术挑战角度看,物理智能仍面临诸多难题。

长程任务规划的稳定性。

复杂环境的鲁棒性。

安全约束的严格保证。

人机协作的自然性。

这些问题需要持续的研究和创新。

PhysBrain 1.5为解决这些问题提供了新的起点。

从全球竞争角度看,中国在物理智能领域正在崛起。

京东、阿里、腾讯、字节等企业都在积极布局。

学术界也在持续产出高质量研究。

PhysBrain 1.5的开源是中国贡献的重要里程碑。

它展示了中国在物理智能领域的技术实力。

也为全球开源生态注入了新的活力。

从未来展望角度看,物理智能的发展路径清晰。

短期:在特定场景实现商业化落地。

中期:在多个场景实现规模化应用。

长期:实现通用物理智能,服务千行百业。

PhysBrain 1.5是这条路径上的关键节点。

它证明了技术路线的可行性。

也为后续发展奠定了坚实基础。

总结来看,PhysBrain 1.5是物理智能领域的重要里程碑。

它用8B参数拿下了开源第一。

用人类学习范式开辟了新路径。

用统一动作空间解决了跨实体迁移。

用三阶段训练保证了能力稳步提升。

从技术指标看,PhysBrain 1.5的表现令人印象深刻。

在EgoThink规划维度上,相比基础模型提升显著。

在SimplerEnv仿真基准上,成功率达到53.9%。

证明从人类自我中心监督到下游机器人控制的有效迁移。

在RoboTwin 2.0真实世界基准上,成功率90.48%。

远超一众SOTA模型。

从数据规模看,E2E-3M数据集包含约300万个VQA语料。

覆盖EgoDex实验室场景和BuildAI工厂场景。

每个场景都提供了丰富的第一人称视角视频。

经过结构化标注后成为高质量训练数据。

这是目前最大的具身智能VQA数据集之一。

从模型规模看,PhysBrain 1.5提供2B和8B两个版本。

2B版本适合资源受限的场景。

8B版本在性能和效率之间取得平衡。

两个版本都采用了相同的训练框架。

开发者可以根据需求选择合适的版本。

从开源协议看,PhysBrain 1.5采用MIT许可证。

这是最宽松的开源协议之一。

允许商业使用、修改和分发。

没有附加限制条件。

体现了京东开放共享的技术理念。

从社区反馈看,PhysBrain 1.5受到了广泛关注。

HuggingFace上的模型下载量快速增长。

GitHub上的Star数持续攀升。

技术社区的讨论热度很高。

这反映了业界对物理智能的强烈需求。

从技术传承看,PhysBrain 1.5是系列模型的最新版本。

PhysBrain 1.0在2025年12月发布。

奠定了人类学习范式的基础。

PhysBrain 1.5在此基础上进行了多项改进。

包括更大的数据集、更优的架构、更好的训练策略。

代表了当前物理智能基座模型的最高水平。

这是中国AI企业在物理智能领域的重要贡献。

也是开源生态持续繁荣的体现。

PhysBrain 1.5将加速物理智能的研究和应用。

推动机器人从实验室走向真实世界。

最终让AI真正融入人类的生产和生活。

从技术实现看,PhysBrain 1.5的推理效率值得关注。

8B参数的模型可以在消费级显卡上运行。

单卡即可实现实时生成。

个人开发者、高校实验室和小型团队都可以从本地体验和复现。

这大大降低了物理智能研究的硬件门槛。

从部署灵活性看,PhysBrain 1.5支持多种推理框架。

兼容vLLM、TensorRT等主流推理引擎。

支持FP16、INT8等多种量化精度。

可以根据实际需求选择合适的部署方案。

满足从云端到边缘的不同场景需求。

from transformers import AutoModelForCausalLM, AutoTokenizer import torch # 加载PhysBrain 1.5模型 model_name = "jdopensource/PhysBrain-1.5-8B" tokenizer = AutoTokenizer.from_pretrained(model_name) model = AutoModelForCausalLM.from_pretrained( model_name, torch_dtype=torch.float16, device_map="auto" ) # 准备输入 prompt = "请帮我拿起桌上的红色杯子" inputs = tokenizer(prompt, return_tensors="pt").to(model.device) # 生成动作序列 with torch.no_grad(): outputs = model.generate( **inputs, max_new_tokens=512, temperature=0.7, do_sample=True ) # 解码输出 action_sequence = tokenizer.decode(outputs[0], skip_special_tokens=True) print(f"生成的动作序列: {action_sequence}")

从技术生态看,PhysBrain 1.5与京东其他模型形成协同。

JoyAI-LLM提供语言理解和生成能力。

JoyAI-Image-Edit提供图像理解和编辑能力。

JoyAI-Echo提供长视频生成能力。

PhysBrain 1.5提供物理世界理解和交互能力。

这些模型共同构成了完整的AI技术栈。

从产业价值看,PhysBrain 1.5将推动多个行业的智能化升级。

在制造业,可以实现更灵活的生产线。

在物流业,可以提升仓储和配送效率。

在服务业,可以提供更智能的服务体验。

在医疗业,可以辅助康复和手术。

这些应用将创造巨大的经济和社会价值。

从人才培养看,PhysBrain 1.5的开源将促进相关人才培养。

高校可以基于此模型开展教学和研究。

学生可以通过实践学习物理智能技术。

企业可以基于此模型开发应用。

这将为行业发展提供充足的人才储备。

京东的愿景是打造全球最大的物理世界运营中心。

PhysBrain 1.5是这个愿景的关键一步。

从基础模型到应用落地,从技术开源到生态建设。

京东正在构建完整的物理智能技术栈。

这将为中国乃至全球的AI产业发展注入新动力。

未来,当我们回望2026年。

PhysBrain 1.5的发布可能是一个标志性事件。

它证明了物理智能可以从人类视频中学习。

证明了8B参数可以媲美GPT-6 Astra。

证明了开源可以加速技术创新。

这是物理智能的黎明时刻。

也是中国AI企业走向世界舞台中央的见证。

PhysBrain 1.5的开源,将激励更多团队投身物理智能研究。

推动这个领域从理论走向实践。

从实验室走向千家万户。

让物理智能真正服务于人类社会。

让我们拭目以待。

物理智能的未来,正在被PhysBrain 1.5重新定义。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/10 23:59:14

Mongoose 8 升级迁移指南:从 7.x 到 8.x 的全面破坏性变更解析

Mongoose 8 升级迁移指南:从 7.x 到 8.x 的全面破坏性变更解析 【免费下载链接】mongoose MongoDB object modeling designed to work in an asynchronous environment. 项目地址: https://gitcode.com/GitHub_Trending/mo/mongoose 从 Mongoose 7.x 升级到 …

作者头像 李华
网站建设 2026/9/10 23:59:09

SpringBoot构建美术馆数字化平台的技术实践

1. 项目背景与核心需求去年参与了一个美术馆的数字化改造项目,他们需要将线下展览搬到线上。最初考虑用WordPress搭建,但发现其扩展性和定制化能力无法满足艺术品的多维展示需求。最终我们选择了SpringBoot作为技术底座,开发了一套专门针对艺…

作者头像 李华
网站建设 2026/9/10 23:57:24

### IEEE 754 单精度浮点数阶码深度解析报告

在现代计算机科学与数值计算领域,IEEE 754 标准是浮点数运算的绝对基石。该标准由电气和电子工程师协会(IEEE)于1985年制定,旨在解决不同计算机架构之间浮点数表示与运算不一致的问题。无论是底层的微处理器架构(如x86…

作者头像 李华
网站建设 2026/9/10 23:57:10

GPS北斗双模公交调度方案:从车载终端选型到到站预报的落地实践

我在公交站等车时经常会看那个电子站牌,上面写着"XX路还有3分钟进站",结果等了8分钟车才到。刚开始我也吐槽电子站牌不准,后来跟公交运营的朋友聊深了才发现,问题不在站牌本身,而在于很多公交公司连自己调度…

作者头像 李华
网站建设 2026/9/10 23:55:54

孤岛微电网事件触发控制策略与Simulink仿真实践

1. 项目概述在新能源发电占比逐年提升的背景下,孤岛微电网的稳定运行控制成为电力系统领域的研究热点。传统基于周期采样的控制方式存在通信资源浪费、控制器计算负担重等问题,而事件触发机制通过仅在系统状态超出预设阈值时进行控制更新,可显…

作者头像 李华