2025 年的人形机器人赛道,不缺热度,缺的是冷静下来的判断力。一个“羞答答”的机器人在比赛中拿了冠军,反而是件特别现实的事:它不是科幻片里那种丝滑得像真人一样的表演,而是会笨拙地拿起物品、慢半拍地回应用户指令、甚至偶尔重心不稳晃一下,但最终硬扛着完成了整个任务流程。
很多人看到这种画面会下意识觉得“这还远得很”,但如果你往前翻三年的机器人 demo 视频,就会理解为什么懂行的从业者反而对这类“不完美但真实”的夺冠更有感触。人形机器人正在从“能展示动作的演示品”走向“能在约束环境里完成任务的工程品”,这个跨越远比参数翻倍更有意义。这篇文章想和你聊的,正是藏在这次夺冠背后的技术判断,以及熊友军这类行业老兵眼中,人形机器人下一程真正要解决的工程难题。
1. 夺冠不等于成熟,“羞答答”背后是更真实的工程形态
先还原一下“羞答答”这个评价到底指什么。它不是指团队谦虚,而是现场观众和评委最直观的感受:这台机器人的动作没有短视频里那么利落。拿取物品时手指到位速度偏慢,移动时步态偏谨慎,与人对话时响应有明显的停顿感。按照炫技标准去打分,它拿不到印象分;按照任务完成度去衡量,它却把裁判设定的实际环节一项项做完了,最终夺冠。
这件事值得展开的原因在于:它触碰到人形机器人行业一个长期存在的认知错位。过去几年里,各家公司发布的 demo 几乎都在追求“惊艳感”——跑酷、后空翻、跳舞、叠衣服。这些内容在传播层面非常成功,让人觉得机器人最新进展的衡量标准是动作的流畅度和拟人化程度。但落到真正需要交付的工业巡检、仓储分拣、实验室操作、家庭服务等场景,机器人面对的是一种完全不同的评价体系:能不能连续工作两小时不趴窝、遇到异常物体能不能不抓碎、断电重启后能不能恢复任务状态。
从这个角度看,“羞答答”反而是一种可信的信号。它说明团队在取舍上没有死磕炫技指标,而是把关注点放在了关节力控精度、视觉伺服响应、任务状态机的稳定性这些“不见效但必须做对”的底层层面上。更快更漂亮是迭代的方向,但不是当前能跨越到应用阶段的钥匙。行业真正缺的,不是再多一个跑酷视频,而是怎么让机器人从“看起来像人”走到“干得了活”。
熊友军在赛后交流里提到的核心判断也与此相关:人形机器人接下来拼的是工程化能力,而不是单点指标堆叠。所谓工程化能力,翻译成开发者听得懂的话,就是系统要能在真实环境中稳定复现,每一次执行都有可对标的输入输出,而不是实验室里靠几十次重试刷出来的成功率。
对普通技术开发者和机器人爱好者来说,这段变化意味着两件事。第一,看比赛、看评测、看 demo 的眼光要换一下,多注意机器人在失败后怎么恢复,而不是只看成功片段。第二,如果你正打算进入这条赛道,纯算法岗位的窗口期正在收窄,系统集成、仿真平台搭建、数据管线设计这些“筑基工种”的需求会持续增加。
2. 人形机器人下一程的核心问题:从 demo 到干活
聊完比赛视角,我们把话题拉回行业全景。人形机器人的“下一程”,本质上是回答一个问题:它要怎样才能从阶段性演示走向可部署、可运营、可回本的生产工具。这个问题有明确的工程边界,也有清晰的落地路径。
2.1 大脑:从专用模型到具身智能底座
过去的人形机器人也有“大脑”,但更多是功能解耦的模块组合:物体识别调一个视觉模型、路径规划调一个导航模块、动作生成走一套轨迹规划算法。这种架构的优点是每个模块都能单独优化,缺点同样明显——跨模块的信息损耗很大,而且当环境出现预期外变化时,系统缺乏实时修正的协同能力。
具身智能底座的思路是让感知、决策、控制之间的边界变模糊,用端到端或多模态模型同时处理“我看到什么”“我该做什么”“我手脚该怎么动”。大模型在这条路线里的角色有三层:
- 作为任务理解层:把人类指令翻译成机器人可执行的子目标序列;
- 作为视觉语义层:让机器人理解物体名称、空间关系、操作约束;
- 作为策略初始化层:通过预训练让机器人对常见操作有一个还算合理的初始策略,而不是从零开始探索。
从最近行业展示的方案和论文看,模仿学习、强化学习与 VLA(视觉-语言-动作)模型的结合已经成了主流技术组合。这也是为什么很多创业团队即便自研算法能力一般,也选择接开源大模型做上层调度——因为大脑能力正在被平台化、基础模型化,垂直场景的价值更多体现在数据质量和任务工程上。
2.2 小脑:稳定与柔顺是机器人落地的前置条件
人形机器人真正难住工程团队的,往往不是“怎么想”,而是“怎么站得住、走得稳、拿得牢”。这里涉及运控领域的经典难题:双足步态规划、全身动力学控制、接触力估计与柔顺控制。简单说,不管大脑想得多完整,小脑执行不稳定,任务必然失败。
柔顺控制是“羞答答”式表现背后的技术主角。机器人拿一个纸杯和一个铁块,必须施加不同的力度,这个力度不能靠查表,得靠力传感器反馈和动力学模型实时估计。训练时如果只做好刚体操作,到了真实世界很容易把软性物体捏坏;反过来,如果过度追求柔顺,又会导致动作拖泥带水、流程超时。
目前行业里比较成熟的做法是做分层控制:上层用强化学习训练一套通用步态或操作策略,底层仍然保留基于模型的控制做安全兜底。这种混合架构既保证了任务的泛化能力,也限制了机器人的最大输出力与关节加速度,避免在异常工况下损坏硬件。
2.3 数据:比算法更稀缺的资产
只要接触过具身智能,基本都听过一句话:人形机器人现在最缺的不是模型,而是高质量操作数据。大模型的训练数据可以从互联网爬取,但机器人“抓取一个杯子”“推开一扇门”“把一个零件插进槽位”这类物理交互数据,互联网上根本没有现成的大规模语料。
当前主流的数据获取路径有四条:
- 真实机器人遥操作采集:人戴数据手套或使用主手,在真实环境中操控机器人完成操作,记录关节指令与视觉反馈。优点是数据真实、直接可用;缺点是采集成本极高,一天一位操作员最多积累几百条有效轨迹。
- 仿真合成数据:在 Isaac Sim、MuJoCo 等仿真环境里批量生成任务场景,用自动策略或脚本产生海量轨迹。优点是规模大、成本低;缺点是 sim-to-real 迁移有落差,视觉材质、物理参数都存在域差异。
- 人类视频学习:从 YouTube 等平台的海量人类操作视频中提取动作语义,用视频扩散模型或逆动力学模型生成机器人的动作先验。这条路径还比较前沿,但潜力很大,因为它解决的是“数据几何量级”的问题。
- 遥操作与自动生成混合:先用少量真实数据微调仿真策略,再用仿真策略批量生成带标注的数据,最后做真实环境抽检校准。这是目前工程效率比较高的组合方式。
对中小团队来说,一上来就自建百台级机器人采数集群并不现实。更务实的路径是先选一个细分场景,把几百条高质量真实数据配几万条仿真数据跑通一个闭环,再逐步扩大数据池。熊友军在访谈中也强调过类似观点:数据的核心指标不是总量,而是分布和标注质量。一堆重复的、任务定义模糊的数据,对模型训练的贡献是负面的。
2.4 硬件:关节、灵巧手和成本剪刀差
如果大脑解决了“做什么”,小脑解决了“怎么稳住”,那硬件解决的是“这个动作在物理上能不能实现”。工业机械臂能精确重复,很大程度归功于高刚度、高精度的关节和谐波减速器。但人形机器人要在开放环境和人协作,关节必须兼具大扭矩输出、高带宽响应和一定的弹性柔顺能力,这是三类互相拉扯的指标。
行业内卷最密集的硬件方向基本集中在三块:
- 高力矩密度关节:在同体积同重量下输出更大扭矩,直接影响机器人能扛多重的负载、能不能完成蹲起和搬运动作;
- 灵巧手:从三指到六指,从欠驱动到全驱动,手指自由度越多,能完成的操作种类越丰富,但控制复杂度和成本同步上涨;
- 传感器与计算平台融合:六维力传感器、触觉阵列、RGB-D 相机、机载算力单元要协同工作,需要整体功耗和散热方案跟上。
成本剪刀差是另一个绕不开的问题。目前一台人形机器人整机成本从几十万到百万级不等,核心原因是减速器、无框电机、高精度力传感器这些关键零部件还没有形成足够大的量产规模。但只要单型号出货量能跨过千台,供应链成本就会明显下探。这也是为什么头部公司都在集中资源打标准化爆款单品,而不是做大量定制化机型。
3. 具身智能技术栈拆解:传统开发者如何入局
讲了这么多行业层面的判断,接下来落到开发者视角。很多后端、算法、嵌入式工程师会觉得人形机器人是高不可攀的领域,需要深厚的机器人学背景。实际情况没这么绝对,人形机器人正在快速复制当年互联网基础设施化的过程:底层框架逐渐统一,开发门槛持续下降,真正稀缺的是能快速理解场景并组装技术栈的人。
3.1 技术栈全景
一个典型的人形机器人应用开发技术栈大致可以分成六层:
- 硬件层:电机、减速器、编码器、力传感器、IMU、计算平台(如 Jetson 系列或 x86 工控机);
- 系统层:实时操作系统(RT-Linux、Preempt-RT)或通用 Linux + 机器人中间件(ROS 2);
- 驱动层:关节伺服驱动、EtherCAT 或 CAN 总线通信、实时控制循环;
- 感知层:目标检测、语义分割、6D 姿态估计、点云处理、SLAM 地图构建;
- 决策层:任务规划、导航决策、大模型意图理解、行为树/状态机编排;
- 执行层:运动规划、MPC 或强化学习策略、全身控制、力位混合控制。
大多数软件背景的开发者,真正需要深入的是第 3 到第 6 层,尤其是感知、决策和执行之间的接口设计。
3.2 最小入门路径:仿真优先
在没有实体机器人硬件的情况下,仿真环境是学习入门的最高性价比方案。几个主流工具值得优先投入:
- MuJoCo:接触动力学仿真精度高、速度快,适合做强化学习和运控研究;
- Isaac Sim / Isaac Lab:基于 NVIDIA Omniverse,视觉保真度高,适合做感知-决策联合仿真和合成数据生成;
- Gazebo + ROS 2:生态成熟,适合传统机器人学教学和原型验证。
建议入门路线是:先在一套机器人 URDF 模型上跑通“接收速度指令-关节插补-里程计反馈”的最小闭环,再逐步加入视觉识别、路径规划、末端夹取等模块。这个过程能帮助你建立对机器人系统工程复杂度的直觉,避免对着产品 demo 误判难度。
3.3 最短代码示例:用 Python 操作 MuJoCo 跑通一个双足站立任务
下面给一个可以直接运行的最小示例,帮你理解仿真环境里机器人控制循环的基本结构。示例依赖mujocoPython 包,跑一个 XML 定义的简单双足模型,通过 PID 控制让它在重力下保持站立。
# 文件路径:demo_stand.py import mujoco import numpy as np # 加载模型(这里用 MuJoCo 内置的 humanoid 模型做演示) xml_path = mujoco.get_assets_path() model = mujoco.MjModel.from_xml_path(xml_path + "/humanoid.xml") data = mujoco.MjData(model) # 设置仿真步长和总时长 dt = model.opt.timestep sim_time = 5.0 steps = int(sim_time / dt) # 简单比例控制器:让所有关节先保持初始角度 kp = 20.0 kd = 2.0 for i in range(steps): # 期望位置取当前关节角度,这样控制器只做“锁位” qpos_target = data.qpos.copy() # 计算位置误差与速度误差,输出关节力矩 qpos_err = qpos_target - data.qpos qvel_err = -data.qvel ctrl = kp * qpos_err + kd * qvel_err # 只对可驱动关节施加控制 data.ctrl[:] = ctrl[model.jnt_dofadr[model.actuator_trnid[:, 0]]] if model.nu > 0 else 0 mujoco.mj_step(model, data) if i % 100 == 0: print(f"step {i}, height={data.qpos[2]:.3f} m") print("simulation finished")这个示例的核心目的是展示一个控制循环的骨架:读状态、算误差、输出力矩、步进仿真。真实机器人系统只是把“仿真步进”换成“硬件通信周期”,把“状态读取”换成“编码器和力传感器反馈”,其余思路是相通的。
运行方式:
pip install mujoco python demo_stand.py如果模型站立成功,你会看到打印的height数值基本稳定在初始值附近;如果控制参数不当,数值会快速发散,说明系统失稳。这个实验对理解关节级 PID 和系统稳定性很有帮助。
4. 从比赛冠军到商业落地:场景选择决定生死
技术能力是基础,但人形机器人创业真正考验的是场景选择。同样的机器人在工业产线、商业导览、家庭助理、科研教学等场景中,交付难度和商业价值可以差出几个量级。
当前行业内公认优先落地且商业闭环相对清晰的场景,集中在三类:
4.1 工业场景:用强约束换确定性
工业环境的结构化程度最高:光照稳定、地面平整、任务重复、安全规范明确。机器人在这种环境里最容易达到 90% 以上的任务成功率,而强约束也意味着发生安全事故的后果被限制在可控范围。具体岗位包括上下料、质检搬运、货架拣选、高危区域巡检等。
但工业场景的挑战同样明显:客户要的是每 24 小时稳定运行,不是 85% 的“偶尔成功”。这意味着残次品率、平均无故障时间、维护响应速度这些运营指标,比模型精度更决定订单能否续签。
4.2 科研与教育场景:先获得数据与反馈
高校实验室和职业院校是人形机器人最重要的早期客户群。他们采购的目的不是直接用机器人赚钱,而是完成科研课题、培养人才、验证算法。这类场景容错度高,愿意接受开发者模式的产品,还能反哺改进意见和训练数据。对创业公司来说,科研教育场景是现金流与数据飞轮的起点。
4.3 商业服务场景:体验优先,但对可靠性要求极高
商业导览、智慧场馆、酒店配送等场景,人形机器人承担的是“科技感体验”职责。这类场景对单次任务成功率的要求没有工业产线那么极端,但对交互自然度、突发情况应对能力、外观安全性要求更高。客户的付费动机往往是营销价值,而非直接生产回报,因此续费率存在不确定风险。
从熊友军的行业判断中能明显感受到,他更看好先把能够形成“数据-场景-需求”闭环的垂直行业打透,再逐渐横向扩展到通用场景。这其实是所有复杂硬件创业公司的共同路径:先做高毛利、低变量的窄场景,再规模化降本,才谈得上通用性。
5. 开发者如何为下一程做准备
无论你是算法工程师、嵌入式工程师,还是准备转型进入具身智能的软件开发者,下面几条工程实践建议都能帮助你在接下来的行业周期里占据有利位置。
5.1 保持对硬件基础的敬畏
很多纯软件背景开发者进入机器人领域时,容易低估硬件限制的影响。关节最大力矩、电机散热、通信周期、传感器噪声,这些物理约束会直接影响算法能跑多快、能跑多稳。建议至少补上三项基本功:
- 能读懂机械结构爆炸图与电气接线图;
- 理解 PID 控制、前馈控制、力位混合控制的基本差异;
- 实际操作过至少一款机器人仿真环境或真实开发板。
5.2 掌握仿真到现实的迁移思维
仿真做的再好,真实世界的坑也躲不掉。尽量在项目早期就引入 domain randomization(域随机化),在仿真里同时改变质量、摩擦力、视觉纹理、延迟时间等参数,让策略学会适应不确定性。这比在单一仿真环境里刷到 99% 成功率更接近真实部署。
5.3 重视数据工程能力
前文提到数据是核心资产,而数据工程能力正是很多算法团队最稀缺的短板。值得掌握的技能包括:数据标注规范设计、分布式数据存储与检索、自动清洗管道搭建、数据分布可视化分析。一句话总结:能把原始记录变成高质量训练集的人,价值不亚于调模型的人。
5.4 从开源社区吸收成熟组件
不要重复造轮子。当前 ROS 2、MoveIt、Isaac 生态都提供了大量成熟的定位、导航、运动规划工具。在项目早期,直接复用社区方案能显著压缩开发周期,把精力集中在最有业务价值的地方。等系统跑通之后,再根据性能瓶颈逐步替换自研模块,这种“先跑起来再优化”的策略在机器人领域同样适用。
5.5 关注模型小型化与端侧推理
人形机器人不一定总能把所有计算放在云端,通信延迟、隐私、断网可靠性都会成为问题。端侧小型化模型、模型量化、知识蒸馏等方向会越来越重要,建议持续关注 NVIDIA Jetson、Qualcomm RB5、以及各类 NPU 平台上的模型适配方案。
6. 常见误区与产业判断
聊到最后,专门梳理几个最容易误导新人和外部观察者的判断误区,避免大家被部分宣传带偏节奏。
误区一:机器人动作越像人,就越先进。动作拟人度只是交互体验的一维指标,真正决定任务能力的,是复杂环境下目标达成率、任务泛化性和自主恢复能力。很多“动作诡异”但成功率高的机器人,在实际项目里比“炫技流畅”的机器人更有用。
误区二:人形本体是必须的。很多任务其实用机械臂、轮式底盘甚至固定工位就能完成,加一双腿不仅贵,还增加了控制难度和故障率。人形本体的价值主要体现在三类场景:人类环境基础设施天然适配、需要全身协调操作的复杂任务、情感交互与品牌展示。做产品选型时,别为了“人形”而人形。
误区三:大模型能直接生成机器人控制指令就能投入生产。从自然语言到机器人动作之间还有漫长的安全校验、动作可行性过滤、力控保护、异常监测环节。大模型解决的是意图理解和任务分解,真正的安全保障必须由专门的控制和监控系统兜底。
误区四:仿真效率高,可以完全替代真实测试。靠仿真数据训练出的策略,在做 sim-to-real 迁移时必然面临物理差异。最稳妥的流程是仿真大量预训练 + 真实环境少量微调 + 真机巡检回灌,三种手段协同,而不是互相替代。
误区五:人形机器人离我们太远,现在不用关注。实际从产业链进度看,关键零部件的国产化替代正在加速,软件生态的标准化程度也逐年提高,行业已经进入“能用原型机跑通流程、开始抠成本控良率”的阶段。等到你发现身边友商已经在小批量部署时,再入局就晚了。
熊友军在沟通中反复提到的一个概念是“耐心”。人形机器人是硬件、软件、数据、场景四位一体的长期工程,没有任何一个单点突破能带来终局。对从业者来说,现在最该做的不是押注某一个“颠覆性算法”,而是选择一个能持续积累行业数据的场景,把团队、数据、供应链、客户关系四张牌依次打好。对技术观察者来说,衡量这个行业是否进入正轨,也不是看又发布了多少新视频,而是看在具体产线上,机器人每连续运行 100 小时,需要有几次人工介入;每一次介入,是在补环境、改夹具,还是在改代码、调策略。这些枯燥的数字,才是人形机器人下一程真正要突破的关卡。