具身智能江湖里一直存在几种明显的流派划分:有人把重点放在大语言模型和视觉语言模型上,强调“脑子好不好用”;有人把重点放在传感器、执行器和真实物理交互上,强调“身体能不能扛住”;还有一派人很少直接出现在论文标题里,但几乎每一次人形机器人上热搜,背后都有他们的工作。这就是“小脑派”。
小脑派这个名字听起来不像“具身智能”“世界模型”那样有冲击力,但它解决的问题非常现实:当一个机器人被大模型规划好“走到桌子前,拿起杯子”之后,它到底该怎么落脚、怎么保持平衡、怎么在遇到推搡时不摔倒、怎么让手臂不抖。大脑给出的是目标和抽象指令,小脑给出的是能让身体真正动起来的高频、连续、物理可执行的动作。
这篇文章不打算讲某个能一键部署的开源仓库,而是把“小脑派”这个技术方向拆开看:它在具身智能体系里的位置、它与大脑派的关系、当前主流的训练与部署思路、学习路线上应该先掌握什么,以及为什么它离新闻头条最近却最难做好。如果你想在具身智能方向做技术选型或规划学习路线,这篇可以作为一份背景梳理。
作为“具身江湖志”的第五篇,我尽量把概念性内容写得能落地:后面会给出分层架构、强化学习训练流程、仿真到真机迁移的关键点、部署参数与常见误区,也会结合实际开发中容易被忽略的安全边界展开。
1. 小脑派到底指什么:先给一张分层图
在具身智能的系统里,“大脑”和“小脑”不是生物学意义上的严格划分,而是一种工程分层习惯。可以简单理解为:
- 大脑负责:多模态感知、语义理解、任务规划、长程决策,运行频率低,典型在 1Hz 到 10Hz 级别。
- 小脑负责:运动控制、平衡维持、扰动恢复、阻抗调节、步态生成,运行频率高,典型在 20Hz 到 200Hz,甚至更高。
- 底层执行器负责:电机力矩环和电流环,运行频率通常上千赫兹。
所以“小脑派”更准确的说法是:专注于物理交互与运动控制的技术流派,它关心的不是“做什么”,而是“怎么把动作做稳”。我们经常在新闻里看到的机器人空翻、跑酷、跳舞、抗踹,甚至机械臂柔顺插拔、末端力控打磨,本质上都属于小脑派要解决的范围。
| 分层 | 处理内容 | 典型频率 | 输入信号 | 输出信号 |
|---|---|---|---|---|
| 大脑层 | 视觉感知、语义指令、任务规划 | 1Hz - 10Hz | 图像、文本、点云 | 高层动作指令、目标状态 |
| 小脑层 | 步态控制、平衡、扰动恢复、力控 | 20Hz - 200Hz | 关节角、角速度、IMU、接触力 | 关节目标位置、速度或力矩 |
| 执行器层 | 电机力矩环、电流控制 | 1kHz 以上 | 目标力矩、编码器反馈 | PWM、电流指令 |
这里需要强调,上面表格里的频率区间是典型工程范围,不代表每一个项目都必须对齐。不同机器人、不同任务会差很远。比如四足机器人奔跑时,控制频率往往比双足站立高;机械臂力控的底层频率又和人形机器人的步态控制不一样。
小脑派的核心特征不在于用多大的模型,而在于它对实时性、稳定性和物理一致性要求极高。一个后空翻动作能上新闻,不只是因为它“好看”,更因为它背后同时解决了建模、估计、控制、仿真迁移和安全兜底这些复杂问题。对观众来说,看的是几秒钟的视觉冲击;对工程师来说,看的是一个完整的小脑系统是否成立。
2. 为什么小脑派离新闻头条最近
过去很长时间里,AI 新闻的主角是语言模型:写诗、写代码、做逻辑推理。这类成果传播性很强,因为它触达了文字这个所有人都能理解的信息载体。但到了具身智能领域,传播逻辑变了:物理世界的动作是更直观、更有冲击力、也更难伪装的东西。你可以让一个语言模型通过文本测试,但很难让一个控制不稳的人形机器人通过“在花园石子路上稳定行走”的测试。
新闻媒体拍人形机器人,最愿意拍什么?大概率是它能做什么肉眼可见的动作,而不是它的内部推理链路。机器人在做跑跳、转身、上下楼梯、抓取物品时,每个动作都立刻被观众感知。这就意味着小脑派的成果天然具备视觉传播优势,也因此离新闻头条最近。
但这里有一个容易被忽略的代价:露脸越多,意外也越容易被放大。很多机器人演示视频之所以能火,是因为它完成了极少次数、极为精心准备的高难度动作。观众可能只看到一次成功,看不到背后成百上千次的失败、调参、模型回滚和硬件检修。
从技术角度解释为什么小脑派难做,主要有三个原因:
第一,物理世界不可精确建模。摩擦力、重心偏移、机械形变、电机摩擦、电池电压变化都会影响运动结果。仿真里调好的参数,到真机上经常出现完全不同的表现。
第二,干扰无处不在。一个小石块、一阵侧风、一个意外的接触力、推搡,都可能让机器人失去平衡。小脑系统必须在极短时间内感知并修正,这种实时性压力是语言模型场景里没有的。
第三,演示目标的“上限”通常挑战硬件极限。后空翻对关节输出的峰值力矩、机器人结构强度和姿态估计精度都有极高要求,软件只负责让硬件尽可能接近极限地工作。如果反过来硬件不支撑,小脑层再强也不会产生这样的演示效果。
所以“小脑派离新闻头条最近”的判断,不是说它容易获得流量,而是说新闻头条上那些让人记住的高光动作,绝大多数都由小脑派承担了最后也是最危险的一步。
3. 大脑派与小脑派的分工和执行接口
在具体产品里,大脑和小脑不是完全独立的两个模块,中间需要一套明确的接口协议。通常大脑负责输出任务级动作指令,这些指令有三种主要表达方式。
一是目标速度指令。比如要求机器人以每秒 0.8 米的速度向前走,小脑层拿到这个速度指令后,通过状态估计器和步态策略把它转化成具体的落脚点、支撑腿切换和髋膝踝协调。
二是目标姿态指令。比如要求机械臂末端到达某个世界坐标位置,并保持指定姿态。小脑层内部需要做逆运动学分解、避障规划和力矩分配,不能直接把末端坐标塞给关节电机。
三是任务序列。比如“先走到门前,再抬手开门,跨过门槛”。这种复杂任务需要大脑把完整任务拆解成多个子技能,每个子技能对应小脑层已经训练好的一个控制策略。
在实际工程中,接口设计最常见的错误是直接让大模型输出关节角度或关节力矩序列。听起来很“端到端”,但大模型输出频率低、抖动大,而且没有物理一致性约束,直接下发给伺服系统很容易造成震荡甚至损坏硬件。合理的方式是让大脑只决定“做什么级别的动作”,把“怎么用电机实现”完全留给小脑层。
举个例子,大模型说“往前快走两步然后站住”。这句话经过语义理解后,变成高层指令:x 方向速度指令 1.0m/s,持续时间 2 秒,然后速度变为 0。小脑控制策略接收这个速度指令后,在内部不断推理当前位置、速度、身体倾斜角、接触力,并以高频生成目标动作,再由底层 PD 控制器转换成电机力矩。
这种分工的价值在于解耦。大脑可以随时升级成更强的模型,只要它输出的高层指令符合接口格式,小脑端可以不做大改动。反过来,小脑端把运动控制做扎实后,换一个更强的认知模型也能快速接入,不至于每升级一次大脑就把整个控制代码重写。
4. “走得稳”到“做得好看”的关键技术链条
很多小脑派的新手会问我,学习路线应该从哪件事开始。我的建议是先建立一个连续的技术链条认知,而不是急着去跑某个开源库。这个链条可以划分为四段:状态估计、运动生成、仿真训练、真机迁移。
4.1 状态估计:小脑控制的“感知底座”
小脑层用到的状态并不直接来自摄像头。高频控制需要低延迟、确定性的本体感知信号,比如关节角度、关节角速度、身体姿态角、角速度、足底接触力。惯导数据要和关节编码器数据做融合,再通过状态估计器得到当前速度、机体坐标系相对于世界坐标系的姿态。
如果状态估计不准,后面的平衡控制基本无从谈起。比如机器人以为自己站稳了,但实际身体已经前倾了 3 度,等真正的平衡控制器发现偏差时可能已经来不及调整。这就像一个人闭着眼单腿站立,如果前庭系统给大脑的错误信息太大,下一秒就会倒。
在工程上,常见做法是使用扩展卡尔曼滤波,把 IMU 数据和运动学模型结合,估计机器人躯干的线速度和姿态角。更前沿一些的做法是会训练一个简单的回归网络来直接输出速度估计,但这需要足够的真实数据做监督。
4.2 运动生成:从偏差控制到强化学习策略
小脑派的核心技术演进体现在运动生成方式上。早期双足机器人依靠 ZMP(零力矩点)理论和解析步态规划,机器人必须在规划好的路径上严格执行,一旦受外界干扰,很容易失去平衡。
后来出现了基于模型预测控制的全身控制(WBC、MPC),它可以实时优化全身各关节的加速度和接触力,抗扰动能力明显增强,但需要比较精确的动力学模型,而且在复杂地形上扩展性有限。
最近几年流行的是基于强化学习的运动控制策略。典型做法是把人形机器人建模为强化学习环境,状态量包括关节角、关节角速度、IMU 数据、速度指令;动作量通常是目标关节位置增量或者目标速度,再交给高频 PD 控制器解算成力矩;奖励函数则包含速度跟踪误差、姿态稳定、能量消耗、动作平滑性等项。
为什么小脑派喜欢用强化学习而不是传统解析控制?最关键的原因是强化学习可以学到“非结构化但非常有效”的控制策略。比如在乱石堆行走时,最优落脚点和身体姿态很难用一个显式规则表达出来,但大量的仿真试错可以让策略自己发现鲁棒的模式。
4.3 Sim2Real:小脑派最难也最值钱的部分
仿真训练出来策略并不能直接搬到真机上。仿真模型和真实物理之间存在偏差,这些偏差包括摩擦力差异、质量分布误差、电机延迟、关节间隙、传感器噪声。
为了解决这个问题,标准的做法是“域随机化”。在仿真环境中随机化重量、摩擦系数、重心位置、电机强度、传感器噪声、控制延迟等参数。策略不再依赖某一个精确的模型值,而是学会在可能的物理变化范围内都保持稳定。这样从仿真迁移到真机时,成功率会高很多。
| 随机化参数 | 作用 | 训练时的常见做法 |
|---|---|---|
| 地面摩擦系数 | 让策略适应光滑或粗糙地面 | 在低值和高值之间均匀采样 |
| 关节电机力矩 | 模拟电机老化或电压波动 | 在标准值上乘一个扰动系数 |
| 控制延迟 | 模拟真实通讯延迟 | 随机插入固定步数的延迟 |
| 传感器噪声 | 提高状态估计鲁棒性 | 在状态输入中加高斯噪声 |
| 外部推力 | 增强抗干扰能力 | 随机施加侧向推力 |
域随机化不是万能的。过度随机化会让策略变得保守,动作软绵绵,明明能跑到的速度跑不到。工程上需要拿一组“真机可接受的最小随机范围”来做对照,先不加扰动把动作学出来,再逐步增加扰动。
5. 小脑层的推理部署:实时性优先于模型大小
小脑派在大众新闻里看起来是“物理表演”,但在工程师视角里,它本质上是一个非常严苛的实时推理系统。训练阶段可以用大型显卡和大量并行仿真环境,但部署阶段必须跑在机器人本地的嵌入式或边缘平台上。
这里有一个很关键的现实约束:策略推理延迟必须小于控制周期。如果控制 50Hz,那留给策略推理的时间只有 20 毫秒,还要算上输入输出、通讯、状态估计的时间。如果用一个巨型神经网络去处理关节状态,即使精度更高,也无法满足控制周期要求,最终只能被淘汰。
因此小脑派的部署模型通常不会是动辄几十亿参数的 Transformer,而是一个参数量很小的多层感知机或者小型循环神经网络。推理工具可以是 TensorRT、ONNX Runtime,也可以用更底层的 C++ 实现。
不过,近年也开始出现一些尝试,把 Transformer 结构用于高阶运动生成或者多任务统一策略。这类模型能否上真机,主要看它是否能满足延迟约束。小脑层一般会保留一个轻量控制器作为高频兜底,上面再接一个稍重的策略做意图识别,形成“大策略降频、小策略保稳”的层次。
部署时还需要考虑确定性。机器人控制程序的延迟不能像普通 Web 服务那样可以容忍偶发的高延迟。如果一个控制周期超时,轻则动作异常,重则机器人摔倒甚至损坏硬件。所以在代码实现上,要避免在实时控制线程里做动态内存分配、网络请求、日志打印等可能阻塞的操作。
6. 一条参考的小脑派训练工作流
为了让上面的概念有一些可操作性,下面给出一条常见的强化学习训练工作流。需要事先说明,这不是某个具体项目的安装脚本,而是工程流程的通用模板。不同团队会使用不同的仿真工具、策略框架和机器人模型,你需要把路径和任务名替换成实际项目。
6.1 准备仿真环境
无论是 MuJoCo、Isaac Gym、Isaac Lab 还是其他仿真器,先要确认两件事:能导入机器人模型,并且能设置关节驱动方式。人形机器人通常采用关节位置目标加 PD 控制的驱动方式,而不是直接在仿真里给力矩。这样做的原因是它更接近真实机器人下位的执行逻辑。
如果你的工作流使用 Python,仿真环境的入口代码大致如下,需要根据项目实际情况替换机器人模型路径和任务名:
import gymnasium as gym from your_task_registry import HumanoidVelocityTask env = gym.make( "YourHumanoidEnv-v0", xml_path="robot/humanoid.xml", control_dt=0.02, physics_dt=0.002, max_episode_steps=1000 )请注意,your_task_registry和YourHumanoidEnv-v0是占位符,真实项目里需要换成你自己注册的环境。
6.2 编写奖励函数并进行训练
小脑派的强化学习训练中,奖励函数决定了策略的质量。一个常见的基础奖励组包括:速度误差惩罚、机身倾斜惩罚、能量消耗惩罚、动作平滑性惩罚。编写时不要一开始就堆几十个奖励项,先用最简单的几项让机器人学会行走,再逐步添加辅助项。
def compute_reward(state, action, command): # 速度跟踪误差 lin_vel = state["base_lin_vel"] lin_vel_error = torch.linalg.norm(lin_vel[:, :2] - command[:, :2], dim=1) reward = -0.5 * lin_vel_error # 姿态稳定惩罚 tilt = torch.linalg.norm(state["projected_gravity"][:, :2], dim=1) reward = reward - 1.0 * tilt # 关节力矩惩罚 torque = torch.linalg.norm(state["torques"], dim=1) reward = reward - 0.0001 * torque return reward这段代码是简化的示意版本,不是任何开源项目的完整实现。真实项目里还需要加入终止条件判断、奖励归一化、周期性步态奖励等。
训练启动时的命令行参数通常涉及并行环境数量、步数、任务名等:
# 训练入口模板,具体命令请以你的项目为标准 python scripts/train.py \ --task your_humanoid \ --num_envs 4096 \ --headless \ --max_iterations 5000 \ --seed 42这条命令里的--task、--num_envs都要按实际支持来填。如果仿真器或策略框架要求不同的参数名,则需要调整。
6.3 导出的模型在仿真里做批量验证
训练完成后不要急着上真机,先做批量验证。把策略导出为 TorchScript、ONNX 或训练框架原生格式,在一个专门评估脚本里连续跑几千个随机初始状态和随机指令,统计成功率、平均速度误差、能耗曲线。
如果发现某些极端状态下失败率明显偏高,比如高速行走时突然转向或者单脚踩到低摩擦区,就需要回到训练阶段补充扰动范围。这个环节非常像软件测试里的回归测试,没有批量验证就上真机,很容易在演示时遇到未预期的情况。
6.4 真机迁移前的检查清单
真机迁移是一个高风险动作,原则上要逐项确认设备状况和安全措施。这里给一个通用的检查清单,不特指某款机器人:
- 机器人硬件完好,电池电量充足。
- 急停按钮可用,远程急停通道正常。
- 状态估计器在静止状态下读数稳定,IMU 未饱和。
- PD 控制参数在真机上完成基础验证。
- 策略只在低速、低力矩档位下测试。
- 真实机器人关节角度定义与仿真模型一致。
- 每次测试前记录日志,方便离线复现分析。
真机第一次运行策略时,通常不会直接跑高速度高难度动作。比较稳妥的做法是先用一个人工遥控模式,让机械师在安全杆保护下逐步把速度指令从 0.1m/s 提高到设计值。
7. “具身智能标准体系”与小脑派的关系
最近在具身智能相关的技术检索里,时常能看到《人形机器人与具身智能标准体系(2026版)》这类标准文件的下载词条。它和人形机器人产品安全的控制策略和系统测试规范密切相关,标准是否能建立,在行业中非常重要。从趋势看,具身智能正在从“展示 Demo”走向“可验收交付”,而验收最依赖的就是小脑层能给出的确定性、可靠性和安全性。
不过也要谨慎一点:不看具体标准章节就引用标准内容是很容易误导读者的。我这里不展开标准条文,只从技术方向上给参考判断。当前人形机器人和具身智能的标准化工作通常围绕几个方向展开:
- 整机与零部件的接口和性能定义;
- 控制与操作系统通信协议;
- 仿真验证与真机测试方法;
- 安全规范和故障停止机制;
- 数据采集与隐私合规要求。
小脑派在这些标准化议题中承担一个非常特殊的角色:它的输出可以被量化测量,也最容易成为标准和验收的切入口。“能空翻一次”和“能连续空翻一千次不失败”在实际验收标准上是两个完全不同的指标。对演示视频来说一次成功就够了,但对标准体系来说,必须要定义可重复、可观测、可评估的最小性能要求。
所以在具身智能标准体系搭建过程中,小脑派的技术能力会被细化为稳定行走速度、爬坡角度、抗干扰推力、最大可恢复扰动幅度、重复定位精度、力控误差、安全制动距离等一系列具体指标。这类指标一旦被标准化,反过来会推动小脑派从“Demo 工程”走向更严谨的工程学科。
8. 小脑派的学习路线和二次开发切入点
如果你想进入小脑派,不要一上来就跑到仿真里训练人形机器人空翻。这条路看上去很性感,但成功率极低。更合理的学习路线是稳步推进,让每一步都有明显的物理反馈。
阶段一:传统运动控制基础
必须补足机器人和控制理论的基础。理解关节空间与笛卡尔空间、刚体动力学、正向和逆向运动学、PD/PID 控制、阻尼控制、导纳控制。即使你未来主要做强化学习策略训练,这些底层知识也会在奖励函数设计、真机调试和安全排查时反复用到。
推荐练习:搭建单摆或二连杆环境,编写一个 PD 控制器让末端到达指定位置,观察不同增益对稳定性的影响。
阶段二:强化学习核心方法
小脑派出现最多的算法还是 PPO 这一类在线策略强化学习方法。你需要理解策略网络、价值网络、reward、observation、action、termination condition 这些概念。不要把重点放在发明新算法上,先能跑通一个控制任务。
推荐练习:在 MuJoCo 里让人形机器人学会速度跟随,设定一个固定的 x 方向速度指令,观察策略收敛过程。
阶段三:仿真环境搭建与任务改造
选择一个主流仿真器,把已有的开源机器人模型加载进去,并修改为自己的任务。重点练习改造任务环境,包括修改机器人初始位置、随机初始化地形、增加随机推力、修改奖励权重。
推荐练习:在四足或人形机器人模型上增加“随机方向推力”扰动项,比较不同奖励权重下策略的抗倾倒能力。
阶段四:真机迁移
真机迁移是少样本高风险的环节。新人最好在有经验工程师的指导下完成。如果暂时没有真机资源,至少要学会完整地跑批量仿真评估并分析失败原因,培养对策略鲁棒性的判断力。
二次开发的切入点可以参考上面阶段。现在不同的具身智能开发平台都开始提供二次开发接口,有的开放机器人模型描述格式,有的开放仿真统一接口,有的直接提供强化学习训练 SDK。如果你的目标不是做底层硬件研究,而是希望在已有的平台上做动作技能开发,那么关键是把平台的任务定义、传感器输入和底盘输出接口搞清楚,然后把主要精力放在特定场景的策略训练上。
9. 小脑派开发中的常见误区与排查方法
小脑派开发中会遇到大量表象相似但原因不同的问题。下面整理几个高频误区和排查思路,避开这些坑可以显著提高效率。
| 问题现象 | 可能原因 | 排查方式 | 解决方向 |
|---|---|---|---|
| 仿真里走路姿势很别扭 | 奖励函数权重不合理 | 查看速度跟踪和姿态惩罚的数值分布 | 逐步调整奖励项权重 |
| 仿真表现好,真机频繁失衡 | 仿真物理差异大,域随机化不够 | 对比真机与仿真模型的基本摩擦力与质量分布 | 增加域随机化范围并校准电机模型 |
| 策略控制频率不够 | 网络结构太重或推理工具没优化 | 测量单个推理周期耗时 | 裁剪网络层数或改用 TensorRT/ONNX |
| 机器人突发震荡 | PD 增益过高或控制周期不稳定 | 看关节力矩曲线是否高频振荡 | 降低增益,排查实时日志阻塞 |
| 训练不收敛 | 奖励稀疏或动作空间过大 | 观察 episode 平均回报曲线 | 增加辅助奖励或降低动作维度 |
| 状态估计漂移严重 | IMU 零偏或观测更新不一致 | 对比机器人静止时的估计姿态 | 标定 IMU,调整滤波器参数 |
| 真机执行时指令跳变 | 大脑高层指令没有做平滑处理 | 查看输入策略的速度指令曲线 | 增加插值和低通滤波 |
这里有必要强调一个常见思维陷阱:如果机器人在真机上跌倒,很多人第一反应是“策略不够强,要多训练”,但真实原因可能出在状态估计、通信延迟、电机响应或机械结构上。基础要素未对齐,策略迭代再多次也没有用。
排查问题时需要形成可靠日志体系。每个控制周期都用软件记录,覆盖高层指令、小脑策略输入、策略输出、PD 控制量、关节实际位置和电流。失败后再从日志中复盘,找错误的究竟是哪一层,而不是盲目修改奖励函数或加训练迭代次数。
10. 小脑派的合规开发与安全边界
小脑派开发涉及物理硬件,高风险性和安全使用边界是不可忽略的。
在演示和真机测试环节,必须设置急停和限位保护机制。小脑层即使策略设计得再稳健,也不能代替机械急停。尤其是人形机器人、足式机器人的动载巨大,一次失控可能造成设备和周边人员受伤。
在涉及人脸识别、语音采集导航、摄像头视觉感知时,要遵守各平台对个人信息和生成内容的规定。不要在未经授权的情况下收集或传播他人肖像、环境信息,也不要在公共场景使用未经许可的视觉数据进行模型训练。
如果预期成果是作为产品或开源项目发布,还要确认是否符合特定行业的安全生产标准;针对不同领域所需的认证类型,需要按对应规范准备。标准体系的出现,本质上就是为行业提供可预期的工程约束,而不是让某个单一团队自行承担道德风险。
如果你的开发场景涉及云平台接口调用,要确保数据链路加密,不把含个人信息的图像音频明文上传到不信任的服务器。批量开发和内容分发时,也应遵守平台关于真实性的披露要求,避免在演示中误导观众,把安全无关能力默认为生产能力的做法是对同行和用户的不负责任。
11. 结语:小脑派不是配角
回到这个系列的主题:“离新闻头条最近的小脑派”不该被误读为“小脑派只是负责表演”。正是因为媒体更喜欢拍那些“看得见的灵活性”,小脑派的真实工作量才往往被严重低估。后空翻、碎石路行走、抗踹站立的背后,是多层系统的集成。
如果给你一个明确的行动建议,就是先不要急着追大模型、追任务规划,不要只盯大脑层。把时间投入到一个小型的腿式平台或机械臂平台上,把一个动作的稳定性做扎实,亲身经历过一次从仿真到真机的迁移,你会比大部分只看论文和演示视频的人更理解具身智能的本质。大脑可以做任何决定,但只有小脑能让它“站得住”。
如果你现在正处在要不要转向小脑派的分岔路口,初期最能验证自己的方式并不是做后空翻或跑酷。把一个四足或人形环境跑通,让它稳定地向前走到目标速度且能抵抗方向推搡,就已经算是过了第一关。真正困难的从来不是看起来酷的东西,而是那些看起来很简单、却必须在真实物理环境中始终成立的东西。