详细介绍RoboChallenge基准
详细介绍 RoboChallenge 基准 ,给出相关论文地址,分析,任务类型,数量等所有维度的信息,最后给出一个csdn标题
我会先核对 “RoboChallenge” 的正式出处、论文/项目页和数据规模,再把任务类型、评测指标、数据构成、优缺点和适用研究方向系统整理出来,避免把同名项目混在一起。
目前已经确认:RoboChallenge 不是单一数据集,而是一套面向视觉-语言-动作模型(Vision-Language-Action, VLA)的真实机器人在线评测体系;其核心基准经历了Table30和Table30 V2两代。V2 在 2026 年重点从“任务完成能力”推进到“泛化能力”评测。
下面按截至 2026 年 9 月公开资料,把 RoboChallenge 从“平台—基准—任务—机器人—数据—评测协议—指标—结果—V2 演进—优缺点—与其他真机 Benchmark 对比”完整拆开讲。这里最容易混淆的一点是:RoboChallenge 并不是单一数据集,而是一套真实机器人在线评测平台;Table30 / Table30 V2 才是它的核心 Benchmark。citeturn663659academia40
一、RoboChallenge 到底是什么?
RoboChallenge是面向具身智能(Embodied AI)、尤其是视觉-语言-动作模型(Vision-Language-Action, VLA)的大规模真实机器人评测(Real-Robot Evaluation)平台。
它试图解决一个很现实的问题:
很多 VLA 论文展示了非常漂亮的 Demo,但不同研究团队往往:
- 用不同机器人;
- 用不同相机;
- 用不同任务;
- 用不同初始摆放;
- rollout 次数不同;
- 测试人员不同;
- 成功标准也不同。
于是论文 A 的 80% 成功率和论文 B 的 60% 成功率,实际上未必具有可比性。
RoboChallenge 的核心思想就是把机器人评测变成类似“统一在线考场”:
模型仍然运行在研究者自己的 GPU / 服务器上,但真实机器人、测试环境、任务初始化、评分和日志由 RoboChallenge 统一管理。
它因此重点追求三个目标:
| 目标 | 英文 | RoboChallenge 的解决思路 |
|---|---|---|
| 可比较性 | Comparability | 不同模型在相同机器人和任务上测试 |
| 可复现性 | Reproducibility | 控制任务初态和测试协议 |
| 可扩展性 | Scalability | 在线 API + 多机器人并行运行 |
| 公平性 | Fairness | 统一测试人员、初始状态和评分标准 |
| 真机真实性 | Real-World Fidelity | 不以仿真成绩代替真实物理交互 |
首篇 RoboChallenge 技术报告于 2025 年提出初始的Table30:30 个真实桌面机器人操作任务,并使用 4 类机器人、总计 10 台真实机器人进行在线评测。citeturn663659academia40
二、核心论文和官方地址
| 资源 | 信息 | 地址 |
|---|---|---|
| RoboChallenge 原始论文 | RoboChallenge: Large-scale Real-robot Evaluation of Embodied Policies,2025 | urlarXiv 论文:2510.17950turn663659academia40 |
| RoboChallenge 官方技术报告 | Table30 原始设计、系统、实验与 benchmark | url官方 Technical Report PDF |
| Table30 V2 论文 | Table30 V2: Evaluating Generalized Models by Real Robots at Scale | urlCVPR 2026 Open Access 论文页 |
| Table30 V2 官方技术报告 | V2 完整协议、任务设计、Zero-shot/OOD | urlTable30 V2 官方 PDF |
| RoboChallenge 官网 | Benchmark、Leaderboard、Competition | urlRoboChallenge 官网 |
| Table30 数据 | 第一代 30 个任务 | urlHugging Face:Table30 |
| Table30 V2 数据 | 第二代 30 个任务 | urlHugging Face:Table30 V2 |
其中 Table30 V2 已正式进入CVPR 2026 Workshop / GigaBrain Challenge体系,其论文收录于 CVPR 2026 Workshops,页码为 4461–4467。
三、RoboChallenge 的整体工作方式
这一点其实是 RoboChallenge 最有意思的地方。
传统机器人 Benchmark 常见两种模式:
| 方法 | 问题 |
|---|---|
| 把 checkpoint 上传给主办方 | 模型环境、CUDA、依赖容易冲突 |
| 参与者提供公网 API | 网络、安全、实时性问题严重 |
| 上传 Docker | 机器人驱动、系统版本和硬件兼容复杂 |
RoboChallenge 采用的是远程机器人范式(Remote Robot Paradigm)。
模型完全运行在参与者自己的机器上。
系统大致是:
Real Robot→Observation API→User VLA→Action API→Real Robot\text{Real Robot}\rightarrow\text{Observation API}\rightarrow\text{User VLA}\rightarrow\text{Action API}\rightarrow\text{Real Robot}Real Robot→Observation API→User VLA→Action API→Real Robot
用户通过 API 获取:
ot={ It(1),It(2),...,It(V),qt,trobot,nt}o_t=\{I_t^{(1)},I_t^{(2)},...,I_t^{(V)},q_t,t_{\mathrm{robot}},n_t\}ot={It(1),It(2),...,It(V),qt,trobot,nt}
其中:
It(v)I_t^{(v)}It(v)是不同相机视角的 RGB / Depth;
qtq_tqt是本体状态(Proprioception);
trobott_{\mathrm{robot}}trobot是机器人端时间戳;
ntn_tnt表示当前动作队列中尚未执行的 action 数量。
模型计算:
At=π(ot,T)A_t=\pi(o_t,\mathcal{T})At=π(ot,T)
然后把 action chunk 放入先进先出动作队列(FIFO Action Queue)。
这种方式的好处是研究者不用把 checkpoint 交出去,也不用适配主办方 GPU 软件栈,同时仍然是真正控制远程真实机器人。
四、第一代 Benchmark:Table30
4.1 基本规模
第一代Table30的核心数字是:
| 维度 | Table30 |
|---|---|
| 任务数量 | 30 |
| 机器人类型 | 4 类 |
| 初始物理机器人数量 | 10 台 |
| 单臂任务 | 19 |
| 双臂任务 | 11 |
| 单任务测试次数 | 10 rollouts |
| 单 rollout Progress Score | 最高 10 分 |
| 单任务 Progress Score | 最高 100 分 |
| 演示数据 | 每任务最多约 1000 episodes |
| 主要应用 | 桌面真实机器人操作 |
| 主要模型 | VLA / robot policy |
第一代平台使用UR5、Franka Panda、ARX-5、Cobot Magic ALOHA四种机器人。
五、Table30 使用哪些机器人?
第一代的任务分布非常值得关注。
| 机器人 | 类型 | Table30 任务数 |
|---|---|---|
| ALOHA | 双臂 | 11 |
| ARX-5 | 单臂 | 11 |
| UR5 | 单臂 | 6 |
| Franka Panda | 单臂 | 2 |
| 合计 | 30 |
因此从构型角度:
| 构型 | 数量 |
|---|---|
| 单臂操作(Single-Arm) | 19 |
| 双臂操作(Two-Arm) | 11 |
RoboChallenge 年度报告还建立了任务标签体系。注意这些标签不是互斥分类:一个任务可以同时属于 precise3d、bimanual、repeated 等多个类别,因此数量相加会大于 30。
六、Table30 到底测试哪些能力?
这是理解这个 Benchmark 最关键的一张表。
| 能力标签 | 中文 | 任务数量 |
|---|---|---|
| Precise3d | 高精度三维操作(Precise 3D Manipulation) | 12 |
| Repeated | 重复操作(Repeated Manipulation) | 10 |
| Bimanual | 双臂协调(Bimanual Coordination) | 8 |
| Manipulation | 一般操作(General Manipulation) | 6 |
| Classification | 视觉分类(Visual Classification) | 5 |
| Multiview | 多视角感知(Multi-view Perception) | 5 |
| Simple-pick | 简单抓取(Simple Pick-and-Place) | 4 |
| Temporal | 时序 / 长程记忆(Temporal / Long-Horizon Memory) | 3 |
| Softbody | 柔性物体操作(Soft-Body Manipulation) | 3 |
这里已经能看出 RoboChallenge 与很多“抓起一个方块放进盒子”的机器人 Benchmark 有明显区别。
它希望覆盖:
感知 → 定位 → 抓取 → 操作 → 时序 → 多阶段规划 → 双臂 → 柔性物体。
七、Table30 的完整 30 个任务
官方当前公开的第一代任务如下:
| # | 官方任务名 | 中文含义 |
|---|---|---|
| 1 | arrange_flowers | 插花 |
| 2 | arrange_fruits_in_basket | 将水果放入篮子 |
| 3 | arrange_paper_cups | 整理纸杯 |
| 4 | clean_dining_table | 清理餐桌 |
| 5 | fold_dishcloth | 折叠抹布 |
| 6 | hang_toothbrush_cup | 挂牙刷杯 |
| 7 | make_vegetarian_sandwich | 制作素食三明治 |
| 8 | move_objects_into_box | 将物体放入箱子 |
| 9 | open_the_drawer | 打开抽屉 |
| 10 | place_shoes_on_rack | 把鞋放到鞋架 |
| 11 | plug_in_network_cable | 插入网线 |
| 12 | pour_fries_into_plate | 把薯条倒入盘子 |
| 13 | press_three_buttons | 按顺序按三个按钮 |
| 14 | put_cup_on_coaster | 把杯子放在杯垫上 |
| 15 | put_opener_in_drawer | 把开瓶器放入抽屉 |
| 16 | put_pen_into_pencil_case | 把笔放进笔袋 |
| 17 | scan_QR_code | 扫描二维码 |
| 18 | search_green_boxes |