整理日期 2026-09-20 · 内容逐字转自 benchmark-tutorial/00-overview.md「横向对照表」一节(9 行 7 列),维度未增删。规模数字以本地仓库 commit 为准,定义以论文为准;SOTA 格格式为分数(日期,出处)。另附表注 4 条见表下。
| 榜单 | 定位 | 引擎 | 规模(任务数 / 演示数) | 指标 | SOTA + 日期 | 复现成本 |
|---|---|---|---|---|---|---|
| LIBERO | 终身机器人学习的任务注册与遗忘度量,测知识迁移与灾难性遗忘,不测真机迁移 | MuJoCo + robosuite / Franka Panda | 130 个语言条件任务,分 4 组套件;演示数以仓库数据配置为准 | 稀疏成功率 + 混淆矩阵 + 前向迁移(含负向遗忘与成功率曲线面积,定义见论文评估节) | 未公开单一榜首分数(2026-09-20 整理,出处:论文 Table 1 / Table 2 基线对比,ER 与 PackNet 等方法按套件报告) | 低纯仿真,复现入口见 benchmarks/LIBERO/README.md 与分章 01 |
| CALVIN | 语言条件长时序操作协议,测 5 步链式执行与跨环境泛化,不测大规模真机排名 | PyBullet + PlayTable 操作台 / 7 自由度机械臂 | 约 34 类原子操作,5 步序列约 1000 条链,4 个环境 A/B/C/D;训练与评测划分以论文与仓库配置为准 | LH-MTLC 链式评估:SR_1 至 SR_5 + 平均成功链长(定义见论文评估节) | 53.9%(2021-12,出处:论文评估表 MCIL 基线 D→D 的 MTLC 单步);arXiv:2112.03227 ⚠️待点开确认(CALVIN,原因:版本号未核实) | 低纯仿真,复现入口见 benchmarks/calvin/README.md 与分章 02 |
| SimplerEnv | 真实策略的 real-to-sim 排名复现,测仿真评估是否保序,不测新策略训练榜首 | SAPIEN + ManiSkill2 真机映射分支 / Google Robot 与 WidowX | Google Robot 与 WidowX 两类本体约 10 个任务族,配对外观与位姿变体;论文报告约 1500 轮配对评估 | 成功率 + Pearson 相关 + MMRV(排错的最大真实代价,定义见论文评估节) | 未公开单一成功率榜首(2026-09-20 整理,出处:论文 Fig.1 强相关结论,仿真与真实配对评估约 1500 轮;各策略分值见分章 03,不转述二手排名) | 中纯仿真但需视觉匹配资源,复现入口见 benchmarks/SimplerEnv/README.md 与分章 03 |
| RoboCasa365 | 厨房原子到组合的泛化阶梯,测组合泛化与数据规模效应,不测开放家务全集 | MuJoCo + robosuite / 移动操作平台 | 365 个任务,覆盖约 60 类厨房活动;约 2500 个厨房场景;约 612 小时人工演示 + 约 1615 小时合成演示(定义见 365 论文第 1 节;原版 100 任务对照见分章) | 分见与未见组合成功率 + 终身学习阶段成功率(定义见 365 论文评估节) | 平均 22.5%(Atomic-Seen 44.1% / Composite-Seen 9.0% / Composite-Unseen 11.7%)(2026-03,出处:365 论文正文系统评估节);仿真加真实联合训练 79.8%,纯真实 61.8%(出处同);原版分数引用 arXiv:2406.02523 ⚠️待点开确认(RoboCasa 原版,原因:与仓库引用段对应关系未核实) | 中高大规模数据与多场景渲染,复现入口见 benchmarks/robocasa/README.md 与分章 04 |
| ManiSkill | 图形处理器并行的大规模操作基准,测并行吞吐与跨本体泛化,不测家务语义规划 | SAPIEN 3 + PhysX 并行物理 + Vulkan 并行渲染 / 多形态本体 | ManiSkill2 约 20 个任务族;ManiSkill3 约 12 类域、20 余种机器人本体,数百万帧演示(含规划、强化学习与遥操作来源,定义见 ManiSkill3 论文第 1 节) | success_once / success_at_end / 回报值(定义见论文评估节) | 91.6%(2024-10,出处:ManiSkill3 论文正文真实评估,22 次成功共 24 次试验平均);ManiSkill2 分数引用 arXiv:2302.04659 ⚠️待点开确认(ManiSkill2,原因:版本号未核实),细项见分章 05 | 中需图形处理器并行,复现入口见 benchmarks/ManiSkill/README.md 与分章 05 |
| BEHAVIOR-1K | 完整家务活动的符号化定义,测长时程规划与状态变化处理,不测单步抓取榜首 | Isaac Sim + OmniGibson / 移动双臂平台 | 1000 个日常活动,50 个场景,9000 余个物体;挑战子集约 100 任务与约 2 万条轨迹(定义见论文第 1 节) | BDDL 谓词满足率 + 效率分(定义见论文评估节) | 未公开单一榜首分数(2026-09-20 整理,出处:论文实验节,长时程与复杂操作仍是挑战,基线分散未收敛,细项见分章 06) | 高真实感渲染与大场景资源需求大,复现入口见 benchmarks/BEHAVIOR-1K/README.md 与分章 06 |
| RoboTwin 2.0 | 双臂数字孪生的评测与数据工厂,测双臂协作与视觉指令泛化,不测单臂桌面榜首 | SAPIEN 3.0 / Aloha、ARX、Franka 等双臂平台 | 50 个评测任务,731 个物体共 147 类,5 种双臂构型,10 万余条预采集轨迹(定义见 2.0 论文摘要与第 1 图;1.0 对照见分章) | 任务成功率 + 视觉与指令泛化剖面(含杂物、光照、背景、台面高度与语言五轴域随机,定义见论文评估节) | 71.3%(2025-06,出处:论文 Fig.1 自研方法);代码生成成功率提升 10.9 个百分点(出处:论文摘要与正文);纯合成零样本相对提升 228%,加 10 条真实演示相对提升 367%(出处同,细项见分章 07) | 中纯仿真但双臂与域随机配置多,复现入口见 benchmarks/RoboTwin/README.md 与分章 07 |
| RoboDojo | 按能力维度剖分的统一评测,测记忆、精度、长时程等短板定位,不测单一总榜首 | Isaac Sim 5.1 + IsaacLab 2.3 / 多机器人本体 | 仿真 42 个标准任务加 12 个随机任务共 54 个,另有 18 个真机任务;30 余种策略已上报(定义见论文第 3 节) | 五维能力成功率:记忆、精度、长时程、开放理解等分维报告(定义见论文第 3 节评估设置) | 基线平均约 8% 至 13%(2026-07,出处:论文主结果表,如 Hy-Embodied 类基线平均约 13.07% 与 8.80% 双列;各维度细项见分章 08) | 高仿真加真机两套,复现入口见 benchmarks/RoboDojo/README.md 与分章 08 |
| VLA-Harness | 一次接入、多处评测的矩阵型框架,测跨模型横评与复现保真,不测单一操作技能榜首 | WebSocket 加消息打包协议,各榜单容器隔离 / 依所连榜单本体而定 | 约 14 个仿真榜单适配器,6 类模型服务;榜单页聚合 657 条结果覆盖 17 个榜单(定义见论文 Fig.1 与第 1 节) | 分集到任务再到榜单三级聚合 + 复现偏差报告(定义见论文第 2 至 3 节) | 聚合 657 条结果(2026-03,出处:论文 Fig.1);复现警示:单个未记录参数可摆动 55 个百分点,如 LIBERO 案例从 97.8% 降至 42%(出处:论文 Sec.III);并行评估最高约 47 倍加速,如 2000 轮 LIBERO 约 18 分钟(出处:论文摘要与 Fig.1) | 中需容器与多榜单配置,复现入口见 benchmarks/vla-evaluation-harness/README.md 与分章 09 |
横向可滚动查看全表;首列与表头冻结。点「下载 CSV」可直接用 Excel 打开,「复制 TSV」可粘贴进在线表格。