整理日期 2026-09-20 · 内容转自 benchmark-tutorial/00-overview.md「横向对照表」(定位 / 引擎 / 规模 / 指标 / SOTA 逐字照录,仅调列序,SOTA 移末列为备注)。「环境 + 技术栈」按各仓安装脚本 / Dockerfile / requirements 逐项扒出(conda / pip / 数据资产点名计数);「预估搭建时间」以 RoboTwin 两周实测(按 10 个工作日计 10 人天)为锚点、其余按原成本档同比例折算,待按实际团队与机器校准。
| 榜单 | 定位 | 引擎 | 规模(任务数 / 演示数) | 指标 | 官方已评测模型 | 新模型接入工作量预估 | 环境 + 技术栈 | 预估搭建时间 | 备注(SOTA + 日期) |
|---|---|---|---|---|---|---|---|---|---|
| LIBERO★ 2343 | 终身机器人学习的任务注册与遗忘度量,测知识迁移与灾难性遗忘,不测真机迁移 | MuJoCo + robosuite / Franka Panda | 总计 130 个语言条件任务,分 4 组套件
|
FWT / NBT / AUC(稀疏成功率)+ 混淆矩阵
|
RESNET-RNN、RESNET-T、VIT-T三套官方策略架构 | 4–6 人天经验初估·待确认(配置三选 + 训练入口成熟;含适配编写 + 联调 + 基础测试脚本)适配文件:lifelong/models/新策略.py + configs/policy/新配置.yaml | 环境conda python=3.8.13;单机 CPU 可跑,GPU 可选(torch cu113)技术栈约 18 项requirements.txt 15 个钉死版本(robosuite 1.4.0、robomimic 0.2.0、bddl 1.0.1、gym 0.25.2、transformers 4.21.1…)+ torch 1.11.0+cu113 全家桶 + pip install -e . + 演示数据(HF 镜像) | 3–5 人天锚定折算·待确认(原成本档:低) | 未公开单一榜首分数(2026-09-20 整理,出处:论文 Table 1 / Table 2 基线对比,ER 与 PackNet 等方法按套件报告) |
| CALVIN★ 991 | 语言条件长时序操作协议,测 5 步链式执行与跨环境泛化,不测大规模真机排名 | PyBullet + PlayTable 操作台 / 7 自由度机械臂 | 约 34 类原子操作 + 1000 条 5 步链 + 4 个环境
|
MTLC 单步 + LH-MTLC 链式(SR_1 至 SR_5 + 平均链长)
|
MCIL官方基线;超 MCIL 的开源模型见官方排行榜 | 6–10 人天经验初估·待确认(双接口对接;含适配 + 联调 + 测试脚本)适配文件:evaluate_policy.py 内两扩展类 + calvin_agent/models/ 下模型本体 | 环境conda python=3.8 + cmake 3.18.4(tacto 触觉编译用),EGL 离屏渲染技术栈约 8 项3 个 editable 包(tacto、calvin_env、calvin_models)+ pyhash(setuptools 需 <58 兜底)+ 数据集 D / ABC / ABCD(debug 版 1.3GB 起)+ PyTorch Lightning + Hydra 训练栈 | 5–8 人天锚定折算·待确认(原成本档:低;数据下载体量大) | 53.9%(2021-12,出处:论文评估表 MCIL 基线 D→D 的 MTLC 单步);arXiv:2112.03227 ⚠️待点开确认(CALVIN,原因:版本号未核实) |
| SimplerEnv★ 1168 | 真实策略的 real-to-sim 排名复现,测仿真评估是否保序,不测新策略训练榜首 | SAPIEN + ManiSkill2 真机映射分支 / Google Robot 与 WidowX | 两类本体约 10 个任务族 + 约 1500 轮配对评估
|
成功率 + Pearson 相关 + MMRV + 两套评估做法
|
RT-1、RT-1-X、RT-2-X、Octo | 4–7 人天经验初估·待确认(照推理主入口模式;含真机视频调试脚本,官方文档重点强调)适配文件:policies/{新策略}/(仿 rt1/octo)+ simple_inference_visual_matching_prepackaged_envs.py(定制再改 main_inference.py + scripts/ 配置) | 环境conda python=3.10/3.11 + CUDA 11.8–13 + NVIDIA GPU(RTX 最佳,非 RTX 光追慢)技术栈约 6 项numpy==1.24.4(pinocchio IK 要求 <2.0)+ ManiSkill2 real2sim 分支及依赖 + RT-1 推理栈 + Octo 推理栈(full install) | 8–12 人天锚定折算·待确认(原成本档:中;视觉匹配调试占大头) | 未公开单一成功率榜首(2026-09-20 整理,出处:论文 Fig.1 强相关结论,仿真与真实配对评估约 1500 轮;各策略分值见分章 03,不转述二手排名) |
| RoboCasa365★ 1747 | 厨房原子到组合的泛化阶梯,测组合泛化与数据规模效应,不测开放家务全集 | MuJoCo + robosuite / 移动操作平台 | 365 个任务 + 约 2500 场景 + 超 2000 小时数据
|
分组成功率(原子 / 组合可见 / 组合未见)+ 终身学习阶段成功率
|
Diffusion Policy、π0、π0.5、GR00T N1.5 | 6–10 人天经验初估·待确认(gym + 多视角输入对齐;含联调 + 测试脚本)适配文件:robocasa/ 下策略学习代码(仿 scripts/collect_demos.py / demos/ 组织),gym.make 直连 | 环境conda-forge python=3.11,全平台可装技术栈约 4 项robosuite master 分支(pip install -e .)+ robocasa 本体(pip install -e .,numba 0.56.4 兜底)+ kitchen assets 约 10GB | 12–25 人天锚定折算·待确认(原成本档:中高;不含全量数据下载) | 平均 22.5%(Atomic-Seen 44.1% / Composite-Seen 9.0% / Composite-Unseen 11.7%)(2026-03,出处:365 论文正文系统评估节);仿真加真实联合训练 79.8%,纯真实 61.8%(出处同);原版分数引用 arXiv:2406.02523 ⚠️待点开确认(RoboCasa 原版,原因:与仓库引用段对应关系未核实) |
| ManiSkill★ 3350 | 图形处理器并行的大规模操作基准,测并行吞吐与跨本体泛化,不测家务语义规划 | SAPIEN 3 + PhysX 并行物理 + Vulkan 并行渲染 / 多形态本体 | ManiSkill2 约 20 任务族 + ManiSkill3 约 12 类域
|
各任务族成功率(训练 / 测试物体集分离)+ 回报值
|
Sense-Plan-Act、Transporter Networks、DAPG+PPO、BC、Octo、RT-1X | 7–12 人天经验初估·待确认(控制器观测转换;含转换调试 + 测试脚本)适配文件:agents/新 agent(仿 base_agent.py,registration.py 注册)+ examples/benchmarking 评测脚本 | 环境Linux + NVIDIA GPU 全功能(Windows / Mac 仅部分),Vulkan 必须装技术栈约 22 项pip install mani_skill(含 numpy / scipy / gymnasium / h5py / sapien≥3.0.3 / pytorch_kinematics 等约 20 项)+ 按系统版本装 torch + Vulkan | 8–12 人天锚定折算·待确认(原成本档:中) | 91.6%(2024-10,出处:ManiSkill3 论文正文真实评估,22 次成功共 24 次试验平均);ManiSkill2 分数引用 arXiv:2302.04659 ⚠️待点开确认(ManiSkill2,原因:版本号未核实),细项见分章 05 |
| BEHAVIOR-1K★ 1712 | 完整家务活动的符号化定义,测长时程规划与状态变化处理,不测单步抓取榜首 | Isaac Sim + OmniGibson / 移动双臂平台 | 1000 个活动 + 50 场景 + 9000 余物体
|
BDDL 谓词满足率 + 效率分(导航距离 / 仿真耗时 / 物体位移)
|
RL-VMC(SAC 端到端)、RL-Prim.、RL-Prim.Hist. | 10–15 人天经验初估·待确认(原语 + BDDL;含长链联调 + 测试脚本)适配文件:原语选择策略 + BDDL 对接(action_primitives/ 六类原语现成,不用写) | 环境模块化安装:conda behavior 环境 + CUDA 12.8 + Isaac Sim(wheels 约 12GB,需接受 NVIDIA EULA)技术栈约 6 项OmniGibson + bddl3 + 数据集约 10GB(另挂载)+ primitives / eval 按需 + 数据集 TOS 确认 | 25–50 人天锚定折算·待确认(原成本档:高;Omniverse 环境最耗时,约 5–10 周单人) | 未公开单一榜首分数(2026-09-20 整理,出处:论文实验节,长时程与复杂操作仍是挑战,基线分散未收敛,细项见分章 06) |
| RoboTwin 2.0★ 2898 | 双臂数字孪生的评测与数据工厂,测双臂协作与视觉指令泛化,不测单臂桌面榜首 | SAPIEN 3.0 / Aloha、ARX、Franka 等双臂平台 | 50 评测任务 + 731 物体 + 10 万余条轨迹
|
任务成功率 + Easy / Hard 两档 + 视觉指令泛化剖面
|
ACT、DP、RDT、Pi0、DP3 | 4–6 人天经验初估·待确认(XPolicyLab;含联调 + 基础测试脚本)适配文件:仿 scripts/eval_policy*.py + XPolicyLab 策略服务(子模块需初始化) | 环境git clone --recurse-submodules(XPolicyLab 子模块)+ SAPIEN 3.0;官方称安装约 20 分钟技术栈约 4 项XPolicyLab + env_cfg / envs + HF 预采集 10 万+ 轨迹(默认直接下数据开训) | 10 人天(两周)你方实测锚点(原成本档:中;纯仿真部分) | 71.3%(2025-06,出处:论文 Fig.1 自研方法);代码生成成功率提升 10.9 个百分点(出处:论文摘要与正文);纯合成零样本相对提升 228%,加 10 条真实演示相对提升 367%(出处同,细项见分章 07) |
| RoboDojo★ 606 | 按能力维度剖分的统一评测,测记忆、精度、长时程等短板定位,不测单一总榜首 | Isaac Sim 5.1 + IsaacLab 2.3 / 多机器人本体 | 仿真 54 组 + 真机 18 个 + 训练数据约 38 小时
|
五维能力成功率 + 平均分(每任务 50 轮,按五维平均)
|
Hy-Embodied-0.5-VLA、SpatialForcing、pi0.5、X-VLA30 余种策略已上报 | 4–6 人天经验初估·待确认(两文件接入;含容器联调 + 测试脚本)适配文件:XPolicyLab/policy/〈名〉/eval.sh + deploy.yml(仿真侧只调 robodojo.sh) | 环境Docker 一条龙(Ubuntu 22.04 + CUDA 12.8.1 cudnn devel):cmake / build-essential / ffmpeg + EGL / Vulkan 运行库 + Miniconda + Python≥3.11技术栈约 6 项Isaac Sim + IsaacLab 2.3 + CuRobo + robodojo pip 栈 + XPolicyLab 子模块 + Assets 挂载(策略服务跑容器外经 TCP) | 12–25 人天锚定折算·待确认(原成本档:高;纯仿真部分,真机工位另计) | 基线平均约 8% 至 13%(2026-07,出处:论文主结果表,如 Hy-Embodied 类基线平均约 13.07% 与 8.80% 双列;各维度细项见分章 08) |
| VLA-Harness★ 620 | 一次接入、多处评测的矩阵型框架,测跨模型横评与复现保真,不测单一操作技能榜首 | WebSocket 加消息打包协议,各榜单容器隔离 / 依所连榜单本体而定 | 约 14 适配器 + 6 模型服务 + 657 条聚合结果
|
分集 → 任务 → 榜单三级聚合 + 复现偏差报告
|
OpenVLA(含 OFT)、pi0 / pi0-FAST(含 pi0.5)、GR00T N1(含 N1.6)、X-VLA、CogACT(含 DB-CogACT) | 2–4 人天经验初估·待确认(单文件 + 双 YAML;含 smoke 测试)适配文件:predict(obs, ctx) 单文件 + configs/model_servers/〈名〉/(照 examples/pusht_train_eval/ 四件套) | 环境宿主机只需 Python + pip install vla-eval + uv技术栈约 15 项vla-eval 本体依赖约 13 项(anyio / websockets / msgpack / pyyaml / omegaconf / rich…)+ 榜单容器约 20 个 Dockerfile(base:CUDA 12.1 + EGL / Vulkan + Miniforge + uv,ghcr.io 拉取;behavior1k 另需 Isaac Sim 4.5.0 + 双 EULA)+ 两份 YAML + serve / run 双命令 | 8–12 人天锚定折算·待确认(原成本档:中;先跑通 LIBERO 复现矩阵) | 聚合 657 条结果(2026-03,出处:论文 Fig.1);复现警示:单个未记录参数可摆动 55 个百分点,如 LIBERO 案例从 97.8% 降至 42%(出处:论文 Sec.III);并行评估最高约 47 倍加速,如 2000 轮 LIBERO 约 18 分钟(出处:论文摘要与 Fig.1) |
横向可滚动查看全表;首列与表头冻结。点「下载 CSV」可直接用 Excel 打开,「复制 TSV」可粘贴进在线表格。