PUBLIC DATASET LANDSCAPE

开源具身
数据集图谱

把真实机器人轨迹、仿真演示、三维导航环境与第一视角人类示范放进同一张可比较的表里。先判断数据能否直接训练动作,再看规模。

真实机器人轨迹仿真 / 合成数据导航与 3D 场景人类第一视角自动驾驶感知

个重点公开数据集 / 数据集合。本页是“可验证的活动目录”,不是声称永远完整的静态名单。

收录条目含集合与单体数据集
真实机器人 / 混合具备动作或状态轨迹
仿真与 3D 环境适合训练、评测与生成
人类行为先验通常不能直接作为机器人动作
条结果 · 点击表头排序
对比 / 数据集 ↕机构 / 组织 ↕社区指标视频样例类别 ↕来源 ↕公开规模 ↕机器人 / 载体主要模态语言推荐用途开放方式 ↕年份 ↓官方来源
统计快照:2026-08-27。Star 只取官方 GitHub 仓库;Hugging Face 只展示官方数据仓库“最近一个月下载量”,不展示 Likes;Collection 没有统一下载数时,对页面当前列出的官方子仓库求和并明确标注“子库合计”。论文引用只取 Google Scholar 标题匹配结果。数字会变化,“—”表示未找到可唯一匹配的官方入口或本轮未完成 Scholar 核验,不代表 0。

怎么读这张表

  1. 先看“来源”:真实机器人且有 action/state 的条目,最接近 VLA / 模仿学习的直接训练数据。
  2. 再看“控制一致性”:跨机器人集合规模虽大,但动作空间、频率与标定差异会增加清洗和映射成本。
  3. 最后看许可:“需申请”和“研究限定”均不应默认进入商业训练集。

收录边界与局限

  • 收录公开下载或有明确公开申请流程的数据;不收录只有论文、没有数据入口的项目。
  • Open X-Embodiment 是聚合数据集,本表同时保留部分重要组成数据集,统计时会产生重叠,不能直接把规模相加。
  • 规模使用发布方最常用口径(轨迹、小时、场景或帧),不同口径不可直接横比;“约”表示官方近似值。
  • GitHub Stars、Hugging Face 下载量和 Google Scholar 引用量只适合观察社区热度,不能直接代表数据质量;同一项目的代码仓库与数据仓库也可能不同。
  • 第一视角条目查漏参考 awesome-ego-video-datasets ↗,再回到各项目、GitHub、Hugging Face 与论文页逐项核验;未直接照搬其中只有论文而无数据入口的项目。
  • 这是截至核验日的重点目录;社区小规模 LeRobot 数据仍在快速增长,无法穷尽每个个人仓库。
策展口径:公开可获取 · 有明确具身训练/评测价值 · 有可追溯官方来源。
建议把本页当作选型入口,而不是法律或许可意见。
已选择 0 个数据集(最多 4 个)