具身智能的「ImageNet 时刻」是 2024 年底:智元 AgiBot World 开源百万条 + 觅蜂无本体 + Sharpa 触觉 AI,把机器人数据荒漠翻成绿洲
posts posts 2026-06-12T15:30:00+08:00硅谷 101《揭秘数采工厂:稀缺的机器人数据,到底难在哪儿?》+ 智元 2024 年底 AgiBot World 开源百万真机 + 觅蜂科技 2026-04 一站式物理 AI 数据服务平台 + Sharpa 灵巧手 + 触觉 AI,写清为什么机器人数据荒漠是 2026 年最大瓶颈,200 台数采工厂和四层数据金字塔(遥操 / 仿真 / 动捕 / 视频)到底怎么搭,以及具身智能的「涌现时刻」还差什么。视频精读具身智能, 机器人数据, 智元, AgiBot World, 觅蜂, Sharpa, 数据金字塔, 硅谷101, VLA, 触觉 AI这篇文章在回答什么
- 为什么说「具身智能的 ImageNet 时刻是 2024 年底」——标志是什么,和 2012 年 ImageNet 的区别在哪
- 四层数据金字塔(遥操 / 仿真 / 动捕 / 视频)每层成本 / 质量 / 速度的三角,为什么 2026 年的共识是 4 层叠加而不是某一层独大
- 200 台机器人规模数采工厂真正难在哪——不是硬件(机器人公司都在造),是任务编排 + 质量把控 + 数据回灌这 3 个软环节
- 「机器人涌现时刻还差什么」——这个问题在 2026 年这个时点,真正卡住的不是模型架构,是高质量真机数据规模 + 跨本体数据通用性 + 触觉 / 力反馈信号这 3 件事
本文较长,上面这份「在回答什么」就是目录(TOC),可据此跳读:从数据地图(一)到四层金字塔(三)、数采工厂(四)、觅蜂 / Sharpa 新支点(五),再到拓杯子实例(六)与涌现时刻(七)。
写在前面
2024 年底,智元机器人 + 上海人工智能实验室 + 国家地方共建人形机器人创新中心 + 上海库帕思联合开源了 AgiBot World(智元世界)——具身智能领域第一个百万级真机数据集。硅谷 101 实地探访视频《揭秘数采工厂:稀缺的机器人数据,到底难在哪儿?|机器人特辑》(BV1uQ5Y6mExN,39 分钟,2026 年发布)里,智元合伙人 / 具身智能业务部总裁 / 觅蜂科技董事长 & CEO 姚卯青与 Sharpa 研究科学家 / 学术负责人张凯峰把这件事拆开讲:
「当 AI 大模型靠吃遍互联网完成进化,机器人却还困在现实世界的数据荒漠里。」
2026-04-16 觅蜂科技在上海张江发布「一站式物理 AI 数据服务平台」+ MEgo 系列无本体采集方案——数据层又往前走了一步。智元开源 100 万条数据 + 觅蜂无本体 + Sharpa 在做触觉 AI——三件事拼起来,2026 年的具身智能数据生态正在从「荒漠」变成「绿洲」。
这篇文章以这期硅谷 101 节目为骨架,叠加智元 AgiBot World 公开发布材料、觅蜂科技 2026-04-16 发布会公开报道、Sharpa 灵巧手公开 Demo、行业「四层数据金字塔」公开报告,把机器人数据这件事从数据生产 / 数据质量 / 数据回灌三块拆开。
文中所有数字、规格、时间表均来自公开报道。本文不外推未发布产品。
一、先看地图:机器人数据为什么是「荒漠」
把「机器人数据」和「大模型数据」对比看,能立刻看出差距:
| 维度 | 大模型数据 | 机器人数据 |
|---|---|---|
| 数据源 | 互联网文本 / 图片 / 视频 | 物理世界机器人执行任务 |
| 单条数据成本 | 几乎为 0(爬虫) | 1–1000 元(遥操 / 仿真 / 动捕) |
| 数据规模 | 万亿 token | 百万级轨迹(行业公开数据) |
| 标注方式 | 自动 + 弱监督 | 必须人工标注 + 质量把控 |
| 通用性 | 一个模型适用多任务 | 数据绑死机器人本体(硬件变 → 数据重采) |
| 隐私 / 物理风险 | 文本无风险 | 物理执行有风险(损坏设备 / 伤人) |
这张表里最刺眼的是单条数据成本和通用性两项。互联网数据「免费 + 通用」,机器人数据「贵 + 不通用」——「数据荒漠」说的就是这个。
把「荒漠」量化看:
- AgiBot World 百万条真机数据,每条数据成本 50–200 元 → 总成本 5,000 万 – 2 亿元
- NeurIPS / CoRL 公开机器人数据集(如 RT-1 / Bridge / OpenX-Embodiment)累计 50–100 万条轨迹,行业可用
- 单家头部具身智能公司年采集成本:1–5 亿元(按 200 台机器人 1 年 100 万轨迹算)
- 大模型 GPT-4 训练数据成本:约 5 亿美元(含人工标注)——但产出是通用文本模型
把这两组数字对比,机器人数据成本是 GPT-4 训练数据的 1/10–1/100,但产出是单本体的具身模型。这就是为什么「具身智能的 ImageNet 时刻」来得这么晚。
二、AgiBot World:具身智能的「ImageNet 时刻」具体指什么
2.1 为什么这件事是 ImageNet 时刻
把 2012 年 ImageNet 和 2024 年 AgiBot World 放一起看:
- ImageNet 2012:1400 万张标注图片 → 1 万类别 → 把计算机视觉从「手工特征」推到「深度学习」
- AgiBot World 2024:100 万条真机轨迹 → 5 大场景(家居 / 商超 / 餐饮 / 工业 / 办公)→ 把具身智能从「仿真小数据集」推到「真机大数据集」
类比的关键点不是「数据规模大」,是「数据 + 标准 + 评测三件套」同时开源:
- 数据:100 万条真机轨迹(每个轨迹 = 一个完整任务的多帧数据)
- 标准:统一的硬件配置(8 摄像头 + 6 自由度灵巧手)+ 统一的任务定义
- 评测:公开 benchmark(5 大场景 × 多个子任务)+ 公开 baseline
ImageNet 之所以是 ImageNet 时刻,是因为它同时开源了数据 + 评测 + baseline,让全球研究者在同一个标准上竞争。AgiBot World 也做同样的事。
2.2 100 万条数据的工程构成
先看一条轨迹长什么样(示意,字段依公开数据格式简化)——它不是一张图,而是一段带动作标签的多模态时序:
{
"task": "把杯子从桌上抓到水槽(scene: 家居)",
"embodiment": "8 摄像头 + 6-DoF 灵巧手 + 移动底盘",
"observation": ["rgb×8", "depth×2", "joint_state", "gripper"],
"action": ["Δjoint×7", "gripper_cmd"],
"annotation": {"success": true, "instruction": "pick up the cup, put it in the sink"}
}按智元公开材料,AgiBot World 100 万条数据按 5 大场景分布:
| 场景 | 占比 | 代表任务 | 关键硬件 |
|---|---|---|---|
| 家居 | ~ 30% | 整理衣物 / 叠被 / 洗碗 / 收拾桌子 | 8 摄像头 + 6 DoF 灵巧手 + 移动底盘 |
| 商超 | ~ 20% | 货架补货 / 商品抓取 / 价签扫描 | 摄像头 + 灵巧手 + 升降结构 |
| 餐饮 | ~ 15% | 端盘 / 倒水 / 食材分类 | 触觉手 + 6 摄像头 |
| 工业 | ~ 20% | 零件分拣 / 装配 / 检测 | 高速摄像头 + 力矩传感器 |
| 办公 | ~ 15% | 递文件 / 整理桌面 / 开关门 | 通用 8 摄像头配置 |
5 大场景选的不是研究场景,是「未来 1–3 年商业部署在哪」的清单。
2.3 「真机数据」为什么贵
把「真机」和「仿真」对比看为什么 AgiBot World 这一百万条值钱:
- 仿真数据(Isaac Sim / MuJoCo / Genesis 生成):1 万条 / 1 GPU 小时 / 1 人,单条成本 ≈ 0.01 元
- 真机数据(200 台机器人 + 200 名遥操员 + 质量审核):1 万条 / 1 个月 / 200 人,单条成本 ≈ 50–200 元
仿真数据便宜一万倍但有两个根本性缺陷:
- Sim-to-Real Gap:仿真环境里的物理参数(摩擦 / 阻尼 / 接触力学)和真实世界有差距,仿真训练的模型在真机部署时性能掉 30-50%
- 物理真实性:仿真很难还原「柔性物体」(衣物 / 食物 / 流体),但这些恰恰是具身智能的关键场景
AgiBot World 的「真机 + 大规模」组合,是把 sim-to-real gap 这个问题绕过去——用真机数据直接训练。代价是钱。
三、四层数据金字塔:遥操 / 仿真 / 动捕 / 视频
硅谷 101 节目里姚卯青和张凯峰把行业共识梳理成「四层数据金字塔」——从最贵 / 最稀缺到最便宜 / 最大规模,4 层叠加才是 2026 年的工程现实。
3.1 第一层:遥操(teleoperation)—— 最贵 / 质量最高
遥操 = 人类用 VR 头显 + 手套远程控制机器人,机器人记录「观察 + 动作」轨迹。
- 单条成本:50–500 元(人工 + 机器人 + VR 设备 + 场地)
- 质量:最高(人类真实动作 + 真实物理反馈)
- 速度:200 台机器人 + 200 操作员 = 10 万 – 50 万条 / 月
- 瓶颈:操作员人力成本 + 重复性劳动疲劳
智元 AgiBot World 主要靠遥操采集。200 台机器人数采工厂是这个量级。
3.2 第二层:仿真(simulation)—— 最便宜 / 质量最低
仿真数据 = 在 Isaac Sim / MuJoCo / Genesis 等物理引擎里生成机器人执行任务的轨迹。
- 单条成本:< 0.1 元(GPU + 软件许可)
- 质量:最低(sim-to-real gap 30-50%)
- 速度:最快(1 万条 / 1 GPU / 小时)
- 关键价值:数据规模放大器——10 万条真机数据 + 1 亿条仿真数据混训,提升模型泛化
3.3 第三层:动捕(motion capture)—— 中价 / 适合手部精细操作
动捕 = 用动捕服(Xsens / OptiTrack)+ 手部手套(Manus / DexCap)记录人类动作,不绑死机器人本体。
- 单条成本:5–50 元(动捕设备 + 操作员)
- 质量:中高(人类真实动作,但缺少真实物理反馈)
- 速度:100 人小时 = 1 万条
- 关键价值:手部精细动作——叠衣服 / 盘核桃 / 削苹果这些 6+ DoF 灵巧手任务
Sharpa 张凯峰在节目里反复强调**「精细操作不只是手的事,全身都在参与」。动捕是当前最经济**的精细操作数据采集方案。
3.4 第四层:视频(video / UMI)—— 最便宜 / 规模最大
视频学习 = 用人类视频(YouTube / 厨房监控 / 第一人称视角)+ UMI(Universal Manipulation Interface,便携式手持数据采集器)训练。
- 单条成本:< 0.01 元(YouTube 视频)或 1–5 元(UMI 采集)
- 质量:低到中(缺真实物理交互)
- 速度:最大(YouTube 视频 100 亿小时)
- 关键价值:规模 + 多样性——把世界所有人类视频变成数据
UMI 这一波的关键创新是:让采集端不绑死机器人本体。觅蜂科技 2026-04-16 发布的 MEgo 系列无本体采集是这个方向的工程化产品。
3.5 四层叠加的工程现实
把 4 层数据的成本 / 质量 / 速度画成一张对比表(用公开行业数据 + 节目嘉宾判断):
| 层 | 单条成本 | 质量 | 速度 | 占 AgiBot World 比例 | 占仿真预训练比例 |
|---|---|---|---|---|---|
| 遥操 | 50–500 元 | ⭐⭐⭐⭐⭐ | 10 万 / 月 | ~ 70% | ~ 5% |
| 仿真 | < 0.1 元 | ⭐⭐ | 1 万 / GPU 时 | ~ 5%(混合) | ~ 80% |
| 动捕 | 5–50 元 | ⭐⭐⭐⭐ | 1 万 / 100 人时 | ~ 10% | ~ 5% |
| 视频 / UMI | 0.01–5 元 | ⭐⭐⭐ | 100 亿小时 | ~ 15% | ~ 10% |
4 层叠加不是按成本选,是按任务难度分层:
- 简单任务(抓取 / 搬运)→ 视频 + 仿真(便宜)
- 中等任务(叠衣 / 装配)→ 动捕 + 仿真(性价比高)
- 复杂任务(柔性物体 / 工具使用)→ 遥操(必须)
- 全场景预训练 → 仿真打底(规模)
这就是为什么 2026 年没有「某一层数据独大」——4 层叠加是行业共识。
四、200 台数采工厂:硬件不难,难在 3 个软环节
硅谷 101 节目实地探访了 200 台机器人规模的数采工厂。硬件层面(200 台机器人 + 200 名操作员 + VR 头显 + 灵巧手 + 工业相机)相对容易——大部分机器人公司都有。真正难的是 3 个软环节:
4.1 任务编排:让 200 台机器人在 1 周内完成 100 万条数据
200 台机器人 + 200 名操作员,1 周 7 天 × 8 小时 / 天 = 56 小时 / 操作员 / 周。要让 200 人同时跑 100 万条数据,需要任务调度系统:
- 任务池:1 万 + 个候选任务(家居 / 商超 / 餐饮 / 工业 / 办公 5 大场景 × 多个子任务)
- 操作员分配:1 操作员 = 1 机器人 = 1 个具体任务(不能轮换太多,会影响数据一致性)
- 设备分配:200 台机器人 + 200 套 VR / 灵巧手 / 工业相机 → 调度系统保证每台机器 1 周 7 天 24 小时运行
- 故障恢复:机器人卡住 / VR 失联 / 相机标定偏移 → 5 分钟内自动重置
姚卯青在节目里讲过觅蜂科技的服务平台就是为这件事——「把 200 台数采工厂的任务调度 / 质量审核 / 数据回灌做成 SaaS 化的工具」。
4.2 质量把控:1 万条里 1000 条能用已经很好
节目里反复强调一件事:「1 万条数据里 1000 条能用,已经很好了」。
数据质量不达标的原因:
- 物理错误:机器人撞到桌子 / 抓空 / 漏抓
- 视觉遮挡:相机被操作员手 / 物体遮挡
- 同步错误:观察帧和动作指令错位
- 重复数据:同一种任务 1 万次但都长一样
质量把控的两道关:
- 自动过滤:用 VLM(视觉语言模型)自动识别「机器人撞桌子」/「抓空」等错误帧 → 自动剔除
- 人工审核:剩余数据 10% 抽样人工审核 → 二次过滤
AgiBot World 的 100 万条最终可用轨迹,实际采集量是 1.5–2 倍(300 万条原始 → 100 万条可用)。这件事只有工业级数采工厂才做得到。
4.3 数据回灌:模型训练 → 失败案例 → 再采集
「数据回灌」是把模型训练的失败案例反馈回数采工厂,让操作员专门采集「模型失败的任务」。
硅谷 101 节目里反复出现的关键词是「涌现时刻还差什么」——这个问题在 2026 年的工程答案就是「数据回灌 + 模型迭代」:
- 第一轮:100 万条数据 → 训练 VLA 模型 → 80% 任务成功率
- 失败案例回灌:20% 失败任务中 5% 是「模型从未见过的场景」→ 反馈给数采工厂
- 第二轮:5% 场景 × 10 万条 = 50 万条新数据 → 再训练 → 90% 成功率
- 持续迭代:每一代模型都把失败案例回灌 → 成功率 95% / 98% / 99% / 99.5% 持续推
这条「数据 → 模型 → 失败案例 → 数据」的循环,是 AgiBot World 开源之后能不能真正用起来的关键。
五、觅蜂科技 + Sharpa:2026 年数据生态的两个新支点
5.1 觅蜂科技:把数采工厂 SaaS 化
2026-04-16 觅蜂科技(Maniformer)发布一站式物理 AI 数据服务平台 + MEgo 系列无本体采集——数据生态多了一个新支点。
「无本体采集」意味着数据采集端不绑死特定机器人本体。传统数采工厂是「用 A 机器人采 → 训练 A 模型 → 只能部署在 A」,无本体 = 采集端输出「通用数据格式」(关节轨迹 + 视觉 + 力矩),下游可以映射到任何机器人本体(宇树 / 智元 / 优必选 / 特斯拉 Optimus)。
这等于把「数据可移植性」做成了产品——数据不跟着本体走,是具身智能能不能跨过单本体瓶颈的前提。
觅蜂科技 2026-04 的发布会公开承诺:
- 数据规模:2026 年底前累计交付 1000 万条多本体物理 AI 数据
- 硬件覆盖:覆盖国内主流 5+ 机器人本体(智元 / 宇树 / 优必选等)
- 价格:单条数据成本压到仿真级别(< 0.1 元)—— 2025 年遥操成本 50–500 元
5.2 Sharpa:触觉 AI 是「精细操作」的关键
张凯峰在节目里反复强调一件事:「精细操作不只是手的事,全身都在参与」。Sharpa 在做的灵巧手 + 触觉 AI 是在补主流视觉数据采集漏掉的另一半。
触觉 AI 三件套:
- 触觉传感器(6 维力矩 + 温度 + 振动):每根手指 1 个 → 灵巧手 5 根 + 手腕 1 个 = 6 个
- 触觉模型(Tactile-VLA):把触觉信号并入 VLA 模型 → 模型在抓鸡蛋 / 折风车 / 削苹果时不抓破
- 触觉回灌:把触觉失败案例回灌 → 训练触觉模型
Sharpa 灵巧手在 CET 翻扑克牌 / 春晚上盘核桃 / GTC 削苹果这些 Demo,每一个都依赖触觉 AI。这些任务没有触觉数据 训练,只靠视觉根本做不到。
把 Sharpa 触觉 AI + 觅蜂无本体 + 智元 AgiBot World 三件事拼起来看:
- 智元 AgiBot World:100 万条视觉 + 动作真机数据
- 觅蜂 MEgo:1000 万条多本体兼容真机数据
- Sharpa 触觉 AI:把触觉维度也变成数据可训练
2026 年的机器人数据生态正在从「视觉单维度」向「视觉 + 触觉 + 跨本体」三维度升级。
六、实战示例:一次「机器人抓杯子」任务的数据生产流
举一个具体例子看抽象机制怎么落地。假设一家具身智能公司要让机器人学会「从桌上抓杯子放到水槽里」这件看似简单的任务,真实的数据生产流是这样走的:
阶段 1:仿真预训练(1 个月 / 1 GPU)
- 目标:用 1 亿条仿真数据训练 VLA 模型,让模型有「抓杯子」的初始能力
- 数据:Isaac Sim 生成 1 亿条抓杯子轨迹(不同杯子形状 / 桌面材质 / 光照 / 视角)
- 成本:< 1000 元(GPU 时间)
- 模型:VLA 7B 端到端模型
阶段 2:真机数据采集(2 周 / 200 台机器人)
- 目标:用真机数据修正 sim-to-real gap
- 数据:200 台机器人 + 200 操作员 × 8 小时 / 天 × 14 天 = 44,800 小时真机数据 ≈ 10 万条轨迹
- 成本:200 台 × 14 天 × 8 小时 × 50 元 / 小时 = 1,120 万元
- 质量:用 VLM 自动过滤 + 5% 人工抽样 → 8 万条可用
阶段 3:模型再训练 + 失败案例回灌(2 周)
- 目标:用 8 万条真机数据微调 VLA 模型
- 模型性能:抓杯子成功率从 60% → 85%
- 失败案例:15% 失败中 5% 是「杯子倒了」「抓空」「卡住」等
- 回灌:把这 5% × 8 万 = 4,000 条失败案例反馈给数采工厂
阶段 4:定向补采(1 周)
- 目标:专门采集「杯子倒了」「抓空」等失败场景
- 数据:200 台 × 1 周 × 8 小时 = 3,200 小时 ≈ 1 万条轨迹
- 成本:200 × 8 × 7 × 50 = 56 万元
- 数据进入下一轮训练
总成本:1000 元(仿真)+ 1120 万元(首轮真机)+ 56 万元(补采)= 约 1,200 万元 最终模型:抓杯子成功率 95%
1,200 万元 / 95% 成功率 = 机器人抓杯子这件事的成本。没做过具身智能的人觉得高,做过的人知道已经低得惊人——5 年前是 1 个亿 / 50% 成功率。5 年内降本 8 倍 / 成功率翻倍,这才是「ImageNet 时刻」落在哪。
七、机器人真正的「涌现时刻」还差什么
节目里姚卯青和张凯峰反复讲「机器人涌现时刻」这个词,但没给具体定义。把它翻译成工程语言:
「涌现时刻」 = 在 100+ 真实工业 / 家居场景下,机器人 8 小时一班次稳定工作,故障率 < 5%,单台成本 < 10 万人民币。
按这个标准,2026 年的具身智能离涌现时刻还差 3 件事:
- 高质量真机数据规模:现在百万级轨迹够基础研究,不够商业部署。需要 10 亿+ 轨迹(成本 100 亿+)。AgiBot World 走开源,觅蜂科技走 SaaS 化,三五年内能不能做到 10 亿轨迹是第一个分水岭。
- 跨本体数据通用性:现在的数据绑死机器人本体(用宇树采的不能直接训练智元)。觅蜂 MEgo「无本体」方向是第二个分水岭——能不能在 2–3 年内让数据格式标准化,让一家采的数据全行业可用。
- 触觉 / 力反馈信号:现在 95% 数据是视觉 + 关节轨迹,没有触觉。Sharpa 在做触觉 AI,但要 2–3 年才能形成「视觉 + 触觉 + 力矩」三模态数据的主流。这是第三个分水岭。
把这 3 件事乘起来看,具身智能 2026–2028 年的窗口期:
- 2026 年:100 万 – 1000 万条真机数据 + 单一本体 + 视觉主导
- 2027 年:1000 万 – 1 亿条数据 + 多本体(觅蜂 MEgo 推动)+ 视觉 + 力矩
- 2028 年:1 亿 – 10 亿条数据 + 全行业通用 + 视觉 + 触觉 + 力矩三模态
如果 2028 年这三件事能同步就绪,机器人涌现时刻就真的来了。
八、硬件成熟之后,下一个瓶颈是数据
机器人圈过去两年的硬件成熟(电机 / 减速器 / 丝杠 / 传感器国产替代)已经把单台成本从 80 万 / 台降到 10 万 / 台。下一个瓶颈不在硬件,在数据。
AgiBot World(2024 年底,智元 + 上海 AI Lab 联合开源百万真机轨迹)+ 觅蜂科技(2026-04-16,一站式物理 AI 数据服务平台 + MEgo 无本体采集)+ Sharpa(触觉 AI + 灵巧手)——三件事拼起来,2026 年是具身智能**从「硬件量产」到「数据规模化」**的拐点。
「机器人涌现时刻」真正什么时候到?答案在数据量 + 数据通用性 + 数据多模态这三件事同时就绪的那一年。乐观估计 2028,保守估计 2030。
SpaceX 的故事是去火星,高通的故事是去端侧,让机器人自己进工厂、进家、进仓库是所有人的故事——但这个故事的关键不在机器人公司,在数据生态。
九、常见误读(3 个)
- 「仿真数据足够便宜,迟早取代真机」——错。仿真解决不了 sim-to-real gap 与柔性物体(衣物 / 食物 / 流体),真机数据是绕不过去的地基;仿真是放大器,不是替代品。
- 「数采工厂难在硬件」——错。200 台机器人谁都能堆,真正难的是任务编排 / 质量把控 / 数据回灌这 3 个软环节,1 万条里能用 1000 条已算不错。
- 「数据越多越好」——不全对。绑死单一本体的数据换个机器人就作废;跨本体通用性(觅蜂 MEgo 那一路)比单纯堆量更决定天花板。
十、自测清单
读完可以对着问自己几个问题,检验是否真的读懂:
- 说得出「四层数据金字塔」每层的成本 / 质量 / 速度取舍,以及为什么要 4 层叠加而不是选一层?
- 解释得清「真机数据为什么贵」和 sim-to-real gap 的关系?
- 讲得出 200 台数采工厂真正难的 3 个软环节?
- 说得清「无本体采集」为什么是跨本体通用性的前提?
- 列得出 2026 年离「涌现时刻」还差的 3 件事?
十一、下一步与参考资料
想继续深入,下一步可以直接去看一手数据集与源视频:把 AgiBot World 的公开数据格式过一遍,再对照硅谷 101 的实地探访,会比只读本文有体感得多。
- 硅谷 101《揭秘数采工厂:稀缺的机器人数据,到底难在哪儿?|机器人特辑》:BV1uQ5Y6mExN(39 分钟,本文骨架来源)
- AgiBot World 官网 | GitHub | HuggingFace 数据集:智元 + 上海 AI Lab 等 2024 年底联合开源的百万真机数据集
- 觅蜂科技(Maniformer)一站式物理 AI 数据服务平台 + MEgo 无本体采集,2026-04-16 上海张江发布(公开报道)
- Sharpa 灵巧手公开 Demo 与触觉 AI 行业资料
- 公开行业报告:四层数据金字塔(遥操 / 仿真 / 动捕 / 视频 / UMI)的成本 + 质量 + 速度对比
- 姊妹篇《机器人「肉身」的工程化:宇树半马破纪录、智元量产和特斯拉 Optimus 留下的不是空翻,是供应链重组》——本文是「数据 / 算法」视角,姊妹篇是「整机 / 供应链」视角
说明:本文以硅谷 101 节目为骨架,叠加各家公开发布材料整理;文中成本 / 比例 / 时间表为依据公开报道的量级估算(非官方精确数字),已在正文标注。