注册并分享邀请链接,可获得视频播放与邀请奖励。

阿里嘎多美羊羊桑 (@wangy112375) “Physical AI 真正卡住的地方,不是机器人,也不是算力。 是数据。 先看一组对比就知道” — TopicDigg

阿里嘎多美羊羊桑 的个人资料封面
阿里嘎多美羊羊桑 的头像
阿里嘎多美羊羊桑
@wangy112375
加入 June 2021
0 正在关注    0 粉丝
Physical AI 真正卡住的地方,不是机器人,也不是算力。 是数据。 先看一组对比就知道为什么。 语言大模型可以直接吃互联网海量文本,GPT-3 级别大概用了 1500万小时量级的数据。 但换到机器人操作,真正支撑通用具身智能,粗估需要的是上亿小时级别的高质量操作数据。 现在整个行业真正能拿出来的真实机器人轨迹,加起来也就几千小时。 目前最大的开放数据集之一 Open X-Embodiment,也只有100多万条真实机器人轨迹,覆盖22种本体、500多个技能。 放到 Foundation Model 的尺度里,还是远远不够。 ① 为什么传统方式这么慢? 一台机械臂 + 一个操作员 + 一个固定场景。 一天能采几十到上百条有效演示已经不错了。 换场景要重新布线、标定,换机器人本体更是接近重头再来。 成本高、速度慢、覆盖窄。 这也是为什么机器人数据一直是行业瓶颈。 ② Axis 换了一种玩法 @axisrobotics 把全球贡献者变成一个可以并行扩张的数据引擎。 打开浏览器就能遥操作仿真机器人,不需要真机,也不需要特殊硬件。 任务自动生成,物体、布局、光照、语义都可以随机变化。 早期一个活动3天就收了1万多条有效轨迹,Beta阶段10天左右做到18万条。 到现在: 430万+轨迹 16万+用户 1600+任务 而且不只是仿真。 第一人称数据也可以用手机采集,把现实中的人类动作转成机器人可以学习的训练素材。 再接上后训练闭环: 模型跑失败 → 人接管修正 → 修正数据回流 → 模型继续训练。 数据不是采完就结束,而是在不断 compounding。 ③ 最关键的是,数据真的有效 用 Axis 数据持续预训练后,π0.5 在 LIBERO-Plus 上的成功率从 83.9% → 88.8%。 相比同等体量的 RoboCasa 对照集,高出了30多个点。 这至少说明了一件事: 数据的规模重要,但多样性同样重要。 所以我现在越来越觉得,Physical AI 真正的基础设施,不只是机器人本体和算力。 而是谁能持续、低成本、大规模地产生高质量数据。 硬件已经在进步,算力也不是完全不够。 真正缺的是一套可以持续跑起来的 Data Engine。 Axis 现在做的,就是把这件事变成基础设施。 机器人智能不是几个实验室关起门来就能磨出来的。 得让更多人一起贡献数据。
显示更多
这边 @axisrobotics 跟Kaito的合作不是可以提交10篇,然后6篇最高分计入榜单 我就准备写6篇,而且写的越早,流量跑的越高,S1最后一天写流量就跑一天,肯定不划算 另外郡主老板昨天公布了撸 axis 空投的3个方向: 1)DC角色(需要做贡献,泡DC,也是个辛苦活) 2)任务积分这边说是大头(但是黑奴的很,适合体力好的兄弟) 3)kaito活动(个人感觉最轻松,但是门槛高,账号质量Aura分数直接决定排名) 以上,要么天资卓越;要么付出汗水,还是公平的 总之S1是先试水,毕竟第一个项目,热度又高,参与人数有多,很卷,等排名具体出来了再决定后续怎么撸 如果排名不理想,我水平就在这里了,也提升不了;如果排名好,那继续肝 // 最后简单看下 Axis 这两天进展 📌 8月21日|后训练数据实验 Axis 发现,真正有效的不是完整人类轨迹,而是经过验证的短纠正片段,平均约0.8秒 660条纠正数据里,只有161条最终进入训练,成功率从约40%提升到约48%。 📌 8月24日|Booster Robotics 双方开始互动,后续可能共同推进仿真驱动的全身控制研究 📌 Axis Weekly • 修复浏览器、策略与物理栈的重放/运行时对齐问题 • TaskGen 新增27个铰接物体家族 • RoboCasa 全场景上线(50×50网格) • 下一阶段继续筛选真正有效的纠正数据 整体还是在围绕一件事:数据采集 → 筛选 → 训练 → 再采集
显示更多
0
21
16
1
转发到社区