英伟达推出RoboTTT:机器人的上下文扩展到8000步
现有机器人基础模型基本只看单步或最近几帧,长时程任务步数多了就会出错。RoboTTT把视觉运动上下文扩展到8K时间步——约合30Hz控制下的5分钟,比现有最强策略高三个数量级,而且推理延迟不随上下文增长。
你给它看一段人类演示视频,它就能一次性模仿,组装从未见过的电路配置;执行中途犯错,它自己会纠正;你把装好的零件拆掉,它会回头重装。真机上能完整跑通5分钟、10阶段的组装任务,之前的机器人都做不到。
继参数量、数据量之后,上下文长度可能成为机器人基础模型的第三条scaling曲线。
官方介绍:
显示更多