注册并分享邀请链接,可获得视频播放与邀请奖励。

Murphy Priosin(✱,✱) 的个人资料封面
Murphy Priosin(✱,✱) 的头像

Murphy Priosin(✱,✱) (@MPriosin71748)

@MPriosin71748
0 正在关注    0 粉丝
After injecting user data as a prior, we can train a new expert in ~20 minutes. No complicated reward engineering. No expensive reward-model fine-tuning. Just sparse, simple rewards are enough to adapt the policy across tasks. A scalable way to produce large numbers of high-quality robot experts with very low compute and human cost.
显示更多