Embodied Decision Intelligence Lab (EDI Lab) 清华大学具身决策智能实验室

RLinf上新STEAM算法

pi*0.6 RECAP没解决的问题,被STEAM解决了

清华于超老师团队联合正行创新(Striding Al)、无问芯穹(Infinigence Al)提出了STEAM算法, 正是为解决这个问题而生。STEAM 的核心想法是:从专家演示的时间顺序中自监督学习帧级进展信号,再用这个信号为专家数据、机器人 rollout 和人工纠正数据逐帧打分。它不需要手工奖励,不需要人类逐帧标注,也不依赖外部价值模型来判断每一帧好不好。它学习的是更基础的东西:在一个任务中,两帧之间是否发生了真正的局部进展。

详细请见 https://mp.weixin.qq.com/s/RN9CKziSdxT0o9VJ0nx7rg

Previous post
RLinf参展中国国际供应链促进博览会
Next post
RLinf v0.3 发布