Embodied Decision Intelligence Lab (EDI Lab) 清华大学具身决策智能实验室

百度百舸率先适配 RLinf v0.3

云厂商首家!百度百舸率先适配 RLinf v0.3,打通具身智能进化闭环

强化学习开源框架 RLinf 正式发布 v0.3 版本,首次打通从数据采集、模型训练到真机部署的完整闭环。百度智能云在发布当天即完成适配,成为国内首家支持 RLinf v0.3 的云厂商。开发者可通过百度百舸「快速开始」功能,一键拉起 RLinf v0.3 预制开发环境(如适配 LIBERO 仿真、OpenVLA 模型训练的预置镜像),免去繁琐的环境打包与软件部署,快速跑通从框架适配到场景验证的全流程。

在最新的科研成果中,百度百舸团队联合上海交大、地瓜机器人发布 dVLA-RL 框架,首次打通 PPO 算法与离散扩散 VLA 模型的适配通路,为机器人 Foundation Model 持续自主进化奠定了技术基础。该框架的全部实验均基于百度百舸平台完成,百舸团队针对 RLinf 的深度 AI Infra 工程优化,大幅提升了 dVLA 模型在强化学习阶段的训练效果。

  1. RLinf v0.3 迎来里程碑升级:打通真机与仿真持续进化的「双闭环」

作为具身智能行业广泛应用的底层开发平台,RLinf 始终紧跟前沿迭代,半年内已高效完成 3 次版本重磅更新:

它实现了从「仿真训练」到「真机在线学习」、再到「持续迭代优化」的统一开发闭环,支撑机器人在真实世界中长期持续进化。RLinf

开源项目地址:https://github.com/RLinf/RLinf

为了支撑这一闭环,RLinf v0.3 在五个核心维度进行了全面重构与升级:

RLinf v0.3 详细信息,请访问 https://rlinf.readthedocs.io/en/release-v0.3/index.html

  1. 百度百舸 AI Infra 工程优化协同:为 RLinf 筑牢全流程底座基于高性能计算、极致存储系统及超大规模高速互联网络,百度百舸 AI 计算平台已搭建起完整的具身智能工作流,覆盖从数据准备、开发训练、仿真验证到推理部署的研发全链路。本次与 RLinf 开源社区的深度合作,百度百舸将进一步为产业界提供前沿具身模型、创新算法与多元仿真环境的支持。

在产品体验层面,开发者可通过百舸的「快速开始」功能,在开发机一键拉起 RLinf v0.3 预制开发环境,例如适配 LIBERO 仿真、用于 OpenVLA 模型训练的成套预置镜像,省去繁琐的环境打包与软件部署,率先跑通从框架适配到场景验证的第一步。

在此之上,结合百度百舸平台专属的 AI Infra 工程优化能力,平台更可为上层各类具身模型的开发、训练与仿真带来极致的性能提速,大幅缩短模型迭代周期,实现算力资源性价比的极致放大。行业实践表明,具身智能的大规模落地,既不是单点的算法突破能够完成的,也不是单纯堆砌算力就能解决的。它本质上需要前沿开源生态的算法创新、中层 AI Infra 工程优化与底层算力网络能力的协同推进。正基于此,百度百舸正通过全方位的技术与效率赋能,以极致的 AI Infra 工程优化与算力网络能力,完美承载并加速 RLinf 生态中前沿算法与具身模型的落地应用,共同构建起具身智能持续进化的坚实底座。

  1. 落地见证:dVLA-RL 发布验证百度百舸对 RLinf 的深度优化能力在最新的学术成果中,百度百舸团队联合上海交通大学、地瓜机器人(D-Robotics)等前沿机构,联合发布了 dVLA-RL 强化学习训练框架,首次打通经典 PPO 算法与离散扩散 VLA 模型的适配通路,为机器人 Foundation Model 持续自主进化奠定了技术基础。

该框架的全部实验均基于百度百舸 AI 计算平台完成。其中,百度百舸团队针对 RLinf 进行的 AI Infra 工程优化,大幅度提升了 dVLA 模型在强化学习阶段的训练效果。目前,百度百舸已经服务超过 30 家具身智能头部企业及创新中心。未来,百度智能云将持续携手更多科研机构与产业伙伴,依托百度百舸 AI 计算平台的极致性能与 AI Infra 工程优化能力,共同加速全球具身智能产业的创新与规模化落地。

Previous post
RLinf v0.3 发布
Next post
具身智能或进入 Token 时代,清华团队提出 Harness VLA 引领范式变迁