当Codex、Claude Code等数字世界智能体已展示出"大模型理解目标、拆解任务、调用工具"的高效工作方式时,随着GPT-6 Astra开始接受真实机器人操作测试,这种智能体范式正逐渐走向物理世界。
今天,由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent正式开源。RPent面向真实物理世界,将通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力,以及记忆、工具和机器人接口连接起来,形成从感知、决策、执行到反馈纠错的完整闭环。在LIBERO-PRO基准测试中,RPent达到92.6%的任务成功率,并将端到端任务完成速度优化7倍以上。
RPent由大规模具身强化学习框架RLinf的核心团队打造,延续了该团队在具身智能基础设施领域的技术积累。
真机演示中,RPent展示了多个开放式任务:机器人将钢珠倒入碗中、双臂协同擦拭盘子,还会主动移开遮挡物找到藏在碗下的勺子。这些任务并非为每种场景单独训练专用策略。例如当任务变为"将干净餐具放入纸箱"时,冻结VLA只会沿用训练时的动作,错误地将盘子放入金属篮,而RPent智能体会先观察环境,再根据新目标选择放置位置;若视觉定位出现偏差,还会检查结果、排除错误并重新定位。
在饮料分拣任务中,机器人抓起瓶子后会先小幅试抬确认夹持稳定,当运动路径不可行时调整腕部姿态继续执行,展现了完整的"观察-判断-执行-纠错"闭环。
在能力复用方面,RPent可将原本用于拿起容器的技能重新组合用于倾倒钢珠,又把抓取动作与双臂协同组合完成持盘、擦拭和收纳。探索成功后,RPent将经过验证的任务逻辑沉淀为任务卡(Task Card),再次执行时启用Flash Mode直接复用流程,只根据当前视觉状态做必要调整,有效降低执行延时。
当前具身智能呈现两条技术路线:纯VLA端到端方案精细操作出色,但任务变长、场景受扰时迅速退化;纯大模型Agent方案则依赖通用模型能力。RPent所探索的,正是让机器人理解目标、调用能力、应对变化,并将一次成功沉淀为可复用经验的具身智能体形态。