Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents
一句话概括
RPG 是一套不更新模型权重的机器人自我改进框架:它从离线数据识别技能,在仿真中练习并诊断失败,再把通过跨任务评估的改动保留下来。冻结的多模态大模型在 22 个操作任务的留出初始化上,成功率从 28.6% 升到 95.0%。
速览
- 任务:让机器人执行系统在不更新权重的前提下自主改进,测试时由多模态 LLM(Large Language Model,大语言模型)用系统提示词和技能库协调感知与控制。
- 方法:重建(Reconstruct)识别离线数据中的操作能力并构造仿真练习任务;练习(Practice)用执行反馈、仿真器特权状态和数据集视频诊断失败;上真机(Go Real)前先做跨任务评估。
- 关键数字:22 个操作任务留出初始化上,成功率从第 1 轮练习后的 28.6% 提升到 15 轮后的 95.0%;真机 30 次试验全部成功,三个任务各 10 次。
- 数据与开源:摘要给出项目网站 https://rpg-robot.github.io/;数据集与代码的开源情况摘要未给出。
问题背景
让机器人可靠完成多样化操作任务,传统上代价很高。人需要写技能、设计奖励函数、把感知与控制手工对接,每换任务或环境就要重新维护。
近年大模型开始充当调度器,用自然语言提示词协调感知模块与底层控制策略。但这类系统通常靠人工反复调试提示词和技能库,缺少自主改进机制。
另一条路线是让模型在仿真中自我练习并更新权重。权重更新成本高、易遗忘,也难保证真机迁移。
RPG 的切入点是:能否不碰模型参数,把改进转移到外部可复用的符号技能库和系统提示词上?这样改进可解释、可回滚、可跨任务复用,也贴合“冻结大模型 + 外围系统迭代”的工程约束。
方法要点
RPG 的流程分三段。
重建(Reconstruct):从离线数据集中识别机器人已具备哪些操作能力,据此在仿真中构造相关练习任务。练习不是凭空生成,而是围绕数据中已出现的能力做针对性扩展。
练习(Practice):在仿真中执行这些任务,用三类信号诊断失败——执行反馈、仿真器特权状态(真机拿不到的“上帝视角”信息)、可用的数据集视频。基于诊断,系统做三件事:开发新的可复用符号技能、精炼已有技能、修改系统提示词。
上真机(Go Real):改进不是无条件接受。候选改动先经过跨任务评估,单独测试每个候选变更,再测试合并后的修订版本,通过后才保留进技能库和提示词。测试时,一个多模态 LLM 用最终的系统提示词和技能库协调感知与机器人控制。
关键设计有两点:改进发生在系统层而非权重层;跨任务评估作为准入门槛,避免局部修补破坏其他任务。
关键结论
- 在 22 个操作任务的留出初始化上,成功率从第 1 轮练习后的 28.6% 提升到 15 轮后的 95.0%。
- 对比基线中,ASPIRE 为 75.5%,由 GPT-6 Astra Pro 驱动的 CaP-Agent0 为 60.0%,RPG 均优于它们。
- 经过统一的校准与硬件适配流程后,冻结系统在 30 次真机试验中全部成功,三个任务各 10 次。
- 摘要未给出:22 个任务的具体清单、任务难度分布、每轮练习的样本量与耗时、失败诊断准确率、技能库规模增长曲线、真机试验的随机化程度与统计置信区间。
- 摘要未给出:基线是否也做了同等轮数的练习、是否共享同一底层控制策略,因此“优于基线”的公平性细节无法从摘要判断。
- 摘要未给出:跨任务评估的具体指标与阈值,以及被拒绝的候选改动比例。
读后思考
RPG 最值得注意的不是某个数字,而是它把自我改进从权重空间搬到了符号与提示词空间。
这带来几个实际好处。改进过程可读、可审计,出问题能定位到具体技能或提示词条目;技能库可跨任务复用,不必为每个新任务从零调参;冻结大模型意味着可以持续换用更强的基础模型而不必重训。
适用场景上,它适合任务族相对固定、但初始化和环境有变化的工业或服务机器人场景,例如抓取摆放、开关门、插拔类操作。只要有可用的离线数据集和能提供特权状态的仿真器,就能搭起这套闭环。
对研究而言,它提供了一个把仿真特权信息蒸馏成真机可用符号技能的范式。
局限与开放问题
第一,练习环节依赖仿真器,仿真与真机的差距(sim-to-real gap)是隐含风险。摘要说真机 30 次全成功,但样本量小、任务数只有三个,泛化性仍需更大规模验证。
第二,诊断依赖特权状态,这类信息真机上没有。如何保证诊断出的技能在真机同样有效,摘要未给出机制细节。
第三,技能库和提示词会随轮数增长。长期是否会膨胀、冲突或退化,摘要未给出。95.0% 是 15 轮后的结果,是否已饱和、继续练会不会过拟合,也是开放问题。
第四,对比基线的公平性、任务难度分布、失败案例类型,摘要都未交代,读者难以判断提升幅度的真实含金量。真机全部成功是否因为任务被挑选得较容易,也需要原文补充。
总体而言,RPG 指出了一个有前景的方向:不改权重,也能让机器人系统越练越强。但它离通用自主改进还有距离,尤其在仿真依赖、真机泛化和技能库长期健康度这三方面。