RoboQuest: Generalist Physical Agents that Search, Inspect and Test
一句话概括
现有通用多模态智能体在陌生环境中主动获取信息的能力不足。RoboQuest 基准显示,最强模型仅完成 23% 的任务回合,失败主因是过早停止探索,而非动作执行能力欠缺。
速览
- 任务与方法:RoboQuest 是面向目标导向具身探索(goal-directed embodied exploration)的基准,含 10 个移动操作(mobile manipulation)任务,覆盖搜索、基于操作的检查、交互式测试三类不确定性。
- 关键数字:评测 5 个前沿多模态智能体,最佳者成功率 23%;在完整回合演示上微调的 π₀.₅ 策略几乎从未成功。
- 数据与开源:作者发布了完整回合演示(full-episode demonstrations),摘要未给出数据集规模与代码链接。
- 补充发现:在提供隐藏信息的前提下单独测试执行技能,智能体大多能完成所需动作。
问题背景
多模态基础模型(multimodal foundation model)已能胜任多种操作任务,成为通用物理智能体(generalist physical agent)的候选方案。
但陌生环境常缺少完成任务所需的信息。智能体需要自己去确定目标物体在哪、检查未观测到的属性,或弄清一件陌工具的效果。
这类信息只能通过物理交互获得。智能体必须主动探索、用得到的证据调整后续动作,并自行判断何时可以结束任务。
现有评测多关注给定观测下的操作能力,对「先探索、后行动」的完整闭环考察不足。RoboQuest 正是为填补这一空白而提出。
方法要点
RoboQuest 把不确定性归为三类,并据此设计 10 个移动操作任务:
- 搜索(search):目标物体位置未知,需先找到它。
- 基于操作的检查(manipulation-based inspection):物体的某项属性未被观测,需通过操作揭示。
- 交互式测试(interactive testing):工具效果未知,需通过试验发现。
评测方式上,作者用统一的视觉运动接口(visuomotor interface)接入 5 个前沿多模态智能体,保证比较条件一致。
作为对照,作者在自行发布的完整回合演示上微调了 π₀.₅ 策略,检验模仿学习能否解决该问题。
作者还做了隔离测试:把任务所依赖的执行技能单独拿出来,并直接提供隐藏信息,用以区分「不会做」与「不去找」。
关键结论
- 整体成功率低。最佳智能体仅 23% 的回合成功,微调后的 π₀.₅ 策略几乎从不成功。
- 执行能力不是瓶颈。隔离测试显示,智能体在获得隐藏信息后能完成大部分所需动作。
- 失败分析把少数失败归因于执行,多数失败另有原因。
- 过早停止探索是主要问题。智能体在观察到完成任务所需证据之前就做出决定。
- 智能体很少预防或修复自身探索造成的扰动。
- 对多数模型而言,试错学习(trial and error)仍然困难。
读后思考
这份基准的价值在于把「信息获取」从执行能力中拆出来单独度量。隔离测试的设计尤其关键:它证明模型的动作库够用,缺的是决策时机。
「过早停止探索」这一发现指向一个具体的能力缺口——智能体缺少对自身知识状态的判断。它不知道自己还不知道什么,于是把不确定当成已完成。
探索带来的扰动同样值得注意。主动交互会改变环境,而智能体既不预防也不修复,说明探索与稳定性的权衡尚未被现有模型处理。
微调策略几乎不成功,也提示单纯模仿完整回合演示不足以教会探索。演示中的探索行为可能高度依赖上下文,难以被策略直接复用。
局限与开放问题
- 摘要未给出任务场景的具体形态、观测模态与动作空间细节。
- 摘要未给出 5 个被评测智能体的具体名称与规模。
- 摘要未给出演示数据的规模、采集方式与开源地址。
- 23% 这一数字来自单一基准,能否外推到真实环境,摘要未给出证据。
- 如何让智能体判断「证据已足够」,是本文暴露但未解决的核心问题。
- 探索扰动的预防与修复机制,摘要未给出方法层面的方案。
- 试错学习为何对多数模型困难,摘要只给出结论,未给出机制解释。