EMON TECH MEDIA · PAPERS — DNA·52CD39

RoboQuest: Generalist Physical Agents that Search, Inspect and Test

现有通用多模态智能体在陌生环境中主动获取信息的能力不足。RoboQuest 基准显示,最强模型仅完成 23% 的任务回合,失败主因是过早停止探索,而非动作执行能力欠缺。

发表日期

作者

Liu Renhang, Navonil Majumder, Tej Deep Pala, Soujanya Poria

影响力

72.5

阅读时长

约 5 分钟

标签

Agent

RoboQuest: Generalist Physical Agents that Search, Inspect and Test

一句话概括

现有通用多模态智能体在陌生环境中主动获取信息的能力不足。RoboQuest 基准显示,最强模型仅完成 23% 的任务回合,失败主因是过早停止探索,而非动作执行能力欠缺。

速览

  • 任务与方法:RoboQuest 是面向目标导向具身探索(goal-directed embodied exploration)的基准,含 10 个移动操作(mobile manipulation)任务,覆盖搜索、基于操作的检查、交互式测试三类不确定性。
  • 关键数字:评测 5 个前沿多模态智能体,最佳者成功率 23%;在完整回合演示上微调的 π₀.₅ 策略几乎从未成功。
  • 数据与开源:作者发布了完整回合演示(full-episode demonstrations),摘要未给出数据集规模与代码链接。
  • 补充发现:在提供隐藏信息的前提下单独测试执行技能,智能体大多能完成所需动作。

问题背景

多模态基础模型(multimodal foundation model)已能胜任多种操作任务,成为通用物理智能体(generalist physical agent)的候选方案。

但陌生环境常缺少完成任务所需的信息。智能体需要自己去确定目标物体在哪、检查未观测到的属性,或弄清一件陌工具的效果。

这类信息只能通过物理交互获得。智能体必须主动探索、用得到的证据调整后续动作,并自行判断何时可以结束任务。

现有评测多关注给定观测下的操作能力,对「先探索、后行动」的完整闭环考察不足。RoboQuest 正是为填补这一空白而提出。

方法要点

RoboQuest 把不确定性归为三类,并据此设计 10 个移动操作任务:

  1. 搜索(search):目标物体位置未知,需先找到它。
  2. 基于操作的检查(manipulation-based inspection):物体的某项属性未被观测,需通过操作揭示。
  3. 交互式测试(interactive testing):工具效果未知,需通过试验发现。

评测方式上,作者用统一的视觉运动接口(visuomotor interface)接入 5 个前沿多模态智能体,保证比较条件一致。

作为对照,作者在自行发布的完整回合演示上微调了 π₀.₅ 策略,检验模仿学习能否解决该问题。

作者还做了隔离测试:把任务所依赖的执行技能单独拿出来,并直接提供隐藏信息,用以区分「不会做」与「不去找」。

关键结论

  • 整体成功率低。最佳智能体仅 23% 的回合成功,微调后的 π₀.₅ 策略几乎从不成功。
  • 执行能力不是瓶颈。隔离测试显示,智能体在获得隐藏信息后能完成大部分所需动作。
  • 失败分析把少数失败归因于执行,多数失败另有原因。
  • 过早停止探索是主要问题。智能体在观察到完成任务所需证据之前就做出决定。
  • 智能体很少预防或修复自身探索造成的扰动。
  • 对多数模型而言,试错学习(trial and error)仍然困难。

读后思考

这份基准的价值在于把「信息获取」从执行能力中拆出来单独度量。隔离测试的设计尤其关键:它证明模型的动作库够用,缺的是决策时机。

「过早停止探索」这一发现指向一个具体的能力缺口——智能体缺少对自身知识状态的判断。它不知道自己还不知道什么,于是把不确定当成已完成。

探索带来的扰动同样值得注意。主动交互会改变环境,而智能体既不预防也不修复,说明探索与稳定性的权衡尚未被现有模型处理。

微调策略几乎不成功,也提示单纯模仿完整回合演示不足以教会探索。演示中的探索行为可能高度依赖上下文,难以被策略直接复用。

局限与开放问题

  • 摘要未给出任务场景的具体形态、观测模态与动作空间细节。
  • 摘要未给出 5 个被评测智能体的具体名称与规模。
  • 摘要未给出演示数据的规模、采集方式与开源地址。
  • 23% 这一数字来自单一基准,能否外推到真实环境,摘要未给出证据。
  • 如何让智能体判断「证据已足够」,是本文暴露但未解决的核心问题。
  • 探索扰动的预防与修复机制,摘要未给出方法层面的方案。
  • 试错学习为何对多数模型困难,摘要只给出结论,未给出机制解释。

本页为科普精读;细节以 arXiv 原文为准。就本篇提问请点左下角「论文研读助手」。