【ICRA 2025】ExploRLLM:用大语言模型引导强化学习的探索|从 LLM+RL 协同视角

发布时间:2026/10/3 2:42:56
【ICRA 2025】ExploRLLM:用大语言模型引导强化学习的探索|从 LLM+RL 协同视角 摘要本文解读 ICRA 2025 论文《ExploRLLM: Guiding Exploration in Reinforcement Learning with Large Language Models》。该论文提出用基础模型引导强化学习探索的框架 ExploRLLM通过融合大语言模型生成的策略代码、视觉语言模型抽出的物体中心表示与残差强化学习在不牺牲最终策略质量的前提下大幅加速机器人操作任务的收敛其特别之处在于把基础模型从「替代策略」重新定位为「探索先验」——动作可以次优甚至失败只要能提高访问有意义状态的概率就有价值。实验表明短程任务成功率 0.86、长程任务 0.70全面超过纯基础模型基线与关闭探索的强化学习基线并能在零样本条件下迁移到真实 Franka Panda 机械臂为 LLM 与 RL 的协同提供了重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机当基础模型不可靠而强化学习探索又太贵从「语言模型写策略」到「语言模型供探索」的技术脉络研究主线从问题到结论基准/方法设计把语言模型的功能一分为三分类全景方法细节热图采样与残差表示是两处反直觉的设计实验设计与结果四种配置全部领先长程任务从「不收敛」到可学结果对比总结创新模式与写作观察Oral 信号在哪里三个命中的创新模式叙事与措辞观察关键发现局限性常见问题FAQExploRLLM 与 RLingua 这类工作有什么本质区别为什么低层动作要按可供性热图采样而不是取最大值的点探索频率 ε 需要仔细调吗训练时怎么处理真机的视觉检测误差为什么长程任务的提升比短程更明显这套方法能直接部署到真机吗参考链接论文基本信息项目内容标题英文ExploRLLM: Guiding Exploration in Reinforcement Learning with Large Language Models标题中文ExploRLLM用大语言模型引导强化学习的探索作者Runyu Ma, Jelle Luijkx, Zlatan Ajanović, Jens Kober机构代尔夫特理工大学Cognitive Robotics 亚琛工业大学会议ICRA 2025IEEE International Conference on Robotics and AutomationarXivhttps://arxiv.org/abs/2403.09583项目网站https://explorllm.github.io背景与动机当基础模型不可靠而强化学习探索又太贵机器人操作里的强化学习一直受制于两个老问题样本效率低与收敛不确定。在桌面抓取放置这类任务中观测是俯视的 RGB-D 图像动作是连续的抓取与放置位姿状态动作空间很大智能体常常在稀疏奖励里长时间碰不到成功样本。传统的探索手段——贪心探索、玻尔兹曼探索——本质上是随机的只关心探索与利用的权衡没有机制把先验知识注入进来。基础模型看起来提供了另一条路。大语言模型能从常识出发生成任务计划视觉语言模型能做开放词表的目标检测两者配合可以在零样本和小样本设定下给出有意义的动作。但它们也有明显的短板大模型的预测会有物理与空间上的错误而且不会从过去的经验中学习。Socratic Models、Inner Monologue 这类工作把语言模型放进闭环直接决策一旦规划出错系统没有任何纠正机制CLIPort 这类视觉操作模型虽然强但在新场景与复杂几何关系上明显退化。同期还有一条路线是 RLingua它用大语言模型生成的规则控制器去正则化强化学习策略让策略向语言模型靠拢——这等于把语言模型的偏置一起继承了下来。论文的出发点正好相反语言模型的动作不必正确只要它们能落在有意义的动作区域就行。基础模型负责把探索引到「值得试一试」的地方物理层面的偏差交给强化学习通过奖励去修正。这样一来两边的缺点恰好被对方补上。从「语言模型写策略」到「语言模型供探索」的技术脉络这条线走了四年大语言模型在机器人中的角色从直接替代策略退到了只提供探索先验2022–2023 —— Code as PoliciesICRA 2023用大语言模型生成机器人策略代码第一次把语言先验变成可执行程序Socratic ModelsICLR 2023用语言串起多模态零样本推理。2023 —— VoxPoserCoRL 2023让语言与视觉模型生成三维价值图做零样本规划Inner MonologueCoRL 2023引入成功检测器让闭环决策更稳。2024 —— Eureka 让语言模型生成奖励代码来优化强化学习训练同期的 RLinguaRA-L 2024走「用语言模型正则化强化学习」的路线。2024–2025 —— ExploRLLM本文ICRA 2025把基础模型降级为探索先验残差强化学习保留纠正权并完成真机零样本迁移。2026 —— 同一团队的 LLM-TALEICRA 2026把探索推进到任务级与可供性级并在线纠正计划次优性SIERL 则转向搜索启发的探索与语言先验形成互补。图 1ExploRLLM 总览基础模型提供基策略、高效表示与探索策略强化学习智能体学习何时及如何偏离基策略。研究主线从问题到结论图 9ExploRLLM 研究主线Mermaid 流程图RL 探索低效 → 基础模型提供先验但不可靠 → 只把基础模型当探索先验 → 残差 RL 学习如何偏离 → 短程 0.86、长程 0.70。基准/方法设计把语言模型的功能一分为三ExploRLLM 的设计可以概括为一句话让基础模型产出基策略、表示与探索策略让强化学习学习何时偏离以及如何偏离。形式化上每个时刻智能体接收到语言目标与观测动作被改写为物体中心的残差形式 $\tilde{a}_t (k_t, i_t, x_r)$其中 $k_t$ 是抓取或放置的原语索引$i_t$ 是物体索引$x_r$ 是相对物体中心的残差位移真实位姿就是物体位置与残差之和。这样智能体不必从像素直接回归绝对坐标而是学习「相对物体偏多少」这个更小的问题。观测侧同样被重写。大语言模型先把自然语言命令改写为模板化命令向量例如把「把绿色方块放进蓝色碗里」改写成「Pick the [pick_object] and place it in the [place_object]」视觉语言模型再把与任务相关的物体用包围盒框出来按框裁剪出图像块。命令向量、物体位置、图像块与夹爪状态被拼成新的观测像素级的噪声与纹理差异在这一步就被过滤掉了。探索侧的关键取舍是动作由语言模型提供但永远不参与策略参数更新。在 rollout 收集阶段系统以概率 $\epsilon$ 采样本应由语言模型给出的动作否则执行强化学习策略 $\pi_{RL}$。这相当于把 $\epsilon$-greedy 里的随机动作换成了「有常识的动作」。分类全景图 10ExploRLLM 的三大组件Mermaid 分类图物体中心观测LLM 重述指令 ViLD 定位、残差动作空间原语索引 物体索引 残差位移、分层探索与纠正代码探索 SAC 残差。方法细节热图采样与残差表示是两处反直觉的设计物体中心观测与残差动作空间是整篇论文的接缝。视觉语言模型已经给出了每个物体的位置动作空间因此可以改写成「选哪个物体 相对它偏多少」。论文举的例子是抓取字母 O包围盒中心恰好是空心处直接抓中心必然失败而残差位移允许智能体学会往边缘偏。这个设计把「基础模型的语义抽象」与「强化学习的物理修正」切成了两层各自做自己擅长的事。论文还刻意在训练期对包围盒中心注入高斯噪声标准差取图像块半径的一半模拟真实检测误差真机评测时才改用 ViLD 在线检测。低层动作用可供性热图而不是单点是第二处关键设计。语言模型生成的策略代码并不总能给出正确的抓取点——论文自己的例子就是 O 字热图把高值区域放在了中心。作者没有想办法让语言模型变准而是让低层动作按热图随机采样而不是取最大点。这样一来探索行为天然带有噪声也天然会产出反例样本由于强化学习本身就是从奖励中学习的次优的探索恰恰提供了可以纠正的信号。分层策略代码与离线筛选解决了成本问题。直接在每个训练步调用大语言模型的时间与费用极高论文改用 Code-as-Policies 式的分层语言模型程序高层 $\pi_{LLM}^H$ 选择运动原语与交互物体低层 $\pi_{LLM}^L$ 生成基于 OpenCV 与 NumPy 的可供性热图代码。候选策略代码先生成一批、评估成功率、再选出最优的执行之后在训练中反复复用。高层提示用 GPT-4 的少样本示例低层用 GPT-4V 并附上环境图像与图像块示例。实现细节方面网络用两层卷积把每个图像块编码成向量 $\phi \in \mathbb{R}^{n \times d}$与位置、夹爪状态、命令向量拼接后送入自注意力层再接两层 MLP所有 actor 与 critic 共用这一结构。算法本体是 stable-baselines3 里的 SAC只改动了 rollout 收集阶段短程任务训练 25k 步、长程 75k 步每个探索频率训练 6 个随机种子每次训练都包含 20,000 步不带语言模型探索的预热。真机侧在 EAGERx 框架中实现策略与代码。图 2ExploRLLM 的实现结构(a) LLM 重述语言命令(b) 物体中心的残差动作空间(c) 基础模型引导探索与强化学习训练闭环。图 3基于探索提示生成候选策略代码评估后选出探索策略右下角的例子显示 O 字可供性热图把它定位到中心而非边缘正是强化学习需要纠正的次优。实验设计与结果四种配置全部领先长程任务从「不收敛」到可学评测设置仿真环境是 UR5e 机械臂加俯视 RGB-D 相机沿用 Transporter 与 CLIPort 的设定但把方块换成字母等更多样的物体来提高难度。任务分两档短程SH任务是「把指定的字母放进指定颜色的碗」每回合三个字母与三个碗随机摆放长程LH任务是「把所有字母放进颜色匹配的碗」必须完成全部配对。每个配置评测50 个回合初始化分无重叠NO与允许重叠AO两种。真机使用带吸盘夹爪与 RGB-D 相机的 Franka Panda训练全在仿真完成真机只做评测每场景 15 个回合。图 4真机平台Franka Panda 吸盘夹爪 RGB-D 相机策略与代码实现在 EAGERx 框架中训练全在仿真完成、真机仅评测。主结果ExploRLLM 在四种配置上全部领先长程无重叠比最强的纯基础模型基线 Inner Monologue0.58高出一成二以上而完全关闭语言模型探索的版本$\epsilon 0$在长程任务上根本没有收敛表中没有数值。另一个容易被忽略的趋势是本文把「位置不重叠」与「允许重叠」之间的差距压小了说明探索策略确实在纠正基础模型的定位偏差。方法短程 无重叠短程 允许重叠长程 无重叠长程 允许重叠ExploRLLMε20%0.860.800.700.54ExploRLLMε00.560.48——CaP*0.600.480.380.30Socratic Models CLIPort0.780.640.500.36Inner Monologue CLIPort0.820.720.580.42图 5短程任务训练曲线不同探索频率下的收敛表现ExploRLLM 优于纯探索策略虚线与 $\epsilon 0$ 的标准 SAC。图 6长程任务训练曲线LLM 引导探索是成败关键关闭探索的智能体在 75k 步内无法收敛。探索频率消融训练回报对探索频率呈倒 U 形。频率为零时短程回报在零附近且标准差超过 1$\pm 1.13$说明结果高度不稳定长程更差达到 $-3.22 \pm 0.29$ 且不收敛。频率升到 70% 与 90% 之后两种任务都全面崩坏原因是在线采样数据占比太低。值得注意的是纯探索策略本身只有 0.53 与 −1.2这直接说明收益来自强化学习与大语言模型的协作而不是大语言模型单独的能力。探索频率 ε%短程任务25k 步长程任务75k 步0−0.03 ± 1.13−3.22 ± 0.29100.74 ± 0.13−0.73 ± 0.40200.79 ± 0.06−0.42 ± 0.31300.76 ± 0.16−0.23 ± 0.26500.70 ± 0.17−0.40 ± 0.2370−0.29 ± 0.98−1.71 ± 1.3890−0.52 ± 1.12−2.51 ± 1.09纯探索策略LLM-only0.53−1.2零样本跨任务与真机迁移把短程策略接到零样本规划器Socratic Models上之后在已见字母、未见颜色与未见字母上的成功率分别是 74、68、56对照的 CLIPort 方案是 72、50、34——差距主要出现在未见颜色与未见字母上说明泛化能力来自视觉语言模型抽出的物体中心表示。真机零样本迁移方面短程对已见字母是 66.6%、对未见的字母 C 是 53.3%长程是 40% 与 33.3%全程没有任何额外的真机训练。方法Socratic 规划器 短程策略已见字母未见颜色未见字母Socratic Models ExploRLLM746856Socratic Models CLIPort725034真机零样本每场景 15 回合短程任务长程任务已见字母66.6%40%未见字母 C53.3%33.3%图 7真机结果可视化VLM 检测与抓取/放置动作策略在不同物体朝向、未见字母与真实光照噪声下仍可执行。图 8短程 ExploRLLM 策略可被零样本 LLM 规划器如 Socratic Models复用为长程技能每步重置任务空间后执行。结果对比总结图 11结果对比Mermaid 流程图纯 RLε0短程 0.56 且长程不收敛、基础模型最优基线 0.82 / 0.58、纯探索策略 0.53全部汇入 ExploRLLM 的短程 0.86 与长程 0.70最终落到真机零样本 66.6% / 40%。创新模式与写作观察Oral 信号在哪里三个命中的创新模式按顶会创新模式框架ResearchStudio-Idea覆盖 1,947 篇 ICLR/ICML/NeurIPS 论文的 15 种模式拆解ExploRLLM 主要命中三条审计并扭转负载假设P1$\Delta_{OH} 13.1$ ppPC 最偏爱子领域默认「基础模型必须先足够准确才能进入机器人系统」。本文扭转它——动作次优甚至失败也无妨只要能提高访问有意义状态的概率误差交给强化学习修正。证据是探索频率的完整消融$\epsilon 0$ 时短程回报只有 $-0.03 \pm 1.13$ 且长程 75k 步不收敛$\epsilon 20\%$ 时短程升到 $0.79 \pm 0.06$而 $\epsilon 0.5$ 后重新崩坏——扭转后的条件成立而且有明确的边界。重新表述为可解对象P6$\Delta_{OR} 2.9$ pp、$\Delta_{OH} 7.1$ pp双赢模式把「强化学习与基础模型如何耦合」重写为物体中心的残差问题$\tilde{a}_t (k_t, i_t, x_r)$使「何时、如何偏离基策略」变成可以直接学习的对象。证据是长程无重叠成功率 0.70 对 CaP* 的 0.38、Inner Monologue 的 0.58低级错误率 0.14 对 0.38 / 0.18。统一异构输入到同一空间P5$\Delta_{OH} -11.2$ pp社区最偏爱、高引率 17.4%把语言命令、物体位置、图像块与夹爪状态统一进同一个物体中心观测动作空间同步改写为物体中心残差。证据是未见颜色/未见字母 74/68/56 全面优于 CLIPort 的 72/50/34以及真机零样本 66.6% / 40%。组合起来看它的执行力来自「扭转前提 残差重述 统一表示」三步先用 7 档频率乘 6 个种子的受控扫描证明「基础模型是探索先验而非替代策略」成立且有边界再用残差空间把耦合问题变成可解对象最后用仿真、跨任务与真机三组实测收口。叙事与措辞观察叙事弧线是对立开场 → 清单立论 → 承诺兑现对立开场RL often suffers from low sample efficiency and uncertain convergence 紧接 Foundation Models (FMs) offer an alternative两句话内建立起两条路线的张力。清单立论To summarize, our main contributions are the following. 之后是三条带编号的贡献残差空间、分层探索提示、泛化与真机。承诺兑现引言承诺泛化到未见场景、未见任务与真实世界且无需额外训练结论用未见颜色/字母 74/68/56 与真机 66.6% / 40% 兑现。措辞上有三维表现正向证据框架让结论句紧邻具体数字We show that ExploRLLM outperforms both policies derived from FMs and RL baselines 同段就有 0.86 与 0.70新颖性立场把缺陷重述为价值actions generated by FMs may be suboptimal or fail, they can highlight meaningful regions in the action space for exploration而不是硬碰最强的结果范围框架诚实收窄our framework focuses on tabletop manipulation 与 it struggles with mitigating high-level errors。关键发现基础模型的正确用法是探索先验而不是替代策略语言模型的动作不参与策略参数更新只改变 rollout 的数据分布因此它的偏置最终会被数据和梯度消化掉。残差表示是两边的接缝物体中心的观测加上残差动作空间让基础模型负责「往哪里探索」、强化学习负责「偏多少才抓得住」字母 O 的边缘抓取就是最直观的例子。探索频率不需要精调$\epsilon$ 在 0 到 0.5 之间训练都能稳定收敛20% 附近达到峰值短程 $0.79 \pm 0.06$一旦超过 50%在线数据占比不足会让训练发散降到 $-0.29 \pm 0.98$。长程任务的收益最大短程任务上纯强化学习只是不稳定0.56 且方差 0.40长程任务上则完全不收敛这正是语言模型先验价值最高、也是最能体现方法差异的场景。泛化来自表示而非规模观测空间由视觉语言模型压缩成物体中心表示后仿真中学到的策略对真实相机噪声与光照变化更不敏感零样本真机短程 66.6%、长程 40%。低级错误率同步下降短程无重叠场景下的低级错误率从关闭探索时的 0.32 降到 0.14说明语言模型引导的探索不只是让训练更快也让行为更稳。局限性场景覆盖有限只验证了桌面的抓取与放置而且单个任务内的物体数量与类别是固定的尚未扩展到更广的机器人操作任务。只能纠正低级错误系统能修正低层动作偏差但对高层错误例如选错了物体无能为力而这类错误在仿真中本就罕见因此缺乏训练信号作者把这一点列为最主要的未来方向。真机成功率仍有限零样本迁移的短程成绩是 66.6%、长程 40%颜色与深度感知噪声仍造成明显的仿真到真实落差。依赖大模型接口仍需要 GPT-4 / GPT-4V 生成与评估候选策略代码虽然用离线批量筛选替代了逐步在线调用但存在模型可用性与成本约束。论文自身的可改进点主表长程允许重叠场景的低级错误率写作 0.22 ± 0.9标准差与量级明显不符疑似应为 0.09正文称探索频率取值从 0.0 到 0.9但表中只列出 7 档缺少 40、60 与 80另外「the unseen letter C」一处的引号使用了反引号加单引号。常见问题FAQExploRLLM 与 RLingua 这类工作有什么本质区别RLingua 用大语言模型生成的规则控制器去正则化强化学习策略让策略向语言模型靠拢ExploRLLM 只把语言模型的动作当作探索动作不把策略拉向语言模型。前者会继承语言模型的偏置后者把纠正权完整留给强化学习。为什么低层动作要按可供性热图采样而不是取最大值的点因为语言模型给出的热图本身就可能是错的——论文的例子是抓取字母 O 时热图高值落在空心处真正可行的抓取点在边缘。采样保留了随机性能产出反例样本而强化学习恰好可以从奖励中把这些次优纠正过来取最大点则会把错误固化成确定性策略。探索频率 ε 需要仔细调吗不需要。论文扫了 7 档频率乘以 6 个随机种子$0 \epsilon \le 0.5$ 之间训练都能稳定收敛且差别不大20% 附近最好只有把探索推到 0.5 以上70%、90%才会因为在线数据比例不足而发散。训练时怎么处理真机的视觉检测误差训练阶段直接使用仿真真值包围盒中心但注入标准差为图像块半径一半的高斯噪声用来模拟 ViLD 这类开放词表检测器的位置不确定性真机评测时才真正启用 ViLD 在线检测。为什么长程任务的提升比短程更明显长程任务需要在多个字母与碗之间完成全部配对成功样本极其稀少。短程任务里纯强化学习只是不稳定成功率 0.56 且方差高达 0.40长程任务里它 75k 步内根本不收敛语言模型引导的探索把智能体带到原本很难自己碰到的状态区域因此在这里的价值最大。这套方法能直接部署到真机吗可以但成本主要在训练侧。策略在仿真中训练完成后直接部署到 Franka Panda 上做零样本评测短程任务对已见字母达到 66.6%、对未见的字母 C 达到 53.3%长程为 40% 与 33.3%主要风险来自深度与颜色感知噪声以及无法修正的高层错误。参考链接论文 arXiv 摘要页https://arxiv.org/abs/2403.09583项目网站含视频与说明https://explorllm.github.io后续工作 LLM-TALEICRA 2026https://arxiv.org/abs/2509.16615关键基线 Code as PoliciesICRA 2023https://arxiv.org/abs/2209.07753关键基线 Socratic ModelsICLR 2023https://arxiv.org/abs/2204.00598关键基线 Inner MonologueCoRL 2023https://arxiv.org/abs/2207.05608关键基线 CLIPortCoRL 2022https://arxiv.org/abs/2109.12098同期工作 RLinguaRA-L 2024https://arxiv.org/abs/2403.06420给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件