▶ 原文链接

语言模型中的规划与多步推理前沿:LATS、SPRINT 与 SWiRL 方法剖析

来源: YouTube | 未署名主讲人 分类: 其他 原文发表: 未提供日期(推测为 2025 年前后) 纪要生成: 2026-08-05


全集重点


嘉宾/话题简介

主讲人未在音频中具名,从内容推断应为该学术讲座的教师或研究者。讲座围绕三篇前沿论文展开,系统介绍了语言模型中规划与多步推理的最新进展:LATS(ICML 2024)将树搜索与行动反馈结合;SPRINT(NeurIPS 2025)探索推理的并行化;SWiRL(COLM 2025)通过过程奖励 RL 实现多步工具调用。每篇论文均从动机、方法、关键结果及局限性层面进行了深入剖析。


分节详述

00:05 LATS 引入:统一推理、行动与规划

本节重点

详细精要

💬 精华片段(中文)

“The goal here was, let's go from the LLM, generate a plan, and executing on that plan, to really try to encourage diversification and exploration of different types of plans, or paths that the model can take.”

“目标是:不再仅仅让大语言模型生成一个计划并执行,而是真正鼓励不同计划类型的多样化和探索,或者说模型可以选择的不同路径。”


07:57 LATS 六阶段详解:从选择到反思

本节重点

详细精要

💬 精华片段(中文)

“If we just go based on the highest value at that point, we might miss out other nodes that right now, maybe at the current moment have a lower value, but down the road at the end might have higher value.”

“如果我们只根据当前点的最高价值去走,可能会错过那些此刻价值较低但最终可能更高的节点。”


16:58 LATS 实验结果与局限

本节重点

详细精要

💬 精华片段(中文)

“The downside, of course, is the cost. Each of these back propagation and expansion of a tree, all of those are adding a lot of cost, and the cost benefits was not really analyzed in the paper.”

“缺点当然是成本。每一次回传和树扩展都会增加大量成本,而论文并未分析成本收益比。”


23:20 SPRINT:并行规划与执行的推理加速

本节重点

详细精要

💬 精华片段(中文)

“So the idea is, we want the model identify this parallelization opportunities and act on it.”

“所以想法是:我们希望模型识别出这些并行化的机会并采取行动。”


31:53 SPRINT 的效率与泛化结果

本节重点

详细精要

💬 精华片段(中文)

“We have larger savings for problems that need more thinking... if the number of tokens in generated... is small, then there is probably less opportunity for parallelism. But this appears in the harder problems and problems that require more thinking.”

“需要更多思考的问题节省幅度更大……如果生成的令牌数量本来较少,并行化机会可能较少;但在更难的问题和需要更多思考的问题上,并行化的优势就体现出来了。”


50:20 SWiRL:无工具执行的强化学习多步推理

本节重点

详细精要

💬 精华片段(中文)

“We realize that the LLM just does a good job based on the quality of the action that's proposed, we're good in just evaluating that. We don't need to execute the action and evaluate that.”

“我们意识到大语言模型仅凭所提议行动的质量就能做出良好判断,我们只需评估它就行了,不需要实际执行该行动再来评估。”


01:06:16 SWiRL 实验结果与泛化洞察

本节重点

详细精要

💬 精华片段(中文)

“It seems like there is something going beyond just like learning to use a specific tool, rather, the model is learning how to think in steps and how to learn how to invoke a tool.”

“似乎不仅仅是学会了使用某个具体的工具,而是模型学会了如何一步一步思考,以及学会如何调用工具。”


专业术语注释

术语 解释
LATS Language Agent Tree Search,将蒙特卡洛树搜索与语言模型结合,通过行动执行结果评分并扩展推理树。
蒙特卡洛树搜索 (MCTS) 一种通过模拟和回传来平衡探索与利用的搜索算法,常用于游戏和规划。
UCT Upper Confidence bounds applied to Trees,用于树节点选择的公式,平衡探索(访问次数少的节点)与利用(高价值节点)。
ReAct 一种将推理与行动交替进行的框架,模型根据观察结果逐步思考并采取行动。
Math-Shepherd 使用验证器评估推理轨迹、引导搜索的测试时方法。
SPRINT 一种通过微调让模型生成并行规划与执行轨迹的方法,旨在加速推理。
有向无环图 (DAG) 用于表示步骤间依赖关系的图,SPRINT 用它来确定哪些步骤可以并行。
推理模型 (Reasoning Model) 具有显式长链思维推理过程的模型,如 o1、DeepSeek-R1。
SWiRL 一种基于强化学习的多步推理框架,离线构造数据并利用过程奖励训练,无需在训练时实时执行工具。
LLM-as-a-Judge 使用一个语言模型对另一模型的输出进行质量评分的做法,常用于生成奖励或评估。
过程奖励 对推理链中每一步的质量打分,区别于只看最终答案的结果奖励。
自一致性得分 通过对同一节点的多次采样,将采样频率转化为分数,用于评估状态的可靠性。
SFT (监督微调) 使用标注好的输入-输出对直接训练模型的行为,属于模仿学习。
RLHF / RLAIF 从人类偏好/ AI 偏好进行强化学习的方法,通常基于最终答案反馈。
HotPotQA 一个多步问答数据集,要求至少从两篇维基百科文章检索信息才能回答。
WebShop 电商场景的交互式基准,要求模型通过多步搜索和比较找到符合复杂条件的产品。
GSM8k 小学水平的数学应用题数据集,常用于评估数学推理。
GPQA Diamond 高难度问答数据集,考察模型的跨领域推理能力。

延伸思考

  1. 成本与效益的权衡:LATS 虽然性能强劲,但每步扩展和回传产生大量计算开销,实际部署时如何设计裁剪策略或利用更小的策略模型值得探索。
  2. 并行化的理论极限:SPRINT 假设任务内部存在独立子任务,但并非所有多步问题都适合并行;未来能否设计一个“可并行度”评估器,动态决定何时采用并行策略?
  3. 过程奖励的欺骗风险:SWiRL 用 LLM-as-a-Judge 提供过程奖励,若法官本身存在偏见或能被生成器“讨好”,可能扭曲学习目标;结合环境验证或许更稳健。
  4. 从不完美数据中学习:SWiRL 发现即使最终答案错误的过程数据也对 RL 有用,这暗示我们可以更积极地利用丢弃的探索轨迹,类似人类从失败中学习。
  5. 整合趋势:将 LATS 的树搜索、SPRINT 的并行执行与 SWiRL 的过程奖励结合,有望构建一个同时在动作层面搜索、在步骤层面并行、在轨迹层面优化的统一智能体框架。

原文发表:未提供日期(推测为 2025 年前后)  ·  纪要生成:2026-08-05