来源: YouTube | 未署名主讲人 分类: 其他 原文发表: 未提供日期(推测为 2025 年前后) 纪要生成: 2026-08-05
主讲人未在音频中具名,从内容推断应为该学术讲座的教师或研究者。讲座围绕三篇前沿论文展开,系统介绍了语言模型中规划与多步推理的最新进展:LATS(ICML 2024)将树搜索与行动反馈结合;SPRINT(NeurIPS 2025)探索推理的并行化;SWiRL(COLM 2025)通过过程奖励 RL 实现多步工具调用。每篇论文均从动机、方法、关键结果及局限性层面进行了深入剖析。
本节重点
详细精要
三者需迭代进行,才能解决复杂问题(如安排一次旅行)。
LATS 的核心挑战:从生成单一计划到鼓励探索多种路径
模型需要接收不同形式的反馈,并把反馈用于优化未来的搜索和规划。
以夏威夷旅行计划为例展示树搜索流程
整个过程体现出持续探索与利用的平衡,这正是 MCTS 的核心——基于最佳状态扩展并结合探索与利用。
LATS 与现有方法的区别
💬 精华片段(中文)
“The goal here was, let's go from the LLM, generate a plan, and executing on that plan, to really try to encourage diversification and exploration of different types of plans, or paths that the model can take.”
“目标是:不再仅仅让大语言模型生成一个计划并执行,而是真正鼓励不同计划类型的多样化和探索,或者说模型可以选择的不同路径。”
本节重点
详细精要
反思:将模型对成功/失败轨迹的思考文本加入上下文,显著提高整体质量。
状态评分机制:LLM 评判 + 自一致性
最终分值 = 两者相加得到单一值,用于指导扩展。
UCT(应用于树的上置信界)与平衡探索利用
该策略完全借鉴传统 MCTS 文献,没有数学证明其最优性,但被认为是一种较优的平衡方式。
回传机制
通过这种方式,探索过程中积累的经验被用于修正整个搜索树的价值估计。
反思步骤的实施与增益
💬 精华片段(中文)
“If we just go based on the highest value at that point, we might miss out other nodes that right now, maybe at the current moment have a lower value, but down the road at the end might have higher value.”
“如果我们只根据当前点的最高价值去走,可能会错过那些此刻价值较低但最终可能更高的节点。”
本节重点
详细精要
结论:LATS 为测试时用更多计算换取更好解答提供了一种有效机制。
WebShop 数据集上的结果:靠近人类专家水平
展现了该方法的强普适性和即插即用能力。
LATS 的主要优势总结
在多个领域取得极强结果,实现方式相对简单。
关键局限与未解决问题
💬 精华片段(中文)
“The downside, of course, is the cost. Each of these back propagation and expansion of a tree, all of those are adding a lot of cost, and the cost benefits was not really analyzed in the paper.”
“缺点当然是成本。每一次回传和树扩展都会增加大量成本,而论文并未分析成本收益比。”
本节重点
详细精要
因此 SPRINT 旨在让模型自动识别并行化机会并加以利用。
SPRINT 框架:规划-执行隔行交替
通过这种隔行交错的方案,推理过程被加速。
训练数据构造流程:用 LLM 自我标注创建并行思维轨迹
最终得到包含并行规划与执行标记的微调数据集。
微调策略与推理时的行为
<plan i> 和 <exec i>。💬 精华片段(中文)
“So the idea is, we want the model identify this parallelization opportunities and act on it.”
“所以想法是:我们希望模型识别出这些并行化的机会并采取行动。”
本节重点
详细精要
具体数据:在 MATH 数据集上,相比 R1 Distill-7B,SPRINT 模型顺序令牌数量减少约 40%,同时准确率额外提升 3.5 个百分点。
准确率提升的解释
模型能够探索更多方法(在相同计算预算下),从而找到更好的解决路径。
强大的跨域泛化能力
说明模型并非仅仅记住任务特定模式,而是学到了“识别独立子任务并并行执行”这种深层技能。
问题难度与并行阶段的关联
这表明 SPRINT 在天然匹配人类思维:先发散再聚焦。
负载均衡与现实限制
💬 精华片段(中文)
“We have larger savings for problems that need more thinking... if the number of tokens in generated... is small, then there is probably less opportunity for parallelism. But this appears in the harder problems and problems that require more thinking.”
“需要更多思考的问题节省幅度更大……如果生成的令牌数量本来较少,并行化机会可能较少;但在更难的问题和需要更多思考的问题上,并行化的优势就体现出来了。”
本节重点
详细精要
SWiRL 设计目标:教会模型何时调用工具、生成正确查询、维持准确率、从错误中恢复、适时停止并给出答案,且避免训练中调用工具。
多步数据离线生成:逐步提示法
所有工具执行和评分均在离线阶段完成,完全与后续 RL 解耦。
RL 训练阶段:无工具执行的奖励优化
优化目标:最大化每个单步动作的期望奖励,给定所有前序状态和动作。
数据过滤策略对比:过程过滤 vs. 结果过滤
💬 精华片段(中文)
“We realize that the LLM just does a good job based on the quality of the action that's proposed, we're good in just evaluating that. We don't need to execute the action and evaluate that.”
“我们意识到大语言模型仅凭所提议行动的质量就能做出良好判断,我们只需评估它就行了,不需要实际执行该行动再来评估。”
本节重点
详细精要
用不同方式过滤训练集,评估 SWiRL 在多步 RL 后的性能。
跨工具与跨数据集泛化
说明模型学到了通用的“多步思考+工具调用”能力,而非对特定工具的适配。
合成数据规模的扩展效应
这枚最关键的图表表明:通过在易构建数据的环境(如 HotPotQA)大量合成过程数据,能够泛化到全新领域。
RL vs. SFT 的对比
而 RL 给模型提供了在先前步骤基础上重新生成动作的机会,并用该动作的过程奖励指导优化,从而能利用过程正确但结果错误的数据。
过程正确性指标的提升
💬 精华片段(中文)
“It seems like there is something going beyond just like learning to use a specific tool, rather, the model is learning how to think in steps and how to learn how to invoke a tool.”
“似乎不仅仅是学会了使用某个具体的工具,而是模型学会了如何一步一步思考,以及学会如何调用工具。”
| 术语 | 解释 |
|---|---|
| LATS | Language Agent Tree Search,将蒙特卡洛树搜索与语言模型结合,通过行动执行结果评分并扩展推理树。 |
| 蒙特卡洛树搜索 (MCTS) | 一种通过模拟和回传来平衡探索与利用的搜索算法,常用于游戏和规划。 |
| UCT | Upper Confidence bounds applied to Trees,用于树节点选择的公式,平衡探索(访问次数少的节点)与利用(高价值节点)。 |
| ReAct | 一种将推理与行动交替进行的框架,模型根据观察结果逐步思考并采取行动。 |
| Math-Shepherd | 使用验证器评估推理轨迹、引导搜索的测试时方法。 |
| SPRINT | 一种通过微调让模型生成并行规划与执行轨迹的方法,旨在加速推理。 |
| 有向无环图 (DAG) | 用于表示步骤间依赖关系的图,SPRINT 用它来确定哪些步骤可以并行。 |
| 推理模型 (Reasoning Model) | 具有显式长链思维推理过程的模型,如 o1、DeepSeek-R1。 |
| SWiRL | 一种基于强化学习的多步推理框架,离线构造数据并利用过程奖励训练,无需在训练时实时执行工具。 |
| LLM-as-a-Judge | 使用一个语言模型对另一模型的输出进行质量评分的做法,常用于生成奖励或评估。 |
| 过程奖励 | 对推理链中每一步的质量打分,区别于只看最终答案的结果奖励。 |
| 自一致性得分 | 通过对同一节点的多次采样,将采样频率转化为分数,用于评估状态的可靠性。 |
| SFT (监督微调) | 使用标注好的输入-输出对直接训练模型的行为,属于模仿学习。 |
| RLHF / RLAIF | 从人类偏好/ AI 偏好进行强化学习的方法,通常基于最终答案反馈。 |
| HotPotQA | 一个多步问答数据集,要求至少从两篇维基百科文章检索信息才能回答。 |
| WebShop | 电商场景的交互式基准,要求模型通过多步搜索和比较找到符合复杂条件的产品。 |
| GSM8k | 小学水平的数学应用题数据集,常用于评估数学推理。 |
| GPQA Diamond | 高难度问答数据集,考察模型的跨领域推理能力。 |