▶ 原文链接

验证:从训练验证器解决数学问题到缩小生成-验证差距

来源: YouTube 学术讲座 | | 分类: 其他 原文发表: 纪要生成: 2026-08-05


全集重点


嘉宾/话题简介

本集是斯坦福大学AI课程的一次讲座,由讲师(未具名)系统性地回顾了“验证”技术在大型语言模型领域过去四年的发展。讲座通过四篇标志性论文,阐述了如何构建验证器来自动判断模型生成的答案是否正确,从而解决模型的幻觉问题并提升推理能力。内容涵盖了从基础的数据集构建、两种监督学习范式(结果监督与过程监督)、自动化数据标注,到最新的通过弱监督学习集成多个验证器并完成知识蒸馏的前沿方法。


分节详述

00:05 引言与GSM8K数据集

本节重点

详细精要

03:20 训练验证器的原理与方法

本节重点

详细精要

💬 精华片段(中文)

"We are looking at the token-level prediction by the trained verifier. And if it's green, meaning the verifier has a high score... And in this case, there were some lower scores in the middle, but towards the end, it became greener and greener, and this was a correct prediction at the end." "我们观察训练好的验证器在每个Token上的预测。绿色表示验证器给出高分...在这个例子中,中间有一些低分Token,但越接近结尾,分数越来越高,最终做出了正确的预测。"

10:58 验证器 vs. 微调的对比与扩展性分析

本节重点

详细精要

💬 精华片段(中文)

"What they saw was that the larger generator helps. The smaller verifier does better than vice versa. And to some extent, this is intuitive, because if we assume generation is naturally, or on average, is a harder task than verification, then this might make sense." "他们发现大型生成器加小型验证器的组合效果更好。这在某种程度上是直觉性的,因为如果我们认为生成任务天然地或平均上比验证任务更难,那么这个结果就能说得通。"

21:08 过程奖励模型 vs. 结果奖励模型

本节重点

详细精要

29:04 PRM的性能评估与泛化能力

本节重点

详细精要

💬 精华片段(中文)

"PRM outperforms ORM and majority voting... Majority voting, again, fails after, in this case, 100 or so samples. The blue line is the ORM model, and the orange one is the PRM approach that is doing better." "PRM优于ORM和多数投票... 在此案例中,多数投票在采样100次左右后再次失败。蓝线的ORM模型和橙线的PRM方法表现更佳,但PRM明显领先。"

38:14 无人类标注的过程验证:Math-Shepherd

本节重点

详细精要

52:05 缩小差距:弱验证器集成(Weaver)

本节重点

详细精要

💬 精华片段(中文)

"The assumption in Weaver is that each verifier captures independent aspect of the correctness... The signal here is on similarity and dissimilarity across this whole set of verifiers with each other." "Weaver中的一个假设是,每个验证器都捕捉了正确性的一个独立方面... 这里的信号来源于整个验证器集合内部彼此之间的相似性与相异性。"

01:02:13 跨越模型等级与验证成本优化

本节重点

详细精要

01:06:35 课程总结与QA

本节重点

详细精要


专业术语注释

术语 解释
验证器 一个用于评估语言模型生成的解答是否正确的模型或系统,是本次讲座的核心主题。
生成-验证差距 指语言模型能够通过多次生成产生正确答案,但无法可靠地自己识别出哪个答案是正确的这一现象。
GSM 8K 一个包含8500道中小学水平数学应用题的数据集,由OpenAI于2021年发布,核心特点是测试模型的多步推理能力。
结果奖励模型 一种验证器,对语言模型输出的完整解答给出一个整体的、结局性的正确与否的评分。
过程奖励模型 一种验证器,它将解答分解为多个步骤,并对每一步推理的正确性单独进行评分。
过程监督 用于训练PRM的方法,通过为推理过程中的每个步骤提供正确性标签来提供更精细的监督信号。
PRM800K OpenAI发布的一个开源数据集,包含80万个人工标注的步骤级正确性标签,用于训练过程奖励模型。
自动标注 Math-Shepherd论文中提出的方法,通过蒙特卡洛树搜索(即从当前步骤出发N次,看有多少次能到达正确答案)来自动生成步骤级标签,无须人工参与。
硬估计 一种自动标注方法,如果从某步骤出发的N次采样中,只要有任意一次最终答案正确,该步骤就被评为“好”。
软估计 一种自动标注方法,根据从某步骤出发的N次采样中,最终答案正确的概率占比来给出0到1之间的连续评分。
多数投票 / 自洽性 一种基准方法,生成N个解答,将出现频率最高的那个答案作为最终答案,不涉及任何经过训练的验证器模型。
PPO 一种强化学习算法,在Math-Shepherd中被用作优化生成模型的策略,以PRM的评分作为奖励信号。
LLM-as-a-Judge 直接使用一个大型语言模型,通过特定设计的提示词来评价另一个模型生成的回答的质量。
弱验证器 Weaver论文中的概念,指任何单个的、无法完美进行判断的验证器,通过集成多种不完美的验证器来获得强大的整体验证能力。
弱监督学习 一种机器学习范式,Weaver利用该方法将来自多个噪声大、质量不一的“弱验证器”的信号,通过一小部分有标签数据学习权重并整合,生成一个更准确的“强信号”。
多智能体验证 一种利用多个LLM智能体,根据不同的评估维度对一个回答进行打分的验证方法。
知识蒸馏 一种模型压缩技术,将一个大型、复杂的“教师”模型(如验证器集成)的知识,迁移到一个更小、更高效的“学生”模型上。

延伸思考

  1. 生成器与验证器规模的帕累托最优:在计算资源固定的情况下,如何最优地分配模型规模给生成器和验证器(或验证器集成)以获得最高性能?这在当前模型能力普遍提升的背景下是极具价值的研究问题。
  2. 推理时计算的分配策略:除了增加生成样本,也可以增加对验证过程本身的采样。在固定推理总预算下,如何在“多生成”和“仔细验证”之间进行动态分配?
  3. 生成多样性与验证准确率的权衡:用RL和PRM反复优化生成器可能会使其概率分布过度“尖锐”,牺牲解题路径的创造性与多样性。如何在自我改进的闭环中维持这种宝贵的多样性?
  4. 验证器的跨架构泛化:讲座最后提问中提及,生成器和验证器是来自同一模型家族,还是不同架构(如密集型模型 vs. MoE)效果更好,这是一个没有定论且值得系统性探索的方向。
  5. 过程监督中的“奖励黑客”问题:如果使用PRM直接优化生成器,模型可能会学会跳过推理步骤,直接生成PRM喜欢看到的答案。除了保持生成器与验证器独立训练,还有哪些机制可以有效防止这种作弊行为?

原文发表:**纪要生成:** 2026-08-05  ·  纪要生成:2026-08-05