来源: YouTube 学术讲座 | | 分类: 其他 原文发表: 纪要生成: 2026-08-05
本集是斯坦福大学AI课程的一次讲座,由讲师(未具名)系统性地回顾了“验证”技术在大型语言模型领域过去四年的发展。讲座通过四篇标志性论文,阐述了如何构建验证器来自动判断模型生成的答案是否正确,从而解决模型的幻觉问题并提升推理能力。内容涵盖了从基础的数据集构建、两种监督学习范式(结果监督与过程监督)、自动化数据标注,到最新的通过弱监督学习集成多个验证器并完成知识蒸馏的前沿方法。
本节重点
详细精要
挑战:如何自动选择哪个答案是正确的,或在答案生成过程中引导模型。
首篇论文介绍与动机:OpenAI 2021年的论文《训练验证器解决数学问题》,旨在解决LLM的幻觉问题。
本节重点
详细精要
训练数据由(问题,解答,标签)三元组构成。
训练的双重损失函数:验证器训练结合了用于二分类的验证损失和传统的语言模型损失。
二元分类损失:直接预测解答正确与否的损失。论文结果表明,使用两种损失对模型训练有帮助。
验证器的架构细节:验证器本身也是一个语言模型,附带一个输出二元预测的轻量标量头。
训练步骤:先对生成模型在部分训练集上监督微调两个周期(此步是否有必要现在有争议,因为现代模型指令遵循能力已很强),然后生成解答并标注,最后用该数据集训练验证器一个周期。
标签粒度的消融实验:比较了在句子级别和Token级别创建标签的效果。
💬 精华片段(中文)
"We are looking at the token-level prediction by the trained verifier. And if it's green, meaning the verifier has a high score... And in this case, there were some lower scores in the middle, but towards the end, it became greener and greener, and this was a correct prediction at the end." "我们观察训练好的验证器在每个Token上的预测。绿色表示验证器给出高分...在这个例子中,中间有一些低分Token,但越接近结尾,分数越来越高,最终做出了正确的预测。"
本节重点
详细精要
关键条件:验证器要优于此方法,需要训练集足够大。数据量小于1000条时,验证对175B模型的帮助不大。
生成器与验证器规模组合的研究:探究了模型规模的分配策略。
开放问题:寻找生成器和验证器规模的帕累托最优,这在当今基础生成模型能力大提升的背景下,仍是一个有价值的研究课题。
推理时扩展的局限性:通过增加每个问题的候选解答数量,并用验证器评分选优。
💬 精华片段(中文)
"What they saw was that the larger generator helps. The smaller verifier does better than vice versa. And to some extent, this is intuitive, because if we assume generation is naturally, or on average, is a harder task than verification, then this might make sense." "他们发现大型生成器加小型验证器的组合效果更好。这在某种程度上是直觉性的,因为如果我们认为生成任务天然地或平均上比验证任务更难,那么这个结果就能说得通。"
本节重点
详细精要
过程奖励模型:为解答中的每一个推理步骤分配一个奖励分数。这被称为过程监督。
PRM的训练数据构建:核心是获取每个推理步骤的正确性标签。
主动学习策略:为提高数据效率,他们优先选择“可信的错误”答案让人类标注,即最终答案正确但中间步骤错误的样本。这种方法使数据效率提升了2.6倍。
PRM的训练与评分机制:使用GPT-4作为基座模型,先进行监督微调,再基于步骤级标签训练PRM。
系统可基于此总评分决定是输出答案还是重新生成。
过程监督的核心优势:能更好地控制假阳性。
本节重点
详细精要
PRM的独特优势在于,它能检测出分布中出现概率极低(低于5%)的正确答案。
数据效率:在获得同等性能的情况下,PRM所需的数据量更少。
对ORM而言,为一个问题标注100个完整解答的标签,其学习到的信息量,大约只相当于在PRM中为1个解答提供步骤级标签。
泛化能力:评估验证器在不同领域和新数据集上的表现至关重要。
💬 精华片段(中文)
"PRM outperforms ORM and majority voting... Majority voting, again, fails after, in this case, 100 or so samples. The blue line is the ORM model, and the orange one is the PRM approach that is doing better." "PRM优于ORM和多数投票... 在此案例中,多数投票在采样100次左右后再次失败。蓝线的ORM模型和橙线的PRM方法表现更佳,但PRM明显领先。"
本节重点
详细精要
动机:过程奖励模型效果好,但需要大量人工标注,成本高且难以获取。核心问题是:能否自动化PRM的标签收集过程。
自动化标注方法:定义推理步骤的质量为该步骤“能够通向最终正确答案的潜力”。
挑战和缺点:(1)对于难题,如果N不够大,可能找不到任何正确路径,导致所有步骤都得不到正向信号;(2)如果中间步骤有错但因运气好最终答案正确,这些错误步骤仍会被标注为“正确”;(3)可能会惩罚那些不常见但正确的创新性解题路径,因为在小样本N里可能碰巧没被发现。
实验发现:比较硬估计和软估计。
但在该论文设定中,当N=4时达到最佳性能,此时硬估计和软估计差别不大。最终选择硬估计,因为它更容易计算。
性能对比:Math-Shepherd方法与基线对比。
在LLaMA-70B、LLaMA-34B和DeepSeek-67B等多个不同模型上,该结论均成立。
通过强化学习自我改进:将训练的PRM用作奖励模型,来优化生成器本身。
本节重点
详细精要
目标是将一个验证器集合组合成一个更强的单一验证器。
验证器类型:
LLM-as-a-Judge:直接利用LLM自身作为评判者,通过设计Prompt(如:“你认为这个答案正确吗?”)或使用工具、评分细则(rubrics)来获得评分。
集成方法探索:
Weaver方法:“打分、加权、选择”三步法。
弱监督核心假设:Weaver工作受Snorkel (由 Alex Ratner 等人开发) 等项目启发,其关键假设是每个验证器捕捉了正确性的一个独立方面。
基于此独立性假设和贝叶斯公式,可以构建一个优化问题,求解出最优的集成权重。
集成性能显著提升:
💬 精华片段(中文)
"The assumption in Weaver is that each verifier captures independent aspect of the correctness... The signal here is on similarity and dissimilarity across this whole set of verifiers with each other." "Weaver中的一个假设是,每个验证器都捕捉了正确性的一个独立方面... 这里的信号来源于整个验证器集合内部彼此之间的相似性与相异性。"
本节重点
详细精要
当生成器和验证器都升级到70B级别时,系统平均准确率达到86.2%,这与o3-mini这种性质完全不同的专有模型具有高度可比性。
成本挑战与蒸馏解决方案:
本节重点
详细精要
弱监督集成:Weaver另辟蹊径,通过对弱验证器集成进行弱监督优化,通过增加验证器数量实现推理时扩展,最终可通过蒸馏获得高效率模型。
问答环节精要:
| 术语 | 解释 |
|---|---|
| 验证器 | 一个用于评估语言模型生成的解答是否正确的模型或系统,是本次讲座的核心主题。 |
| 生成-验证差距 | 指语言模型能够通过多次生成产生正确答案,但无法可靠地自己识别出哪个答案是正确的这一现象。 |
| GSM 8K | 一个包含8500道中小学水平数学应用题的数据集,由OpenAI于2021年发布,核心特点是测试模型的多步推理能力。 |
| 结果奖励模型 | 一种验证器,对语言模型输出的完整解答给出一个整体的、结局性的正确与否的评分。 |
| 过程奖励模型 | 一种验证器,它将解答分解为多个步骤,并对每一步推理的正确性单独进行评分。 |
| 过程监督 | 用于训练PRM的方法,通过为推理过程中的每个步骤提供正确性标签来提供更精细的监督信号。 |
| PRM800K | OpenAI发布的一个开源数据集,包含80万个人工标注的步骤级正确性标签,用于训练过程奖励模型。 |
| 自动标注 | Math-Shepherd论文中提出的方法,通过蒙特卡洛树搜索(即从当前步骤出发N次,看有多少次能到达正确答案)来自动生成步骤级标签,无须人工参与。 |
| 硬估计 | 一种自动标注方法,如果从某步骤出发的N次采样中,只要有任意一次最终答案正确,该步骤就被评为“好”。 |
| 软估计 | 一种自动标注方法,根据从某步骤出发的N次采样中,最终答案正确的概率占比来给出0到1之间的连续评分。 |
| 多数投票 / 自洽性 | 一种基准方法,生成N个解答,将出现频率最高的那个答案作为最终答案,不涉及任何经过训练的验证器模型。 |
| PPO | 一种强化学习算法,在Math-Shepherd中被用作优化生成模型的策略,以PRM的评分作为奖励信号。 |
| LLM-as-a-Judge | 直接使用一个大型语言模型,通过特定设计的提示词来评价另一个模型生成的回答的质量。 |
| 弱验证器 | Weaver论文中的概念,指任何单个的、无法完美进行判断的验证器,通过集成多种不完美的验证器来获得强大的整体验证能力。 |
| 弱监督学习 | 一种机器学习范式,Weaver利用该方法将来自多个噪声大、质量不一的“弱验证器”的信号,通过一小部分有标签数据学习权重并整合,生成一个更准确的“强信号”。 |
| 多智能体验证 | 一种利用多个LLM智能体,根据不同的评估维度对一个回答进行打分的验证方法。 |
| 知识蒸馏 | 一种模型压缩技术,将一个大型、复杂的“教师”模型(如验证器集成)的知识,迁移到一个更小、更高效的“学生”模型上。 |