来源: YouTube | CS320A 授课老师 | 无 分类: 其他 原文发表: 无 纪要生成: 2026-08-05
本集是 CS320A “自我改进的 AI 智能体”课程的第六讲,主题为“训练时扩展”或“扩展 RL”。授课老师系统性地讲解了如何通过闭环反馈让模型在训练中自我提升推理能力。内容围绕三篇关键论文展开:STaR(自我教导的推理者)、DeepSeekMath(聚焦数学推理的 RL 方案)以及 DAPO(长链推理 RL 的工程解药)。讲座对比了预训练、监督微调、测试时扩展与训练时扩展的差异,并揭示了在数学、编程等可验证领域中,较小模型如何借助精心设计的 RL 算法超越参数规模更大的前辈。
本节重点
详细精要
DAPO:聚焦于强化学习,解决长推理链下 RL 算法的稳定化问题。
动机:AIME 基准上的性能跃迁:以数学推理基准 AIME 2024 和 AIME 2025 为例
这一现象挑战了“参数规模越大性能越高”的传统认知,展示了小模型在推理基准上可达到极高性能。
训练时扩展的定义与三大洞察
洞察三:进行强化学习时,与监督学习相比,必须极度关注实现细节。随着算法规模扩大,细小的修正极其重要。
三种计算范式的关系
💬 精华片段(中文)
"If you take nothing away from this entire lecture, but you just remember this loop, then you have learned the basics of what train time scaling does."
“如果你从这整堂课中只记住一件事,那就记住这个循环,你就学会了训练时扩展的基本原理。”
本节重点
详细精要
AIME 问题需要更深层次的推理,而非简单的模式匹配。
性能对比凸显训练时扩展威力
这说明在基准准确率上,训练时扩展可以弥补甚至超越参数量的不足。
关于算力分配的学生提问
本节重点
详细精要
课程名称“自我改进的 AI 智能体”正源于此。
o1 模型的算力扩展图
o1 的核心发现:同时增加训练时计算和测试时计算可以共同提升基准准确率,从而允许构建一个“圆环”式的反馈环路。
可验证性是成功的关键
💬 精华片段(中文)
"Math is a domain in which there is verifiability... So you have the ability to know which outputs are correct, and which ones are not correct. So you have some ability to actually choose the correct outputs that can then feed into train time scaling."
“数学是一个具有可验证性的领域……所以你能知道哪些输出正确,哪些不正确。因此你有能力挑选出正确的输出,进而馈入训练时扩展。”
本节重点
详细精要
该图表意在展示通过增加两个维度的计算可以实现协同提升,为闭环训练提供了依据。
学生对图表可靠性的质疑
教师承认图表可能存在问题,并开玩笑说“图表并不总是对的,正如它们最近的发布所示”。
测试时扩展 vs 训练时扩展的成本与限制
本节重点
详细精要
链式思考的核心:分配一部分 tokens 专门用于“展现工作”,包括:
具体思考模式实例
自我纠正(化学问题):
可验证领域的优势
本节重点
详细精要
例如在化学问题中,模型自动替换了错误公式,即是一种对知识应用路径的实时修正。
关于简单问题性能退化的讨论
本节重点
详细精要
无论哪一种,都需要验证循环。
关于蒸馏与自我改进的辨析
本节重点
详细精要
挑战:
STaR 的核心思路
将这些理性化后的样本也加入训练集,从而包含更难的题目,实现迭代自举。
STaR 的三大核心假设
💬 精华片段(中文)
"So you basically generate reasoning attempts. You learn from successful reasoning paths where the quality of the reasoning paths is entirely based on things being correct. And for failed attempts, you're basically rationalizing them by saying, OK, here is a hint. Please generate the rationale."
“基本原理是,你生成推理尝试,从成功的推理路径中学习,其质量完全基于正确性。对于失败的尝试,则通过提供提示进行理性化,即‘这是答案,请生成推理过程’。”
本节重点
详细精要
第五步:循环迭代,用微调后的更强模型重新执行上述过程。
实验设置
本节重点
详细精要
常识推理(CommonsenseQA):
数学推理上的异常:理性化未改善 GSM8K
当任务复杂度超出模型能力时,理性化才显出价值。
方法与局限
💬 精华片段(中文)
"The model to reason or there needing to be some sort of a verifier or a reward model. And the reward models if the model is too capable, then the reward rewards will get hacked."
“模型需要具备推理能力或者必须有一个验证器/奖励模型。如果模型过于强大,奖励模型也可能被‘欺骗’。”
本节重点
详细精要
Quiet-STaR:不只将推理步骤放在语言空间,而是让模型在隐层空间(latent space)内通过 MLP 进行“内部思考”,用更高效的方式代替英文推理链。
课堂讨论:STaR 性能的天花板
本节重点
详细精要
启示:在进入 RL 前,提升模型在该领域的基线能力是必需的。
RL 算法挑战:PPO 的内存墙
GRPO(Group Relative Policy Optimization,组相对策略优化):DeepSeek 提出去掉 Critic 模型,利用组基线来估计优势函数,只需 3 个模型副本。
GRPO 工作原理
💬 精华片段(中文)
"So by providing the group context you can save memory, and now you can start scaling up RL."
“通过提供组上下文信息,你可以节省内存,于是就能开始扩展强化学习。”
本节重点
详细精要
在 Math 基准上,DeepSeekMath 通过 GRPO 将准确率从 46.8% 提升至 51.7%,成为第一个在没有 Critic 的情况下突破 50% 的 7B 开源模型。
RL 算法梯度系数比较
GRPO 的优势函数提供了更细粒度的训练信号,特别适用于需要逐步改进的单步答案问题。
关于简单问题退化的深入讨论
本节重点
详细精要
学生和老师补充:除奖励分布外,KL 散度惩罚迫使新策略不远离旧策略,从而维持已有能力,不会在基准上过度特化而牺牲泛化能力。
GRPO 的改进模式
这背后隐含着训练时扩展在提升鲁棒性与成功率,尚无法教会模型解决全新型问题。
奖励信号的设计
本节重点
详细精要
典型失败模式:
DAPO 的四大解药
💬 精华片段(中文)
"If you basically do the online reinforcement learning loop and you sample from the current model, that beats what we were doing earlier... So the model actually became more consistent, not fundamentally smarter."
“如果你运行在线强化学习循环,从当前模型采样,这比我们之前的方法更好……所以模型实际上变得更一致了,而不是从根本上更聪明。”
本节重点
详细精要
对称裁剪则导致熵快速下降并塌陷,准确率停滞。证实了阻止低概率 token 的适当上升会导致探索过早结束。
动态采样的逻辑
相关提问:“过滤掉那些组是否浪费了问题?” 老师澄清:动态采样正是为了不把梯度资源浪费在没有学习可能性的状态上。
采样数量非固定值
本节重点
详细精要
解决方法:改用词元级损失,使损失直接与每个输出序列的长度绑定,从而自然地对于超长错误输出施加更大惩罚,抑制了生成内容长度的爆发。
处理截断带来的噪声
DAPO 引入软惩罚函数:对序列末尾的部分逐步施加更大的惩罚,而非简单截断丢弃。这有效驯服了训练过程中的不稳定性。
技巧叠加带来的性能爬坡
本节重点
详细精要
奖励全对比例:反映当前 batch 内信号饱和度。若比例过高或过低,都意味着采样中缺乏有效差分信号,需启用或调整动态采样。
SFT vs RL 的应用哲学
何时用 SFT:当你已经坐拥海量高质量标注数据,需要一个更快、更直接的方式来固定某种行为模式时。SFT 不能凭空创造复杂的多步推理能力(或增幅有限),但实施成本低,是构建良好基础对话能力的有效手段。
追问:为什么会思考的模型仍不能解决全新问题?
本节重点
详细精要
DAPO:问题极难,推理链极长(如 AIME、IMO),追求 SOTA 时,必须投入资源精细控制 RL 训练的所有变量。
三者共通之利与未达之弊
未改善:模型的根本性能力(解决未见过的全新难题)、Pass@K,以及广泛的域外泛化。这表明闭环训练目前仍是在基础模型的玻璃天花板下进行优化。
关键开放问题
💬 精华片段(中文)
"None of these will yet improve the fundamental capability, or just teach the model to solve new problems, or generalize a lot out of domain."
“所有这些技术目前都还无法提升根本性的能力,或者教会模型解决新问题,或者大量地进行域外泛化。”
本节重点
详细精要
瓶颈在于:奖励信号不够强、奖励存在噪声,模型可能“破解”奖励函数。这些现实问题限制了 RL 作为能力提升引擎的上限。
奖励信号的多维度挑战
应对策略:使用验证器集成(多个不同强弱验证器的组合)来填补单一验证器的信号盲区。
研究方向建议
| 术语 | 解释 |
|---|---|
| Train Time Scaling(训练时扩展) | 在训练阶段使用模型自己生成的输出(经过过滤)进行微调,形成一个闭环,以改进模型性能。 |
| Test Time Scaling(测试时扩展) | 在推理阶段通过采样多条思路、投票、回溯等技术提升回答质量的方案,不改变模型参数。 |
| STaR(Self-Taught Reasoner) | “自我教导的推理者”,一种通过从少量示例自举,迭代生成并过滤推理链来微调模型的方法。 |
| Rationale(推理链/理由) | 模型在输出最终答案前,展示的一系列中间推理步骤。 |
| Rationalization(理性化) | 给模型提供正确答案作为“提示”,让它逆向生成能导向该答案的推理过程。 |
| AIME(American Invitational Mathematics Examination) | 美国数学邀请赛,一个高难度的数学问题基准,用于测试深度数学推理能力。 |
| GSM8K | 一个包含约 8.5k 小学阶段应用题的数据集,常用于评测基础数学推理。 |
| CommonsenseQA | 常识问答基准,包含多项选择题,要求模型理解日常场景与实体关系。 |
| Pass@K | 对同一个问题生成 K 个解,至少有一个正确的概率,衡量模型搜索最优解的能力。 |
| Majority@K | 对同一个问题生成 K 个解,多数投票结果为正确的概率,衡量模型输出的一致性。 |
| PPO(Proximal Policy Optimization) | 近端策略优化,一种常用的强化学习算法,通过限制更新幅度来稳定训练。 |
| GRPO(Group Relative Policy Optimization) | 组相对策略优化,DeepSeek 提出的 RL 变体,用组内奖励标准化替代 Critic 网络,节省内存。 |
| Critic / Value Model | 在 Actor-Critic 架构中用于估计状态或状态-动作价值的模型,GRPO 中将其移除。 |
| Advantage(优势函数) | 在 RL 中表示某个动作相对于平均水平的“好度”,GRPO 通过组内标准化估计该值。 |
| Entropy(熵) | 在 RL 中指策略输出概率分布的均匀程度,高熵代表模型探索性强,低熵意味着策略过于自信。 |
| KL Divergence(KL散度) | 一种度量两个概率分布差异的指标,常用于 RL 中惩罚新策略与旧策略的偏离,防止遗忘。 |
| DAPO(Decoupled Alignment with Partial Observability) | 一套针对长链推理 RL 的稳定化技巧集,提出不对称裁剪、动态采样、词元级损失等方法。 |
| Dynamic Sampling(动态采样) | 过滤掉奖励全对或全错的组,只对具有混合信号的组计算梯度,以维持有效学习。 |
| Token-Level Loss(词元级损失) | 将损失计算分配到每个输出词元,以避免过长序列在训练中获得不成比例的权重。 |
| SFT(Supervised Fine-Tuning) | 监督微调,用标注数据直接训练模型,速度快但难以激发超出数据分布的强推理能力。 |
| Distillation(蒸馏) | 利用大模型生成的输出来训练小模型,使小模型获得接近大模型的性能。 |
| Verifier / Reward Model | 验证器或奖励模型,用于对模型输出进行评分(如0/1或连续值),为 RL 提供训练信号。 |