▶ 原文链接

CS320A 第六讲:训练时扩展(强化学习扩展)

来源: YouTube | CS320A 授课老师 | 无 分类: 其他 原文发表:纪要生成: 2026-08-05


全集重点


嘉宾/话题简介

本集是 CS320A “自我改进的 AI 智能体”课程的第六讲,主题为“训练时扩展”或“扩展 RL”。授课老师系统性地讲解了如何通过闭环反馈让模型在训练中自我提升推理能力。内容围绕三篇关键论文展开:STaR(自我教导的推理者)、DeepSeekMath(聚焦数学推理的 RL 方案)以及 DAPO(长链推理 RL 的工程解药)。讲座对比了预训练、监督微调、测试时扩展与训练时扩展的差异,并揭示了在数学、编程等可验证领域中,较小模型如何借助精心设计的 RL 算法超越参数规模更大的前辈。


分节详述

00:05 引言:训练时扩展与三大关键洞察

本节重点

详细精要

💬 精华片段(中文)

"If you take nothing away from this entire lecture, but you just remember this loop, then you have learned the basics of what train time scaling does."

“如果你从这整堂课中只记住一件事,那就记住这个循环,你就学会了训练时扩展的基本原理。”

02:10 推理基准 AIME 与规模替代

本节重点

详细精要

03:16 训练时扩展的基本原理与循环

本节重点

详细精要

💬 精华片段(中文)

"Math is a domain in which there is verifiability... So you have the ability to know which outputs are correct, and which ones are not correct. So you have some ability to actually choose the correct outputs that can then feed into train time scaling."

“数学是一个具有可验证性的领域……所以你能知道哪些输出正确,哪些不正确。因此你有能力挑选出正确的输出,进而馈入训练时扩展。”

06:26 训练与测试计算的权衡

本节重点

详细精要

07:28 推理模式与可验证性

本节重点

详细精要

10:39 思考模型的核心优势

本节重点

详细精要

14:49 预训练模型与推理扩展

本节重点

详细精要

16:24 论文一:STaR – 利用推理链自举推理

本节重点

详细精要

💬 精华片段(中文)

"So you basically generate reasoning attempts. You learn from successful reasoning paths where the quality of the reasoning paths is entirely based on things being correct. And for failed attempts, you're basically rationalizing them by saying, OK, here is a hint. Please generate the rationale."

“基本原理是,你生成推理尝试,从成功的推理路径中学习,其质量完全基于正确性。对于失败的尝试,则通过提供提示进行理性化,即‘这是答案,请生成推理过程’。”

25:17 STaR 的算法流程

本节重点

详细精要

28:30 STaR 实验结果与挑战

本节重点

详细精要

💬 精华片段(中文)

"The model to reason or there needing to be some sort of a verifier or a reward model. And the reward models if the model is too capable, then the reward rewards will get hacked."

“模型需要具备推理能力或者必须有一个验证器/奖励模型。如果模型过于强大,奖励模型也可能被‘欺骗’。”

36:59 STaR 的变体与问题讨论

本节重点

详细精要

40:51 论文二:DeepSeekMath – 数学推理与 GRPO

本节重点

详细精要

💬 精华片段(中文)

"So by providing the group context you can save memory, and now you can start scaling up RL."

“通过提供组上下文信息,你可以节省内存,于是就能开始扩展强化学习。”

44:03 GRPO:组相对策略优化

本节重点

详细精要

48:14 奖励分配与回归问题

本节重点

详细精要

53:22 论文三:DAPO – 强化学习的稳定性技巧

本节重点

详细精要

💬 精华片段(中文)

"If you basically do the online reinforcement learning loop and you sample from the current model, that beats what we were doing earlier... So the model actually became more consistent, not fundamentally smarter."

“如果你运行在线强化学习循环,从当前模型采样,这比我们之前的方法更好……所以模型实际上变得更一致了,而不是从根本上更聪明。”

54:57 不对称裁剪与动态采样

本节重点

详细精要

57:39 长度损失与过长惩罚

本节重点

详细精要

01:00:25 DAPO 的 RL 修炼观

本节重点

详细精要

01:03:03 技术总结与未来展望

本节重点

详细精要

💬 精华片段(中文)

"None of these will yet improve the fundamental capability, or just teach the model to solve new problems, or generalize a lot out of domain."

“所有这些技术目前都还无法提升根本性的能力,或者教会模型解决新问题,或者大量地进行域外泛化。”

01:08:20 课堂总结与未来方向

本节重点

详细精要


专业术语注释

术语 解释
Train Time Scaling(训练时扩展) 在训练阶段使用模型自己生成的输出(经过过滤)进行微调,形成一个闭环,以改进模型性能。
Test Time Scaling(测试时扩展) 在推理阶段通过采样多条思路、投票、回溯等技术提升回答质量的方案,不改变模型参数。
STaR(Self-Taught Reasoner) “自我教导的推理者”,一种通过从少量示例自举,迭代生成并过滤推理链来微调模型的方法。
Rationale(推理链/理由) 模型在输出最终答案前,展示的一系列中间推理步骤。
Rationalization(理性化) 给模型提供正确答案作为“提示”,让它逆向生成能导向该答案的推理过程。
AIME(American Invitational Mathematics Examination) 美国数学邀请赛,一个高难度的数学问题基准,用于测试深度数学推理能力。
GSM8K 一个包含约 8.5k 小学阶段应用题的数据集,常用于评测基础数学推理。
CommonsenseQA 常识问答基准,包含多项选择题,要求模型理解日常场景与实体关系。
Pass@K 对同一个问题生成 K 个解,至少有一个正确的概率,衡量模型搜索最优解的能力。
Majority@K 对同一个问题生成 K 个解,多数投票结果为正确的概率,衡量模型输出的一致性。
PPO(Proximal Policy Optimization) 近端策略优化,一种常用的强化学习算法,通过限制更新幅度来稳定训练。
GRPO(Group Relative Policy Optimization) 组相对策略优化,DeepSeek 提出的 RL 变体,用组内奖励标准化替代 Critic 网络,节省内存。
Critic / Value Model 在 Actor-Critic 架构中用于估计状态或状态-动作价值的模型,GRPO 中将其移除。
Advantage(优势函数) 在 RL 中表示某个动作相对于平均水平的“好度”,GRPO 通过组内标准化估计该值。
Entropy(熵) 在 RL 中指策略输出概率分布的均匀程度,高熵代表模型探索性强,低熵意味着策略过于自信。
KL Divergence(KL散度) 一种度量两个概率分布差异的指标,常用于 RL 中惩罚新策略与旧策略的偏离,防止遗忘。
DAPO(Decoupled Alignment with Partial Observability) 一套针对长链推理 RL 的稳定化技巧集,提出不对称裁剪、动态采样、词元级损失等方法。
Dynamic Sampling(动态采样) 过滤掉奖励全对或全错的组,只对具有混合信号的组计算梯度,以维持有效学习。
Token-Level Loss(词元级损失) 将损失计算分配到每个输出词元,以避免过长序列在训练中获得不成比例的权重。
SFT(Supervised Fine-Tuning) 监督微调,用标注数据直接训练模型,速度快但难以激发超出数据分布的强推理能力。
Distillation(蒸馏) 利用大模型生成的输出来训练小模型,使小模型获得接近大模型的性能。
Verifier / Reward Model 验证器或奖励模型,用于对模型输出进行评分(如0/1或连续值),为 RL 提供训练信号。

延伸思考

原文发表:无  ·  纪要生成:2026-08-05