来源: YouTube | 讲座 | 未知日期
分类: 其他
原文发表: 未知
纪要生成: 2026-08-05
本集为一次关于推理规模缩放(Inference Scaling)的课堂讲座,由讲师系统梳理了不改变模型参数、仅扩大测试时计算即可提升模型能力的前沿研究。内容涵盖大语言猴子论文中的重复采样策略、覆盖率幂律缩放定律、生成‑验证鸿沟、并行/顺序测试时计算技巧、过程奖励模型引导的树搜索,以及自动组合多种推理操作的 Archon 架构搜索框架。课堂中穿插了学生的提问与讨论,生动展示了该领域的开放问题与实践价值。
本节重点
详细精要
💬 精华片段(中文)
“We are going to see different ways that at inference time, we can make the model be better and become more useful without changing the parameters of the model and without any fine tuning of the models.”
我们会看到不同的方法,在推理时让模型变得更好、更有用,而不需要改变模型参数,也不需要任何微调。
本节重点
详细精要
示例:在极难的数学、编程和不同风格的数学问答问题上,较小模型通过重复采样可以超过更大、专有模型的单次表现。
智能体基准 SWE-bench 上的验证:SWE-bench 模仿软件工程师编辑代码和创建补丁的工作流程。
💬 精华片段(中文)
“It just seems like the models and smaller models already know the answers to these hard problems, and just by doing this repeated sampling, we are eliciting and surfacing those answers.”
看起来这些模型,甚至是较小的模型,已经知道这些难题的答案,只是通过重复采样,我们才把这些答案激发和浮现出来。
本节重点
详细精要
类比:预训练可以通过增加数据量、计算量和参数量按定律降低测试损失,推理阶段也可按定律预测提高覆盖率所需的采样数和资源。
跨模型、跨参数量的验证:
💬 精华片段(中文)
“We can predict to achieve a certain coverage, how many samples we are going to need and how much resources we should allocate to achieve that.”
我们可以预测,要达到某个覆盖率,需要多少样本、应该分配多少资源。
本节重点
详细精要
但跨题目平均后,观察到的是幂律缩放,说明并不是每道题都独立满足同一个 p,而是题目难度的分布形态改变了总体的缩放行为。
充分必要条件:长尾分布:
💬 精华片段(中文)
“The sufficient and necessary condition for it is that we have a long tail of hard problems.”
其充分必要条件是,我们拥有一个极难问题的长尾分布。
本节重点
详细精要
新范式下,可在推理时投入更多计算资源,让智能体持续生成 token 并提升回答质量,甚至离线进行。
自动验证器的重要性与实例:
💬 精华片段(中文)
“We can release our agents to go solve a problem and just keep generating tokens and keep improving the quality of the answers that they generate.”
我们可以释放智能体去解决问题,并不断地生成 token、不断改进答案质量。
本节重点
详细精要
在更难的 MATH 数据集上,差距尤其悬殊;即使加入基于 LLM 的奖励模型(为每个回答打分取最优),仍有很大鸿沟。
困难问题的稀疏性:
💬 精华片段(中文)
“We call this the generation verification gap. The generation, it turns out, we can generate a lot of good responses, but the verification is basically this gap.”
我们把这个称为生成-验证鸿沟。事实证明,我们可以生成许多好的回答,但验证过程就构成了这个差距。
本节重点
详细精要
即使无法确定答案正确,也可以建立模型来识别错误,提前滤除劣质回答(更容易做到“证明错误”而非“证明正确”)。
学生观点二:效率型混合方案(知识图谱 + RAG)
先利用知识图谱或高级文档进行检索增强,在准确度未达预期时才回退到较慢的重复采样流程,以平衡速度与精度。
学生观点三:初始探索 + 并行采样
在采样前先让模型对问题域进行探索、搜集背景信息(某种“自学”),再将获得的上下文输入并行采样,也许能改善 pass@k 的形态。
学生观点四:多验证器集成与成本问题
💬 精华片段(中文)
“One interesting direction would be trying to look at different domains, where there is much difficulty. And also maybe verification is not fully accurate, or maybe it's a bit lost.”
一个有趣的方向是考察各种困难领域,也许验证并非完全准确,或者有点力不从心。
本节重点
详细精要
但对于编程任务,若单元测试覆盖率不足,仍可能出现“通过测试但实际错误”的情况;验证器质量始终是上限。
逐步验证与未来方向:
💬 精华片段(中文)
“The quality of the verifier matters.”
验证器的质量至关重要。
本节重点
详细精要
顺序修订:模型针对问题生成初始解法,然后反复审视、修订、从不同角度优化,直到认为足够好才输出最终答案。注:当前很多推理模型已在训练后展现出内部自我修正的行为。
奖励模型的两大类:
💬 精华片段(中文)
“Instead of asking the model multiple times, we let the model know that it can keep revising its answers, look into that from a different angles, and continue doing so until it's confident that it's ready to generate an answer.”
我们不反复询问模型,而是让模型知道它可以持续修订答案,从不同角度审视,直到它有信心产出答案。
本节重点
详细精要
这种方法不仅能缩小搜索空间,也能避免完全盲目的随机扩展。
结果奖励与过程奖励的混合:
💬 精华片段(中文)
“If you combine the two of outcome based reward model and parallel based upon sequential revisions, you get better results.”
如果把基于结果的奖励模型和基于并行/顺序修订的方法结合起来,会获得更好的结果。
本节重点
详细精要
难度分档方法:用模型的 pass@1 表现为每道题分配难度等级,共 5 档,第 5 档为最难题。
顺序与并行的效果差异:
题目越难,顺序占比的最优值不确定,甚至在桶 4 与桶 5 之间也会变化。
推理缩放 vs 预训练缩放的权衡:
💬 精华片段(中文)
“For the very, very hard problems, still the frontier models, which presumably use more pre-training and they are larger, they do better even if we had a whole lot like infinite budget for test time scaling.”
对于非常非常难的问题,即使我们有近乎无限的测试时缩放预算,使用了更多预训练量、规模更大的前沿模型依然表现更好。
本节重点
详细精要
即便如此,论文中的主观感知不是直接换算,而是反映一个宏观趋势:对多数问题,推理缩放已大幅拉近开源小模型与顶尖大模型的差距,但对最极端的难题,大模型的“原始智力”仍占优。
对研究界的启示:
本节重点
详细精要
优化器 iTest(Inference Time Architecture Search)自动搜索将不同模型和技术组合成推理管线的最佳方式,输出一个“架构”,直接给出最终答案。
六类推理操作:
💬 精华片段(中文)
“We thought of inference scaling in this project as an inference architecture design problem.”
在这个项目中,我们把推理缩放看作一个推理架构设计问题。
本节重点
详细精要
令人惊讶的是,只做融合(红色)就超过了神谕选择器,说明模型在“看到”其他候选答案后能综合出比任意单一样本都更好的回答。
多模型场景:随着模型数量从 1 增加到 10(每次加入稍弱的模型),各方法的相对趋势保持不变,依然符合上述顺序。
💬 精华片段(中文)
“It is so interesting, and this paradigm is so powerful that that can on its own improve the quality of responses over Oracle selection.”
这个范式如此有趣且强大,仅仅融合就能超越神谕选择的回答质量。
本节重点
详细精要
模型可生成类似“输入奇数长度括号串,应输出 no”“遇到闭合括号时必须与最近未闭合括号匹配”等测试描述,并进一步生成对应的测试代码。
单元评估:
本节重点
详细精要
对于编程问题,架构还会包含“生成大量样本→生成单元测试→评估”的模块。
搜索空间化简:
使用贝叶斯优化器,其样本效率远高于随机搜索或贪心搜索,可基于训练集的精度与推理调用次数的权衡来找到最优架构。
“更深”的推理架构带来增益:
💬 精华片段(中文)
“It seems like these additional layers that we are adding here is actually-- just like in deep learning, we are adding layers in pre-training and the model gets better. Seems like these careful kind of additions of these inference layers are helping the model become more and more accurate.”
看起来我们在这里增加的额外层实际就像在深度学习中,我们为预训练增加层数后模型变得更好。这些精心添加的推理层正在帮助模型变得越来越准确。
本节重点
详细精要
目标可以是最大化准确率,也可以在给定推理调用预算下寻找最优。
显著性能提升:
💬 精华片段(中文)
“On average, in this case, we were outperforming GPT-4.0 or Claude 3.5 Sonnet in passage one by an average of 14.1% across these instruction following reasoning and math and coding problems.”
在这些指令跟随、推理、数学和编程问题上,我们 pass@1 平均分别超过 GPT-4o 和 Claude 3.5 Sonnet 约 14.1%。
本节重点
详细精要
💬 精华片段(中文)
“Hopefully, you think about it yourself. And hope you have a happy weekend.”
希望大家自己思考这些问题。祝周末愉快。
| 术语 | 解释 |
|---|---|
| LLM | 大语言模型,本集所有讨论的基础模型类别。 |
| Pre-training(预训练) | 使用海量通用数据训练 LLM 的第一阶段,计算量最大。 |
| Fine-tuning(微调) | 在预训练模型上,使用少量特定任务数据调整参数的第二阶段。 |
| Inference(推理) | 模型部署后,实际接收输入并生成输出的阶段;本集讨论的重心。 |
| Large Language Monkeys(大语言猴子) | 指反复让 LLM 回答同一问题、从大量采样中筛选正确答案的方法,呼应无限猴子定理。 |
| Coverage(覆盖率) | 至少有一个采样答案正确的问题占总问题的比例,衡量重复采样的上限潜力。 |
| Pass@k | 在 k 次采样中至少获得一次正确回答的期望概率(单题或数据集层面)。 |
| Power Law(幂律) | 本文中指覆盖率与采样次数之间的指数关系,可用于预测资源需求。 |
| Verifier(验证器) | 用于判断模型生成答案是否正确的工具或模型,分为 Oracle(完美)、结果型、过程型等。 |
| SWE-bench | 模拟软件工程师解决代码补丁问题的智能体基准测试。 |
| DeepSeek-V3 | 讲座中示例所用的开源大语言模型,在多次采样后能超越部分闭源模型。 |
| CUDA | GPU 编程的低级语言,用于高效硬件加速;代码翻译场景中易自动验证。 |
| KernelBench | 用于评测 CUDA 代码生成能力的基准,因其有自然等价性验证而被选作例子。 |
| Test-time compute(测试时计算) | 在模型推理阶段额外投入的计算资源,不更改模型参数。 |
| Parallel Sampling(并行采样) | 同题同时生成多个独立回答。 |
| Sequential Revisions(顺序修订) | 模型生成一个回答后,迭代修订、补充、多角度审视同一个答案。 |
| Beam Search(束搜索) | 借助 PRM 评分,每步保留评分最高的若干分支继续扩展的树搜索方法。 |
| PRM (Process Reward Model) | 过程奖励模型,对解答的每一步给出评分,用于指导顺序搜索。 |
| ORM (Outcome Reward Model) | 结果奖励模型,仅对最终答案打分。 |
| Generation-Verification Gap(生成-验证鸿沟) | 完美验证下的理论覆盖率与实际可用验证方法能达到的准确率之间的差值。 |
| Archon | 一种自动组合多种推理操作(生成、融合、批判、排序等)的架构搜索框架。 |
| Fusion(融合) | 将多个候选回答全部喂给 LLM,让它综合出一个最优答案的操作。 |
| Critic(批判) | 让模型分析某回答的优缺点。 |
| Ranker(排序器) | 让模型根据质量对多个回答进行排名。 |
| Bayesian Optimization(贝叶斯优化) | 一种搜索昂贵黑箱函数最优解的样本高效方法,本集用于寻找最优推理架构。 |
| iTest (Inference Time Architecture Search) | Archon 中自动搜索推理架构的优化器名称。 |