来源: YouTube | 课程讲座 | 日期未标明
分类: 其他
原文发表: 未标明
纪要生成: 2026-08-05
本集为教学讲座,重点讲解如何利用搜索机制显著提升模型解决复杂问题的能力。前半部分以 AlphaCode 和 AlphaCode 2 为例,剖析在竞技编程中通过大规模采样、聚类与打分模型实现从覆盖到筛选的全链路优化;后半部分介绍 Search‑o1,展示在大型推理模型上构建 “深度研究” 智能体的方法,通过多轮检索与文档精炼来弥合知识缺口。内容直接关联后续作业(HumanEval 与 Agent 搜索)。
本节重点
详细精要
深度研究式搜索类似 作业 3 的准备内容,更接近智能体行为
核心思想:解存在于搜索空间,关键在于策展
本节重点
详细精要
这要求模型不仅要“写代码”,更要读懂题意并决定正确的算法路径
AlphaCode 里程碑:首次端到端泛化
这远比 HumanEval 类简单补全任务困难,后者只需完成一个特定函数
单行补全与完整解决方案的差距
💬 精华片段(中文)
“We know that the solutions lie in the search space of the models, but how do you curate the answer out of the search space of what the model outputs is roughly what we are covering today.”
我们知道解存在于模型的搜索空间中,但如何从模型输出的搜索空间中策展出答案,正是我们今天要讲的内容。
本节重点
详细精要
微调时加入技巧:使用正则化来提升模型对有意义模式的权重,方法叫 GOLD,其核心是对高似然 token 赋高权重,低似然 token 赋低权重,从而提高精度
大规模多样化采样
在提示中随机化问题标签和难度评分,并使用高温度采样,以增加多样性
筛选与聚类作为提交前的“策展”
聚类的重要性在于:只能提交少量解(如 10 个)给 Codeforces 平台,所以必须选出最具代表性的一组
评估渠道:Codeforces 与 CodeContests
💬 精华片段(中文)
“They generate 1 million diverse sample programs per question… and they randomize the problem tags and the ratings in the prompt, and they use a high sampling temperature, so it's like the solutions are going to be diverse.”
每个问题生成 100 万个多样化的样本程序……他们在提示中随机化问题标签和评分,并使用高温度采样,从而保证解法多样。
本节重点
详细精要
假设每道题提交 10 次(而非百万次),AlphaCode 平均排名 54.3%,可与过去六个月 28% 的参赛者竞争
竞赛间方差来源
💬 精华片段(中文)
“The selection stage can also be a bottleneck here. There can be solutions that are almost correct, but not completely correct.”
筛选阶段也可能成为瓶颈。可能存在一些解决方案几乎正确,但并不完全正确。
本节重点
详细精要
10@k:模型生成 k 个样本,但只能提交 10 个,必须先进行内部打分或筛选,因此也反映了过滤流程的质量
模型大小与采样数量的正效应
将样本数量从 1k 提升到 1M,无论是 9B 还是 41B 模型,性能都稳步提高
聚类的持续增益
因为竞技编程题目的特殊性,提交语法不同但逻辑相同的解没有收益,聚类能确保提交的 10 个解覆盖不同解题思路,利用有限的提交机会最大化成功率
采样预算的对数线性趋势
更好模型(如 41B)具有更优的斜率
筛选阶段的瓶颈效应
💬 精华片段(中文)
“If you had unlimited attempts per problem… you are almost getting to something above 40%, and here, you are only getting to 30%, so there is definitely some bottlenecking happening in selection stage.”
如果每题拥有无限次尝试机会……准确率可以超过 40%,但这里只能达到 30%,说明筛选阶段确实存在瓶颈。
本节重点
详细精要
证明了通过大规模采样可以获得高覆盖,且模型并非简单复制训练数据,而是真正进行了一定程度的泛化推理
已知局限
💬 精华片段(中文)
“Loss is often a poor proxy for solve rates… because there are many solutions that could have solved the problem.”
损失往往不能很好反映解题率……因为能解决问题的方法可能有多种。
本节重点
详细精要
分段微调:利用 CodeContests V2 数据集,添加标签后切分为不同子集,以微调多个不同变体模型,这些变体好比“家族”,能提供更多样化的采样
全新打分模型(Scoring Model)
该模型基于高质量、经过人工精心标注的数据集训练,能更精准地区分好代码和坏代码
仅使用 C++ 与采样策略
每道题的输出会先在公开测试上执行,过滤掉不通过编译和明显错误的解,此步骤淘汰约 95% 的样本,剩余约 50k 个样本
簇内打分与终选
💬 精华片段(中文)
“They actually had multiple variants of this model so that they get diversity in the output sampling… and then they had a scoring model which was used for obtaining the best candidates.”
他们实际上拥有该模型的多个变体以提升采样多样性……然后才有了一个打分模型,用来选出最佳候选。
本节重点
详细精要
AlphaCode 2 在只用 100 个样本时解题率就与前者持平,相当于以 1/10000 的预算达成了相同效果,效率惊人
峰值性能
同样使用 1M 样本,AlphaCode 2 解题率达到 43%,较 AlphaCode 提高约 1.7 倍
超越人类平均水平
若只取每个问题最优秀的两个解答,甚至能超过 99.5% 的人类参赛者,意味着几乎碾压所有选手
优化来源解耦
💬 精华片段(中文)
“For AlphaCode 2, once you get to 100 samples, you are achieving the same solve rate as AlphaCode. And if you want to go beyond that, you can use more samples.”
对 AlphaCode 2 而言,只需 100 个样本就达到了 AlphaCode 的解题率。如果你想更进一步,可以继续增加样本。
本节重点
详细精要
另一种方向是通过强化学习让模型本身生成更高质量的样本,从而在根本上降低对大量采样的依赖
基于任务难度的自适应策略
对于复杂问题,由于单一模型难以一步得出答案,可能需要进行任务分解,分步生成与验证
把推理直接嵌入模型
💬 精华片段(中文)
“If you have simpler problems, then it's likely that you can get coverage with fewer number of samples… It's almost like saying the model… more likely to generate the solution in the search space of what it outputs.”
如果问题比较简单,那你用更少的样本就很可能覆盖到正确解……这就像是在说模型更容易在它的输出空间中生成对的那个解。
本节重点
详细精要
这种不确定性会在长链推理中逐步累积,最终导致错误答案,必须引入外部知识来填补
从 RAG 到 Agentic RAG 再到 Search‑o1
Search‑o1 更进一步:它不只是插入检索结果,而是在每一个检索结果上进行“文档内推理”,抽取出与当前推理最相关的片段,摒弃噪声,再无缝拼接到主推理链中
文档内推理的原理
💬 精华片段(中文)
“It will analyze the retrieved documents… extract relevant chunks of information from there, and it will only put these relevant information into the prompts so that it integrates well into the reasoning chain.”
它会分析取回的文档……从中抽取相关信息板块,并仅把这些相关信息放进提示词,从而让它很好地融入推理链。
本节重点
详细精要
关键挑战在于模型需要正确理解陌生化学术语并推断结构
纯推理(Vanilla Reasoning)
因猜测错误导致最终计算完全跑偏,得出错误答案
Agentic RAG
最终仍然给出了错误答案
Search‑o1
💬 精华片段(中文)
“In Search‑o1 process, it did search for this particular formula, and then it refined it to a certain structure, and then that integrated cleanly into reasoning.”
在 Search‑o1 流程中,它搜索了这个特定分子式,将其精炼为具体结构,然后干净地融入了推理过程。
本节重点
详细精要
但 Search‑o1 拥有文档内推理能力,能并行取回更多资料,从中只抽取有用碎片,因此文档越多、可用线索越丰富,准确率不降反升
GPQA 权威数据集表现
讲师提醒正确对比:应观察物理学家解决物理题的对角线数值,而非跨学科比对
多跳问答(Multi‑Hop QA)上的统治力
💬 精华片段(中文)
“As you increase the number of documents, you are actually able to do better because you can summarize what is relevant information… assuming that… fetching more documents gives you more relevant information.”
当你增加文档数量时,性能反而更好,因为你可以总结出哪些信息是相关的……前提是取回更多文档能给你更多相关信息。
本节重点
详细精要
因为模型在每一步都可获取事实支撑,不再需要“硬猜”
多轮迭代的自我纠错机制
如此在“推理‑搜索‑提炼‑再推理”的循环中逐步逼近真相
Search‑R1 的预告
因时间关系,该论文不在课堂详解,但讲师强烈推荐阅读
关于模型置信度的讨论
💬 精华片段(中文)
“The models tend to be overconfident… if you were to calibrate that to the right answer, often you'll find that… if it's 50% correct, it will still be overconfident.”
模型倾向于过度自信……如果校准到真实正确率,你会发现哪怕只有 50% 的准确率,它还是非常自信。
| 术语 | 解释 |
|---|---|
| AlphaCode | DeepMind 发布的早期编码 AI,通过大规模采样与聚类在 Codeforces 上取得 54.3% 平均排名 |
| AlphaCode 2 | 改进版,基于 Gemini Pro 微调,引入打分模型,仅用 100 样本就追平前作百万样本水平,最终达到 43% 解题率、85 百分位 |
| pass@k | 生成 k 个样本,只要其中任意一个通过隐藏测试即算成功,衡量搜索覆盖能力 |
| 10@k | 生成 k 个样本后,仅允许提交 10 个,必须先进行筛选与评分,衡量实战中的综合性能 |
| GOLD | 一种微调技巧,在下一 token 预测损失中对高似然 token 赋高权重、低似然 token 赋低权重,以提升精度 |
| Clustering(聚类) | 对采样得到的代码根据语义等价分组,确保提交的 10 个解覆盖不同解题思路,而非重复提交逻辑相同的解 |
| Scoring Model(打分模型) | AlphaCode 2 中学习的奖励模型,预测代码样本正确性的 0~1 评分,用于从簇内选出最佳候选 |
| Gemini Pro | Google 的大型语言模型,AlphaCode 2 将其作为微调的基座 |
| Search‑o1 | 在大型推理模型上构建的搜索智能体,允许推理中动态触发搜索并对文档进行提炼,大幅降低不确定性 |
| Reason‑in‑Documents(文档内推理) | Search‑o1 的关键模块,对取回的每份文档进行分析与信息抽取,只将相关内容注入推理链 |
| Agentic RAG | 让模型在推理生成中遇到不确定点时插入特殊 token 触发搜索工具,并自动纳入搜索结果,但仍缺乏文档提炼能力 |
| Multi‑Hop QA | 多跳问答,需要结合多份文档进行多层推理才能回答的问题,标准 RAG 极易在此场景饱和 |
| GPQA | 研究生级别问答基准,覆盖物理、化学、生物等学科难题,Search‑o1 在此数据集上与人类专家具备竞争力 |
| HotpotQA / 2Wiki / MusiQue / Bamboogle | 多跳问答 (Multi‑Hop QA) 基准数据集,Search‑o1 在这些数据集上取得了当时最优结果 |
| Codeforces | 在线竞技编程平台,AlphaCode 系列在此平台与人类选手实时竞赛以评估性能 |
| CodeContests | 竞技编程题目数据集,AlphaCode 用其训练和内部评估,V2 为高质量升级版 |
| Search‑R1 | 基于强化学习而非提示的智能搜索模型,能让模型学会何时以及如何搜索以增强推理 |