▶ 原文链接
CS329A: 自改善AI代理 - 从大语言模型到自主代理的演进
来源: YouTube | Akansha & Azalia Mirhoseini |
分类: 其他
原文发表:
纪要生成: 2026-08-05
全集重点
- 推理时扩展 (Inference Scaling) 是新前沿:不仅在训练时扩展模型参数,更在推理时通过多次采样、验证和自纠正,显著提升模型解决复杂问题的能力。
- 从单轮聊天到多步代理:AI正从简单的聊天机器人进化为能自主规划、使用工具、自我纠错并完成端到端任务的代理 (Agent)。
- 组合验证器与反馈循环:通过单元测试、LLM-as-Judge等方式构建有效验证器,并利用RLHF等反馈机制,是实现模型自我改善与任务可靠性的瓶颈和关键。
- 思维链从涌现到可训练:最初的链式思维 (Chain-of-Thought) 是模型规模扩大的涌现行为,而现在推理模型已能通过专门训练,主动生成包括分析、分解、回溯在内的深度思考过程。
- “猴子与莎士比亚”定理的启示:即使是一个较小的模型,若对其重复采样并进行筛选,其解决问题的能力也能超越单次采样的大模型,揭示了模型潜藏的广阔能力空间。
嘉宾/话题简介
本集为斯坦福大学课程 CS329A《自改善AI代理》 的首次讲座,由两位教授共同主讲。Akansha 是斯坦福大学兼职教授,同时也是初创公司 Reflection AI 的研究员,此前曾在 Google Brain 和 Google DeepMind 工作。Azalia Mirhoseini 是斯坦福大学计算机科学系的助理教授,曾参与 Claude (Anthropic) 和 Gemini (Google DeepMind) 等前沿模型的研究。本集主题是回顾大语言模型的发展趋势,并介绍课程将如何聚焦于模型如何在推理时及通过代理工作流实现自我改善。
分节详述
课程介绍与大语言模型缩放定律
本节重点
- 课程旨在探讨AI代理如何实现自我改善。
- 大语言模型的性能随参数、数据和计算量的增加而提升,遵循缩放定律。
- 模型规模呈指数级增长,从 Bert 的 3.4亿 参数发展到 GPT-4 的万亿级别参数。
详细精要
- 模型缩放的根本驱动力:自 GPT-3 以来,一个核心发现是语言模型的性能可以通过增加参数、训练数据和计算量这三个轴来可靠地提升。
- 增加计算量,模型在测试集上的损失函数会持续下降。
- 增加数据集大小,测试损失同样会进一步下降。
-
增加参数数量,例如在Transformer中增加层数,也能提升模型表现。
-
模型规模的指数级增长:从2018年到约2024年,模型尺寸几乎持续增长。
- Bert 110m 参数,GPT-2 1.5B 参数,GPT-3 175B 参数,PaLM 540B 参数。
-
GPT-4 被估计拥有数万亿 (trillions) 参数,展示了模型规模在“大”语言模型中的核心地位。
-
规模扩大带来的关键能力:
- 持续的性能提升:更大的模型在自然语言、推理等多种基准测试中表现更好。
- 少样本学习 (Few-shot Learning):模型无需针对特定领域微调,仅通过提示中的几个例子就能遵循模板进行推理,极大简化了原型开发。区别于零样本学习(只给任务描述),少样本学习同时提供任务描述和几个示例。
- 涌现行为 (Emergent Behavior):像推理这样复杂的能力,只有在模型规模足够大时才会突然出现,这在缩放定律中是不可预测的。
💬 精华片段(中文)
“随着模型变得更大,它们不仅在可预测的缩放定律下表现更好,还会出现一些我们从未预料到的新行为,直到我们构建了这些更大的模型并观察到了这些行为。”
"As the models become bigger, not only we have this predictive scaling laws property that we know how the loss function is going to go down... there are new behaviors that appear in the model that they didn't have before. And we never could predict that until we had these bigger models and saw this behavior in them."
迈向ChatGPT的关键创新:指令微调与RLHF
本节重点
- ChatGPT 的成功不仅是模型规模扩大的结果,还依赖于两项关键的后训练技术。
- 指令微调 使用高质量、多样化的指令-回答对来教模型遵循人类指令。
- RLHF 通过构建奖励模型来对齐人类在有用性、安全性等方面的偏好。
详细精要
-
超越缩放定律的创新:ChatGPT在2022年11月发布,仅用 5天 就获得 100万 用户,其成功飞跃依赖于指令微调 和从人类反馈中强化学习 (RLHF),这两项技术让其超越了类似GPT-3等仅靠预训练的模型。
-
对齐人类偏好的必要性:预训练模型只是从互联网数据中统计性地了解世界,它不理解“对错”,也不知道如何遵循指令。因此,需要引导AI模型遵循人类的目标、偏好和价值观,如今模型正变得在此方面更强大。
-
后训练流程的演进:
- 第一步:高质量数据上的继续预训练/微调:使用公司花费数百万乃至上亿美元购买的高质量数据(如书籍、创意文章)进行下一词元预测,使模型质量大幅提升。
- 第二步:指令微调:使用由人类生成、角色模板和合成数据混合而成的高质量数据集,格式为(指令,问题-答案)。例如,“请回答以下问题:氮的沸点是多少?”,然后给出答案。也可以是链式思维 (Chain-of-Thought) 微调,它展示推导过程。数据集的多样性与质量对最终模型影响巨大。经过此阶段,模型开始具备理解问题、按过程推导答案的能力。
- 第三步:基于人类偏好的RLHF:此步骤不同于创建监督标签,而是创建一个奖励模型。
- 公司花费巨资让人(普通人或专家)对模型生成的多个答案进行评分,评判哪个更正确、更有用、更无害。
- 用这些评分训练出一个奖励模型来模拟人类偏好。
- 然后用这个奖励模型来指导LLM的参数更新,使其生成趋向奖励模型认可的答案。
- 可以设计多种奖励类型(如正确性、有用性、特异性、无害性),并根据偏好进行加权。
💬 精华片段(中文)
“一个模型在预训练后,它看过了互联网、书籍等所有数据,但它不知道什么是对什么是错。它只是从统计上了解世界的状态,但并不真正'知道'事物,也不知道如何遵循指令。”
"When a model is pre-trained, it has no sense. It has seen all data on the internet, in the books, everywhere. But it has no sense of what is right and wrong... It just statistically knows about the state of the world, but it doesn't exactly know things or know how to follow instructions."
推理时扩展:释放模型的潜在能力
本节重点
- 近一年半以来,推理时扩展 (Inference Scaling) 成为提升模型能力的新前沿。
- 受“无限猴子定理”启发的《Large Language Monkeys》研究表明,通过重复采样和验证,小模型可超越单次采样的大模型。
- 推理时扩展的核心发现是:模型在一次生成中表现出的能力远低于其真实潜力。
详细精要
-
推理时扩展的新范式:通过扩展推理时的计算量,可以在不改变模型任何参数的情况下,大幅提升模型解决难题的能力。
-
《Large Language Monkeys》研究:该项目受“无限猴子定理”(让猴子无止境地打字,最终会写出莎士比亚著作)的启发。
- 方法:让LLM充当猴子,对同一个输入问题进行多次(最多10,000次)采样(并行生成),然后使用一个验证器(如单元测试)从众多结果中筛选出正确的答案作为最终输出。
-
关键变量:模型的输出具有统计方差(非确定性),可通过调整 温度 (Temperature) 参数来控制这种多样性。温度过高(如超过1.2)会导致输出乱码。
-
惊人的实验发现:
- 在数学、编程等基准测试中,GPT-4o 单次采样的准确率很高(图中红线)。
- 当对能力较弱的小模型(如 LLaMA 7B)增加采样次数到10,000时,其覆盖率(Coverage),即至少有一个样本能解决问题的比例,超越了 GPT-4o。
- 这证明模型“知道”的远比一次询问所展现的要多得多。有些难题在 10,000 个答案中可能只有 3、4个是正确的,验证了推理时扩展的重要性。
💬 精华片段(中文)
"模型似乎已经知道的东西,比你仅仅问它一次所能得到的要多得多。这就像是推理扩展的基础属性。"
"It kind of seems like the models already know a whole lot more than what you get out of them when you just ask them once... So this is the underlying property of inference scaling.”
推理模型与自改善循环
本节重点
- 推理模型 (如 DeepSeek、o1、Gemini Thinking) 将推理时扩展与训练结合,实现了自改善。
- 在推理时生成高质量合成数据,再反哺微调模型,形成自改善闭环。
- 推理模型展现出与人类似的问题分析、任务分解、自我评估和纠错能力。
详细精要
- 新的训练闭环:以DeepSeek 为代表(2024年12月发布),核心创新在于将推理时扩展和微调相结合。
- 过程:利用推理时扩展为数学、编程等问题生成海量高质量的推理路径(合成数据)。这些数据被用作新的训练集,用以微调模型,使其变得更强。
-
意义:这是模型实现自改善 (Self-improvement) 的激动人心的方向,因为推理时扩展是开放式的,可以持续生成更好的数据来训练模型。
-
推理模型的扩展定律:
- OpenAI o1 模型发布时展示了在 AIME(高难度数学基准)上的对数-线性扩展关系:随着测试时计算的增加(在对数坐标轴上),模型的 Pass@1 准确率稳步上升。
-
这与训练阶段的扩展定律类似,但完全发生在测试时,不改变模型参数。
-
推理模型的内在工作模式:
- 问题分析:在拿到问题后,首先分析关键组成部分,理解输入输出格式等。
- 任务分解:将复杂任务拆解为更简单的子任务,如解析输入、构建矩阵等。
- 自我评估与纠错:模型能在思考中途发现错误,并主动回溯修正(如:“等等,这里可能有问题,我需要修正一下。”)。
-
差异化优势:与GPT-4o相比,推理模型在数学、编程、数据分析等领域大幅领先,但在个人写作或文本编辑上不一定有优势。
-
关于推理能力来源的探讨:
- 推理能力最初(如链式思维)是涌现行为,但现在推理模型更多是通过专门的训练获得,训练数据中包含了分析、回溯等思考技能,使其成为“泛化的思考者”。
- 强化学习(RL)和预训练中的多样化数据都对能力提升有贡献,但目前学界对“为什么RL能带来如此大的性能跳跃”尚不完全理解。
- 一种解释框架是:预训练给予了模型在大量采样中产生正确答案的潜力,而带有验证器反馈的RL训练则提高了模型的 Pass@1 准确率,即一次就答对的能力。
💬 精华片段(中文)
"对于困难问题,就像人类会想得更多、花更多时间、或考虑多种不同策略一样,思考模型也是这么做的。它们可能会使用链式思维或其他技术来解决一个问题。"
"Now for difficult problems, just like humans, think a lot more, spend a lot more time, or consider many different strategies, thinking models do the same. And they may use a chain of thought or other techniques to just go about solving a problem."
从LLM到AI代理的范式转移
本节重点
- LLM作为聊天机器人是单轮交互,而 AI代理 (Agent) 能自主完成端到端的任务。
- 代理的核心特征是:有目标,能规划并采取行动,从环境获得反馈,并自我纠正直至完成目标。
- 编码代理 (如 Cloud Code) 和深度研究代理 (如 Deep Research) 是当前代理工作流的标杆。
详细精要
-
从聊天到行动:当前LLM的性能飞跃主要体现在聊天格式或单次推理。而AI代理(如 Cloud Code, Deep Research)能够执行代理工作流 (Agentic Workflows),端到端地完成现实世界任务,例如:为一个在斯坦福上课的人调研全年的租房方案,分析众多网站并给出综合报告。
-
代理的核心架构:
- 明确目标:用户给定一个最终要达成的任务。
- 自主规划与行动:模型会计划一系列步骤与外部环境(工具、数据库、网络等)互动。
- 反馈与纠错:根据环境或验证器的反馈,持续纠正自身行动。
- 拥有记忆:需要某种形式的记忆来追踪正在完成的任务。
-
终止判断:最终成功达成目标,或主动告知无法完成。
-
代理工作流的抽象模式(从简单到复杂):
- 提示链 (Prompt Chaining):将一个任务分解为多个子任务,按顺序调用LLM完成。
- 路由 (Routing):根据输入任务的复杂度,将其导向不同的工作流(简单或复杂)。
- 并行化 (Parallelization):像深度研究那样,多个LLM调用同时处理不同子主题,最后聚合。
- 编排器 (Orchestrator):一个中央LLM充当“管理者”,进行规划,并动态调用其他LLM或工具。
-
评估器/验证器 (Evaluator / Verifier):使用LLM-as-Judge 评估输出,或用单元测试(如在代码领域)进行客观验证,形成反馈信号。
-
编码代理的可靠性演进:
- 过去,让代理自主与终端交互、浏览仓库、编辑文件、执行命令、根据输出自行修改的闭环系统并不可靠。
- 如今,其可靠性显著提升。关键在于更强大的模型和更好的RL,特别是结合可验证奖励的RL训练。
-
模型变强后,自改善循环 启动:模型能自己生成单元测试,并用其验证自己生成的代码,从而创建一个可靠的自我改进数据飞轮。
-
代理需要的关键能力:
- 用户意图澄清:代理需要主动提问以明确模糊的用户指令。
- 多步推理与规划:复杂任务要求模型具备强大的推理和计划能力。
-
自我修正:在犯错时能识别错误并回溯。
-
代理的广泛应用:
- 编码:代码迁移、版本升级、代码库重构、数据工程任务等。
- 客户支持:实时转录、知识助手、智能回复、通话摘要,实现体验的飞跃。
- 深度研究:自动进行文献综述、总结、综合,生成完整报告。
- AI科学家:辅助产生跨领域的创新想法、迭代实验、撰写论文,因其接触过海量网络信息,有时能提出跳出常规思维框架的点子。
💬 精华片段(中文)
"拥有一个目标概念,然后朝着这个目标采取行动、获得反馈,最后决定何时停止——这正是让代理区别于我们之前所做的聊天机器人类型的东西。"
"This notion of having some notion of a goal, taking actions towards that goal, getting the feedback, and then deciding when to stop, that's what makes agents different from the chatbot types of what we were doing before."
课程后勤与要求
本节重点
- 课程通过三次作业和一个研究项目考察学生对自改善AI代理的理解。
- 项目鼓励提出假设、设计实验并改进现有系统,而非仅开发应用。
- 成绩由 50% 的作业 和 50% 的项目 组成。
详细精要
- 课程主题:涵盖后训练演进、多模态代理、机器人技术等,并会有来自前沿AI实验室的嘉宾讲座。
- 课程项目要求:
- 可接受的项目类型:创建新的评估基准/数据集;分析现有代理系统的可靠性;针对特定基准进行改进实验;复现、改进或质疑论文中的方法,形成自己的研究假设和结论。
- 不可接受的项目类型:纯调研报告、单纯的应用程序开发。
- 目标:必须具备一个研究假设和待回答的问题,并通过实验验证。往届已有同学将项目成果发表在学术会议上。
- 团队:2至4人一组(可单人),提供API积分。项目有提案、中期报告、最终报告和海报展示四个里程碑。
- 评分与政策:
- 评分:三次作业占50%,项目占50%。
- 平台:课程网站获取资料,Canvas 获取通知,Ed 用于公开提问,Gradescope 用于提交。
- 迟交:有固定的迟到天数额度,因人数众多,无例外。
专业术语注释
| 术语 |
解释 |
| 缩放定律 (Scaling Laws) |
一个经验法则,指随着模型参数数量、训练数据或计算量的增加,模型性能(如测试损失)会可预测地提升。 |
| 涌现行为 (Emergent Behavior) |
模型能力(如推理)在尺寸较小时不存在,但当模型参数规模跨越某个阈值时突然显著出现的行为。 |
| 少样本学习 (Few-shot Learning) |
模型仅通过在提示中给出任务描述和几个示例,就能在没有专门训练的情况下完成该任务。 |
| 零样本学习 (Zero-shot Learning) |
模型仅通过任务描述,不依赖任何示例就能完成任务的能力。 |
| 链式思维 (Chain-of-Thought, CoT) |
一种提示技术,在给出最终答案前,引导模型生成一系列中间的推理步骤,从而显著提高复杂推理任务的准确性。 |
| 指令微调 (Instruction Tuning) |
在(指令,回答)对的高质量数据集上微调语言模型,使其能够更好地理解和遵循人类指令。 |
| 从人类反馈中强化学习 (RLHF) |
一种训练方法,首先用人类对模型输出的评分训练一个奖励模型,然后用强化学习算法优化语言模型,使其输出获得奖励模型高分,从而对齐人类偏好。 |
| 奖励模型 (Reward Model) |
RLHF中的核心组件,一个被训练来预测人类对模型输出偏好的模型,用于给LLM的生成结果打分。 |
| 推理时扩展 (Inference Scaling) |
在模型参数固定的情况下,通过在推理时增加计算量(如多次采样、深度搜索)来提升解决难题性能的技术。 |
| 无限猴子定理 (Infinite Monkey Theorem) |
一个思想实验,指如果让一只猴子随机打字无限长时间,它最终能碰巧打出任何给定文本(如莎士比亚全集)。在AI语境下,用以比喻对模型进行大量随机采样。 |
| 验证器 (Verifier) |
一个用于判断模型生成结果是否正确的外部系统或模块,例如代码领域中的单元测试或数学题的答案检查。 |
| 覆盖率 (Coverage) |
在多次采样中,衡量至少有一次采样能产生正确结果的指标。反映了模型潜力的上限。 |
| Pass@1 |
模型在第一次生成就给出正确答案的概率。这是衡量模型直接输出质量的标准指标。 |
| 生成器-验证器差距 (Generator-Verifier Gap) |
指模型(生成器)能够产生正确结果的能力,与拥有一个可靠机制去识别出那个正确结果(验证器)之间的鸿沟。这是AI代理可靠性的核心瓶颈。 |
| AI代理 (AI Agent) |
一个能感知其环境、推理目标、自主规划并执行一系列行动,并从反馈中学习或自我纠正,以完成端到端任务的智能系统。 |
| 温度 (Temperature) |
一个控制语言模型输出随机性的参数。温度越低,输出越确定和保守;温度越高,输出越多样化和有创造性,但过高会导致乱码。 |
延伸思考
- 验证器的瓶颈问题:课程反复强调,在可验证领域(如代码)模型进步神速,但在开放性写作等缺乏有效客观验证器的领域,依赖人类反馈(成本高、速度慢)或LLM-as-Judge(有偏见)的进步是否会遇到天花板?如何构建更通用、鲁棒的验证器是迈向通用代理的关键一步。
- “涌现”与“训练”的界限:模型的分析、回溯等能力究竟是纯粹规模扩大的涌现,还是通过精心设计的训练数据注入的?随着我们主动“寻找”并强化这些能力,我们是否在模糊两者界限,这会影响我们对AI能力本质的理解。
- 成本与性能的权衡:推理时扩展在显著提升能力的同时,带来了巨大的推理成本。对于不同的任务难度和类型,是否存在一个最优的算力分配策略(即时计算 vs. 延迟),能将推理时扩展变得更加实用和经济?
- 自改善的闭环风险:代理通过在其自己生成的合成数据上进行训练来实现自我改善。这种“左脚踩右脚”的模式,一旦基础模型或验证器存在未被发现的偏差或缺陷,是否会导致错误的自我强化和被放大,最终使模型崩溃或偏离用户意图?
- 代理的长期任务规划:课程中展示的搜索、编码代理大多处理的是相对短期或结构化的任务。对于需要长时间、多阶段决策和计划,且反馈信号稀疏的复杂任务(例如运营一家公司一个月),当前的代理架构在记忆和计划方面还存在哪些根本性的不足?
原文发表:**纪要生成:** 2026-08-05 · 纪要生成:2026-08-05