来源: Stanford Online | CS329A Self-Improving AI Agents | 2026-08-03 播客: Stanford Online 分类: AI 研究 原文发表: 2026-08-03 纪要生成: 2026-08-05
本集为斯坦福大学课程 CS329A《自改善AI代理》 的首次讲座,由两位教授共同主讲。Akansha 是斯坦福大学兼职教授,同时也是初创公司 Reflection AI 的研究员,此前曾在 Google Brain 和 Google DeepMind 工作。Azalia Mirhoseini 是斯坦福大学计算机科学系的助理教授,曾参与 Claude (Anthropic) 和 Gemini (Google DeepMind) 等前沿模型的研究。本集主题是回顾大语言模型的发展趋势,并介绍课程将如何聚焦于模型如何在推理时及通过代理工作流实现自我改善。
本节重点
详细精要
增加参数数量,例如在Transformer中增加层数,也能提升模型表现。
模型规模的指数级增长:从2018年到约2024年,模型尺寸几乎持续增长。
GPT-4 被估计拥有数万亿 (trillions) 参数,展示了模型规模在“大”语言模型中的核心地位。
规模扩大带来的关键能力:
💬 精华片段(中文)
“随着模型变得更大,它们不仅在可预测的缩放定律下表现更好,还会出现一些我们从未预料到的新行为,直到我们构建了这些更大的模型并观察到了这些行为。”
"As the models become bigger, not only we have this predictive scaling laws property that we know how the loss function is going to go down... there are new behaviors that appear in the model that they didn't have before. And we never could predict that until we had these bigger models and saw this behavior in them."
本节重点
详细精要
超越缩放定律的创新:ChatGPT在2022年11月发布,仅用 5天 就获得 100万 用户,其成功飞跃依赖于指令微调 和从人类反馈中强化学习 (RLHF),这两项技术让其超越了类似GPT-3等仅靠预训练的模型。
对齐人类偏好的必要性:预训练模型只是从互联网数据中统计性地了解世界,它不理解“对错”,也不知道如何遵循指令。因此,需要引导AI模型遵循人类的目标、偏好和价值观,如今模型正变得在此方面更强大。
后训练流程的演进:
💬 精华片段(中文)
“一个模型在预训练后,它看过了互联网、书籍等所有数据,但它不知道什么是对什么是错。它只是从统计上了解世界的状态,但并不真正'知道'事物,也不知道如何遵循指令。”
"When a model is pre-trained, it has no sense. It has seen all data on the internet, in the books, everywhere. But it has no sense of what is right and wrong... It just statistically knows about the state of the world, but it doesn't exactly know things or know how to follow instructions."
本节重点
详细精要
推理时扩展的新范式:通过扩展推理时的计算量,可以在不改变模型任何参数的情况下,大幅提升模型解决难题的能力。
《Large Language Monkeys》研究:该项目受“无限猴子定理”(让猴子无止境地打字,最终会写出莎士比亚著作)的启发。
关键变量:模型的输出具有统计方差(非确定性),可通过调整 温度 (Temperature) 参数来控制这种多样性。温度过高(如超过1.2)会导致输出乱码。
惊人的实验发现:
💬 精华片段(中文)
"模型似乎已经知道的东西,比你仅仅问它一次所能得到的要多得多。这就像是推理扩展的基础属性。"
"It kind of seems like the models already know a whole lot more than what you get out of them when you just ask them once... So this is the underlying property of inference scaling.”
本节重点
详细精要
意义:这是模型实现自改善 (Self-improvement) 的激动人心的方向,因为推理时扩展是开放式的,可以持续生成更好的数据来训练模型。
推理模型的扩展定律:
这与训练阶段的扩展定律类似,但完全发生在测试时,不改变模型参数。
推理模型的内在工作模式:
差异化优势:与GPT-4o相比,推理模型在数学、编程、数据分析等领域大幅领先,但在个人写作或文本编辑上不一定有优势。
关于推理能力来源的探讨:
💬 精华片段(中文)
"对于困难问题,就像人类会想得更多、花更多时间、或考虑多种不同策略一样,思考模型也是这么做的。它们可能会使用链式思维或其他技术来解决一个问题。"
"Now for difficult problems, just like humans, think a lot more, spend a lot more time, or consider many different strategies, thinking models do the same. And they may use a chain of thought or other techniques to just go about solving a problem."
本节重点
详细精要
从聊天到行动:当前LLM的性能飞跃主要体现在聊天格式或单次推理。而AI代理(如 Cloud Code, Deep Research)能够执行代理工作流 (Agentic Workflows),端到端地完成现实世界任务,例如:为一个在斯坦福上课的人调研全年的租房方案,分析众多网站并给出综合报告。
代理的核心架构:
终止判断:最终成功达成目标,或主动告知无法完成。
代理工作流的抽象模式(从简单到复杂):
评估器/验证器 (Evaluator / Verifier):使用LLM-as-Judge 评估输出,或用单元测试(如在代码领域)进行客观验证,形成反馈信号。
编码代理的可靠性演进:
模型变强后,自改善循环 启动:模型能自己生成单元测试,并用其验证自己生成的代码,从而创建一个可靠的自我改进数据飞轮。
代理需要的关键能力:
自我修正:在犯错时能识别错误并回溯。
代理的广泛应用:
💬 精华片段(中文)
"拥有一个目标概念,然后朝着这个目标采取行动、获得反馈,最后决定何时停止——这正是让代理区别于我们之前所做的聊天机器人类型的东西。"
"This notion of having some notion of a goal, taking actions towards that goal, getting the feedback, and then deciding when to stop, that's what makes agents different from the chatbot types of what we were doing before."
本节重点
详细精要
| 术语 | 解释 |
|---|---|
| 缩放定律 (Scaling Laws) | 一个经验法则,指随着模型参数数量、训练数据或计算量的增加,模型性能(如测试损失)会可预测地提升。 |
| 涌现行为 (Emergent Behavior) | 模型能力(如推理)在尺寸较小时不存在,但当模型参数规模跨越某个阈值时突然显著出现的行为。 |
| 少样本学习 (Few-shot Learning) | 模型仅通过在提示中给出任务描述和几个示例,就能在没有专门训练的情况下完成该任务。 |
| 零样本学习 (Zero-shot Learning) | 模型仅通过任务描述,不依赖任何示例就能完成任务的能力。 |
| 链式思维 (Chain-of-Thought, CoT) | 一种提示技术,在给出最终答案前,引导模型生成一系列中间的推理步骤,从而显著提高复杂推理任务的准确性。 |
| 指令微调 (Instruction Tuning) | 在(指令,回答)对的高质量数据集上微调语言模型,使其能够更好地理解和遵循人类指令。 |
| 从人类反馈中强化学习 (RLHF) | 一种训练方法,首先用人类对模型输出的评分训练一个奖励模型,然后用强化学习算法优化语言模型,使其输出获得奖励模型高分,从而对齐人类偏好。 |
| 奖励模型 (Reward Model) | RLHF中的核心组件,一个被训练来预测人类对模型输出偏好的模型,用于给LLM的生成结果打分。 |
| 推理时扩展 (Inference Scaling) | 在模型参数固定的情况下,通过在推理时增加计算量(如多次采样、深度搜索)来提升解决难题性能的技术。 |
| 无限猴子定理 (Infinite Monkey Theorem) | 一个思想实验,指如果让一只猴子随机打字无限长时间,它最终能碰巧打出任何给定文本(如莎士比亚全集)。在AI语境下,用以比喻对模型进行大量随机采样。 |
| 验证器 (Verifier) | 一个用于判断模型生成结果是否正确的外部系统或模块,例如代码领域中的单元测试或数学题的答案检查。 |
| 覆盖率 (Coverage) | 在多次采样中,衡量至少有一次采样能产生正确结果的指标。反映了模型潜力的上限。 |
| Pass@1 | 模型在第一次生成就给出正确答案的概率。这是衡量模型直接输出质量的标准指标。 |
| 生成器-验证器差距 (Generator-Verifier Gap) | 指模型(生成器)能够产生正确结果的能力,与拥有一个可靠机制去识别出那个正确结果(验证器)之间的鸿沟。这是AI代理可靠性的核心瓶颈。 |
| AI代理 (AI Agent) | 一个能感知其环境、推理目标、自主规划并执行一系列行动,并从反馈中学习或自我纠正,以完成端到端任务的智能系统。 |
| 温度 (Temperature) | 一个控制语言模型输出随机性的参数。温度越低,输出越确定和保守;温度越高,输出越多样化和有创造性,但过高会导致乱码。 |