▶ 原文链接

CS329A: 自改善AI代理 - 从大语言模型到自主代理的演进

来源: YouTube | Akansha & Azalia Mirhoseini | 分类: 其他 原文发表: 纪要生成: 2026-08-05


全集重点


嘉宾/话题简介

本集为斯坦福大学课程 CS329A《自改善AI代理》 的首次讲座,由两位教授共同主讲。Akansha 是斯坦福大学兼职教授,同时也是初创公司 Reflection AI 的研究员,此前曾在 Google BrainGoogle DeepMind 工作。Azalia Mirhoseini 是斯坦福大学计算机科学系的助理教授,曾参与 Claude (Anthropic) 和 Gemini (Google DeepMind) 等前沿模型的研究。本集主题是回顾大语言模型的发展趋势,并介绍课程将如何聚焦于模型如何在推理时及通过代理工作流实现自我改善。


分节详述

课程介绍与大语言模型缩放定律

本节重点

详细精要

💬 精华片段(中文)

“随着模型变得更大,它们不仅在可预测的缩放定律下表现更好,还会出现一些我们从未预料到的新行为,直到我们构建了这些更大的模型并观察到了这些行为。”

"As the models become bigger, not only we have this predictive scaling laws property that we know how the loss function is going to go down... there are new behaviors that appear in the model that they didn't have before. And we never could predict that until we had these bigger models and saw this behavior in them."

迈向ChatGPT的关键创新:指令微调与RLHF

本节重点

详细精要

💬 精华片段(中文)

“一个模型在预训练后,它看过了互联网、书籍等所有数据,但它不知道什么是对什么是错。它只是从统计上了解世界的状态,但并不真正'知道'事物,也不知道如何遵循指令。”

"When a model is pre-trained, it has no sense. It has seen all data on the internet, in the books, everywhere. But it has no sense of what is right and wrong... It just statistically knows about the state of the world, but it doesn't exactly know things or know how to follow instructions."

推理时扩展:释放模型的潜在能力

本节重点

详细精要

💬 精华片段(中文)

"模型似乎已经知道的东西,比你仅仅问它一次所能得到的要多得多。这就像是推理扩展的基础属性。"

"It kind of seems like the models already know a whole lot more than what you get out of them when you just ask them once... So this is the underlying property of inference scaling.”

推理模型与自改善循环

本节重点

详细精要

💬 精华片段(中文)

"对于困难问题,就像人类会想得更多、花更多时间、或考虑多种不同策略一样,思考模型也是这么做的。它们可能会使用链式思维或其他技术来解决一个问题。"

"Now for difficult problems, just like humans, think a lot more, spend a lot more time, or consider many different strategies, thinking models do the same. And they may use a chain of thought or other techniques to just go about solving a problem."

从LLM到AI代理的范式转移

本节重点

详细精要

💬 精华片段(中文)

"拥有一个目标概念,然后朝着这个目标采取行动、获得反馈,最后决定何时停止——这正是让代理区别于我们之前所做的聊天机器人类型的东西。"

"This notion of having some notion of a goal, taking actions towards that goal, getting the feedback, and then deciding when to stop, that's what makes agents different from the chatbot types of what we were doing before."

课程后勤与要求

本节重点

详细精要


专业术语注释

术语 解释
缩放定律 (Scaling Laws) 一个经验法则,指随着模型参数数量、训练数据或计算量的增加,模型性能(如测试损失)会可预测地提升。
涌现行为 (Emergent Behavior) 模型能力(如推理)在尺寸较小时不存在,但当模型参数规模跨越某个阈值时突然显著出现的行为。
少样本学习 (Few-shot Learning) 模型仅通过在提示中给出任务描述和几个示例,就能在没有专门训练的情况下完成该任务。
零样本学习 (Zero-shot Learning) 模型仅通过任务描述,不依赖任何示例就能完成任务的能力。
链式思维 (Chain-of-Thought, CoT) 一种提示技术,在给出最终答案前,引导模型生成一系列中间的推理步骤,从而显著提高复杂推理任务的准确性。
指令微调 (Instruction Tuning) 在(指令,回答)对的高质量数据集上微调语言模型,使其能够更好地理解和遵循人类指令。
从人类反馈中强化学习 (RLHF) 一种训练方法,首先用人类对模型输出的评分训练一个奖励模型,然后用强化学习算法优化语言模型,使其输出获得奖励模型高分,从而对齐人类偏好。
奖励模型 (Reward Model) RLHF中的核心组件,一个被训练来预测人类对模型输出偏好的模型,用于给LLM的生成结果打分。
推理时扩展 (Inference Scaling) 在模型参数固定的情况下,通过在推理时增加计算量(如多次采样、深度搜索)来提升解决难题性能的技术。
无限猴子定理 (Infinite Monkey Theorem) 一个思想实验,指如果让一只猴子随机打字无限长时间,它最终能碰巧打出任何给定文本(如莎士比亚全集)。在AI语境下,用以比喻对模型进行大量随机采样。
验证器 (Verifier) 一个用于判断模型生成结果是否正确的外部系统或模块,例如代码领域中的单元测试或数学题的答案检查。
覆盖率 (Coverage) 在多次采样中,衡量至少有一次采样能产生正确结果的指标。反映了模型潜力的上限。
Pass@1 模型在第一次生成就给出正确答案的概率。这是衡量模型直接输出质量的标准指标。
生成器-验证器差距 (Generator-Verifier Gap) 指模型(生成器)能够产生正确结果的能力,与拥有一个可靠机制去识别出那个正确结果(验证器)之间的鸿沟。这是AI代理可靠性的核心瓶颈。
AI代理 (AI Agent) 一个能感知其环境、推理目标、自主规划并执行一系列行动,并从反馈中学习或自我纠正,以完成端到端任务的智能系统。
温度 (Temperature) 一个控制语言模型输出随机性的参数。温度越低,输出越确定和保守;温度越高,输出越多样化和有创造性,但过高会导致乱码。

延伸思考

  1. 验证器的瓶颈问题:课程反复强调,在可验证领域(如代码)模型进步神速,但在开放性写作等缺乏有效客观验证器的领域,依赖人类反馈(成本高、速度慢)或LLM-as-Judge(有偏见)的进步是否会遇到天花板?如何构建更通用、鲁棒的验证器是迈向通用代理的关键一步。
  2. “涌现”与“训练”的界限:模型的分析、回溯等能力究竟是纯粹规模扩大的涌现,还是通过精心设计的训练数据注入的?随着我们主动“寻找”并强化这些能力,我们是否在模糊两者界限,这会影响我们对AI能力本质的理解。
  3. 成本与性能的权衡:推理时扩展在显著提升能力的同时,带来了巨大的推理成本。对于不同的任务难度和类型,是否存在一个最优的算力分配策略(即时计算 vs. 延迟),能将推理时扩展变得更加实用和经济?
  4. 自改善的闭环风险:代理通过在其自己生成的合成数据上进行训练来实现自我改善。这种“左脚踩右脚”的模式,一旦基础模型或验证器存在未被发现的偏差或缺陷,是否会导致错误的自我强化和被放大,最终使模型崩溃或偏离用户意图?
  5. 代理的长期任务规划:课程中展示的搜索、编码代理大多处理的是相对短期或结构化的任务。对于需要长时间、多阶段决策和计划,且反馈信号稀疏的复杂任务(例如运营一家公司一个月),当前的代理架构在记忆和计划方面还存在哪些根本性的不足?

原文发表:**纪要生成:** 2026-08-05  ·  纪要生成:2026-08-05