▶ 原文链接
自我改进智能体的未来研究方向
来源: YouTube | Akanksha & Azalea | 无发布日期
分类: 其他
原文发表: 未知
纪要生成: 2026-08-05
全集重点
- 多样性推理链:对于自我改进循环至关重要,多智能体微调等多样化推理链生成技术,可突破单一模型数据多样性不足的瓶颈,实现持续的性能提升。
- 自动化元验证:验证是自我改进的核心瓶颈,DeepSeekMath-V2 提出的元验证器能自动识别推理链中的问题,实现自我验证循环,是突破瓶颈的关键方向。
- 突破数据壁垒:让模型自主提出并解决处于能力边缘的任务(如自玩式课程学习),是摆脱对人类专家数据依赖、驱动自我改进循环的重要路径。
- 智能效率革命:由于推理需求爆炸式增长,未来趋势是通过“智能每瓦”(IPW)等指标驱动,将大量推理从云端转移到由本地模型服务的边缘设备上。
- 持续学习与系统优化:未来的关键挑战包括实现模型权重的持续在线学习,以及为高吞吐、低延迟的测试时扩展构建专门优化的系统基础设施。
嘉宾/话题简介
本集是课程《自我改进智能体》的最后一讲,由两位讲师共同完成。前半部分系统性地回顾了课程核心内容,并深入探讨了推动自我改进循环的三个前沿研究方向:多智能体微调与推理多样性、自动化元验证技术,以及基于自玩式课程学习的数据瓶颈突破。后半部分则聚焦于智能的效率层面,提出了“智能每瓦”这一新颖的评估指标,并基于大规模数据分析,论证了未来AI推理工作负载将从云端向本地设备转移的趋势,指出了系统优化和持续学习等未来研究的重点方向。
分节详述
00:05 课程回顾与自我改进智能体的核心概念
本节重点
- 本季课程覆盖了从测试时扩展和训练时扩展到智能体工作流的关键技术。
- 自我改进智能体是一个通过与环境交互、收集反馈来修正行为、实现目标的通用系统。
- 当前的智能体工作流需要编排大语言模型(LLM)、验证器、工具调用和搜索算法等组件。
详细精要
- 课程内容系统回顾:课程的初始部分重点探讨了测试时扩展和训练时扩展。
- 这些技术依赖验证器和奖励驱动的基本循环,并结合强化学习和搜索算法来提升模型在数学和编程等领域的性能。
-
随后讨论了开放式(Open-endedness)和进化策略,如在AlphaEvolve等技术中,模型不仅追求奖励,还能在可定义的空间中进行探索,而不仅仅是驱动自我改进循环。
-
智能体工作流的构建:随着任务复杂度的提升,需要构建端到端的智能体工作流。
- 工作流涉及工具使用,使模型能与环境和工具交互,驱动任务完成。
- 为完成多步骤任务,模型需要具备访问知识库的能力,这引入了检索和内存的需求。
-
这要求模型具备更好的规划和多步推理能力。课程中还邀请了客座讲师,讨论了后训练、多模态智能体、机器人技术和推理等话题。
-
自我改进智能体的定义与推广:课程名为“自我改进智能体”,其核心是 智能体 这一概念,而非仅限于LLM。
- 智能体是 LLM 的泛化,它拥有一个目标,能主动与环境交互,收集反馈,并利用反馈来修正其步骤。
- 它们是能够引导自身进程、使用工具并最终达成目标的系统。在当前范式下,仅靠LLM本身往往不足以驱动实现完整目标,因此需要人工编排LLM和工具构成工作流。
- 在某些场景(如编程智能体)中,部分智能体工作流已能自我驱动。构建这些工作流时,通常需要编排LLM、验证器(如LLM-as-a-judge)、工具调用和搜索算法(如并行LLM调用),并要求模型具备规划、多步推理和自我纠正的能力。
💬 精华片段(中文)
“So it's basically systems that can direct their own processes, use tools, and then accomplish a goal.”
“所以它们基本上是能够引导自身进程、使用工具并最终达成目标的系统。”
04:22 自我改进循环的三大前沿方向:多样性、验证与数据
本节重点
- 推理链的多样性是打破自我改进循环性能停滞的关键。
- 鲁棒的验证技术,特别是对推理过程的元验证,是另一个核心瓶颈。
- 突破数据壁垒,让模型自主选择训练数据,是实现持续自我改进的第三个重要方向。
详细精要
- 方向一:推理链的多样性问题:现有的测试时扩展和训练时扩展常局限于数学、编程等狭隘领域。
- 一个重要的研究领域是如何让推理链足够多样化,以实现跨领域的泛化,并持续驱动自我改进循环。
- 目前,预训练阶段的互联网数据非常多样化,这是其性能优势的来源之一。而在指令微调时,产生的合成数据若仅由单一LLM生成,即使温度很高,其输出的多样性也会不足,导致迭代几次后性能提升停滞。
-
一个直观的解决方案是使用多个专门的智能体来提升多样性,这正是第一部分要讨论的论文的核心思想。
-
方向二:构建鲁棒的验证技术:验证是构建自我改进循环的一个关键环节。
- 如何拥有鲁棒的验证技术或能够审查推理链的元验证技术,是极具价值的研究方向。
-
这引出了第二部分论文的核心思想,即构建自动化自我验证循环。
-
方向三:打破数据选择壁垒:在训练时扩展中,进入训练流程的提示(prompts)通常是由人类静态选择的。
- 随着模型能力超越人类,找到足够多的专家来创建任务将成为一个限制因素。
- 关键问题是如何打破数据壁垒,让自我改进循环能够自主选择驱动其前进的正确数据。第三部分论文将探讨如何让模型自己提出并解决任务。
💬 精华片段(中文)
“So how do you break through the data barriers so that the self-improvement loop can pick the right set of data that drives that loop?”
“那么,如何打破数据壁垒,让自我改进循环能够选择驱动这个循环的正确数据呢?”
06:26 方向一:多智能体微调与多样化推理链
本节重点
- 多智能体微调通过引入多个专门的智能体(生成智能体和评判智能体)来生成和筛选多样的推理链,打破单一模型的数据多样性瓶颈。
- 此方法通过在所有生成智能体的响应间进行总结和评判,内在地实现了多数表决,提升了生成质量。
- 实验表明,该方法不仅在训练域内,在相邻域也能持续提升模型性能并保持响应的多样性。
详细精要
- 单一模型微调的瓶颈:传统迭代微调使用拒绝抽样(即只微调正确的解答),但单一LLM生成的解答会趋于雷同,导致性能提升在几轮迭代后停滞。
- 根本原因在于缺乏多样性。预训练数据因来源广泛而具有多样性,而单一LLM即便在高温下也难以生成足够多样的输出。
-
直观的解决方案是使用多个以某种方式专门化的智能体来提升多样性。
-
多智能体微调的工作流程:该方法训练两类专门化的智能体:生成智能体和评判智能体。
- 生成智能体负责生成多样化的初始解答。在后续的多轮辩论中,每个生成智能体会在下一轮生成前,总结所有其他智能体的响应并纳入自己的生成过程。
- 评判智能体负责评估和精炼整个更新后的答案集,而非单一智能体的回答。
- 训练过程:生成模型基于同一基座模型进行微调,通过筛选与多数表决结果匹配的输出进行有监督微调(SFT)。评判模型则通过在正确变正确的轨迹上进行训练,来学习对比正确和错误的答案。
-
这种方法在生成阶段和评判阶段都引入了多样性,并将多数表决内建到了工作流中。
-
实验结果与洞察:该技术在多个开源模型上进行了验证。
- 结果显示,多智能体微调能够在多轮微调迭代中持续提升模型性能,而单一智能体微调的准确性则会饱和甚至崩溃。
- 在衡量多样性的指标(嵌入不相似度)上,多智能体方法在整个过程中始终保持较高的多样性。
- 该技术的泛化能力也得到证实:在相邻域(如GSM 8k)上,经过多智能体微调的模型同样表现出更高的性能。
💬 精华片段(中文)
“What that roughly says is that if you want self-improvement, the reasoning chains that are provided to the model to drive those need to be diverse in some way.”
“这大致说明,如果你想实现自我改进,提供给模型以驱动这一过程的推理链,就需要以某种方式足够多样化。”
14:50 方向二:自动化元验证与 DeepSeekMath-V2
本节重点
- 现有强化学习方法只校验最终结果,而复杂的推理(如定理证明)需要校验中间步骤,但过程的过程奖励模型构建困难。
- DeepSeekMath-V2 提出了 元验证器 的概念,该验证器能审查另一个 LLM-as-a-judge 验证器的分析是否可靠。
- 通过 生成器-验证器-元验证器 三者的迭代训练,系统实现了自动化的自我验证循环,并在竞赛级数学难题上取得了显著的性能提升。
详细精要
- 过程验证的挑战:当前基于结果的奖励模型虽然推动了基准测试饱和,但在定理证明等领域,正确的答案可能伴随错误的推理。
- LLM常生成数学上无效的证明,且传统的 LLM-as-a-judge 技术无法有效识别这些错误。
-
然而,人类专家能够通过检查步骤之间的逻辑瑕疵和推理鸿沟来发现问题。
-
DeepSeekMath-V2 的元验证方案:该方案旨在训练模型自动化地完成上述专家验证工作。
- 系统架构:构建了一个 生成器、一个 验证器 和一个 元验证器 的三方循环。
- 生成器 创作证明。
- 验证器(作为LLM-as-a-judge)识别证明中的问题,并给出0.5到1的分数。
- 元验证器 则审查验证器的分析,判断其发现的问题是否真实存在,以及评分是否与问题相符。
-
训练与迭代:首先由人类专家标注数据来训练这个审核体系。一旦元验证器和验证器达到一定能力,就能自动化地标注和发现新证明中的问题。这种 生成器-验证器-元验证器 的互相驱动形成了一个强大的自我改进循环。
-
实验结果与洞察:该技术基于 DeepSeek-V3 基座模型,在TRPO上构建了强化学习循环。
- 在 IMO 和 CNML 问题上,仅通过验证生成循环的迭代优化,证明分数在8次迭代中持续攀升。
- 使用 best-of-32 策略时,该开源方案在 2024 IMO Shortlist 上获得了 42% 的证明分数。
- 这表明,若能识别推理链中的问题并引导模型纠正,是一种极有前景的“攀登”技术。自我验证成功突破了验证瓶颈,使生成器能学会区分高低质量的证明,并最大化质量。
💬 精华片段(中文)
“So this notion of meta-verification is generally quite interesting in that verifiers can get correct score when the reasoning chains are incorrect.”
“因此,元验证的概念通常非常有趣,因为它解决了当推理链错误时,验证器却可能给出正确分数的难题。”
23:23 方向三:自玩式任务提案与数据自主性
本节重点
- 提出了一种极端的范式:让模型自己提出并解决任务,从而完全摆脱对人类生成提示数据的依赖。
- 任务提案器基于演绎、溯因、归纳三种编程范式生成任务,并通过难度奖励和有效性检查来筛选任务。
- 这种方法形成了自驱动的课程学习,模型在自生成的编程任务上不断攀登,最终达到了最先进的编程基准测试分数。
详细精要
- 问题阐述:当前AI训练栈中,有监督学习阶段依赖人工整理的推理轨迹,强化学习阶段依赖专家整理的问答对。
- 随着模型越来越聪明,能否找到相应级别的专家来创建任务(如 IMO 或高难度编程问题)将成为限制因素。
-
提出的解决方案是让一个单一的模型同时充当任务提案器和求解器,实现数据极端自主。
-
自玩式任务提案与求解机制:该方法专注于编程领域,定义了三种任务类型。
- 任务类型:
- 演绎:给定程序与输入,让环境执行以获得输出。
- 溯因与演绎类似。
- 归纳:采样现有程序,为其生成新输入和自然语言描述。
- 任务选择与奖励:提案器根据任务难度获得奖励,奖励函数为
1 - 平均成功率。这确保模型选择的是难度适中(即不可能太简单,也不可太难)的任务,以实现最佳学习效果。
-
任务验证与管理:通过运行程序检查完整性、安全性和确定性来验证任务有效性。所有通过验证的任务被存入任务缓冲池,提案器可从中采样,并结合模型成功/失败信息,形成一种不断进化的课程学习系统。
-
实验结果与洞察:该技术在未见人类生成提示数据的情况下,在一些编程基准上达到最先进水平,甚至优于使用数万个专家示例训练的模型。
- 涌现行为:任务的复杂度指标和多样性随时间推移而增加,提案器持续生成越来越难的任务,而求解器能力也随之提升。
- 泛化能力:虽然仅在自生成的编程任务上攀登,模型在数学基准测试上同样观察到强大的性能表现,这印证了合成数据带来的泛化效应,且更大的模型从这种数据飞轮中获益更多。
- 本质上,它解决了“模型应在哪些任务上运行自我改进循环”这一瓶颈问题。
💬 精华片段(中文)
“So this is almost like game theory where the proposer and solver are slightly adversarial, but overall, they are helping each other improve in some ways.”
“所以在某种程度上,这很像博弈论,提案器和求解器略带有对抗性,但总体而言,它们又在以某种方式互相帮助、共同提高。”
40:21 智能效率革命:从云端到边缘的范式转移
本节重点
- 当前AI推理正处于“大型机时代”,所有推理负载高度集中于云端,导致算力和能源需求呈爆炸式增长。
- 研究提出并量化了智能每瓦 (IPW) 这一新指标,用于同时衡量模型解决任务的准确性以及所消耗的功率。
- 主要发现:本地模型能力正以每年3.1倍的速度提升,目前可解决高达 88.7% 的常见聊天查询,预示着推理负载从云到端的巨大转移潜力。
详细精要
- 当前“大型机时代”与算力爆炸:几乎所有LLM(无论是商业还是开源大模型)的推理都发生在云端。
- 对算力的需求呈爆炸式增长。例如,谷歌云在20个月内计算服务增长了1200倍;英伟达经历了年同比10倍的增长。
- 这种增长完全由AI驱动,导致对数据中心的电力需求急剧上升,预计需要高达250GW。
-
数据显示,谷歌处理的Token数量在2025年2月为160万亿,到同年10月已飙升至1.3千万亿。
-
“智能每瓦”(IPW) 指标的提出与量化:为系统性研究推理效率,研究提出了 IPW 指标。
- 定义:IPW = 平均任务准确率 / 平均功耗。它衡量的是模型在解决任务时的“每瓦特智能”。
-
研究范围:覆盖了超过 20个本地模型(如Qwen、GPT-OSS、Gemma3)、多种硬件(企业级与本地加速器)、100万来自ChatGPT的用户查询及多个推理基准(如Natural Reasoning、MLU Pro、Super GPQA),并评估了准确率、能耗、延迟等指标。
-
关键研究发现:
- 本地模型能力飞速增长:自2023年以来,本地模型(≤20B活跃参数)解决聊天查询的比例已提升3.1倍,目前能处理 88.7% 的查询。
- 本地与企业级芯片的效率差距:在IPW方面,Apple M4 Max 比 B200 低1.5倍,原因在于后者为AI工作负载进行了极端优化。
- 智能效率的复合增长:过去两年,IPW 总体提升了5.3倍,其中3.1倍来自模型能力的提升,1.7倍来自硬件效率的改进。
- 这些趋势共同指向一个未来:海量推理负载可以从云端转移到边缘设备(如笔记本电脑、手机)上,由更高效的本地模型来处理。
💬 精华片段(中文)
“It turns out that local models not only are very, very good already, but the trend of their improvement is also very interesting.”
“结果发现,本地模型不仅现在就已经非常、非常好了,而且它们的改进趋势也非常有意思。”
51:49 未来研究方向的总结与展望
本节重点
- 测试时扩展的基础原理仍待探索,特别是模型为何能从中得出正确答案,以及如何将成功轨迹蒸馏回模型。
- 持续学习是核心挑战,当前“异步数据生成后离线微调”的模式与人类持续学习的方式存在巨大差异。
- 为高吞吐、低延迟的测试时扩展工作负载(如反复采样、工具调用)专门优化系统基础设施至关重要。
- 混合推理服务引擎、新型节能模型架构,以及将IPW作为核心优化目标,是推动本地推理普及的关键。
详细精要
- 测试时扩展与合成数据的未解之谜:当前通过强化学习和合成数据驱动模型进步的方式非常有效,但其基本原理尚不清楚。
- 需要理解:为何通过反复提问(测试时扩展),模型最终能产生正确答案?这个过程揭示了模型的什么属性?
-
最佳实践是什么:如何将成功的轨迹最佳地蒸馏回模型本身以实现能力固化?这为从合成数据飞轮现象过渡到持续学习提供了明确的切入点。
-
迈向持续学习的新范式:当前模型的训练是离线且异步的:“智能体积累经验”和“模型微调”是分离的、滞后的过程。
- 这与人类持续在线学习、从正面和负面经历中即时更新技能的模式存在巨大脱节。
-
这对于实现技能迁移(例如机器人的跨具身泛化)至关重要,这不是仅靠添加外部记忆系统就能实现的。如何更自然地将模型解决问题的经验实时反馈并更新到权重中,是未来的关键研究方向。
-
面向新型工作负载的系统与硬件优化:主流的测试时扩展方法(如搜索、辩论、工具调用)与当前主流的单轮聊天机器人模式截然不同,它们涉及复杂的计算图。
-
这为系统和推理优化创造了巨大机会,需要开发专门的技术(如Hydrogen、Token SRS)来支持高吞吐、低延迟的智能体工作负载。
-
面向本地推理的未来架构与指标:向本地推理的转移趋势将催生新的研究方向。
- 需要构建混合推理服务引擎,能根据任务复杂度和资源需求,在本地和云端模型/加速器之间实现平滑的流量路由。
- 探索针对本地加速器能效推理优化的新型模型架构和内核(kernels),目前该领域的关注度远不如对云加速器的优化。
- 能源将成为未来最宝贵的资源,IPW这类指标应成为AI系统优化的核心目标,而目前在这一维度上的研究还相对匮乏。
💬 精华片段(中文)
“There's this new kind of unleashed era of like synthetic data, flywheel, and continual learning that is happening in this kind of connection between the fine-tuning and online learning and test-time scaling.”
“我们正在开启一个合成数据、数据飞轮和持续学习的新时代,这个时代发生在微调、在线学习和测试时扩展三者之间的交叉点上。”
专业术语注释
| 术语 |
解释 |
| 测试时扩展 (Test-time Scaling) |
在模型推理(测试)阶段,通过增加计算量(如生成多个样本、进行搜索)来提升最终输出质量的技术,通常不改变模型权重。 |
| 训练时扩展 (Train-time Scaling) |
在训练阶段,利用在推理循环中收集的验证器反馈和奖励,通过强化学习等方法优化模型参数以实现能力提升的技术。 |
| 自我改进循环 (Self-improvement Loop) |
一个由生成、验证、反馈和学习构成的自动化过程,模型通过该循环不断迭代,提示自身能力,对于本课程特指智能体系统中的这一过程。 |
| 验证器 (Verifier) |
在自我改进循环中,负责对模型(生成器)输出质量或正确性进行评估并产生奖励信号的模块或模型。 |
| 合成数据 (Synthetic Data) |
由AI模型(而非人类)生成的数据,在本集语境中特指LLM生成的,用于训练或微调其他(或自身)模型的文本、代码或推理轨迹。 |
| 拒绝抽样 (Rejection Sampling) |
一种从模型中采样多个候选输出,并仅保留符合特定标准(如答案正确)的样本进行后续微调的数据筛选方法。 |
| 元验证器 (Meta-verifier / Meta Verification) |
一种验证之上的验证机制。在本集中,它审计一个LLM验证器(LLM-as-a-judge)对生成内容的分析过程的合理性,判断其指出的错误是否为幻觉。 |
| 智能每瓦 (Intelligence Per Watt, IPW) |
本集提出的一个衡量AI推理效率的指标,计算方式为“平均任务准确率 / 平均功耗”。用于综合评估模型能力和能源效率。 |
| 课程学习 (Curriculum Learning) |
一种训练策略,模仿人类的学习方式,让模型从较简单的样本或任务开始学习,然后逐渐增加难度。本集中,模型通过自玩方式自动生成了这一过程。 |
| 持续学习 (Continual Learning) |
使模型能够像人类一样,在部署后持续地从新数据、新任务和交互经验中在线学习和更新权重,同时不会灾难性地遗忘旧知识。区别于当前的离线微调范式。 |
| LLM-as-a-judge |
一种将大语言模型用作评估器的技术,通常用于对另一个模型生成的文本质量、连贯性或安全性等进行打分或提出批评。本集中用作验证器。 |
| TRPO (Trust Region Policy Optimization) |
一种强化学习算法,通过限制每次策略更新的幅度来保证训练过程的稳定性和可靠性。本集中被用作构建RL循环的基础算法。 |
| IMO (International Mathematical Olympiad) |
国际数学奥林匹克竞赛,其题目常被用作评估顶级AI模型在数学推理和定理证明方面能力的极难基准。 |
延伸思考
- 自我改进的通用边界:讲师提出了一个关键问题——能否通过在可验证领域(如数学、编程)的自我改进,使模型在不可验证领域(如创意写作、芯片设计)的能力也普遍提升,从而减少或消除对人工标注数据的依赖?这是一个非常有价值但计算代价高昂的研究假设。
- 持续学习的现实路径:当前的主流方法是记忆系统、长上下文或KV缓存注入,但这是否能真正替代权重更新带来的根本性技能习得与泛化?未来的研究可能需要在模型架构和训练算法上进行根本性创新,以实现无需灾难性遗忘的在线权重更新。
- 端云协同的系统设计:既然研究表明88.7% 的简单查询可由本地模型解决,那么如何设计一套智能混合推理引擎,使其能准确判断查询的复杂度并近乎实时地在端侧和云侧模型之间进行路由,同时保证用户体验的无缝切换,将成为一个重要的系统工程问题。
- 能效作为第一性能指标:随着AI对全球能源消耗的影响加剧,智能每瓦(IPW)应从单纯的研究指标演变为驱动模型架构设计、芯片设计和数据中心优化的核心商业和工程目标。这可能会催生出一系列专为高能效设计的“压缩”模型和异构计算单元。
原文发表:未知 · 纪要生成:2026-08-05