▶ 原文链接
构建自我完善的AI:从工具调用、代码执行反馈到宪法约束
来源: YouTube | 未具名讲师 | 无发布日期
分类: 其他
原文发表: 无发布日期
纪要生成: 2026-08-05
全集重点
- 交互与反馈是模型自我完善的关键:孤立推理的局限性推动了对工具调用、执行反馈和AI自我批判的研究,三者核心区别在于反馈来源不同。
- ReAct范式:首次将推理与行动交织结合,通过在语言空间生成思考痕迹并驱动机器动作,解决了大模型缺乏现实世界“基础”和容易“幻觉”的问题。
- RLEF方法:展示了如何利用代码执行反馈(单元测试通过/失败)作为奖励信号进行强化学习微调,证明纯粹的执行反馈能显著提升编程能力并实现泛化。
- 宪法式AI:提出用人类编写的原则(宪法)取代昂贵的人工反馈,让模型基于原则进行自我批判和修正,在保持有用性的同时极大提升无害性,实现了二者更好的帕累托前沿。
- 从手工框架到内生能力:虽然ReAct等手工工作流仍因领域特异性而存在,但现代模型已开始通过后训练将这些推理-行动模式内化,但完全自动化的搜索空间定义仍是开放难题。
嘉宾/话题简介
本集播客是系列课程中的一讲,聚焦于使大语言模型(LLMs)超越简单聊天机器人、实现自我完善的三大关键技术。讲师通过三篇经典论文,系统阐述了如何构建有效的外部反馈闭环,让模型能通过与环境、代码及自身原则的交互,不断迭代、演化并做出更可靠的决策。内容涵盖了从开创性的推理-行动结合框架 ReAct,到利用 执行反馈 进行强化学习的代码生成方法 RLEF,再到完全摆脱人类标注者、基于原则的自我改善框架 宪法式AI(Constitutional AI)。
分节详述
[00:05] 导论:让大模型与现实世界交互
本节重点
- 大模型擅长NLP但在现实任务中需要与现实、工具和代码互动并从中学习。
- 本讲聚焦于模型自我完善的三种途径,核心差异在于反馈来源。
- 三种途径分别为:与环境的交互(工具调用)、与代码执行的交互(执行反馈)、与自身原则的交互(自我批判)。
详细精要
- 大模型的现实世界鸿沟:大语言模型在聊天场景中表现出色,但要解决实际任务必须能与环境交互。
- 讲师指出,虽然 思维链(Chain of Thought) 等测试时计算方法能提供稳健验证,但它们仍依赖模型内部状态,缺乏外部世界的反馈。
-
例如,直接问模型今天天气或时事,由于其没有“基础(grounding)”,可能会产生“幻觉(hallucinate)”,因为它无法主动搜索并获取实时信息。
-
课程核心:三种反馈驱动的自我改进:本次讲座将深入三篇论文,它们都旨在让模型自我提升,但反馈机制截然不同。
- ReAct:研究如何让模型超越纯粹推理,通过工具调用将行动纳入考虑。反馈来自与环境交互后的观察结果。
- RLEF:聚焦于代码生成,利用运行代码或测试的执行反馈来提升模型能力。
-
宪法式AI(Constitutional AI):利用模型自我批判的反馈循环来改进模型,反馈来自模型依据原则对自身输出的批判。
-
反馈来源的分类总结:讲师精辟地将上述差异归结为反馈来源的不同。
- 反馈可以来自与环境的互动。
- 反馈也可以来自某种批判机制。
- 反馈还可以基于“什么是正确答案”的已知知识进行“基础(grounding)”。
💬 精华片段(中文)
“All three of those techniques are ways for the model to improve itself. But what differs in each of these techniques is, where is the feedback coming from? It's some form of interaction with either the environment or some form of critique mechanism or grounding using what we know should be the right answer.” (有这三种技术都是模型自我改善的方法。但每种技术的区别在于,反馈从何而来?它可以是某种形式的与环境的互动,或是某种批判机制,或是利用我们所知道的正确答案来进行基础验证。)
[02:13] ReAct:用语言空间中的推理与行动交织来构建智能体
本节重点
- 人类决策是“思考-行动-观察-再思考”的循环,ReAct为LLMs模拟了这一过程。
- 早期的LLMs难以结合推理和行动,容易产生幻觉且缺乏现实基础。
- ReAct通过一种简单的提示工程,即穿插生成“思考”和“行动”轨迹,显著提升了模型在知识密集型和决策型任务上的表现。
- ReAct增强了推理过程的可解释性和可信度,并减少了幻觉。
详细精要
- 人类的思考-行动循环:ReAct的灵感源于人类决策的基本模式。
- 人类在做决定时会先思考,例如“这门课对我有什么帮助?”,这产生了行动的理由。
- 行动后,会观察到新状态,例如“我喜欢/不喜欢这门课”,然后基于此产生新的推理,进而采取下一步行动(如做作业)。
-
这种思考与行动的循环对细化大语言模型的生成内容极为有益,但早期模型很难将二者作为独立过程结合起来。
-
ReAct的原理:提示工程中的交替生成:ReAct通过一个极其简单的抽象来结合推理和行动——纯提示(prompting)。
- 它让模型首先生成语言化的推理轨迹(verbal reasoning traces),例如,要求模型“逐步思考”任务。
- 然后,将该推理轨迹附加到提示中,再问:“基于此,应该采取什么行动?”,模型据此生成一个动作。
-
这种方法将动作空间定义为一个分类任务,即提供给模型一个有效动作的有限集合,使其决策更“基础(grounded)”,在机器人领域同样适用。
-
HotpotQA实例解析:通过一个具体的问答任务展示了ReAct的优势。
- 问题:“除了Apple Remote,还有什么其他设备可以控制Apple Remote最初设计用来交互的程序?”
- 标准提示和思维链(CoT) 都给出了错误的答案。CoT虽然展示了中间步骤,但最终答案仍不正确。
- 仅行动的提示:模型搜索了相关信息,但最终意识到无法给出好答案。
- ReAct(推理+行动交织):
- 思考1:需要搜索Apple Remote,找到它最初设计的交互程序。
- 行动1:搜索“Apple Remote”。
- 观察1:得到信息,它最初设计是用来控制“Front Row”媒体中心。
- 思考2:需要搜索“Front Row”查找其他控制设备。
- 行动2:搜索“Front Row”,搜索失败。
- 思考3:换个词,搜索“Front Row software”。
- 行动3:搜索“Front Row software”。
- 观察3:得知它是一个已停产的媒体中心软件,功能上可以替代。
- 思考4:基于此,可以生成最终答案。
- 这个例子证明,交替穿插思想和行动能让模型表现得更好,其推理过程本身就是一个允许它不断修正和改进的抽象层。
-
此外,讲师指出,现代模型(如通义千问)的 “思考模式” 正是将这类ReAct轨迹蒸馏(distilled)并内化的结果。
-
ReAct vs. 思维链与纯行动:实验结果:在知识密集型任务HotpotQA和事实核查任务FEVER上的结果显示。
- 基准方法包括:标准提示、CoT、CoT-自洽性(SC,Self-Consistency,即多数投票)、仅行动(Act)。
- ReAct普遍优于仅行动模式,但在HotpotQA上并未总是优于CoT。
- 然而,当将ReAct与CoT-SC通过回退(fallback) 策略结合时,则全面超越了单一技术。这揭示了:有效结合模型内部知识和外部知识,并用推理作为中间桥梁来检索正确信息,才是最佳路径。
- 失败模式分析:CoT的主要失败模式是幻觉。而ReAct由于能接触外部知识库,成功检索到准确信息,因此错误更少,可信度更高。
-
在决策任务WebShop(模拟在线购物)中,ReAct的表现显著优于传统的模仿学习(IL) 和IL + 强化学习(RL),取得了更高的得分和成功率(得分: 62.3 vs 52.2,成功率: 28.7% vs 19.2%),但仍远低于人类专家水平(成功率82.1%),说明仍有巨大提升空间。
-
ReAct的优缺点:
- 优点:性能更好、幻觉更低、决策过程更可解释。
-
缺点:如果行动空间巨大,需要极多的上下文示例;由于多步推理,推理成本更高;多步过程中的错误会级联放大(errors cascade over time)。
-
课堂讨论:应对嘈杂环境与新认知机制:同学们针对ReAct的局限提出了见解。
- 对嘈杂反馈的处理:若环境反馈有误导性,可增加一层 “反思(reflection)” 机制,让智能体反思环境给出的信息;或者赋予智能体回溯(backtrack) 能力,避免陷入重复循环;还可以通过多次外部检索、多数投票等方法建立置信度。
- 其他认知机制:除了ReAct,还应借鉴任务分解、并行思考、记忆(memory)、过往经验等人类认知机制。一个关键点是,不同任务所需的最佳推理-行动时间比是不同的,现代模型有时会“过度思考(overthink)”,哪怕对简单任务也产生极长的推理轨迹。
💬 精华片段(中文)
“So there is this loop between thinking and action that helps us function as humans. A similar loop can be very useful in terms of refining what language models generate.” (正是这种思考与行动之间的循环帮助了我们作为人类发挥作用。一个类似的循环对于精炼大语言模型生成的内容来说,会非常有用。)
[27:26] RLEF:利用代码执行反馈进行强化学习
本节重点
- 编码智能体需要来自代码执行的反馈来迭代优化,RLEF是首个正式展示这一有效性的框架。
- 其核心创新是双层测试策略和混合的Token-Turn级别策略。
- 该方法通过在训练和推理时都使用执行反馈,形成一个端到端的RL微调循环。
- 实验证明,RLEF显著提高了模型在代码竞赛等任务上的解题率,并且这种提升可以泛化到其他基准测试。
详细精要
-
为何需要执行反馈:构建强大的编码智能体(如Cloud Code)的关键,在于理解用户意图并根据生成的代码获得反馈以进行迭代。RLEF是一个端到端的RL微调框架,其核心是将执行反馈(即单元测试的通过/失败) 作为奖励信号。
-
RLEF的核心机制:迭代反馈循环:RLEF巧妙融合了训练时和推理时的执行反馈。
- 推理时反馈(Exploitation):模型接收问题描述,生成代码,并在一组公开测试(public tests) 上运行。如果失败,执行反馈(如超时或断言错误)会作为上下文提供给LLM,进行下一次尝试。此循环持续直到代码通过公开测试或达到轮次上限。
- 训练时反馈(Policy Update):通过的代码解决方案会在一组私有测试(private tests) 上运行,得到一个二元奖励(通过/失败)。然后,使用PPO(Proximal Policy Optimization) 算法基于此奖励来更新模型策略。
-
双层测试策略的精妙之处:公开测试提供即时反馈,引导模型开发出更好的局部解决方案;而私有测试则完全隐藏,只在最终评估奖励时使用。这种分离防止了模型直接记忆测试输出,确保了泛化能力。
-
混合Token-Turn级别策略:一个与RL算法相关的实现细节。
- 在生成代码(Policy Model)时,模型逐token(token by token)输出,实现细粒度控制。
- 但在用价值函数计算优势时,是在回合级别(turn-level) 进行的。整个响应(多个token)共享一个来自最后一个token的单一优势值。
-
这种方法更接近GSPO的思想,即对整个序列给予奖励,而非对每个token分别给予奖励。
-
实验结果与为何有效:
- 性能提升:在CodeContests(竞争性编程)数据集上,使用RLEF训练的模型,解题率显著高于基础模型,且随着采样预算的增加而持续提升。
- 泛化能力:RLEF带来的提升可以泛化到其他代码生成基准测试,因为它不是简单地针对特定测试集过拟合,而是通过修复错误来增强模型能力。
- 有效性的原因:通过分析错误轮次,发现RLEF能让模型在后续轮次中产生更少的错误输出,有效地修复(repair) 之前的错误。这表明模型不仅利用了更大的样本多样性,而且基于错误反馈的编辑也更具针对性。
-
错误分析:RLEF会减少完全错误的输出,但可能导致超时错误(timeout errors) 增加。这通常是因为模型虽能修复部分错误,但生成的解决方案仍然不够优化,导致测试运行超时。
-
课堂讨论:二元奖励的局限与多轮鼓励泛化:
- 二元奖励的局限:对于更复杂的代码问题,仅靠通过/失败的二元反馈可能不足以指导精确调试,可能需要包含错误堆栈跟踪等元数据。
- 为何鼓励一次性做对:同学质疑二元奖励是鼓励模型反复修复而非一次性正确。讲师回应,推理时的多轮反馈循环给了模型修正的机会,并且可以随时增加最大尝试轮次。但本质上,这触及了过程奖励模型 vs. 结果奖励模型的经典辩论,在不同领域和任务下可能需要不同选择。
- 为何能泛化:同学认为,由于竞赛题目比人类级别更难,其解决轨迹本身就包含了强大的推理逻辑,因此学习这些轨迹能自然泛化。同时,与监督微调(SFT)相比,RL方法因其探索性,在解决“稍有不同”的新问题时泛化能力可能略强。
- 处理代码库超出上下文窗口的挑战:针对此问题,同学们集思广益:
- 类似ReAct的思路,动态检索所需信息片段。
- 对代码元素进行摘要,拼合后放入上下文窗口。
- 构建代码库的图正则化表示(graph-regularized version),进行相似性搜索,迭代寻找最相关的信息。
💬 精华片段(中文)
“What this paper shows is basically an end-to-end RL fine-tuning framework. The actions in this particular case are generated code, and the observations ... come from execution feedback. Execution feedback is test feedback.... And you get binary reward based on whether those tests pass or fail.” (这篇论文展示的,基本上是一个端到端的强化学习微调框架。在这个例子中,动作是生成的代码,观察结果来自执行反馈。执行反馈就是测试反馈……然后你会根据这些测试是否通过或失败得到一个二元奖励。)
[46:21] 宪法式AI(Constitutional AI):从原则中学习无害性
本节重点
- 传统RLHF依赖昂贵耗时的人工反馈,宪法式AI(CAI)提出用人类编写的“宪法”替代人工。
- CAI分为两个阶段:监督学习阶段让模型基于宪法自我批判和修正;RL阶段训练一个基于宪法和AI反馈的偏好模型来微调LLM。
- 核心思想是:模型已能很好地遵循指令,因此可以听令进行自我评价和修正。
- 实验证明,CAI在保持有用性的同时,极大地提升了无害性,实现了更优的“有用-无害”帕累托前沿。
详细精要
-
RLHF的成本难题与宪法式AI的诞生:传统方法通过人类对模型的多个输出进行偏好排序,训练奖励模型来提升模型性能。但这需要收集大量人类标签,成本极高且繁琐。Anthropic提出的宪法式AI,旨在利用模型日益增长的指令遵循能力,用一套人类编写的原则——即“宪法(Constitution)”——来定义模型应有的行为,从而将人工从反馈循环中移除。
-
宪法示例与自我批判过程:宪法由一系列用于批判和修正的原则组成。
- 原则1(有害/不道德内容):要求模型批判某个潜在有害的回复,然后要求其移除相关部分进行改写。
- 原则2(性别偏见):要求模型判别回复是否含有性别偏见,并论述为何存在偏见,然后要求其移除任何偏见痕迹。
- 原则3(不适宜儿童):要求模型判断回复是否适合儿童,并思考怎样改才合适,然后要求重写。
-
这个过程要求模型具备识别特定行为和遵循复杂改写指令的双重能力。
-
宪法式AI的两阶段训练法:
- 阶段一:监督式微调(Supervised Learning):首先生成一些有害提示(红队提示,red-teaming prompts)的模型回复,然后根据宪法生成批判和修正的成对数据,最后在这份数据上对模型进行微调。结果是,随着修正次数增加,模型无害性提高,但有用性略有下降,而两者的总分单调递增。
-
阶段二:强化学习(RL):首先,使用第一阶段生成的回复,由AI根据宪法评价哪个更好,以此来训练一个偏好模型(Preference Model)。然后,使用这个偏好模型来对LLM进行RL微调,目标是最大化“体贴、尊重、诚恳”等特质。这个阶段完全用AI反馈替代了昂贵的人类反馈。
-
实验结果与CoT的作用:
- 通过对比仅有用性RLHF、有用+无害RLHF、CAI和CAI + 思维链(CoT),发现CAI方法在无害性Elo评分上取得了巨大提升,远超纯人工反馈的方法。
- 有用性与无害性的权衡:结果显示,CAI + CoT在帕累托前沿(Pareto frontier) 上取得了最好成绩,即在实现极高无害性的同时,对有用性的牺牲最小。这是该论文成功平衡安全与实用两大目标的关键证明。
-
CoT的角色:有趣的是,CAI + CoT在有害性上表现最佳,但有用性似乎稍低,这再次反映了安全性与实用能力之间需寻求权衡(trade-off)。
-
开放问题与后续工作:
- 宪法的更新与遗忘:若想更新宪法,一般通过模型更新周期进行(因后训练仅占小部分算力)。但更根本的问题是,如何让模型“忘记”旧规则或“持续学习”新规则,即持续学习与机器遗忘(machine unlearning)问题,目前仍是开放性研究。
- AI反馈的准确性:训练偏好模型时,其准确性如何保证?通常需要一个小规模的人类评估集来验证,确保AI偏好与人类偏好有一致性。
- 模型的过度自信:让模型自我批判有时很难,因为模型可能过于自信,不知自己所不知。一种改进方法是使用多个模型的共识来进行批判,效果可能更好。
💬 精华片段(中文)
“They basically used constitutional AI or human-written principles called the Constitution, and then used them to improve the model by describing what is the desired behavior. So humans don't need to be in the loop, except to write that Constitution.” (他们基本上使用了宪法式AI,也就是被称为“宪法”的人类手写原则,然后通过描述什么是期望的行为来改进模型。因此,除了编写这部宪法之外,人类无需留在反馈闭环中。)
[01:00:33] 课程总结与展望
本节重点
- ReAct利用工具调用和环境反馈让模型在真实世界中行动,生成可解释的决策。
- RLEF利用代码执行反馈进行RL微调,显著提升和泛化编程能力。
- 宪法式AI利用人类价值观原则生成AI反馈,在保持有用性的同时极大提升安全性。
- 这三者共同展示了超越固定训练数据的持续自我完善的路径,并为构建更强大AI智能体奠定了基础。
详细精要
- 三大技术的核心贡献提炼:
- ReAct:让LLM结合推理和行动,通过与世界的交互获得“基础”,给出更好、更可解释的答案,并在决策环境中做出有用决策。其价值在于开创性地在语言空间中实现了推理和行动的交织,使得决策过程极其可解释。
- RLEF:在编程领域,利用执行反馈(单元测试)作为核心信号,让模型迭代式地自我改进,生成正确的代码解决方案,降低了达到顶尖性能的预算成本。
-
宪法式AI:利用人类编写的规则,让模型自我生成反馈,从而将自我改善泛化到任何可以规则化的指令遵循任务上,成功地在有用性和无害性之间找到了更好的平衡点。
-
通向通用智能体的道路:这三种技术为构建能自我完善的智能体铺平了道路。
- 当反馈闭环包含足够强的信号时,模型就能超越其原始训练数据,实现真正的提升。
- ReAct定义了一种“工作流(workflow)”:推理 → 行动 → 推理。这使得我们可以将复杂的用户任务分解为这个流程。
- 然而,任务的“工作流”是高度领域特定的。为法律、金融等构建智能体,所需遵循的步骤大不相同。目前还不存在能自动发现所有任务工作流的通用方法。
-
虽然现代模型通过海量训练已开始将ReAct类模式内化,但完全放弃手工框架、实现自动化的推理空间搜索(automated search in reasoning space),仍面临挑战,因为大多数现实任务的搜索空间并非精确定义的。
-
对人类认知的借鉴与超越:当前大量创新(分解、分析、并行)都受人类问题解决方式的启发。但最终目标是超越语言描述,实现不依赖于显式语言推理的、自动化的搜索与提升过程。这条道路在围棋等状态和行动空间定义清晰的游戏环境中更为清晰,但在开放式的现实任务中仍前路漫漫。
💬 精华片段(中文)
“When the feedback loop has enough signal, then you have a way to improve the model beyond just what is the data it was trained on.” (当反馈闭环拥有足够强的信号时,你就拥有了一种方法,能让模型超越其训练所用的数据,去实现自我提升。)
专业术语注释
| 术语 |
解释 |
| Grounding / Grounded(基础) |
指将模型内部知识与外部世界的信息(如实时数据、执行结果、事实)联系起来,使模型输出不再是纯粹的“幻觉”,而是基于事实根据的。 |
| Hallucinate / Hallucination(幻觉) |
指大语言模型生成看似合理但实际错误、无意义或与事实不符的内容。 |
| Chain of Thought(思维链) |
一种提示工程技术,通过要求模型在给出最终答案前,展示一系列中间推理步骤,来提高其解决复杂问题的能力。 |
| ReAct |
一种将推理(Reasoning)和行动(Acting)交替结合的范式。模型先生成“思考”轨迹,再基于此生成并执行“动作”,以此从环境中获得观察结果,用于下一轮思考。 |
| Tool Calling(工具调用) |
模型生成结构化的指令来调用外部工具(如搜索引擎、API、计算器)以完成任务或获取信息的能力。 |
| RLEF |
指“Reinforcement Learning with Execution Feedback”,一种利用代码执行反馈(如测试通过与否)作为奖励信号来微调大语言模型的强化学习框架。 |
| Execution Feedback(执行反馈) |
程序代码在实际运行后返回的信息,如运行成功、错误堆栈跟踪、超时或测试失败等。在RLEF中,它是环境对模型行动的直接响应。 |
| Constitutional AI(宪法式AI) |
一种用人类编写的原则清单(“宪法”)来指导模型行为的训练方法。模型通过遵循宪法进行自我批判和修正,从而减少对人类反馈的依赖。 |
| RLHF |
“Reinforcement Learning from Human Feedback”的缩写,一种经典的通过收集人类对模型输出的偏好排序数据来训练奖励模型,再以此进行强化学习微调的方法。 |
| PPO |
“Proximal Policy Optimization”的缩写,一种流行的强化学习算法,通过限制每一次策略更新的幅度,使训练过程更稳定。 |
| Preference Model(偏好模型) |
一种模型,其作用不是直接生成答案,而是预测(或判断)两个或多个输出中,哪个更好、更符合特定评估标准(如有用、无害等)。它是RLHF或宪法式AI训练中的核心组件。 |
| Pareto Frontier(帕累托前沿) |
经济学和多目标优化中的概念。在本文语境下,指在“有用性”和“无害性”两个目标间权衡时,所能达到的“在不损害一方的情况下,无法再提高另一方”的最佳方案集合。 |
| Self-Consistency(自洽性) |
一种解码策略,通过对同一问题生成多个独立的推理路径并进行“多数投票”,选出最一致的答案,以提高模型输出的可靠性和准确性。 |
| ELO(ELO评分) |
一种常用于棋类比赛的计分方法,通过两两比较来评估玩家的相对技能水平。在AI中,用于量化人类的相对偏好,即通过成对比较来评估不同模型输出在人类眼中的优劣。 |
延伸思考
- 从手工作坊到自动化工厂:ReAct的手工工作流设计何时会被能够自主学习最优”推理-行动“策略的RL方法完全取代?决定这一转变的关键瓶颈是任务的搜索空间能否被精确定义,还是模型基础能力的再次飞跃?
- 反馈信号的丰度问题:RLEF展示了二元(通过/失败)反馈的有效性,但这种“稀疏奖励”在更复杂的软件工程任务(如SWE-bench)中是否足够?何时必须引入更密集的过程奖励(如状态好坏、代码风格评分)?
- 宪法的普适性与动态性:宪法式AI预设了一套普世的行为准则,但不同文化、法律体系甚至不同用户对“无害”、“偏见”的定义可能冲突。如何设计和部署一套可动态调整、个性化甚至可被众包的“动态宪法”,以确保AI对齐更广泛和多元的人类价值观?
- “无用”的安全阀:当安全性与有用性产生冲突时,我们究竟应该在多大程度上牺牲模型的能力?过度强调无害性是否会创造一个“懒惰但安全”的AI,从而抑制其在医疗、法律等高危领域发挥巨大潜力的可能性?
原文发表:无发布日期 · 纪要生成:2026-08-05