▶ 原文链接

构建自我完善的AI:从工具调用、代码执行反馈到宪法约束

来源: YouTube | 未具名讲师 | 无发布日期 分类: 其他 原文发表: 无发布日期 纪要生成: 2026-08-05


全集重点


嘉宾/话题简介

本集播客是系列课程中的一讲,聚焦于使大语言模型(LLMs)超越简单聊天机器人、实现自我完善的三大关键技术。讲师通过三篇经典论文,系统阐述了如何构建有效的外部反馈闭环,让模型能通过与环境、代码及自身原则的交互,不断迭代、演化并做出更可靠的决策。内容涵盖了从开创性的推理-行动结合框架 ReAct,到利用 执行反馈 进行强化学习的代码生成方法 RLEF,再到完全摆脱人类标注者、基于原则的自我改善框架 宪法式AI(Constitutional AI)


分节详述

[00:05] 导论:让大模型与现实世界交互

本节重点

详细精要

💬 精华片段(中文)

“All three of those techniques are ways for the model to improve itself. But what differs in each of these techniques is, where is the feedback coming from? It's some form of interaction with either the environment or some form of critique mechanism or grounding using what we know should be the right answer.” (有这三种技术都是模型自我改善的方法。但每种技术的区别在于,反馈从何而来?它可以是某种形式的与环境的互动,或是某种批判机制,或是利用我们所知道的正确答案来进行基础验证。)


[02:13] ReAct:用语言空间中的推理与行动交织来构建智能体

本节重点

详细精要

💬 精华片段(中文)

“So there is this loop between thinking and action that helps us function as humans. A similar loop can be very useful in terms of refining what language models generate.” (正是这种思考与行动之间的循环帮助了我们作为人类发挥作用。一个类似的循环对于精炼大语言模型生成的内容来说,会非常有用。)


[27:26] RLEF:利用代码执行反馈进行强化学习

本节重点

详细精要

💬 精华片段(中文)

“What this paper shows is basically an end-to-end RL fine-tuning framework. The actions in this particular case are generated code, and the observations ... come from execution feedback. Execution feedback is test feedback.... And you get binary reward based on whether those tests pass or fail.” (这篇论文展示的,基本上是一个端到端的强化学习微调框架。在这个例子中,动作是生成的代码,观察结果来自执行反馈。执行反馈就是测试反馈……然后你会根据这些测试是否通过或失败得到一个二元奖励。)


[46:21] 宪法式AI(Constitutional AI):从原则中学习无害性

本节重点

详细精要

💬 精华片段(中文)

“They basically used constitutional AI or human-written principles called the Constitution, and then used them to improve the model by describing what is the desired behavior. So humans don't need to be in the loop, except to write that Constitution.” (他们基本上使用了宪法式AI,也就是被称为“宪法”的人类手写原则,然后通过描述什么是期望的行为来改进模型。因此,除了编写这部宪法之外,人类无需留在反馈闭环中。)


[01:00:33] 课程总结与展望

本节重点

详细精要

💬 精华片段(中文)

“When the feedback loop has enough signal, then you have a way to improve the model beyond just what is the data it was trained on.” (当反馈闭环拥有足够强的信号时,你就拥有了一种方法,能让模型超越其训练所用的数据,去实现自我提升。)


专业术语注释

术语 解释
Grounding / Grounded(基础) 指将模型内部知识与外部世界的信息(如实时数据、执行结果、事实)联系起来,使模型输出不再是纯粹的“幻觉”,而是基于事实根据的。
Hallucinate / Hallucination(幻觉) 指大语言模型生成看似合理但实际错误、无意义或与事实不符的内容。
Chain of Thought(思维链) 一种提示工程技术,通过要求模型在给出最终答案前,展示一系列中间推理步骤,来提高其解决复杂问题的能力。
ReAct 一种将推理(Reasoning)和行动(Acting)交替结合的范式。模型先生成“思考”轨迹,再基于此生成并执行“动作”,以此从环境中获得观察结果,用于下一轮思考。
Tool Calling(工具调用) 模型生成结构化的指令来调用外部工具(如搜索引擎、API、计算器)以完成任务或获取信息的能力。
RLEF 指“Reinforcement Learning with Execution Feedback”,一种利用代码执行反馈(如测试通过与否)作为奖励信号来微调大语言模型的强化学习框架。
Execution Feedback(执行反馈) 程序代码在实际运行后返回的信息,如运行成功、错误堆栈跟踪、超时或测试失败等。在RLEF中,它是环境对模型行动的直接响应。
Constitutional AI(宪法式AI) 一种用人类编写的原则清单(“宪法”)来指导模型行为的训练方法。模型通过遵循宪法进行自我批判和修正,从而减少对人类反馈的依赖。
RLHF Reinforcement Learning from Human Feedback”的缩写,一种经典的通过收集人类对模型输出的偏好排序数据来训练奖励模型,再以此进行强化学习微调的方法。
PPO Proximal Policy Optimization”的缩写,一种流行的强化学习算法,通过限制每一次策略更新的幅度,使训练过程更稳定。
Preference Model(偏好模型) 一种模型,其作用不是直接生成答案,而是预测(或判断)两个或多个输出中,哪个更好、更符合特定评估标准(如有用、无害等)。它是RLHF或宪法式AI训练中的核心组件。
Pareto Frontier(帕累托前沿) 经济学和多目标优化中的概念。在本文语境下,指在“有用性”和“无害性”两个目标间权衡时,所能达到的“在不损害一方的情况下,无法再提高另一方”的最佳方案集合。
Self-Consistency(自洽性) 一种解码策略,通过对同一问题生成多个独立的推理路径并进行“多数投票”,选出最一致的答案,以提高模型输出的可靠性和准确性。
ELO(ELO评分) 一种常用于棋类比赛的计分方法,通过两两比较来评估玩家的相对技能水平。在AI中,用于量化人类的相对偏好,即通过成对比较来评估不同模型输出在人类眼中的优劣。

延伸思考

  1. 从手工作坊到自动化工厂:ReAct的手工工作流设计何时会被能够自主学习最优”推理-行动“策略的RL方法完全取代?决定这一转变的关键瓶颈是任务的搜索空间能否被精确定义,还是模型基础能力的再次飞跃?
  2. 反馈信号的丰度问题:RLEF展示了二元(通过/失败)反馈的有效性,但这种“稀疏奖励”在更复杂的软件工程任务(如SWE-bench)中是否足够?何时必须引入更密集的过程奖励(如状态好坏、代码风格评分)?
  3. 宪法的普适性与动态性:宪法式AI预设了一套普世的行为准则,但不同文化、法律体系甚至不同用户对“无害”、“偏见”的定义可能冲突。如何设计和部署一套可动态调整、个性化甚至可被众包的“动态宪法”,以确保AI对齐更广泛和多元的人类价值观?
  4. “无用”的安全阀:当安全性与有用性产生冲突时,我们究竟应该在多大程度上牺牲模型的能力?过度强调无害性是否会创造一个“懒惰但安全”的AI,从而抑制其在医疗、法律等高危领域发挥巨大潜力的可能性?

原文发表:无发布日期  ·  纪要生成:2026-08-05