来源: AI Engineer | Vivek Trivedy | 2026-08-12 播客: AI Engineer 分类: AI 工程 原文发表: Aug 12, 2026 纪要生成: 2026-08-14
Vivek Trivedy 是 LangChain 的应用研究负责人。本集演讲围绕一个看似朴素、实则关键的问题展开:当 Agent 在真实环境中运行并犯下错误后,我们该如何利用已经产生的数据来持续改进它?Vivek 提出了一套“发布 → 收集 Trace → 数据挖掘 → 数据驱动实验”的配方,并结合 LangChain 帮助客户处理大规模 Trace 数据的实际经验,讨论了可观测性与持续学习的耦合、开放模型微调、Harness 工程、Auto Research、记忆系统与“睡眠时间计算”等前沿方向。
本节重点
详细精要
本集要解决的核心问题是:如何通过数据(Data)来持续改进 Agent(Agents)。
引入普遍困境:他讲了一个很多人都经历过的故事。
这正是演讲要回应的“有了数据、犯了错误,然后呢?”的问题。
演讲的目标:提出一套可以持续改进 Agent 的 配方(Recipe)。
💬 精华片段(中文)
我们今天要讨论的问题是:如何持续改进 Agent,以及如何通过数据做到这一点。
"The problem that we're going to talk about today is how do we continuously improve agents, but how do we do that via data?"
本节重点
详细精要
也只有在真实环境中,你才能获得关于它行为的反馈。
第二步:收集大量 Trace(Traces):每次 Agent 在环境中操作,都会产生数据。
演讲者强调要把所有这些数据都存储起来,以便后续使用。
第三步:在 Trace 上做数据挖掘(Data Mining):一旦积累了海量 Trace 数据,就可以进行挖掘。
他承诺会明确介绍要做哪些数据挖掘,但当前先点出这是流程中的关键环节。
第四步:数据驱动实验(Data-Driven Experiments):这是“有趣的部分”。
💬 精华片段(中文)
构建成功 Agent 的第一步,是把它发布出去。
"So, the first step in building a successful agent is shipping it."
本节重点
详细精要
他想强调一个可能被忽略的事实:可观测性(Observability)与持续学习之间存在非常紧密的耦合。
耦合的核心原因:Agent 在环境中运行时会不断产生 Trace 数据。
如果你是一家 持续学习公司,你就需要 Trace;如果你有 Trace,你就能尝试对 Agent 做持续学习。
查看数据带来优势:他插入了一个 Meme,提到电影《心灵捕手》里的 Will Hunting。
💬 精华片段(中文)
如果你是一家持续学习公司,你就需要 Trace;如果你有 Trace,你就能尝试对 Agent 做持续学习。
"If you're continual learning company, you need traces, and if you have traces, then you can try to do continual learning over your agents."
本节重点
详细精要
在头脑中可以推理代码做什么,看到函数如何相互调用,大致理解 Python 逻辑。
Agent 世界不存在这种可读推理:Agent 由非常复杂的组件构成。
因此,人类很难推理:某个 Prompt 改动 在大规模上会如何影响 Agent 行为。
领域差异巨大:同一个 Prompt 改动在不同领域会有完全不同的影响。
例如,用于 医疗领域 的 Prompt 改动,与用于 法律领域 的 Prompt 改动,效果会截然不同。
从确定性到自主性的转变:自 ChatGPT 时刻 以来的四年里,行业开始用 确定性(Determinism)换取自主性(Autonomy)。
💬 精华片段(中文)
过去四年以来,我们开始用确定性换取自主性。
"Over the last four years since the ChatGPT moment, we've started trading determinism for autonomy."
本节重点
详细精要
派 Agent 去阅读其他 Agent 的 Trace,寻找多个维度的信息。
用 Trace 回答三类问题:
反事实(Counterfactual)验证:例如已经用 GPT 5.5 运行,听说 GLM 很好,如果换成 GLM 5.2 做这个任务会怎样?需要 Metrics 来比较。
Trace 级别捕捉实际用户行为:Trace 能捕捉用户真实看到的行为,因此对精细粒度的行为观察非常有帮助。
关于数据规模的观点:今天的 Agent 数据将是人类有史以来见过的最少的数据。
💬 精华片段(中文)
我们今天看到的数据,将会是人类有史以来见过的最少的数据。
"The data that we see today is going to be the smallest that humans have ever seen in their entire lives."
本节重点
详细精要
要理解海量数据,需要解决多个问题,演讲者聚焦两个。
问题一:大规模阅读 Trace 极其昂贵。
可以直观理解为:输入 Token 成本 × Trace 数量 × 每条 Trace 的平均大小。
问题二:超长交互无法被单个 Agent 完整读取。
因为完整的上下文根本 放不进 Memory(Fit in Memory)。
解决方案方向:把上下文当作 外部对象(External Object),通过查询的方式访问。
💬 精华片段(中文)
大规模阅读 Trace 极其昂贵,尤其是当你有数百万条 Trace、每条 Trace 又有数百万 Token 的时候。
"Reading traces at scale is super expensive, especially if you have millions of traces and if you have millions of tokens per trace."
本节重点
详细精要
团队会清醒地思考:完成给定任务所需的最低智能水平(Minimum Level of Intelligence)是多少。
实践路径:先确认任务可行性,再回看 Trace 用开放模型替代。
一旦达到那个“水线(Waterline)”,就回看 Trace,看看能否用开放模型做同样的事情。
与 Harvey 的合作案例:在 Harvey 的 Legal Benchmark(法律基准)上做了大量工作。
具体逻辑:Opus 的某些推理方式可能是 Prompt 导致的,也可能它确实更聪明;如果开放模型不够聪明,就需要给它更多指导,使其在低得多的成本下达到同样的智能水平。
Harness 工程存在智能阈值:Harness 工程很好,能获得即时反馈,也可以运行在 Evals 上。
到达该阈值后,就应该考虑在领域特定任务上 Fine-Tune 模型。
微调可超越前沿性能:很多客户会拿 Base Model 在非常垂直的特定任务上微调。
聚焦在窄任务集上,可以让 Base Model 达到并超越前沿性能。
经济决策变化:从 Token 成本到硬件成本:很多人刚开始做微调时容易忽略。
💬 精华片段(中文)
开放模型在智能上已经达到了一个拐点,我们在 LangChain 不会对每个用例都去用前沿模型。
"Open models have basically hit an inflection point in intelligence that we at LangChain don't reach for the frontier models for every single use case."
本节重点
详细精要
产品会去读取所有 Trace,发现 Issues,进行 Agentic 搜索,并为你准备后续可用的数据集。
Trace 挖掘的三大输出之一:蒸馏与微调(Distillation and Fine-Tuning)。
这就是 蒸馏(Distillation) 和 SFT(Supervised Fine-Tuning,监督微调)。
输出之二:生成 Evals 和 Environments。
换句话说,Evals 的目的就是让它们被通过。
输出之三:为人类准备内容。
💬 精华片段(中文)
我认为,你可以通过展示你在 Agent 上运行的 Evals,来基本定义它的行为。
"I think you can basically define agent behavior by showing the evals that you ran on it."
本节重点
详细精要
在经典机器学习中,你有一个数据集,然后尝试拟合模型;这些原则仍然适用于如今的 Agent-First 世界。
原则的应用方式:Model-Harness-Task Fit:
算法看起来稍有不同,但机器学习的整体过程并没有本质变化。
工作内容的变化:我们进入了一个 Data-First、Agent-First、Fit-First 的世界。
💬 精华片段(中文)
我们在经典机器学习中使用的那些原则,绝对仍然适用于这个以 Agent 为先的世界。
"The same principles that we use in ... classical machine learning ... definitely still apply to this agent-first world."
本节重点
详细精要
这个通用反馈循环是:做某事 → 读结果 → 读 Trace → 进行更新,它最终非常有用。
结合模型微调的案例:Terminal Bench:他提到在“Auto Research”这个词出现之前,很多人就在做类似事情。
例如 Terminal Bench 很难,那么如果让一个 Agent 读自己的 Trace、提出实验并尝试修复,会发生什么?
关键洞察:给 Agent 密集反馈信号(Densifying Feedback)。
Trace 是承载这些反馈的 Substrate(基质),而 Agent 非常擅长读取 Trace 并判断下一步该做什么。
何时 Harness 工程、何时微调:
很多团队只需要 Harness 工程就足以解决客户用例,因此通常最先推荐 Harness 工程。
三明治策略:先做 Harness 工程,再用 Fine-Tuning 突破天花板,之后如有需要再做 Harness 工程。
💬 精华片段(中文)
如果你想改进你的 Agent,最好的做法就是尽可能快地收集反馈。
"If you need to do something for improving your agent, the best thing that you can do is collect feedback as quickly as possible."
本节重点
详细精要
就像人类一样:在环境中采取行动,然后更新自己。
持续学习今天长什么样尚不清楚,但必须在三个轴上同时推进:
第三轴:Memory(记忆)。
Memory 的挑战:人类很擅长随时间记住事情,但我们不是 Append-Only Log(只追加日志)。
需要对那些文件随时间进行更新,并让记忆变得真正高效。
睡眠时间计算与 Dreaming:很多解法来自 Scaling Sleep Time Compute 和广义上的 Dreaming。
💬 精华片段(中文)
我们不能只是把所有东西追加到一个大文件里,然后去搜索它。
"We cannot just append everything to like a really big file and then search over it."
本节重点
详细精要
这是理解你的 Agent 在做什么的最容易的方式。
要点二:对开放模型非常兴奋。
感兴趣的人可以一起聊聊,如何用开放模型让一切更智能、更便宜。
要点三:持续学习的定义。
持续学习就是:在环境中运行,然后把数据整合回 Agent 状态。
要点四:数据爆炸的机遇。
💬 精华片段(中文)
挖掘 Trace 会给你可攀爬的信号。
"Mining traces gives you signals to hill climb on."
| 术语 | 解释 |
|---|---|
| Agent | 在环境中自主行动、调用工具、执行任务的智能体系统,是本次演讲的优化对象。 |
| Trace | Agent 每次运行产生的完整轨迹数据,包括工具调用、输出消息、API 调用、CLI 使用等,是数据挖掘的核心原料。 |
| Data Mining | 在海量 Trace 数据中挖掘问题、模式、反馈信号的过程,用于指导 Agent 改进。 |
| Observability | 可观测性,指通过 Trace 等数据理解 Agent 行为的能力,与持续学习紧密耦合。 |
| Continual Learning | 持续学习,Agent 在环境中行动后,利用反馈更新自身 Prompt、知识或记忆的过程。 |
| Harness Engineering | 通过调整 Prompt、工具说明、上下文等“外部框架”来提升模型表现,无需改变模型权重。 |
| Fine-Tuning | 在领域特定任务上对 Base Model 进行微调,使其在窄任务集上达到或超越前沿模型表现。 |
| Distillation | 蒸馏,将强模型(如 GLM 5.2)的好行为通过数据集迁移到更小、更便宜模型的过程。 |
| SFT | Supervised Fine-Tuning,监督微调,用输入-输出示例对模型进行监督式训练。 |
| Eval | 评估集或评估任务,用于衡量 Agent 行为是否达标,Agent 会通过调整行为来“爬坡”通过这些评估。 |
| Compaction | 上下文压缩,在超长 Agent 运行中压缩历史信息,可能导致模型“变笨”,需通过 Trace 检验。 |
| Token | 模型处理文本的基本单位,用于衡量 Trace 大小和成本。 |
| Open Models | 开放权重模型,过去 6 个月达到智能拐点,可在很多场景替代前沿模型。 |
| Frontier Models | 前沿模型,如 Opus、GPT 5.5 等能力最强但成本也最高的模型,用于验证任务可行性。 |
| Opus | Claude 系列前沿模型,在 Trace 评判能力上被作为基准,开放模型试图以更低成本匹配它。 |
| GPT 5.5 | 文中提到的前沿模型之一,用于某些任务的反事实比较。 |
| GLM 5.2 | 文中提到的模型之一,被用于运行任务并作为蒸馏数据来源。 |
| 9B / 13B | 模型参数量级,用于指代更小、更便宜的开放模型,可通过微调模仿大模型行为。 |
| Codex / Cloud Code / Deep Agents | 编码类或深度 Agent 产品,它们会产生超长交互,难以被单个 Agent 读取完整 Trace。 |
| Swarms | 群体编排,多个 Agent 相互调用的组织方式,使行为更难以推理。 |
| Hooks / Middlewares | Agent 的扩展组件,分别在特定事件触发或处于中间层处理逻辑,增加系统复杂度。 |
| Counterfactual | 反事实分析,例如把 GPT 5.5 换成 GLM 5.2 会怎样,用于基于 Trace 评估不同模型方案。 |
| Hill Climb | 爬山优化,比喻 Agent 通过不断调整行为使 Eval 分数上升的优化过程。 |
| Auto Research | 自动研究,让 Agent 读 Trace、提出实验并尝试修复,以自动提升某个分数。 |
| OPD / OPSD / trySFT | 文中提到的 RL 或微调相关方法名称,属于寻找“好的 Fit 函数”的研究方向。 |
| Terminal Bench | 终端基准测试,输出为通过/未通过,是稀疏反馈的典型例子,说明需要密集反馈信号。 |
| Densifying Feedback | 密集化反馈,把稀疏的通过/失败信号扩展为可指导下一步的详细反馈,Trace 是其载体。 |
| Substrate | 基质,指 Trace 承载反馈信息的基础材料。 |
| Model-Harness-Task Fit | 演讲者提出的框架:把数据、Harness 和模型三者拟合,使所有任务通过。 |
| scikit-learn | 经典机器学习工具库,其“把学习系统拟合到数据”的抽象思想仍适用于 Agent-First 世界。 |
| Input Token Cost | 输入 Token 成本,用于计算大规模读 Trace 的费用。 |
| Hardware Costs | 硬件成本,微调后可转向按集群成本思考,而不是按 Token 计价。 |
| Cluster | 计算集群,高推理量下运行集群可提供无限推理并降低成本。 |
| LangSmith Engine(原文转写 LangSplat Engine) | LangChain 构建的产品,用于自动化 Trace 挖掘:读 Trace、找 Issues、生成 Evals 和反馈数据集。 |
| Append-Only Log | 只追加日志,指一种不可持续的简单记忆方式,无法支撑 Agent 长期工作。 |
| Sleep Time Compute | 睡眠时间计算,指在离线阶段读取生命周期 Trace 并更新 Agent 状态的计算范式。 |
| Dreaming | 广义的“做梦”,比喻 Agent 离线回顾经历、更新记忆和知识的机制。 |