▶ 原文链接

改进 Agent 是一个数据挖掘问题(Improving Agents is a Data Mining Problem)

来源: AI Engineer | Vivek Trivedy | 2026-08-12 播客: AI Engineer 分类: AI 工程 原文发表: Aug 12, 2026 纪要生成: 2026-08-14


全集重点


嘉宾/话题简介

Vivek TrivedyLangChain 的应用研究负责人。本集演讲围绕一个看似朴素、实则关键的问题展开:当 Agent 在真实环境中运行并犯下错误后,我们该如何利用已经产生的数据来持续改进它?Vivek 提出了一套“发布 → 收集 Trace → 数据挖掘 → 数据驱动实验”的配方,并结合 LangChain 帮助客户处理大规模 Trace 数据的实际经验,讨论了可观测性与持续学习的耦合、开放模型微调、Harness 工程、Auto Research、记忆系统与“睡眠时间计算”等前沿方向。


分节详述

00:01 开场:改进 Agent 是一个数据挖掘问题

本节重点

详细精要

💬 精华片段(中文)

我们今天要讨论的问题是:如何持续改进 Agent,以及如何通过数据做到这一点。

"The problem that we're going to talk about today is how do we continuously improve agents, but how do we do that via data?"


01:04 持续改进 Agent 的四个步骤

本节重点

详细精要

💬 精华片段(中文)

构建成功 Agent 的第一步,是把它发布出去。

"So, the first step in building a successful agent is shipping it."


02:40 持续学习与可观测性的紧密耦合

本节重点

详细精要

💬 精华片段(中文)

如果你是一家持续学习公司,你就需要 Trace;如果你有 Trace,你就能尝试对 Agent 做持续学习。

"If you're continual learning company, you need traces, and if you have traces, then you can try to do continual learning over your agents."


03:43 为什么 Trace 很重要:从代码到 Agent 的转变

本节重点

详细精要

💬 精华片段(中文)

过去四年以来,我们开始用确定性换取自主性。

"Over the last four years since the ChatGPT moment, we've started trading determinism for autonomy."


04:45 LangChain 如何阅读 Trace

本节重点

详细精要

💬 精华片段(中文)

我们今天看到的数据,将会是人类有史以来见过的最少的数据。

"The data that we see today is going to be the smallest that humans have ever seen in their entire lives."


06:18 Trace 规模的挑战:成本与上下文窗口

本节重点

详细精要

💬 精华片段(中文)

大规模阅读 Trace 极其昂贵,尤其是当你有数百万条 Trace、每条 Trace 又有数百万 Token 的时候。

"Reading traces at scale is super expensive, especially if you have millions of traces and if you have millions of tokens per trace."


07:50 开放模型拐点、Harness 工程与微调

本节重点

详细精要

💬 精华片段(中文)

开放模型在智能上已经达到了一个拐点,我们在 LangChain 不会对每个用例都去用前沿模型。

"Open models have basically hit an inflection point in intelligence that we at LangChain don't reach for the frontier models for every single use case."


10:27 LangSmith Engine 与 Trace 挖掘的三大输出

本节重点

详细精要

💬 精华片段(中文)

我认为,你可以通过展示你在 Agent 上运行的 Evals,来基本定义它的行为。

"I think you can basically define agent behavior by showing the evals that you ran on it."


12:31 从经典机器学习到 Model-Harness-Task Fit

本节重点

详细精要

💬 精华片段(中文)

我们在经典机器学习中使用的那些原则,绝对仍然适用于这个以 Agent 为先的世界。

"The same principles that we use in ... classical machine learning ... definitely still apply to this agent-first world."


14:33 Auto Research、反馈密度与 Harness vs 微调

本节重点

详细精要

💬 精华片段(中文)

如果你想改进你的 Agent,最好的做法就是尽可能快地收集反馈。

"If you need to do something for improving your agent, the best thing that you can do is collect feedback as quickly as possible."


17:09 持续学习的三个轴与记忆/睡眠计算

本节重点

详细精要

💬 精华片段(中文)

我们不能只是把所有东西追加到一个大文件里,然后去搜索它。

"We cannot just append everything to like a really big file and then search over it."


18:41 关键要点与结束

本节重点

详细精要

💬 精华片段(中文)

挖掘 Trace 会给你可攀爬的信号。

"Mining traces gives you signals to hill climb on."


专业术语注释

术语 解释
Agent 在环境中自主行动、调用工具、执行任务的智能体系统,是本次演讲的优化对象。
Trace Agent 每次运行产生的完整轨迹数据,包括工具调用、输出消息、API 调用、CLI 使用等,是数据挖掘的核心原料。
Data Mining 在海量 Trace 数据中挖掘问题、模式、反馈信号的过程,用于指导 Agent 改进。
Observability 可观测性,指通过 Trace 等数据理解 Agent 行为的能力,与持续学习紧密耦合。
Continual Learning 持续学习,Agent 在环境中行动后,利用反馈更新自身 Prompt、知识或记忆的过程。
Harness Engineering 通过调整 Prompt、工具说明、上下文等“外部框架”来提升模型表现,无需改变模型权重。
Fine-Tuning 在领域特定任务上对 Base Model 进行微调,使其在窄任务集上达到或超越前沿模型表现。
Distillation 蒸馏,将强模型(如 GLM 5.2)的好行为通过数据集迁移到更小、更便宜模型的过程。
SFT Supervised Fine-Tuning,监督微调,用输入-输出示例对模型进行监督式训练。
Eval 评估集或评估任务,用于衡量 Agent 行为是否达标,Agent 会通过调整行为来“爬坡”通过这些评估。
Compaction 上下文压缩,在超长 Agent 运行中压缩历史信息,可能导致模型“变笨”,需通过 Trace 检验。
Token 模型处理文本的基本单位,用于衡量 Trace 大小和成本。
Open Models 开放权重模型,过去 6 个月达到智能拐点,可在很多场景替代前沿模型。
Frontier Models 前沿模型,如 Opus、GPT 5.5 等能力最强但成本也最高的模型,用于验证任务可行性。
Opus Claude 系列前沿模型,在 Trace 评判能力上被作为基准,开放模型试图以更低成本匹配它。
GPT 5.5 文中提到的前沿模型之一,用于某些任务的反事实比较。
GLM 5.2 文中提到的模型之一,被用于运行任务并作为蒸馏数据来源。
9B / 13B 模型参数量级,用于指代更小、更便宜的开放模型,可通过微调模仿大模型行为。
Codex / Cloud Code / Deep Agents 编码类或深度 Agent 产品,它们会产生超长交互,难以被单个 Agent 读取完整 Trace。
Swarms 群体编排,多个 Agent 相互调用的组织方式,使行为更难以推理。
Hooks / Middlewares Agent 的扩展组件,分别在特定事件触发或处于中间层处理逻辑,增加系统复杂度。
Counterfactual 反事实分析,例如把 GPT 5.5 换成 GLM 5.2 会怎样,用于基于 Trace 评估不同模型方案。
Hill Climb 爬山优化,比喻 Agent 通过不断调整行为使 Eval 分数上升的优化过程。
Auto Research 自动研究,让 Agent 读 Trace、提出实验并尝试修复,以自动提升某个分数。
OPD / OPSD / trySFT 文中提到的 RL 或微调相关方法名称,属于寻找“好的 Fit 函数”的研究方向。
Terminal Bench 终端基准测试,输出为通过/未通过,是稀疏反馈的典型例子,说明需要密集反馈信号。
Densifying Feedback 密集化反馈,把稀疏的通过/失败信号扩展为可指导下一步的详细反馈,Trace 是其载体。
Substrate 基质,指 Trace 承载反馈信息的基础材料。
Model-Harness-Task Fit 演讲者提出的框架:把数据、Harness 和模型三者拟合,使所有任务通过。
scikit-learn 经典机器学习工具库,其“把学习系统拟合到数据”的抽象思想仍适用于 Agent-First 世界。
Input Token Cost 输入 Token 成本,用于计算大规模读 Trace 的费用。
Hardware Costs 硬件成本,微调后可转向按集群成本思考,而不是按 Token 计价。
Cluster 计算集群,高推理量下运行集群可提供无限推理并降低成本。
LangSmith Engine(原文转写 LangSplat Engine) LangChain 构建的产品,用于自动化 Trace 挖掘:读 Trace、找 Issues、生成 Evals 和反馈数据集。
Append-Only Log 只追加日志,指一种不可持续的简单记忆方式,无法支撑 Agent 长期工作。
Sleep Time Compute 睡眠时间计算,指在离线阶段读取生命周期 Trace 并更新 Agent 状态的计算范式。
Dreaming 广义的“做梦”,比喻 Agent 离线回顾经历、更新记忆和知识的机制。

延伸思考

原文发表:Aug 12, 2026  ·  纪要生成:2026-08-14