来源: YouTube | David & Jane (JP Morgan Private Bank) | 2025-05-29 播客: LangChain 分类: AI 工程 原文发表: May 29, 2025 纪要生成: 2026-08-06
本次演讲来自 JP 摩根私人银行 投资研究团队的 David 和 Jane。他们所在的团队负责为高净值客户筛选和管理数千种复杂的投资产品。面对海量的结构化数据、爆炸式增长的非结构化文档,以及高度依赖人工专家的专有分析模型,他们自主开发了内部 AI 智能系统 "Ask David"。本集深入探讨了他们如何基于 LangGraph 从零开始构建这一多代理系统,以在严苛的金融合规与极高准确性要求下,实现投资研究的自动化与规模化。
本节重点
详细精要
这种模式阻碍了团队为平台上的所有产品生成深度洞察的能力,使高质量服务受限于人力瓶颈
"Ask David" 旨在成为数据、分析、可视化与洞察的一站式决策助理
💬 精华片段(中文)
"Today, when you have a question, you come to me. You come to David and Dave will give you an answer. But tomorrow, you'll be able to go ask David, our AI powered solution designed to transform the way we answer investment questions." ("今天,如果你有问题,你来找我,找 David,我会给你答案。但明天,你就可以去问 David —— 我们专为转变投资问答方式而设计的 AI 驱动解决方案。")
本节重点
详细精要
代理的核心作用在于引入 效率 和 一体化的用户体验,将分散的查询结果聚合
非结构化数据的管理挑战与机遇
大模型技术的进步为充分利用这些非结构化信息带来了巨大的机会,能够从以往必须由人工阅读的杂乱文件中提取有效信息
专有模型与分析工具的封装与调用
代理系统的任务是能够自动调用这些分析 API,实现洞察生成的 规模化
"Ask David" 的正式含义
💬 精华片段(中文)
"With the help of agent, we can scale the insight generation and we can make our service available to more of our clients." ("在代理的帮助下,我们可以规模化地生成洞察,并将我们的服务提供给更多的客户。")
本节重点
详细精要
监督器具备关键的安全意识:它掌握 何时触发 Human-in-the-loop,确保在高风险环节引入人类监督以保障最高的准确率和可靠性
结构化数据代理的设计模式
在获得结构化的返回数据后,再利用 大语言模型 对数据进行最后的归总与润色,生成易于阅读的自然语言回答
非结构化数据代理的设计差异
系统采用基于 RAG 的代理 来检索最相关的文档片段,并从中提炼答案
分析代理的复合决策机制
对于复杂的分析需求,代理会采用 文本转代码生成 的技术,且在最终执行代码前会引入 人类监督 层,确保金融模型计算的绝对安全
端到端工作流的双通道子图设计
💬 精华片段(中文)
"The supervisor agent have access to both short-term and long-term memories so that it can customize the user experience. It also knows when to invoke human in the loop to ensure the highest level of accuracy and also reliability." ("监督器代理能够访问短期和长期记忆,从而定制用户体验。它也知道何时调用人机协同机制,以确保最高水平的准确性和可靠性。")
本节重点
详细精要
随后,系统将请求送入 特定基金工作流,该工作流内部的监督器会提取出具体的基金信息作为上下文,并意识到需要调用 文档检索代理 去挖掘相关资料
数据检索与工具调用
快速抓取到背后的结构化与非结构化背景信息
关键节点:基于用户角色的答案个性化
该节点能够根据用户画像和角色权限智能 定制回答的颗粒度与语言风格
质量保障:基于 LLM 审判的反省节点
这一环是为了在不添加人工负担的情况下,最大限度地擦除低级错误
最终处理与记忆更新
💬 精华片段(中文)
"A due diligence specialist may demand a very detailed answer while a advisor maybe just need a general answer. So this personalization node will tailor the answer based on the user roles." ("尽职调查专家可能需要非常详细的答案,而顾问可能只需要一个通用答案。因此,这个个性化节点会根据用户角色来定制答案。")
本节重点
详细精要
第四阶段:当前架构,依据实际业务需求生成了 针对不同意图的独立子图 —— 普通问题子图与特定基金子图。这种架构使得后续扩展新的业务意图变得极其容易
重构式开发的深层原因
💬 精华片段(中文)
"Start simple and refactor often. I know I show you a fairly complex diagram earlier but we didn't really focus on building that diagram from day one." ("从简单开始,并经常重构。我知道我之前展示了一张相当复杂的架构图,但我们从第一天起并没有专注于去构建那张图。")
本节重点
详细精要
持续的评估能为你提供 日拱一卒的信心,通过数据曲线证明每次调整是在向正确的方向前进
多维度的评估策略与指标选取
真值的积累飞轮:一旦启动评测,就会产生数据审阅需求,在不断的审阅过程中,会自动 积攒出更多的高质量真值数据集
LLM 裁判与人类审阅的混合方案
💬 精华片段(中文)
"You can start evaluation with or without ground truth it doesn't matter there are so many metrics beyond just accuracy and each one of them will provide you some insight." ("无论有没有真值,你都可以开始评估。除了准确度之外还有很多指标,每一个都会为你提供一些洞察。")
本节重点
详细精要
最后冲刺(90%-100%):这就是 GenAI 应用的 "最后一公里",也是"最艰难的里程"。由于生成式 AI 的固有随机性,100% 可能难以企及
极限条件下的 "守门人" 策略
💬 精华片段(中文)
"Between 90% and 100%, that's what we call the last mile and the last mile is always hardest mile. In terms of GenAI applications, it may not be achievable to get that 100% mark, so what do we do? Human is in the loop." ("在 90% 和 100% 之间,就是我们所说的'最后一公里',而这最后一公里总是最难的一段。在生成式 AI 应用中,可能无法达到 100%,那我们该怎么办?让人参与进来。")
| 术语 | 解释 |
|---|---|
| LangGraph | 由 LangChain 推出的用于构建有状态、多参与者应用程序的框架,本案例中用于编排包含监督器与子代理的状态图。 |
| 多代理系统 | 由多个具备不同专业能力的 AI 代理组成的系统,通过一个中央监督器代理进行调度,以协作完成复杂任务。 |
| 监督器代理 | 该架构中的中央协调节点,负责理解用户意图、访问记忆系统并将任务分发给特定的子代理。 |
| 领域特定 QA 代理 | 针对特定行业(如金融)或特定数据集进行深度定制,能精准回答专业问题的问答代理。 |
| ReAct Agent | 一种结合推理与行动的 AI 代理设计模式,能够根据外部工具的反馈循环执行任务,是 "Ask David" 的早期原型形态。 |
| RAG 代理 | 基于检索增强生成技术的代理,在处理提问时先从向量数据库中检索最相关的非结构化文本片段,再交给大模型归纳总结。 |
| 人机协同 | 在本语境下指 AI 系统在信心不足或面对高风险操作(如代码执行)时,自动暂停并将任务升级给人类专家审核的机制。 |
| 子图架构 | 将不同意图(如通用问题 vs 特定基金问题)封装在相互独立的有向无环图中的设计,便于独立维护与横向扩展。 |
| LLM as Judge | 利用另外的大语言模型作为评估器,通过特定的提示词对 AI 生成的回答进行打分和逻辑检查的自动化评估方法。 |
| 最后一公里 | 指在 GenAI 应用中,准确率从 90% 提升到近乎完美的 100% 的极其艰难的最终优化阶段。 |
| 未格式化文本至代码生成 | 指将用户的自然语言指令自动转化为可执行的编程代码(如 Python/SQL),以调用复杂的分析模型。 |
| 个性化和反省节点 | 前者根据用户角色调整答案的专业度与长度;后者在生成答案后进行自我批判,如不合逻辑则触发重试。 |
值得进一步关注的问题、争议点或行动建议: