来源: YouTube | Rahul Ghosh, Vidya Sagar (AWS), Dipen (Yahoo Finance) | 2025-12-04 分类: 其他 原文发表: Dec 04, 2025 纪要生成: 2026-08-06
本集内容来自AWS re:Invent 2025大会,由三位嘉宾共同分享。Rahul Ghosh 和 Vidya Sagar 来自 AWS 生成式AI创新中心(Gen AI Innovation Center),他们介绍了AI智能体的关键推理模式以及Amazon Bedrock AgentCore如何解决智能体规模化落地的挑战。另一位嘉宾 Dipen 来自 雅虎财经(Yahoo Finance),他在AI和数据科学领域有超过17年的经验。本集深入探讨了雅虎财经如何结合AWS服务,构建一个用于金融研究和问答的多智能体系统,以弥合散户投资者与专业机构之间的信息鸿沟。
本节重点
详细精要
专注于与AWS客户合作,共同解决他们在将生成式AI(Gen AI) 引入生产流程时遇到的最艰巨挑战。
Dipen(雅虎财经 AI 负责人):介绍其团队背景及项目合作历程。
雅虎财经团队在过去 近一年的时间 里一直与AWS Gen AI创新中心以及Vidya的团队紧密协作,构建生成式AI功能。
Vidya Sagar(AWS Gen AI 创新中心应用经理) :介绍Gen AI创新中心的全球业务范围和核心职能。
本节重点
详细精要
覆盖关键方面:跨分布式环境的智能体编排、访问多模态数据(结构化与非结构化)、协调API工具调用智能体,以及管理异构数据源和评估性能。
AI智能体的定义:AI智能体代表着我们构建、部署和与技术互动方式的结构性转变(Tectonic Shift)。
智能体化AI(Agentic AI)为大语言模型(LLM) 带来了质的飞跃,通过赋予它们工具调用能力、记忆组件和智能体循环(Agentic Loops) 来实现真正的“自主行动能力(Agency)”。
四大关键驱动力:将智能体AI从炒作变为现实,已不再是“是否可行”的问题,而是“如何让其最好地成功”。
智能体开发工具:当下涌现出种类繁多的开发框架和复杂工具,极大地降低了构建和部署智能体的门槛。
智能体AI成熟度模型:从基于规则的传统自动化到完全自主设定目标的四个层级。
💬 精华片段(中文)
"AI agents represent a tectonic shift in how we build, deploy, and interact with technology." "AI智能体代表着我们构建、部署和与科技互动方式的根本性转变。"
本节重点
详细精要
循环可以是单步或多步的,其中工具、记忆和目标作为输入喂给LLM,整个过程在开发者设定的护栏(Guardrails) 和可观测性机制下运行。
ReWOO与Reflexion推理策略:对于深度研究和金融应用等复杂场景,仅有ReACT是不够的,需要融合多种策略。
Reflexion:促进自我反思和迭代优化。智能体可以评估其生成报告的质量,识别研究中存在的空白点,然后迭代地修正其结论,这对于保障分析质量和维护信息可信度至关重要。
单一智能体 vs. 多智能体:选择合适的模式取决于任务的复杂度和可用的工具集。
💬 精华片段(中文)
"The more we expand their scope, the more likely they are to make mistakes. So when you are providing an agent with too many tools, this can lead to confusion between tool selection for the agent." "我们越是扩大其职责范围,它们犯错的可能性就越大。当你为一个智能体提供过多工具时,就会导致它在选择工具时产生混淆。"
本节重点
详细精要
管理者掌握最终的决策权,整个流程呈现出结构化和可预测的特征。
智能体集群模式(Agent Swarm Pattern):采用集体协作式的分布式决策过程。
关键优势:由于共享全局信息,集群模式能够防止智能体之间因为拥有相似的工具集或数据源而重复执行相同任务。
混合模式(Hybrid Pattern):在实际复杂业务中,往往会结合以上两种模式的优势。
本节重点
详细精要
金融分析通常需要多步推理、假设生成、跨数据源的数据收集,以及通过多轮验证与修正来合成最终结论。
多模态数据集成挑战:分析师必须处理高度异构的信息。
挑战在于,这些数据来自数百个全球数据源,各自的更新频率和可靠性标准参差不齐。
规模与质量的权衡:海量数据带来了“信号与噪声”的甄别难题。
因此,深度研究系统必须有全面的审计追踪(Audit Trail),追溯每一个信息来源,并具备 “重大信息(Material Information)” 的检测能力,以确保研究结果的一致性。
系统架构示例:一个为满足上述复杂要求而设计的管理者-子智能体架构。
本节重点
详细精要
核心矛盾:基础设施、资源调度、安全与治理等方面的复杂性会显著拖慢创新,成为许多客户将POC部署到生产环境失败的首要原因。
Amazon Bedrock AgentCore 的价值主张:它不是一个框架,而是一个专门解决上述生产级挑战的智能体工具链。
三大核心价值:大幅缩短业务价值的变现时间(免去基础设施和运维开销);打破技术黑盒;提供经过长期验证的、安全可靠且可自动伸缩的部署环境。
POC到落地必须克服的五大挑战:这些是实现商业价值的必经之路,没有捷径。
合规与可观测性:企业级应用必然要求全面的审计、监控和合规能力。
AgentCore架构如何运作:以一个待部署的研究型智能体为例。
💬 精华片段(中文)
"Complexity will basically slow down the innovation. Complexity around infrastructure management and everything will slow down the innovation." "复杂性会从根本上拖慢创新的步伐。围绕基础设施管理等各方面的复杂性,都会让创新步履维艰。"
本节重点
详细精要
本节重点
详细精要
混合内容的复杂性:SEC文件尤其典型,其中既有精确的财务报表表格,又有关于管理层讨论、风险披露等的大量叙述性文字。不同数据的到达速率也不同,特别是在财报季存在流量洪峰。
架构演进:从同步到异步解耦:原型阶段的简单同步架构在生产环境中存在致命瓶颈。
最终方案:异步轮询。客户端提交问题后立即返回,智能体工作流转至异步执行。任务完成后,智能体将答案写回数据库,客户端再通过轮询(Polling) 来获取结果,实现了API和智能体的解耦。
核心的股权研究多智能体系统:由一个管理者智能体统领多个专业化的子智能体。
扩展的网络搜索:当自有知识库已授权数据不充分时,系统也会针对权威信息源进行受限的网络搜索,并将结果提供给新闻智能体。
输入与输出护栏:贯穿始终的安全防线。
本节重点
详细精要
支撑性服务:RDS(关系型数据库) 用于存储对话历史和上下文信息;工作流的驱动和编排同样依靠Lambda函数;系统整体的可观测性则通过 CloudWatch 指标 来监控。
AgentCore作为统一平台的价值:若采用 AgentCore,上述许多系统组件的复杂度将可以被一个统一框架所吸收。
本节重点
详细精要
灵活的数据处理与推理:在查询“Meta是否有内部人士卖出股票?”时,用户不仅可以要求用表格呈现,系统还能自动利用已有数据,推导并创建出原始数据库中不存在的计算列,如“交易价值”。
AWS Bedrock Guardrails 的安全防线实践:这是确保系统安全与合规的核心防御机制。
本节重点
详细精要
知识库重排序:对初步检索的结果进行二次重排序(Re-ranking),确保最终送给LLM的是相关性最强的文本块。
系统提示词的优化:在金融领域的提示词设计中,最佳实践是相信模型的涌现能力,而非硬编码指令。
解决时间复杂性:对于最棘手的财年问题,最有效的办法是提供一个专门的工具,比如通过股票代码查询该公司具体财季的函数。
系统评估的独特挑战与混合式解决方案:在金融领域的评估是“构建系统”与“证明其有效”是两码事。
他们的混合式方法:
最终评估指标与成本:
💬 精华片段(中文)
"Building a system for financial question answering is one thing, but proving that it works reliably, that's a completely different ball game." "构建一个金融问答系统是一回事,但要证明它能可靠地工作,就是完全不同性质的一件难事了。"
| 术语 | 解释 |
|---|---|
| Gen AI (生成式AI) | 指生成式人工智能,能够创造新的内容(文本、图像、代码等)的AI技术,本集中特指基于大语言模型的应用。 |
| Multi-Agent Systems (多智能体系统) | 一种由多个自治的AI智能体组成的系统,它们相互通信、协作或由管理者协调,以共同完成一个复杂的任务。 |
| Amazon Bedrock | AWS提供的一项全托管服务,允许用户通过API访问和定制来自多家AI公司的高性能基础模型,并构建生成式AI应用。 |
| AgentCore | AWS于re:Invent 2025上重点介绍的智能体工具链,提供运行时、网关、身份、记忆和可观测等模块化功能,用于简化AI智能体从原型到生产环境的规模化落地。 |
| ReACT (Reasoning and Act) | 最主流的智能体推理模式,核心是“思考-行动-观察”的循环。智能体接收任务后,推理下一步行动(调用工具或回答),执行后根据观察结果再次推理,如此往复。 |
| ReWOO (Reasoning Without Observation) | 一种智能体推理策略,特点是先制定完整计划,再并行执行多个工具调用,以大幅加速数据收集过程,适合财报、股价等数据可同时获取的场景。 |
| Reflexion | 一种侧重于“自我修正”的智能体推理模式,允许智能体评估自己生成的报告,识别逻辑漏洞或信息空白,并迭代地改善最终输出。 |
| Agentic AI (智能体化AI) | 指具备“自主性”的AI,超越了单纯的聊天机器人,能够通过使用工具、记忆和规划,自主地完成多步、目标导向的任务。 |
| RAG (检索增强生成) | 一种将信息检索系统与LLM相结合的架构。在回答问题时,先从外部知识库中检索最新的、相关的私有数据,再交给LLM进行总结和生成答案,以解决幻觉和知识过时问题。 |
| MCP (Model Context Protocol / 模型上下文协议) | 一种开放协议,旨在标准化应用程序如何为LLM提供上下文,在本集中特指一种连接各类工具和数据源的统一协议或服务器。 |
| Supervisor Sub-agent Pattern (管理者-子智能体模式) | 一种层级化的多智能体协作模式,由管理者智能体理解任务、分解任务并路由给对应的子智能体执行,最终由管理者汇总答案。 |
| Agent Swarm (智能体集群模式) | 一种去中心化的多智能体协作模式,集群内的每个智能体共享上下文,并可以自主决定将任务移交给另一个智能体。 |
| RAG Agent (检索增强生成智能体) | 与特定知识库或向量数据库连接的智能体,其核心行动是从中检索相关信息来增强LLM的回答。如本集雅虎财经的SEC文件智能体和新闻智能体。 |
| Tool-calling Agent (工具调用智能体) | 主要通过与外部API进行交互来完成任务的智能体,能够生成并执行函数调用,直接获取精确、实时的结构化数据。 |
| SQS (Simple Queue Service) | AWS提供的全托管消息队列服务,在本架构中用于解耦API层和计算层,实现异步任务缓冲。 |
| LLM as a Judge (LLM作为裁判) | 一种自动化评估方法,使用一个强大的LLM,根据预设的评价量规,对另一个AI系统生成的输出进行打分和评估。 |
| Hierarchical Chunking (层级分块) | 一种处理文档并构建向量的高级技术,它会尊重文档的章节、标题等层级结构进行切分,而不是按固定Token长度机械切割,能更好地保留上下文。 |
| Prompt Injection (提示词注入) | 一种针对LLM应用的安全攻击,攻击者在输入中植入恶意指令,试图覆盖或绕过系统的原始Prompt指令,导致系统执行非预期的行为。 |
| Golden Dataset (黄金数据集) | 在AI系统评估中,由人类专家手动创建的、包含高质量、绝对正确的“问题-标准答案”对的数据集,用于作为评估系统性能的基准。 |
多智能体的协调成本与收益平衡:雅虎财经选择了结构化更强的管理者模式。在实际业务场景中,如何权衡“管理者-子智能体”的可控性与“智能体集群”的协作灵活性?在什么任务类型下,集群模式可能会表现出比管理者模式更高的效率?
AgentCore的模块化设计对现有技术栈的影响:Vidya强调AgentCore是框架和模型无关的。这是否意味着AWS正在从“云基础设施提供商”向“智能体运行环境平台”转型?这种“只替换部分零件”的策略,是否会比要求开发者全盘重写的平台更容易赢得企业市场?