▶ 原文链接
遗传评估与长程任务:衡量AI能力的新视角(中文)
来源: YouTube | 未知嘉宾 | 未知日期
分类: 其他
原文发表: 未知
纪要生成: 2026-08-05
全集重点
- 度量AI进步的双重维度:不仅是任务长度,更要看任务的经济价值和合成质量,单一指标无法全面反映AI的真实能力。
- 任务时长呈指数级增长但可靠性脱节:AI可完成任务的时间每七个月翻一番,但在高可靠性要求(80%)下,其有效时长远低于50%可靠性下的数据。
- 真实经济价值任务的线性追赶:在与十年经验的人类专家比拼中,AI的胜率呈线性而非指数级增长,目前最强模型在约48%的任务上能达到或超越人类。
- 参考数据和知识合成是关键瓶颈:AI在需要检索、整合并验证外部知识库的任务上表现挣扎,尤其是在查找基础性论文和确保引用准确性方面存在巨大差距。
- 上下文才是真正的护城河:AI更像一个能力很强但缺乏领域背景知识的“外包人员”,面对需要大量隐性知识和对任务环境有深度理解的真实工作时,其性能会显著下降。
嘉宾/话题简介
本集为一堂大学课程讲座,主讲人系统性地探讨了如何评估 AI 智能体在完成长程、复杂和专业任务上的能力。讲座围绕三篇核心论文展开,分别从任务完成时长、真实世界经济价值以及深度研究合成三个不同但相互关联的维度,剖析了当前 AI 模型的能力边界、失败模式以及未来发展方向。
分节详述
[00:05] 引言:为何需要新时代的智能体评估?
本节重点
- 传统基准测试正迅速饱和,不足以反映真实进步。
- 新的评估需关注任务完成的时间跨度和经济价值。
- 课程将围绕三篇论文展开,从不同角度衡量 AI 能力。
详细精要
💬 精华片段(中文)
"Traditional benchmarks... are starting to saturate it fairly quickly. However, we do need to measure, both in terms of capability and economic impact, how these models are progressing so that we can see what their impact will be in the coming years."
(传统基准测试正迅速趋于饱和。然而,我们确实需要从能力和经济影响两个方面来衡量这些模型的进步,以便了解它们在未来几年内将产生何种影响。)
[04:23] 论文一:METR — 衡量任务完成的时间跨度
本节重点
- 通过三个任务套件,覆盖从1秒到8小时的任务。
- 以人类专业人士的完成时间为基准,衡量 AI 完成任务的时长和可靠性。
- 揭示 AI 可完成任务的时间长度呈指数级增长。
详细精要
- METR 的评估框架:专注于模型能完成的任务持续时间,并与可靠性(如50%或80%成功率)关联。
- 统一基准:所有任务以专业人类完成该任务所需的时间作为衡量尺度。
- 任务套件构成:使用了三个覆盖不同时长和复杂度的任务套件,总计约170个任务。
- SWAA:66个任务,时长1到30秒,专注于基本原子操作(如打开文件)。
- HCAST:97个任务,时长1分钟到30小时,涵盖多样化的软件和研究工程任务。
- RE-Bench:7个任务,时长可达8小时,提供完整的ML研究风格任务(如AI科学家论文)。
-
具体任务案例:包含了查找Shell脚本(3秒)、Wikipedia研究、检测修复模拟输入文件的Bug(人类需10分钟)、JSON数据格式转换(数据清洗)、以及实现自定义CUDA内核并追求性能提升(需8小时以上)等不同维度的任务。
-
建立人类基线的方法:为保证基准的准确性,研究团队采用了严格的专家校准方法。
- 聘请具有约五年经验的熟练专业人士来完成任务,并记录其成功完成所需的时间。
- 对成功尝试的完成时间取几何平均值,作为任务难度评级。
-
潜在挑战:有经验的专业人士可能会低估任务的难度,因为他们已经习惯了成功的标准,而这与模型对任务难度的感知可能不一致。
-
核心发现一:能力呈指数级增长:从模型发布日期来看,其完成任务的时间跨度正在以指数速度延长。
- GPT-2时代(2019年):只能完成约2秒的任务。
- GPT-4时代(2023年):进步到可以完成数分钟级的任务。
- Claude 3.7 Sonnet时代(2025年):在50%的可靠性下,任务时长已达到59分钟。
-
增长速率:这一趋势表明,任务完成时间大约每七个月就会翻一番。
-
核心发现二:能力增长背后的驱动力:这种指数级增长是由多种模型基础能力的提升共同推动的。
- 更好的逻辑推理:模型学会了更好地进行推理。
- 代码生成能力提升:模型在代码生成方面表现更佳。
- 工具使用:模型使用工具的方式得到改善(如ReAct等)。
- 目标导向与错误恢复:模型能够更好地从错误中恢复,并对最终目标有更强的意识和记忆,能追踪任务进度。
- 语境工程:来自学生的补充,指出更好地在多时间步中结构化上下文(即语境工程),以及使用如Cursor等工具的在线反馈和用户日志进行改进,也是重要的推动力。
- 规划与重规划:面对复杂问题,模型会先进行显式规划,并在执行过程中根据收集的数据触发重规划,从而减少试错。
- 记忆与环境理解:智能体需要理解其操作的环境(如代码库),记忆机制有助于在多次操作中保持这种理解。
💬 精华片段(中文)
"The longer the task, the harder it's for models to stay on track and complete. And this is partly why agentic evaluations and what you measure starts to become a challenging aspect."
(任务越长,模型就越难保持正轨并完成它。这也是为何智能体评估及其指标开始成为一个挑战的部分原因。)
[19:36] 论文一(续):可靠性差距与失败模式分析
本节重点
- 高可靠性要求下(80%成功率),AI的任务完成时长急剧下降。
- 任务成功率存在巨大的可靠性差距。
- 模型的失败模式主要集中在规划、工具选择和重复性错误上。
详细精要
- 可靠性的巨大差距:当要求更高的可靠性时,模型的性能会显著下降。
- 以80%的成功率来衡量,即使是2025年的最强模型,其稳定完成任务的时间也仅有8到10分钟,远远低于50%成功率下的59分钟。
- 这种差距揭示了在现实世界部署模型时,即使是中等复杂度的任务也存在巨大的可靠性挑战。
-
主讲人将其比喻为:你把任务交给一个实习生,但他只有一半的概率能成功完成。
-
模型的典型失败模式:分析GPT-4(非推理型)和o1(推理型)等模型,揭示了以下共通的失败模式。
- 糟糕的规划:模型不知道如何将给定任务分解为合理的步骤。
- 糟糕的工具选择:模型选择的工具集可能不正确。
- 错误的心理运算或推理:模型在进行数学或逻辑推理时出错。
- 过早放弃任务:模型出现重复性行为,但无法判断任务是否成功,最终放弃。
-
陷入重复性循环:模型执行某些动作,即使失败了,该动作仍是最高概率的选择,导致不断重试。在GPT-4上该问题非常严重,而在o1上有所缓解。
-
METR基准的局限性:任何基准都不是完美的,METR同样存在一些缺陷。
- 对模糊复杂任务的性能较低:在那些没有一个唯一正确答案或涉及复杂性的“混乱”任务上,模型表现较差。
- 基准污染:在SWE-bench等基准中,模型可能早已“见过”大部分代码库(如 GitHub 仓库),导致其预测的增长时间偏短,如果面对完全未见的仓库,表现会打折扣。
- 缺乏领域上下文时性能下降:对比拥有项目背景的代码维护者和缺乏背景的外包承包商,后者的解决速度可能慢5到18倍。模型的表现更接近于承包商,像一个低语境的人类,缺乏特定领域的专家知识和上下文。
💬 精华片段(中文)
"So this gap, basically, says that if you're trying to deploy these models in real-world tasks, then there will be reliability challenges even for moderately complex tasks."
(所以这个差距基本上意味着,如果你想在真实世界任务中部署这些模型,那么即使是中等复杂度的任务也会面临可靠性的挑战。)
[27:27] 论文二:GDPVal — 评估真实世界的经济价值
本节重点
- GDPVal评测的是模型在真实、具有经济价值的任务上与人类专家的对比。
- 任务库来自GDP前5%的行业专家,覆盖9个行业、44个职业。
- 趋势与METR不同,AI能力的提升在这里更多是线性的。
详细精要
- GDPVal的评估哲学:核心问题不再是“AI能做这个吗?”,而是“如果把这个任务交给模型而不是人类,输出的结果足够好吗?”。
- 任务的胜率直接与拥有十几年经验的行业专家进行对比。
-
任务库设计源自多个行业的真实工作,覆盖范围极广,包括房地产、政府、制造业、专业科技服务、医疗、金融、零售、信息和影视编辑等。
-
任务样例与数据集特点:任务非常真实且多样化,直接取自各领域的专业人士。
- 制造工程师:为装配线设计一个3D模型的电缆卷轴架。
- 金融投资分析师:创建竞争格局分析。
- 注册护士:根据组织图像评估并撰写咨询报告。
- 影视编辑:根据脚本制作开场片段。
- 客服代表:为不满的客户起草邮件回复。
- 礼宾服务:为一个四口之家创建行程计划。
- 审计员:根据多个采购订单找出定价不一致的地方。
- 房地产经纪人:为新楼盘设计销售宣传册。
- 康乐工作者:优化展销会摊位布局。
- 数据集规模:数据集覆盖了9个经济部门、44个职业,包含1320个任务,其中220个是开放目标的。它主要集中在美国O*NET职业分类体系中,占总GDP前5%数字化任务的60%,具有很强的代表性。
-
任务特征:有些任务平均完成时间需7小时,有些则需数周。任务形式包含文本和多模态(CAD、视频、音频、电子表格)。通过专家审核,89% 的任务被确认表述得非常清晰。
-
核心发现:线性而非指数级的进步:与METR指数级增长的趋势相反,GDPVal显示出一种更接近线性的趋势。
- GPT-4o (2024年): 胜率(含平局)约为12.4%。
- 演进路径:胜率逐步提升至 25%、30% 左右。
- Claude Opus 4.1 (最新): 胜率达到47.6%,约有48% 的任务能达到或超越人类专家水平。
-
趋势解读:这种线性趋势表明,在需要数小时、数天甚至数周才能完成的真实专业工作上,模型的可靠性提升是渐进的,而非跳跃式的。它打破了人们因METR指数趋势而产生的过于乐观的推断。
-
模型性能差异与失败模式:不同模型在不同类型的任务上各有千秋。
- Claude系列:在美学、文档格式化、理解PDF/电子表格/演示文稿方面表现更好。
- GPT-5:在指令遵循、精确计算和纯文本任务上表现更好。
- 主要失败模式:指令遵循:模型经常承诺会查看参考数据,但实际上却用幻觉内容替代;或者出现格式错误。例如,GPT-5 在减少指令遵循错误方面被测量出更优。
-
结果质量分布:在由GPT-5完成的任务中,大约一半是可接受但平庸的(subpar),只有约20% 是模型确实做得更好,而有29% 是糟糕或灾难性的,其输出完全不可接受。
-
通过采样迭代提升性能:利用模型的自我完善能力可以显著提升效果。
- 并行/顺序采样:通过让模型多次尝试(n次)并基于上次迭代进行改进,可以大幅提升性能。
-
成本与速度:对于 GPT-5,通过多次尝试,成本改进可达1.6倍,速度改进可达1.4倍。即使有这些改进,其成功完成任务的成本仍不到专家薪水的10%。
-
各行业/职业的性能差异:模型在不同职业中的表现存在巨大的不均衡。
- 达到或接近人类专家水平的领域:柜台及租赁店员、房地产经纪人、运输/收货/库存管理员、采购代理、计算机和IT经理、软件开发人员、政府行政服务经理、合规官、医疗健康服务经理、个人理财顾问等。在零售、批发、编辑、研究、销售等领域也表现突出。
- 关键限制:上下文:这些高表现任务的提示都经过了精心设定,包含了人类专家脑中所有的上下文。当模糊提示(移除上下文) 时,模型就难以判断该做什么,胜率会下降。这进一步印证了模型更像一个需要被“建筑师”(人类)清晰指引的“执行者”,而不是能自己定义问题的专家。
💬 精华片段(中文)
"So it kind of makes it more realistic by nailing it down not just by numbers of hours, but more by this is real work. And can the AI models do it or not?"
(所以这使它更加现实,不仅仅是凭小时数来下结论,而是聚焦于“这是真实的工作,AI模型到底能不能做?”)
[51:41] 论文三:DeepScholar-Bench — 深度研究合成能力的考验
本节重点
- 该基准专注于生成式研究合成,如撰写论文的相关工作部分。
- 评估模型的三个维度:知识合成、检索质量和可验证性。
- 所有现有系统的性能都极差,揭示了巨大的能力差距。
详细精要
- 任务定义与动机:DeepScholar-Bench 专注于衡量 AI 执行深度研究合成的能力。
- 具体任务:为学术论文撰写相关工作部分。这是一个许多研究者(包括现场学生)梦寐以求能自动化的任务。
- 信息来源:数据集使用近期发布的、具有博士级难度的 arXiv 论文,覆盖22个领域。
-
动态更新:该基准每月用新论文重新运行一次,保持数据的新鲜度并有效避免数据污染,因为它只检查在主流模型训练截止日期之后发表的论文。
-
三个核心评估轴:该基准从三个角度衡量模型输出。
- 知识合成:输出内容是否组织连贯,并抓住了所有关键事实(key nuggets) ?
- 检索质量:找到的参考文献是否相关?是否覆盖了该领域重要的基础性论文(citation counts/importance)?
- 可验证性:每个基于引用的声明(claim) 是否真的能得到其后面引用的论文的支持?这分别从精确率和覆盖率两个角度衡量。
-
人工验证:所有指标都由人工评估员进行验证,并在评估中实现了70% 到 80% 的人类评估者间同高度。
-
整体表现:性能极差,提升空间巨大:这是该基准最引人注目的发现。
- 在所有这些指标上,没有任何现有系统的综合得分超过 19%,与多数一出来就被迅速刷榜的基准形成鲜明对比,留出了巨大的提升空间。
- 知识合成方面:OpenAI 深度研究 在组织语言方面做得非常好,输出非常连贯,但几乎所有的模型都会持续性地遗漏关键事实。
- 检索质量方面:所有系统都在查找全面且重要的来源集上挣扎,其文档重要性得分都低于 12.5%。
-
可验证性方面:表现出严重的不平衡。DeepScholar base 系统可达到 90% 的精确率,但 OpenAI 深度研究 的可验证性较低,尽管它写出的英文非常优美。这表明合成质量与可验证性之间存在需要权衡的张力。
-
核心失败模式分析:性能不佳的背后,是模型在几个关键步骤上存在系统性缺陷。
- 无法找到全面且基础的来源:即使检索到了相关文档,模型也常常无法识别和包含该领域的基础性论文,而这对于人类专家来说是常识。
- 无法有效提取关键信息:即使提供了“完美”的论文集,模型从中提取关键事实的覆盖率也只有50%。如果不提供,覆盖率会更低。
- 无法平衡合成质量与可验证性:目前没有任何系统能同时在这两方面都表现出色。成功地引用参考数据,对于智能体评估任务来说是一个非平凡的难题。
💬 精华片段(中文)
"The fun thing about this particular benchmark is that none of the existing systems actually exceeds 19%. So if this were to show up in your homework... there's a lot of headroom for you folks to actually make it a final project."
(这个特定基准有趣的地方在于,没有任何现有系统的表现能超过19%。所以,如果这出现在你们的作业里,那大家有很大的空间可以把它直接做成一个期末项目。)
[01:00:40] 总结:跨基准的综合分析与未来展望
本节重点
- 单一基准无法全面衡量AI,需从时长、经济价值和合成质量三重维度综合评判。
- AI能力在软件工程等领域进步神速,但在需要大量上下文、高可靠性和外部知识验证的任务上仍有巨大差距。
- 未来的关键挑战在于可靠性、上下文理解、以及从知识库中检索和验证信息的能力。
详细精要
- 多维度评估的重要性:通过将三个基准的视角交叉,我们可以得出更立体的结论。
- 以研究合成为例:它在METR的时间跨度上可能表现为进入了数小时的长程范围(当前能力约50分钟),但GDPVal和DeepScholar-Bench揭示出,即使时长达标,其输出质量和经济价值仍然可能很差(如事实覆盖率低,可验证性差)。
-
这表明,仅仅因为模型能处理更长的任务,并不意味着它们总能产生高可靠性或高质量的成果。我们需要基于时长、经济价值和合成质量的多元指标。
-
各基准的局限性与互补性:
- METR:是自动评分的、单智能体任务,对错误不惩罚,无资源限制。而真实世界可能有更多主观约束、多智能体协作的可能,以及成本和犯错代价。
- GDPVal:任务被极度清晰化,是一锤子买卖(无迭代),并要求模型本身具备隐性知识。这忽略了真实工作中“搞清问题是什么”这个关键环节。
-
DeepScholar-Bench:揭示了模型在查找高质量来源、提取和验证关键事实方面的挣扎。这是一个人类专家驾轻就熟,但AI步履维艰的领域。
-
当前 AI 能力的确定性认知:我们可以清晰地看到模型的长板和短板。
- 长板:在隔离的、良好定义的任务上,特别是在软件工程和ML研究这两个计算机科学自身擅长的领域,模型进步神速,可以解决长达一小时的复杂问题,并能生成结构井然的输出。 AI助手在人类监督下已具备成本效益。
-
短板与不确定性:
- 上下文缺失时性能低下:当提示中缺乏领域背景时,模型无法自行推断出要解决什么问题。
- 高可靠性遥不可及:要达到95% 的可靠性,模型还有很大差距。
- 对抗性环境表现不佳。
- 泛化能力有限:目前尚未看到在软件和知识工作之外出现广泛的泛化能力。
- 知识库应用存在关键缺陷:在查找全面、高质量的来源,提取关键事实,并以高精确率和高覆盖率进行验证方面,模型仍然很弱。
-
综合预测与展望:
- 综合 METR 和 GDPVal 的趋势,前者预测到2028-2031年,模型可完成长达一个月任务(50%可靠性),后者则显示出更线性的、基于具体任务的进步。两者视角不同,但都指出了可靠性上的长尾问题。
- 即使在软件工程等领域持续改进,像分布式系统这类难题,“最后的20%”将极具挑战性,类似于Waymo在自动驾驶中面临的“最后1%”的难点。
- 关于“AI 科学家”(能独立提出假设并完成整个实验循环),主讲人认为这仍是我们对AGI的定义,但目前还远未实现。当前AI的价值更多体现在作为强大的共同科学家 或头脑风暴伙伴。
- 在大多数领域,实现可靠性,尤其是在长尾场景下的可靠性,将是“最后一公里”的艰巨挑战。
💬 精华片段(中文)
"So even if the models are solving longer and longer horizon tasks, that doesn't necessarily mean they're always giving highly reliable or quality outputs. So we need metrics which are duration-based, economic value-based, and also synthesis quality-based."
(因此,即使模型正在解决越来越长程的任务,并不一定意味着它们总能给出高可靠性或高质量的输出。所以,我们需要基于时长、经济价值和合成质量的多元指标。)
专业术语注释
| 术语 |
解释 |
| METR |
一个专注于衡量AI模型能力的组织,在本集中特指其提出的以“人类专业完成任务所需时间”为基准,衡量AI可完成任务时间长度的评测方法。 |
| GDPVal |
OpenAI发布的一个基准测试,通过让AI与拥有十年以上经验的行业专家直接比拼任务的“胜率”,来衡量AI在真实、具有经济价值的任务上的表现。 |
| 时间跨度指标 |
由METR提出的核心指标,即用人类专业人士成功完成任务所需的时间来校准AI完成同一任务的复杂性。 |
| 胜率 |
GDPVal中的核心指标,指在模型和人类专家的输出之间进行成对比较时,模型的输出被判定为更优或与人类持平的比例。 |
| 50%可靠性 / 80%可靠性 |
在METR评估中,指模型以特定概率(50%或80%)成功完成任务的时间长度。例如,50%可靠性下的59分钟,意味着交给模型100次,它会成功59次。 |
| SWAA |
METR测试套件之一,包含66个任务,时长1-30秒,专注于最基础的原子级操作。 |
| HCAST |
METR测试套件之一,包含97个任务,时长1分钟至30小时,涵盖多样化的软件和研究工程任务。 |
| RE-Bench |
METR测试套件之一,包含7个任务,时长可达8小时,专注于完整的、真实的机器学习研究任务。 |
| SWE-bench |
一个广泛使用的、用于评估AI模型在解决真实世界GitHub软件问题上能力的基准。 |
| DeepScholar-Bench |
斯坦福大学提出的一个动态基准,专注评估AI进行生成式研究合成(如撰写论文的“相关工作”部分)的能力。 |
| 语境工程 |
一种新兴的实践,指通过更好地在多步骤交互中设计、结构化和维护模型的上下文信息(提示历史、参考文件等),来提升模型性能而不改变模型本身。 |
| 数据污染 |
指模型的训练数据中已经包含了用于测试它的基准题目或答案,导致其测试得分虚高,无法反映真实能力。 |
| O*NET |
美国的职业信息网络数据库,提供了数百种职业的标准化和细致描述,GDPVal以此作为任务分类的参考框架。 |
| arXiv |
一个收集物理学、数学、计算机科学、生物学等领域学术论文预印本的开放获取网站。DeepScholar-Bench使用其上的论文作为数据源。 |
延伸思考
值得进一步关注的问题、争议点或行动建议,2~5条。
- 指数增长与线性现实的悖论:METR的七个月翻倍趋势与GDPVal的线性增长趋势之间存在明显矛盾。这背后是 “任务长度” 和 “任务执行质量与价值” 的根本区别。未来,AI能力的衡量标准是否需要从“能做多长”彻底转向“做得多好、多值钱”?
- “外包工”而非“专家”的比喻:讲座中将AI比作一个能力很强但缺乏背景的“外包工”,这一洞察至关重要。它意味着,人机协同的范式可能在很长一段时间内会是“人类做架构师,AI做执行者”。那么,哪些职业和任务是提供清晰“架构说明书”最容易的? 这或许才是AI能最先颠覆的领域。
- 可验证性是终极关卡:DeepScholar-Bench揭示的合成质量与可验证性的失衡极具深意。一个能侃侃而谈但无法验证的AI,在高风险领域的应用将受到极大限制。这指向了可靠的引用、事实核查和归因能力可能是下一代模型突破的关键,也是创业公司的机会所在。
- 计算机科学的“自噬”现象:主讲人提到,软件工程和ML研究是目前进步最快的领域,可能是因为作为计算机科学家的我们最擅长将自己的工作自动化。这是否意味着所有可被结构化、模块化和清晰验证的知识工作,最终都将面临类似的、来自从业者内部的“自动化浪潮”?
原文发表:未知 · 纪要生成:2026-08-05