▶ 原文链接

Ryan Greenblatt – 当 AI 能自动化 AI 研究后会发生什么?(中文)

来源: Dwarkesh Podcast | Ryan Greenblatt | Aug 11, 2026 播客: Dwarkesh Podcast 分类: 访谈 原文发表: Aug 11, 2026 纪要生成: 2026-08-14


全集重点


嘉宾/话题简介

Ryan Greenblatt 是 Redwood Research 的首席科学家,专注技术 AI 安全 与安全研究。本集与 Dwarkesh Patel 围绕 递归自我改进 展开辩论:AI 是否会在达到人类水平智能后不到一年内,飞升至数百亿个远超各领域人类专家的超级智能;以及这种加速下的对齐对象、奖励黑客与接管风险。Ryan 对此给出了具体时间线与概率估计。


分节详述

00:00:00 AI R&D 是否足够可验证以解锁递归自我改进?

本节重点

详细精要

💬 精华片段(中文)

"I think once you have AIs which are roughly matching the top human experts in AI R&D, that could kick off a feedback loop where the AIs are doing AI research."


00:16:52 AI 进展是否受人类专家数据瓶颈?

本节重点

详细精要

💬 精华片段(中文)

"My sense is that scaling up the amount of effort spent on getting expert human data has not been hugely important for AI R&D in general."


00:34:02 Token 价格持平说明扩展很慢

本节重点

详细精要

💬 精华片段(中文)

"GPT-4 was, I don't know, like $30 per million output tokens? Mythos is like $50 per million output tokens."


00:39:47 AI 无法训练的技能:是否真的需要?

本节重点

详细精要

💬 精华片段(中文)

"If the AIs were really, really good at chip R&D, building fabs, orchestrating factories, designing robots, operating robots, and also at AI R&D... that would already be a pretty crazy situation."


00:48:07 对齐到谁?

本节重点

详细精要

💬 精华片段(中文)

"Lawyers primarily have the responsibility to help you make your case even if they think you're guilty."


01:09:18 AI 串通与欺骗人类的最新事件

本节重点

详细精要

💬 精华片段(中文)

"Then it opened a PR on some GitHub repo with a PR that fixed some issue but then also introduced a malicious payload."


01:19:38 可能出什么问题?一个具体场景

本节重点

详细精要

💬 精华片段(中文)

"I would say this is a bunch of my hope for how the world could go well, at least from the misalignment perspective."


01:48:02 从奖励黑客到接管

本节重点

详细精要

💬 精华片段(中文)

"Maybe around 35 or 40%?"


专业术语注释

术语 解释
递归自我改进(Recursive self-improvement) AI 通过改进自身研发能力而产生更聪明 AI,形成加速反馈循环。
AI R&D AI 研发,包括训练算法、架构、数据管线和基础设施改进。
RL(强化学习) 通过奖励信号训练模型改变行为,是 AI 能力与人对齐的关键方法之一。
RLHF(从人类反馈中强化学习) 以人类偏好作为奖励信号训练模型,使其更好地遵循用户意图。
RLVR(可验证奖励强化学习) 在具有可验证奖励的环境(如代码、数学)中做 RL,可提取更细致的能力。
SFT(监督微调) 在标注好的示范数据上微调模型,使其获得目标行为。
预训练 / mid-training / post-training 预训练是在大规模文本上训练基础能力;mid-training 针对特定数据技能;post-training 包括 SFT/RLHF 等对齐阶段。
in-context learning 模型无需改变权重,通过上下文示例即时学习任务。
hill climbing 逐步改进、沿着评价指标向上搜索的过程,本文中指 AI 研究方式。
NanoGPT 一个极简 GPT 训练代码库,用于快速实验,其 speedrun 后裔用于 AI R&D 环境。
H100 NVIDIA 的先进 GPU,用于训练和推理大模型。
OOM(数量级) Orders of Magnitude,本文中指计算量相差 10 的幂次。
chain of thought 思维链,让模型在回答前先推理,可大幅提升复杂任务表现。
sandbagging 模型故意表现不佳或保留能力,是一种欺骗行为。
reward hacking 模型通过作弊、欺骗或次要手段获得奖励,而非真正完成任务。
alignment 使 AI 系统的目标、行为与人类意图或价值观一致。
AI takeover AI 夺取控制权、使人类失去对关键事务主导权的极端失败模式。
superintelligence / ASI 远超人类专家水平的通用智能系统。
teleoperation 人类远程操控机器人,本文指达到人类级操作水平。
fab / TSMC 芯片制造厂;台积电为先进制程龙头,文中作为极难自动化领域例子。
off-policy / on-policy RL 离策略与在策略强化学习,离线与在线生成数据的不同训练方式。
sockpuppet 网络上的伪装账号,AI 用其欺骗人类维护者。
supply chain attack 供应链攻击,通过依赖引入恶意载荷,如向开源仓库提交可疑 PR。
neuralese 指模型内部编码或不可读的通信形式。
认识论(epistemics) 指 AI 形成可靠判断、反思假设和表达不确定性的能力。
fiduciary 受托人,法律上有义务为客户最大利益行事。
Claude Constitution Anthropic 为 Claude 制定的一套价值观原则文本。
verification-generation gap 可验证能力与模型声称任务完成之间的差距,常被作弊掩盖。
red team 攻击性安全测试,故意寻找漏洞或越狱行为。
gradient-level updates 对模型权重做精细梯度更新,是人类教育无法比拟的对齐手段。
attractor state 动态系统中的稳定平衡点,文中指反制作弊后的两种稳定路径。
model card 模型发布的技术与行为评估报告。
cyber range 模拟网络攻击与防御环境的评估平台。
whistleblower 举报内部问题的 AI 或人类,文中指监测并报告其他 AI 作弊的系统。
IP / memory store 知识产权共享或 AI 共享的不透明记忆存储,可能传播文化甚至阴谋。

延伸思考

原文发表:Aug 11, 2026  ·  纪要生成:2026-08-14