▶ 原文链接
前英伟达工程师:为什么 AI 成本即将下降 1000 倍
来源: Invest Like the Best | Neil(Sal Research 创始人兼 CEO) | 2026-08-25
播客: Invest Like the Best
分类: NVIDIA
原文发表: 2026-08-25
纪要生成: 2026-09-02
全集重点
- 低成本 token 是北极星:Sal Research 目标是把每 token 成本做到行业最低,让智能成为人人都用得起的商品。
- 长时程后台智能体是未来:从低延迟聊天机器人转向运行数小时、数天、数周的后台代理,吞吐导向成为更优策略。
- 异构芯片套利策略:不押注单一芯片,AMD、TPU、Tranium 甚至没有 NVLink 的芯片,只要价格合适都能被榨出性能。
- 分布式 1MW 数据中心 + 低 uptime:牺牲冗余和 95% 正常运行时间,换取别人不愿碰的廉价电力和算力。
- 开源 + 丰富 token 终局:开源模型无法被剥夺,闭源领先时间可能无法长期维持,世界将走向"每个用户都拥有自己的智能 harness"。
嘉宾/话题简介
本集嘉宾 Neil 是 Sal Research 的创始人兼 CEO。他曾是 NVIDIA 工程师,大学期间就在 NVIDIA 从事 GPU 内核与软件工作,亲历了 Tensor Core 从争取硅片面积到成为 AI 基础设施核心的全过程。Sal Research 定位为"token 工厂":通过 API 以市场最低价格提供开源大模型推理服务,并托管长时程智能体沙箱。本集围绕软件、硬件、电力三个层面展开,讨论如何把 AI 推理成本降低三到六个数量级,并重新设计数据中心、芯片组合与计算编排。
分节详述
00:00 公司定位:Token 工厂与"丰裕"哲学
本节重点
- Sal Research 是价格最低的 token API 提供商,支持长时程智能体沙箱。
- 核心信念:机器能思考这件事本身极其深刻,应该让最多人获得。
- 每次让商品便宜 10 倍,就会诞生一个新品类。
- token 只是过渡单位,未来的单位会从 token 转向"结果"。
详细精要
- 公司基本形态:一个"token 工厂"
- Sal Research 提供 API,任何人可以发送请求,使用开源大语言模型完成任意任务。
- 他们以市场上无可匹敌的价格提供 token;同时托管称为 sandbox 的长时间运行智能体虚拟机,支持运行 数小时、数天甚至数周。
-
嘉宾把公司定位为"某种特定推理类型"的绝对最便宜提供商和使能者。
-
公司的核心主题是"丰裕"
- 目标是把"智能"这种新商品,以几乎每个行业都可持续的成本交付给尽可能多的人。
- 信念:任何东西只要便宜 10 倍,就会成为新的产品类别;他们希望为 token 做到这一点。
-
机器能思考这件事本身极其深刻,现在的任务就是让世界上尽可能多的机器朝着"思考"工作。
-
token 是今天的正确单位,但不是最终单位
- 当前的北极星是:每 token 成本做到行业最低,并且低出一个数量级。
- 长期的演变方向是从 token 转向"结果 / outcome":今天通过智能体消耗 token 时,并不控制它推理多少 token,它可能推理一段时间、调用一定数量的工具。
-
未来会看到智能体自我管理 token 预算,而不是由公司设定工程师每月可以花多少 token 的配额。
-
为什么存在机会:两个顺风
- 第一个顺风是 开源崛起:越来越多客户和市场开始关心"拥有智能",想要对自己依赖的东西拥有控制权和主权。
- 开源模型的最大特征是权重永远属于你,你有权永远部署它、没人可以夺走。
- 过去两三年,Base10、Fireworks、Together 等公司都在大规模服务开源模型,但它们都被一个非常重要的客户 Cursor 拉向低延迟推理。
-
嘉宾认为一年前选择低延迟是正确的,但大概六个月前开始,市场发现低延迟并不是智能体唯一需要的东西,还需要持久性和更长时程的任务。
-
未来属于长时程、后台的智能体推理
- 机器会运行数小时或数天;每秒 100 个 token 和每秒 10 个 token 差别不大,后者附带明显的效率优势。
- 主持人问"难道不是什么都越快越好吗",嘉宾回应:当你等待时当然应该得到最快答案,但技巧是不让你等待。
- 最好延迟是零延迟:早上醒来,工作已经在夜里完成,你甚至不需要提出要求。
- 更深层的原因是:人在循环中不断提示和等待响应,反而会成为瓶颈;更好的方式是让智能体在人类时间尺度上运行,像管理同事一样,每天、甚至每周检查一次。
💬 精华片段(中文)
"最好的延迟是根本没有延迟。早上醒来时,工作已经在夜里完成了,你甚至不需要提出要求。"
"The best latency is no latency at all. When you wake up in the morning, the work's already been done overnight. You didn't even have to ask for it."
05:12 长时程智能体的证据与应用场景
本节重点
- 测试时计算扩展让"给智能体更多时间"从理论走向现实。
- 长期市场份额会从 50/50 变为 90/10,后台压倒实时。
- 深度研究和网络安全是最典型的后台任务。
- 安全已经变成"proof of work":花多少 Anthropic API 预算攻击自己软件,等同于安全性。
详细精要
- 测试时计算扩展是第一个重要信号
- 概念约两年前被提出:给智能体更多时间,它就能给出更好的答案。
- 真正值得押注是从去年底的 Opus 4.5 开始:它是第一个有一定能力处理较长时程任务的智能体。
- Opus 4.5 刚出来时相当平庸,但看近期模型和开源工作,智能体已经能连续运行 1 小时左右;嘉宾认为虽然还不到"数天",但 1 小时今天已经相当合适。
-
平均回合/任务长度越来越长,只要几个数据点就能画出指数,看出"更长时间运行"是有价值的。
-
长期市场份额:后台将占 90%
- 这个市场无界,因为没有人类在循环中,你可以任意在后台消耗 token。
- 相比之下,人类注意力有限:即使让嘉宾在 Codex 或 Cloud Code 上消耗 10 倍 token,他一天大部分时间已经在编码,可能已经做不到了。
-
真正没有上限的是后台/主动消耗;嘉宾预计今年结束时可能还只是 50/50 的后台与实时负载,但长期会走向 90/10,明显偏向后台。
-
深度研究:需要 10,000 个以上信息源的确定答案
- 大多数深度研究问题,不是查 100 个、1000 个来源,而是 10,000 个来源或更多。
- 客户 Parallel Web Systems 的目标是建立整个互联网的权威索引,并实时监控互联网变化。
- 这是 exabyte 量级的疯狂任务,需要一种完全不同的智能规模才能实现。
-
深度研究是 Sal Research 的最大类别,网络安全也正越来越多地朝这个方向走。
-
网络安全:破坏代码的方式比生成代码更多
- 能生成的代码数量巨大,但破坏同一段代码的方式呈指数级更多。
- Fable / Mythos 等模型发布时,网络安全社区立即推动用它们对每一行历史代码从 20 种不同方式 找漏洞。
- 这些方式包括:内存错误、业务逻辑错误、网络漏洞等。
- 每种方向都需要专门的智能体:不只是盯着源码看一遍,而是搭建环境进行渗透测试。
-
圈内开始流行一句玩笑:安全已经变成 proof of work——保护软件安全的问题,本质是你愿意花多少 Anthropic API 预算来攻击自己的软件,因为那是世界上最好的工具。
-
智能前沿是"锯齿状"的
- 并不存在"Fable 找到所有 bug 的超集"这种情况。
- 有些 bug 用很小的模型就能找到,大模型反而找不到;有些 Haiku 能找到,Fable 找不到,反之亦然。
- 这鼓励了一种非常多样化的采样方式:构建能自主破坏软件、从而让你能修补软件的网络安全智能体。
💬 精华片段(中文)
"安全已经变成了工作量证明:你想要安全的软件,真正的问题是你在 Anthropic API 上花了多少美元来试图攻破自己的软件。"
"Security has become proof of work. When you want secure software, it's really a question of how many dollars did you spend on Anthropic's APIs trying to break into your software."
08:50 主动智能体、可验证任务与丰裕愿景
本节重点
- 主动智能体是个人用户最令人兴奋的方向:Siri 级别的全天候理解与主动执行。
- 关键解锁条件是"愿意在没有回报承诺的情况下花 token"。
- 可验证问题是智能体自我改进的钥匙;不可验证的人类品味暂时留给人类。
- 长时程任务成本正从数百万美元降至数千、数百,甚至未来几十美元。
详细精要
- 对个人用户最令人兴奋的是主动智能体
- 设想一个 Siri 一直在后台运行,理解你一天收到的所有邮件、短信,形成对你生活的百科全书式理解并主动帮助。
- 目前仍是点解决方案,用户需要大量提示;Siri 不够主动,这正是丰富推理可以解决的问题。
- 如果机器足够可靠且私密,它甚至能理解你与它互动的方式,并在你打开手机时主动弹出"下一步行动"。
-
嘉宾认为,完全可以建立"你接下来要做什么"的良好模型,而核心前提是极其便宜的智能。
-
真正的解锁:愿意在没有回报承诺时花费 token
- 你必须准备好花费 token,即使当时没有即时回报;这是主动系统与传统按需系统的根本区别。
- 长期视角:我们现在拥有一种能处理任何可验证问题的智能形式。
- 可验证问题包括:大多数软件、许多形式化数学证明,甚至科学发现。
-
这些任务目前背后都隐藏着美元成本:本质上是"你能用多少 token 让它成功"。
-
长时程任务成本正在快速下降
- 目前已经能把某些长时程任务的美元成本拉到合理区间:不是数百万,而是数千美元。
- 未来可能降到数百、甚至几十美元,就能对任意科学问题或研究问题得到确定答案。
- 如果未来真的如此,我们会变得只受限于"人们能提出什么样的问题"。
-
模型正处于临界点:它能接下高层次问题,并自行追踪每一个可能的后续问题;剩下的唯一问题是 token 预算,而 Sal Research 要解决的就是 token 预算问题。
-
不可验证任务的边界:人类品味领域
- 嘉宾把整个人类品味类别都归为不可验证任务。
- 人类品味尚未被解决,嘉宾不确定它是否从根本上能被解决;他乐于被惊喜。
- Sal Research 专注非常量化的问题,把写作质量、艺术之美留给人类。
💬 精华片段(中文)
"你必须愿意在没有回报承诺的情况下花费 token。这就是解锁。"
"You have to be willing to spend tokens without any promise of return. That's the unlock."
13:00 全栈方法:从 NVIDIA 内核到"速度光速"文化
本节重点
- 软件、硬件、电力三层同时发力,软件从最低层内核开始。
- Tensor Core 是 GPU 上加速矩阵乘法的专用单元,2016 年只有 5-10% 硅片面积。
- NVIDIA 的"speed of light"文化:永远追逐绝对性能极限,而不是相对数字。
- GPU 本质是吞吐机器,但过去几年被聊天机器人形态逼成了低延迟机器。
详细精要
- 从软件开始:构建整个 LLM 软件栈以榨取峰值 GPU 效率
- 当前用的是 NVIDIA GPU,目标是从同一芯片上比全世界任何人都榨出更多 token。
- 起点是最低层的内核编程,这正也是嘉宾的背景:他大学期间第一份工作就在 NVIDIA,2016 年亲眼看到 Tensor Core 如何在芯片上赢得地位。
- Tensor Core 是 GPU 上加速矩阵乘法的专用单元。
- 矩阵乘法为什么重要?嘉宾无法给出神性解释,但他听到的一种说法是:它是把两组数字混合并产生有趣交互的一种非常简洁的方式。
-
线性代数恰好是数据中任意关系的紧凑表示,这是非常方便的巧合。
-
NVIDIA 从图形公司到机器学习算力公司的历史
- NVIDIA 一直以图形和游戏 GPU 占据主导;2010 年代中期开始进行"臭鼬工厂"项目,让图形处理器更适应机器学习任务。
- 嘉宾读过当时经理的实验室笔记:他们参加 ICML、NeurIPS 这类小会议,注意到研究生用游戏级 NVIDIA GPU 训练大模型。
- 到 2015-2016 年,Jensen 有了信念,开始把越来越多宝贵的硅片面积分配给这个新兴能力,放入第一代 Tensor Core。
- 这意味着把"为屏幕像素设计"的游戏芯片改造成做矩阵乘法;过程中要与图形团队争夺硅片面积——任何芯片公司内部都有这种竞争。
-
设计师们非常谨慎,因为押错技术意味着巨大机会成本;最终第一代只拿到大约 5-10% 的 die area,用来加速当时的计算机视觉基础操作——卷积。
-
"速度光速"精神
- NVIDIA 软件团队的目标是从芯片里榨出每一分性能;团队有一个术语叫 speed of light。
- 它代表任何硬件的可能性边缘:如果认为芯片能以某频率运行、每周期产出这么多次乘法,就一定要打破每个瓶颈,达到那个峰值。
- 这个信念深深植入每个工程师的思维:如果机器能做,我们就把它推到我们认定的极限。
-
嘉宾至今对工程师说:我们追逐 100% speed of light,不关心相对竞争数字,只关心绝对数字。
-
NVIDIA 的文化:极高留存率与极端节俭
- 2015-2016 年与嘉宾共事的很多人至今仍在 NVIDIA,公司在硅片侧拥有他职业生涯中见过的最好的工程师。
- 他们极度热情,相信并行计算这个概念,并将其视为一生的事业。
- NVIDIA 也是一家非常节俭的公司:2008 年后硅谷公司普遍削减福利、没有免费午餐,NVIDIA 更进一步——冰箱里连免费牛奶都没有。
- 想喝咖啡加牛奶,必须每月交 1 美元加入"牛奶俱乐部",俱乐部会买 Costco 牛奶放在冰箱里。
-
嘉宾特别记得这件事;Sal Research 不这样做,但这种节俭文化渗透在整个公司。
-
GPU 本质是吞吐机器,但 AI 过去几年选择了低延迟
- GPU 在获得大量工作、并以峰值利用率持续咀嚼时最快乐。
- 但过去几年 AI 的主流形态是交互式聊天机器人,这要求尽快把答案吐给键盘前的用户。
- 在快速吐 token 时,GPU 极难进入"完全计算利用"的快乐路径。
- 由此产生根本权衡:吞吐导向 vs 延迟优化;所有人都选择了延迟优化,因为用户形态是聊天机器人。
- 嘉宾认为未来一年最深刻的转变,就是从聊天机器人走向主动/后台智能体;届时围绕吞吐构建软件栈会合理得多。
💬 精华片段(中文)
"GPU 本质上是一台吞吐机器。当你给它大量工作、让它以计算单元的峰值利用率咀嚼时,它最快乐。"
"The GPU is fundamentally a throughput machine. The GPU is happiest when you give it a lot of work to do and let it chew through that work at peak utilization of its compute units."
19:16 吞吐与延迟的权衡,以及 NVLink 的角色
本节重点
- 吞吐和延迟的权衡几乎是所有系统的基础;GPU 上体现为批处理。
- 公交 vs 私人出行是准确类比:批处理让每个请求花更长时间,但整体效率更高。
- NVLink 本质上是改善延迟的技术,只在低延迟推理中是必需的。
- 如果不关心低延迟,可以放弃 NVLink,换取 flops/美元更高的芯片。
详细精要
- 吞吐与延迟的权衡为何不可打破
- 几乎在所有系统中都存在:少量数据尽快通过并留出缓冲,还是宽而慢地运行。
- "窄而快"与"宽而慢"是计算机科学的经典权衡。
- GPU 的具体机制是 批处理:希望把许多用户的工作组合成一个大 batch,在 GPU 上一次性并行处理。
-
问题在于运行大批次意味着净工作量更多;每个 token 或每个用户请求会在 GPU 上被其他人的流量一起携带,因此停留更久。
-
公交 vs 私人出行的类比
- 去旧金山市中心,可以坐公交,也可以坐私人交通。
- 私人交通走最直接的路径;公交必须服务更多人,走更慢路线,还会停车等人上下车。
-
Sal Research 在第一步要做的,就是在 NVIDIA GPU 上建立"最好的公交"。
-
并行方案:NVLink 与张量并行
- NVIDIA GPU 的一个重大创新是 NVLink 互联。
- 如果有大型矩阵乘法想更快完成,可以把它切成两半、分片到最多 8 块 GPU 上并行工作,最后再把结果归约回来。
- 每块 GPU 只做 1/8 的工作,因此完成更快,但不是 8 倍快,而是亚线性扩展:用 8 倍硬件,可能只得到 4-5 倍速度。
- 原因在于通信开销;每块 GPU 处理更小的 tile,效率会略低于处理更大 tile。
-
这是获得最低延迟的唯一方法,但不是嘉宾想做的;他更倾向专家并行或流水线并行,并可以重叠、隐藏通信延迟,而这在低延迟服务器中更难做到。
-
NVLink 是延迟技术,不是吞吐技术
- 结论:NVLink 本质上是改善延迟性能的技术,并且只在低延迟推理中强相关。
- NVIDIA 非常擅长低延迟推理,但 Sal Research 并不那么在意低延迟。
- 嘉宾不指望其他公司能很快解决 NVLink;它很难扩展、很难生产化。
- 如果另一家厂商的芯片擅长基础计算组件、能做矩阵乘法,但不能与 peer 快速通信,那它在 Sal Research 的栈里仍有一席之地——成为flops/美元极高的选项。
- 嘉宾真正优化的是:这块芯片有多少 flops,以及每小时拥有和运营它的成本。
- 有些芯片在 flops/美元上确实比 NVIDIA 高,但互联较弱;他的工作是选择适合的并行方案。张量并行基本是 Nvidia 必须,但其他技术可能更适合。
💬 精华片段(中文)
"如果你想去旧金山市中心,你可以坐公交,也可以坐私人交通。私人交通走最直接的路径;公交必须服务更多人,走更慢路线,还会停下来等人上下车。"
"If you want to get downtown in SF, you can take the bus or you can take private transit. The private transit is going to have its own direct path; a bus, it's going to have to serve many more people, and it has to fundamentally do something that works for everyone."
23:27 低延迟硬件:SRAM、DRAM、Cerebras 与 Groq
本节重点
- Cerebras、Groq 押注片上 SRAM,追求极快 token/s,但受限于 SRAM 面积和 KV cache。
- SRAM 与 DRAM 工艺完全不同:SRAM 用 6T 晶体管单元,DRAM 用电容存储并需每 50ms 刷新。
- 3-5 年后这些芯片应被视为加速器,与拥有片外内存容量的 GPU 混合使用。
- Transformer 的原罪是同时需要计算受限层和内存受限层,单一芯片很难两者兼得。
详细精要
- Cerebras、Groq 的低延迟独特押注
- Cerebras、Groq 以及几家即将走出 stealth 的公司,不只是做"另一块 GPU",而是构建不同的加速器。
- 它们专注在不同的内存层级:最大化片上 SRAM,把它作为权重和 KV cache 的极快内存。
-
SRAM 与 DRAM 是两种制造芯片内存的方法。
-
SRAM 与 DRAM 的技术区别
- SRAM 把它集成在逻辑 die 上:告诉 TSMC 想要多少 MB 存储,TSMC 有标准单元库可以打印出 SRAM 单元。
- 问题是 SRAM 占用的硅片面积很大;NVIDIA Blackwell 约 800 平方毫米,如果全部做成 SRAM,容量可能只有个位数 GB。
- 对比另一种工艺:由 Micron、SK Hynix、Samsung 制造的 DRAM,更侧重电容器而非晶体管。
- SRAM 的标准做法是 6T 晶体管单元:稳定排列,写入 bit 后保持状态,静态无需主动管理。
- DRAM 是动态的:写入电容的电荷会不断泄漏,必须每 50 毫秒左右刷新每个 bit;内存控制器在不断管理数十亿个 bit。
- 代价换来的是超高密度;于是 DRAM 制造被拆分为独立公司,如 Micron、SK Hynix、Samsung。
-
如果把这些 DRAM 多层堆叠在 NVIDIA 逻辑 die 周围,可获得数百 GB;Blackwell 有 288GB HBM 容量,而逻辑 die 本身可能只有约 500MB SRAM——密度差大约 三个数量级。
-
Cerebras 的做法:整片晶圆堆 SRAM
- SRAM 密度很难提高,但它物理上离逻辑门非常近,算术逻辑单元就紧挨着它。
- Cerebras 声称可达到 21 petabytes/s 的 SRAM 读取速度;对比 NVIDIA Blackwell HBM 大约 10 terabytes/s,又是数量级差异。
- Cerebras 不受 TSMC 800 平方毫米光罩极限限制,使用整张晶圆,让每个 die 通过划片线互连。
- 他们能在每张晶圆上容纳约 50GB SRAM,再堆叠多张晶圆形成流水线,最终拥有高达 1TB 的极快内存。
-
这样做的目的是:整个大模型(如 Kimi)的全部参数能在约 1 毫秒内从逻辑核心进出,从而支撑极高 tokens/s 的推理。
-
这些芯片的市场位置:KV cache 限制
- 可以把一万亿参数模型 Kimi 装到大量 Cerebras 晶圆上,但 KV cache 很难办。
- KV cache:使用语言模型时,每个 token 都留在上下文窗口中;聊了 100,000 token 后,第 100,001 个 token 仍在对话中,模型参考所有过去历史来预测下一个词。
- 因此 KV cache 是一大块内存,必须为每个 token 存一个表示,经常变得比模型权重本身还大。
- 嘉宾喜欢这样理解:模型权重是结晶化知识,KV cache 是当前对话的动态知识。
- 这也是为什么对话深入后有时性能下降:KV cache 精确表示之前所有内容,而训练时模型主要训练在 8,000 或 16,000 token 的对话上,没被优化到 200,000 token 的超长上下文。
- 前沿实验室一直面临挑战:如何让模型在 10,000 token 和 200,000 token 时一样聪明。
-
百万上下文窗口概念已存在多年,Anthropic 首先达到 1 百万上下文;嘉宾在 Cloud Code 中远不到 1 百万前就用 /compact。
-
3-5 年后的角色:异构混合加速器
- 权重存储可以无敌,但 KV cache 会是痛点。
- Cerebras、Groq 应该被看作加速器,真正优势是与传统 GPU 设备结合使用:后者拥有关键的片外内存。
- 需要 on-chip 内存的速度 与 off-chip 内存的容量 的混合。
- Transformer 在极限下有两类阶段:MLP 是计算受限(大 batch 下矩阵乘法、编码世界知识),attention 在极限下通常内存受限(动态适应对话)。
- Transformer 的原罪是把一个本质上内存受限的层与一个计算受限的层并置在一起;单一芯片很难同时擅长两者。
- GPU 在这点上相当平衡,但仍需做选择;Cerebras 适合托管 MLP/权重,GPU 适合扩展超长上下文的 attention。
- 嘉宾相信 NVIDIA 和 Groq 之间正在出现这种分工。
💬 精华片段(中文)
"模型权重是结晶化的知识,而 KV cache 是我们正在进行的这段对话的动态知识。"
"The model weights are crystallized knowledge, and the KV cache is the dynamic knowledge of the exact conversation we're having."
本节重点
- Transformer 的核心是注意力:对序列中任意成对关系建模,动态重新加权输入。
- 从计算机视觉的百万级参数到现在的万亿级参数,Transformer 是桥梁。
- 互联网数据是一次性补贴,已被模型看过多遍;下一阶段是 RL 环境中的可验证自改进。
- 随机人类反馈信号已经过时,需要专家偏好;RL 环境比数据采购更能捕获递归自改进。
详细精要
- Transformer 到底做了什么
- 2017 年的创新是让我们能非常有效地学习无监督数据。
- Transformer 本质上是对任意序列找模式;关键组件是注意力操作:允许模型动态适应序列中最相关的部分。
- 每一步通过 Transformer,本质上是重新加权之前看过的输入,找出对下一个预测最相关的部分。
- 这使其极度擅长学习任意序列数据;而人类最常产生的最有趣序列是语言,于是统治了语言领域。
-
更上层的优势是规模化:Transformer 不引入人类先验,只说"数据序列里会有模式,如果有,我就找到它",并不断投入更多参数。
-
Transformer 与计算机视觉的历史
- 早期计算机视觉模型如支持向量机只有几千参数,深度学习时代到了数千万参数。
- 当时计算机视觉的最大模型约 1.5 亿参数已经很巨大;现在常规讨论 万亿参数。
- Transformer 是从百万参数跨越到万亿参数的桥梁。
- 如果重要扩展单元是数据和计算,Transformer 会继续留存,因为它们像海绵:增加 10 倍计算,总能在某处得到一些 log 改进。
-
嘉宾认为扩展定律"真的非常有效、非常漂亮"。
-
Transformer 为什么难以被替代:注意力代表任意成对关系
- 序列中任何 token 都能关注任何其他 token;如果数据中存在任何关系,Transformer 都能找到它。
- 也许并不需要 all-to-all 建模,但如果需要,Transformer 提供该选项。
- 在找到更好方式去剪枝、让信息建模更有选择性之前,注意力是非常好的操作。
- 一个 CV 时代的技巧(源自 Karpathy):遇到新数据集,第一目标是过参数化、过拟合数据,证明学习算法能把知识注入模型。
-
一旦能过拟合,就能压缩;压缩带来泛化——你不想记住数据,而是找可放进最小参数量的通用模式。
-
互联网是一次性数据补贴
- 我们免费得到了互联网数据:约 30 万亿 token 高质量文本,放宽定义可达 300 万亿 token。
- 数据基本都已被看遍,模型已多次看过整个互联网,人类互联网数据没有更多可做。
- 下一阶段数据是通过 RL 环境健身房的模型自改进。
-
过去重视 ChatGPT 用户交互反馈,但如今我们服务的模型已比"随机人类"聪明太多,随机人类偏好信号已经不值钱,需要专家偏好。
-
可验证任务 + RL 环境 = 自改进配方
- 给模型一个困难但可验证的任务,让它在一个相对隔离的健身房里运行,能量化它是否进步。
- 编码问题、数学问题属于此类;越来越多情况下,只需给智能体一台电脑、让它像人类工作者一样行动,并给目标结果反馈,环境本身就成了数据。
- 嘉宾承认这不是超级差异化的观点,但迄今已非常高产。
- 这比互联网那一大块更深刻:通往 AGI 的最好方式,是不断堆叠专门智能体,直到没有缺口。
- 唯一必须确保的是任务可验证:给模型一套自评分系统,就有了在任何任务上自改进的配方。
- 前沿实验室的支出变化印证了这一点:过去花很多钱买数据,现在更多花在 RL 环境上;这些环境捕捉到了"在可验证任务上递归自改进"的关系。
💬 精华片段(中文)
"互联网是对数据的一次性补贴。我们免费得到了它。"
"The internet was a one-time subsidy on data. We got it for free."
38:53 内核工程、GPU 效率与机架规模计算
本节重点
- LLM 内核仍有改进空间;现在更多是"在白板上写内核",由模型实现。
- 软件优势长期会被前沿实验室能力抹平,软件作为 edge 会逐渐消失。
- GPU 在峰值路径上已达 70-80% 利用率,受限于功耗/散热而非软件。
- NVL 72 机架规模计算是未来效率和速度的主要形态。
详细精要
- 内核仍然需要工程
- 像 Tri Dao 这样的人写出的优秀内核构成了现代深度学习的基石,现代 Transformer 建立在 FlashAttention 之上。
- 但如果稍微偏离"happy path"——比如新模型改变 ROPE 位置编码方式——旧内核可能就不再适用,需要打补丁。
- 还不需要从零发明内核,但需要能快速修改现有 GPU 内核。
- "内核"是 GPU 上运行的任何程序的通称;历史上内核被放进库中,每个内核负责非常狭窄的功能:一个内核做矩阵乘法,另一个内核做加法。
-
越来越常见的是融合内核:矩阵乘法之后再加另一个矩阵,可以把两步融合成一个内核,避免先写 DRAM 再读回来。
-
为什么还在人工写内核:白板 + AI 执行
- 嘉宾认为不应该再手工写内核;Tri Dao 教给他的是"在白板上写内核"。
- 流程:到白板前描述我们觉得机器该做什么,再用自然语言简洁描述给模型,由模型负责拿输入输出、调度策略,具体执行。
- 人类做的是概念设计,模型做实现。
-
嘉宾不确定为什么模型目前还不够擅长这一点,但他相信 6 个月后内核工程模型会好得多;前沿实验室已经做了大量全自动内核工程。
-
软件作为优势会逐渐消失
- 如果软件最终都能接近 speed of light 地压榨硬件,那么软件作为公司优势会随时间消失。
- 像 Mythos 或 GPT 5.6 这样的前沿模型会涨潮抬升所有船只。
- 嘉宾不认为值得专门做一个"让模型更擅长写内核"的业务,那并不是编码中最重要的子集。
-
也许可以在提示中注入一些特权信息来引导模型写得更好,但总体上大家都处在前沿能力的下游。
-
用"煤炭利用率"来理解 GPU 效率
- 主持人用能源历史类比:一块煤炭中可被利用的能量,人类从 10% 提升到 95%。
- 今天 Blackwell 的利用效率怎样?当 GPU 做它最擅长的大型矩阵乘法时,效率是 70-80% 峰值利用率。
- 这实际上受限于电力/散热而非软件;NVIDIA 引用的峰值 flops 比较乐观,因功耗限制永远达不到。
-
但实际中,Transformer 大部分时间并不在"大 batch 矩阵乘法"的 happy path 上,所以工作重点是围绕芯片构建引擎,始终把大批量工作喂给 GPU。
-
从单 GPU 编程到机架规模计算
- 过去一年 GPU 世界最深刻的变化是:不再一次编程一块 GPU,而要考虑整个机架、整个集群、整个数据中心。
- NVIDIA 已经开始出货完整的机架系统,称为 NVL 72;最新芯片 Grace Blackwell 300 以 72 单元机架出货。
- 现在是一场开放竞赛:谁最能高效地编程整个机架规模计算机。
- 嘉宾认为这种计算形态是效率和速度的未来;目前要获得最低延迟或最高吞吐,最好都使用这种芯片,这是一个全新的编程范式。
💬 精华片段(中文)
"我们是在白板上写内核。先去白板上描述我们觉得机器该做什么,然后用自然语言简洁地描述给模型,模型去实现。"
"We write kernels on the whiteboard. We go to the whiteboard, describe what we think the machine should be doing, then we succinctly describe that in natural language to a model, and the model implements it."
44:36 芯片市场、AMD 套利与投资者担忧
本节重点
- Blackwell 像"毒品市场",但 NVIDIA 战略性地分配算力,避免让最有钱的客户积累过多权力。
- 其他芯片不是"劣质",只有"糟糕定价";AMD 是嘉宾乐于低价囤积的目标。
- 本质是套利:在被忽视的芯片上榨出性能,再以利润转售。
- 半导体占 S&P 500 比重从历史 2-4% 升至 19-21%,引发投资者担忧;嘉宾认为 AI 消费不是投机。
详细精要
- Blackwell 的市场与 NVIDIA 的战略
- 主持人说 Blackwell 市场像"毒品市场",因为所有人都稀缺芯片、拼命争夺。
- NVIDIA 把芯片当作长期来看,他们看到对 Blackwell 的巨大需求,完全可以像过去供应商那样涨价,让供需曲线自行交汇。
- 但 NVIDIA 知道:如果让最有深钱袋的人买下所有芯片,长期可能对 NVIDIA 有害,因为那个客户会积累太多权力;他们理解计算就是权力。
- 所以 NVIDIA 在分配算力上非常战略化。
- 第二点是关系很重要:没人愿意接收一个新初创公司的大订单,说什么"我要租 10,000 块 Blackwell 三年五年";这种公司通常只运营了几个月,不知能否付款。
-
说服供应商给你计算访问权极具挑战性,需要极好的关系或极其强大的财务背书。
-
没有坏芯片,只有坏定价
- 嘉宾不愿称其他芯片为"劣质";他的说法是:没有 bad chips,只有 really bad pricing。
- 他愿意以合适价格让任何芯片工作。
- AMD 芯片总体不错,但挑战在于人们不太会编程它们。
- NVIDIA 为自己的芯片做了很多开箱即用的优化;在 AMD 上反而有更多 alpha 可榨,因为厂商做的少。
- 其他人害怕、回避 AMD,嘉宾说"这就是音乐",他很高兴别人继续忽视,这样他能尽量买。
- 不过现在 AMD 在大买家那里已经有点受欢迎:Meta 和 OpenAI 公开买了不少,AMD 供应也在被分配。
- 长尾还有 Etched、Cereva?、D-Matrix 等新公司,最大挑战是能否从 TSMC 获得足够晶圆配给量产。
-
嘉宾会尽快了解任何新芯片,评估是否购买相当比例的供应。
-
本质是算力套利
- 如果能从低关注芯片中榨出性能,再以更高利润转售,就是很好的生意。
- 嘉宾不认为其他人只是"技能不足";他们是世界上最好的团队之一,能使用多种硅架构,在不寻常的地方追性能。
- 关键优势是围绕新芯片快速构建栈的速度;没有大型既有数据中心提供商的锁定。
- 他们有些非常有创造性的数据中心伙伴,愿意快速行动;还有一个新类别可以后续讨论。
- 最重要的是,他们不回避挑战:会公开说"我们爱 TPU,我们让 TPU 工作;我们爱 Tranium,我们让 Tranium 工作"。
-
如果某芯片不轻易工作,就找到方法把它融入异构服务系统;每块芯片都有比较优势,任务就是找到并挤压那个优势。
-
投资者担忧:半导体占 S&P 500 比重
- 主持人提到内存股,以及半导体占 S&P 500 从历史 2-4% 到如今 19-21%。
- 市场历史学生常常看到:某类东西短期触及疯狂峰值,然后回归长期均值。
- 很多人在 Micron、SK Hynix 上赚了钱,但都担心长期计算是商品,不应占全球市值五分之一甚至四分之一。
- 嘉宾自称更多是"历史成员"而非"历史学生":1997 年出生,母亲在 2000 年前后英特尔工作,亲历 dot-com 繁荣与崩盘。
- 他记得那时 Cisco 是世界最有价值公司,英特尔紧随其后。
- 与 25 年前相比,今天的关键区别是:当时网络设备投资多数是投机性的,预期用户需求从未到来。
- 当前的 token/AI 消费不再是投机:人们买 token 因为它立即有价值,不会囤积,而是马上使用。
- 这也不同于两年前的 2023-2024 Hopper 芯片紧缺:那时靠训练支出,训练本质上投机;现在大家都在给 Cloud Code 设支出上限。
- 推理支出会单调递增,没有投机的成分。
💬 精华片段(中文)
"没有坏芯片,只有非常糟糕的定价。我会在合适的价格下让任何芯片工作。"
"There are no bad chips. There's really bad pricing. And I will make any chip work at the right price."
52:49 数据中心:从千兆瓦到 1MW 分布式,以及 95% uptime
本节重点
- 推理所需的数据中心和训练不同:训练是推理的超集,需要更重的网络投资。
- 1GW 数据中心在美国基本无法轻易建成,10MW 是今天的边缘,1MW 很充裕。
- 嘉宾愿意购买 95% uptime 的数据中心,因为后台智能体不介意偶尔中断。
- 这些小型数据中心砍掉电力冗余、柴油发电机、冗余光纤和 SLA,换来难以复制的经济性。
详细精要
- 训练 vs 推理对数据中心的要求不同
- 整个 AI 栈中最保守的是底层基础设施玩家,包括数据中心和芯片基础设施 TSMC。
- 历史上 AI 数据中心为训练而建;训练是推理的超集工作负载——任何训练集群都能做推理,但反过来不行。
- 关键差异在网络:投资多少芯片间带宽、需要多大的集群。
- 数据中心有规模不经济:建 100,000 GPU 的数据中心,比建 10,000 或 1,000 的要昂贵且困难得多。
- 现在大家以 MW/GW 衡量数据中心;美国已几乎不可能轻易建造 1GW 数据中心。
-
100MW 已越来越困难,基本只有极特殊客户能做;10MW 处于今天的可能边缘;1MW 在嘉宾看来是"充裕"的。
-
市场上存在大量分散而非集中的电力
- 有大量聚合供电量,但它不集中,这对训练数据中心没有吸引力,因为没人想处理跨数据中心训练。
- 市场仍有滞后:大多数数据中心开发商仍抱持"必须抢夺 100MW、10MW 数据中心"的态度。
- 但越来越多新思考者认识到,推理更适合分布式 1MW 数据中心。
-
Sal Research 完全同意,并乐于购买美国各地的小批算力,构建自己的推理车队。
-
1MW 的物理尺寸:约 8 台冰箱大小
- 液冷出现后,单个机架可塞入惊人功率密度。
- 1MW 通常被想象成大型数据大厅、巨大仓库,现在可装进约 8 个机架。
-
每个机架大约冰箱大小,排成一列即可;这就是 1MW 的物理规模。
-
愿意接受 95% uptime 的数据中心
- 这些小型数据中心经常没有电力冗余,也往往没有备用柴油发电机。
- 这些昂贵的开销都被砍掉;很多情况下甚至没有冗余网络。
- 它们位于有良好电力接入的地方,使用单一电源,只拉一条光纤,没有三条带冗余、failover 和 SLA。
- 有时数据中心会宕机;嘉宾不惊讶有些会低到 95% uptime,这对其他人是致命的、灾难性的。
- 大千兆数据中心基本没有买主愿意接受 95% uptime;嘉宾说"我是第一个买家,我会买 95% uptime"。
- 原因有二:第一,他们有强大控制平面,能处理单一数据中心故障,只要不与其他中心高度相关,就能把工作负载移走。
-
第二,故障以一定速率发生,嘉宾对 95%、98%、99% uptime 几乎线性满意。
-
为什么后台智能体不介意低 uptime
- 当请求失败时,需要找新 GPU 重新放置请求;该智能体那一回合可能多花 1-3 分钟,甚至 10 分钟。
- 但客户不在乎,因为他们的智能体已经运行了数小时,人可能正在睡觉。
- Sal Research 对客户坦白:平均吞吐会非常有竞争力,但 P99 延迟不受控、无法控制。
- 作为回报,他们提供难以匹敌的经济性,这对后台智能体是正确契合。
💬 精华片段(中文)
"我们是第一个买家——我们会买 95% 正常运行时间。对其他人来说,这是致命的;对我们来说,这只是线性地好或坏。"
"I'm that first buyer. I will buy 95% uptime. It's fatal for anyone else; for me, it's just linearly good or bad."
58:58 电力、可再生能源与"清道夫"战略
本节重点
- 嘉宾可以接受 80% uptime 的可再生能源数据中心,甚至可容忍连续数天到数周停机。
- 通过天气建模预测停机,把工作负载迁移到世界其他地方。
- "清道夫"战略:先捡芯片,再捡电力,从竞标 Anthropic/OpenAI 的算力中退出。
- 目标是用"迷你钢厂"构建全世界最好的钢铁工厂,而非单体巨型工厂。
详细精要
- 太阳能的间歇性只是被错误定价
- 嘉宾是加州之子,热爱太阳能和风能;美国太阳能和风能严重未被充分利用。
- 一直以来的挑战是间歇性:太阳能/风能被认为不适合数据中心,因为数据中心需要持续基载。
- 但嘉宾认为问题更可控:他完全可以容忍数据中心停机数天甚至数周。
-
最坏情况是风不吹、云不散、山谷被雾笼罩持续一段时间;这其实高度可预测。
-
通过天气建模和负载迁移利用可再生能源
- 嘉宾会建模天气,预测数据中心何时离线,然后提前把工作负载移到世界其他地方。
- 这让他获得别人不碰的电力,因为处理这种长期中断太麻烦。
-
如果芯片足够便宜(大概率不是 NVIDIA 机架),闲置芯片的资本成本也不那么让人在意。
-
"清道夫"策略:芯片清道夫 + 电力清道夫
- 首先清道夫芯片,再为芯片清道夫电力。
- 两个情况下都不想跟 Anthropic 或 OpenAI 竞标算力;嘉宾不会赢,也不想赢。
- 他想更有创意,使用对方认为"不可读、不可用"的供应。
- 随时间积累,他只会得到聚合供应,永远得不到集中供应;但足以建起一个经济学无法被击败的聚合工厂。
-
嘉宾说:"我们是工厂,想建成世界上最好的钢铁厂,但通过迷你钢厂,而不是大型单体钢厂。"
-
垂直整合:从拥有全栈到虚拟清道夫
- 极端版本是拥有一切:电力源、数据中心、芯片设计、软件、终端 token 销售——超级资本密集。
- 资本轻版本是几乎什么都不拥有,只做协调平面,成为"虚拟清道夫"。
- 嘉宾的内心有两个部分:作为创始人,他想做所有事情,永不停止,直到构建出从终到始最高效的系统,像现实版 Factorio。
- 作为 CEO 更务实:拥有所有东西的资本需求是疯狂的;软件拥有最高杠杆,所以从软件开始。
- 关于是否拥有发电,他更倾向让其他人专精他们历史擅长的领域,通过 PPA 获得电力。
- 他认为只要达到足够规模,就能赢得把某些环节"收归麾下"的权利;全栈到处有效率,但必须打破供应商对其客户的既有假设。
- 这是很乐观的看法,但只有在承保"计算史上最大市场"时才成立:未来将为推理投入数十亿、数万亿美元投资。
💬 精华片段(中文)
"首先我们清道夫芯片,然后我们为这些芯片清道夫电力。在两种情况下,我都不想和 Anthropic 或 OpenAI 竞标算力。我赢不了,也不想赢。"
"First we scavenge chips, and then we scavenge power for those chips. In both cases I do not want to be bidding against Anthropic or OpenAI for compute capacity. I'm not going to win, and I don't want to."
01:03:38 全系统效率短板、晶圆厂与公司文化
本节重点
- Compute scaling 很高效,MoE 已经非常稀疏;真正的短板在 KV cache 的内存使用。
- 全球有大量 GPU 在私有池中闲置,需要更好的计算编排。
- 晶圆厂过度收紧工艺角;嘉宾愿意接受参数较差或更多废品,换取更低成本。
- 公司文化:极限思考、协作教学、对新芯片保持流动关系。
详细精要
- 全系统最无效率的地方排序
- Compute scaling 很高效:给更多 flops 就会用掉更多 flops,而且已经相当审慎。
- 看现代模型,很少有超过 10% 稠密的;可激活专家中只有 10% 被激活,前沿模型更接近 1%。
-
所以 MoE 方面已经很稀疏,人们已经挤压很久;主要的问题不在 MoE。
-
KV cache 是最大的效率短板
- 注意力及其内存使用是短板;KV cache 目前几乎未压缩。
- 观察 KV cache 的熵,它"没有挣得自己的位置"。
- 每个 token 在 KV cache 里存储数 KB 数据,这个数值可能差了 1-2 个数量级。
-
嘉宾不知道前沿实验室具体做法,但 DeepSeek 确实发表了很有趣的 KV cache 压缩工作,且每年能取得数量级进步,说明还有大量空间。
-
全球计算编排严重不足
- 微观尺度之外,世界并不有效地组织计算;NVIDIA 今年生产 500 万块 Blackwell 芯片,都在哪里?
- 嘉宾严重怀疑它们是否一直被使用。
- 很多计算消失在私人池中,GPU 闲置,这让他"身体上感到痛苦"——硅和电力投入了却闲置。
- 目标是把世界计算作为共享资源更好地组织、编排并更高效打包。
- 现实比人们想象的更糟:大家取笑 XAI 集群的 flop 利用率,但世界其他地方更糟;大量 GPU 在仓库或某客户私有池中闲置未用。
-
Sal Research 正直接攻击这种效率损失。
-
晶圆厂:工艺角与可接受废品
- 一切都平衡增长:即使翻倍芯片产量,TSMC 瓶颈解决后又会撞上下一瓶颈。
- 有趣的是晶圆厂认为必须交付的"不变量"与嘉宾希望的更流动关系之间的差异。
- 如果晶圆厂愿意向他暴露更多权衡,他可以做出更聪明的决定。
- 例子:每个晶圆厂产出中最好芯片和最差芯片存在大量差异;TSMC 花了极大精力收紧 工艺角,让最差芯片尽量接近最佳芯片特性。
- 这增加了许多嘉宾可能不需要的工艺控制;他可能愿意为最差的芯片找到位置,而不需要那么紧的工艺控制。
- 他也可能愿意接受更多废品;这样优化是在 die 成本、die 供应、电力成本和安置地点之间的更整体权衡。
-
最终目标是大幅度扩大美国电力供应,让许多原本无法进入数据中心的芯片有家可归。
-
公司文化与招聘
- 文化是"极限思考":不过度担忧当前状态,而是思考一个月、六个月、一年后的最终状态。
- 不接受机器状态是固定的;即使对 Blackwell,如果发现瓶颈,会认真表征并写下来,反馈给 NVIDIA 或朋友,并用于未来采购。
- 最看重的人是"既是好学生又是好老师";很多团队成员曾是大学助教,喜欢分享知识。
- 一直有白板会议,学院式环境让每个人既能教又能学。
- 关于招聘:唯一无法教的是性能工程的热爱,即挖掘机器每一微秒在做什么;嘉宾最看重的是这一点。
- 他不看重大量 AI 经验或 CUDA 经验;那是巨大的红鲱鱼,因为 CUDA/GPU 概念在过去 5 年已经变化太多,没有意义要求 10 年经验。
- 能力强可以教,但对性能工程的热爱必须天生具备。
💬 精华片段(中文)
"我无法教会的是对性能的热爱——挖掘机器工作的每一微秒,理解那一刻机器上正在发生什么。"
"The one thing I cannot teach is love for performance—love for digging into every microsecond that the machine is working and understanding what's happening on the machine at that time."
01:10:21 实验室格局、闭源与开源、蒸馏与异见观点
本节重点
- 前沿实验室为领先 3-6 个月付出巨额溢价,目前可能仍值得。
- 蒸馏无法被阻止;GitHub 上大量 AI 生成的代码会形成"潜在蒸馏"。
- 开源永远不会消失;训练前沿模型的门槛每天都在降低。
- 嘉宾最异端的观点:最该攻击的是 HBM 短缺,未来将把 KV cache 卸载到闪存。
详细精要
- 对主要实验室的评估
- 一句话总结:实验室为领先 3-6 个月付出巨额溢价,嘉宾认为目前可能仍然值得。
- OpenAI 和 Anthropic 做他们正在做的是完全合理的。
- 蒸馏是敏感话题,也是闭源与开源关系的核心。
- 一种观点认为蒸馏是偷窃;但嘉宾提供替代视角:互联网上越来越多的人工制品是 AI 生成的。
- 仅看 GitHub:过去一年创建的仓库中,有多少可能是 Cloud Code 生成的?这算不算蒸馏?
- 他并不惊讶可以只用 GitHub 上开源的好代码输出训练出 Fable 级别的模型。
- 如果用户拥有与 AI 互动的输出权,且很多人选择发上 GitHub,那么我们长期都会有"潜在蒸馏"。
-
从根本上说,不可能阻止信息或模型能力的扩散;问题只是速度有多快。
-
闭源领先能否持久
- 如果扩展和改进定律长期成立,那么在 3-6 个月领先并收取巨额溢价就仍有价值。
- 但嘉宾不确定这个溢价能持续很久。
- 企业部署不会以 3-6 个月的速度行动;很多企业仍停留在 Opus 4.6 或 4.7,不迅速采用前沿。
- 围绕任何部署变化都有很多问题;行业太早期,无法锁定赢家。
- 他更不认为这是一场可以最终决定胜负的比赛;这是一个持续过程。
-
开源永远不会消失;如果某个领导者退出产生真空,新领导者会进入。激励和顺风太多,训练前沿级模型每天都在变容易。
-
嘉宾希望未来的样子:多样 harness + 便宜 token
- 希望有丰富 token 和多样化 harness;每个人、每个公司、每个用户都可以构建自己的 harness,甚至"把智能体变成你自己的"。
- 距这种定制能力并不遥远。
- 他想要人们拥有自己的智能,定制更可能通过上下文学习,而非权重微调。
- 这个丰裕未来的底层输入就是便宜 token。
- 他的工作是让 token 尽可能便宜,通过每个软件/硬件/电力层级实现;他会使用每块芯片、每个电源、美国每块适合的土地。
- 最终人们会有动力去探索"拥有丰富智能"是什么感觉。
-
我们至今仍把智能体当作"昂贵的咨询对象",只在有难题时问它;这不是正确的智能观。机器能思考令人难以置信,应该让尽可能多的人拥有。
-
最异端观点:HBM 与 KV cache 卸载到闪存
- 大多数异端观点在芯片方面:当谈到定制芯片时,人们问"有何不同",嘉宾的回答是绕开 HBM 短缺,把负载向其他内存形式如闪存极端卸载。
- 他对这个想法非常热情;团队里每个人都知道他一直在敲鼓:我们得改变模型架构,让 KV cache 卸载到闪存在更大程度上可行。
- 在推理社区中,他对围绕 1-10 tokens/s 设计服务系统有异见。
-
更广泛地,他关心怎样让人们每天消耗 1 万亿 token,这是他想创造的能力。
-
1 万亿 token 是多少钱?
- 按 OpenAI 定价,1 万亿 token 至少是 500 万美元(5.5/5.6 版本),用美元衡量最直观——数百万美元。
- 要让人人都能这样消耗,需要每个 token 成本降低 3-6 个数量级。
- 降到 5,000 美元左右,就可能有客户了。
-
事实上,对于某些模型规模,他们正接近以数万美元计价 1 万亿 token;这是可以想象用来运行单个任务的水平。
-
关于"普通人是否真有这么多智能需求"
- 主持人问:普通人现在连自己的大脑都没那么用,会不会实际上世界对智能的需求没那么大?
- 嘉宾从不相信:世界永远对智能有需求;困难在于进入智能的匝道,这是产品社区要解决的挑战。
- 嘉宾不是产品人,无法给出最好的愿景,但他想赋能那些人,让他们永远不被"免费层用户用不起"或"我负担不起这么多 token"所限制。
-
这正是他在客户那里一直听到的痛点。
-
哪个共识观点是错的:晶圆厂地缘政治被夸大
- 嘉宾短期看多 NVIDIA,认为永远不应赌 NVIDIA 输,他们总会重塑自己。
- 但根本性上,让他惊讶的是:对比 Hopper 到 Blackwell 到 Rubin,同类 FP16 乘法的每瓦性能提升没有那么大。
- 进一步看 TSMC 5nm、4nm、3nm、2nm,性能每瓦变化也没有戏剧性差异。
- 所以地缘政治恐惧被夸大:人们担心失去 TSMC 会造成毁灭性打击。
- 嘉宾的反直觉观点:即使失去 TSMC,西方最好工艺如 Intel 最坏情况也只差约 2 倍每瓦性能;差距远小于芯片论坛对话所暗示的。
💬 精华片段(中文)
"我们仍把智能体当成一个昂贵的咨询顾问,只有在遇到难题时才去问它。但这不是思考智能的方式。机器会思考这件事太不可思议了,我们应该让尽可能多的人拥有它。"
"We still treat the agent as a person that is expensive to consult and you should ask them when you have a hard question. That's not the way to think about intelligence. It's incredible that the machine can think, and we should try to get that into as many hands as possible."
01:18:33 给硬件创业者的建议与结尾
本节重点
- 硬件创业必须回答供应链的 3-5 个瓶颈:TSMC 晶圆、HBM、先进封装、电力。
- "尖锐"比"平衡"更重要:挑选 Nvidia 难以改变的点进行攻击,最推荐攻击 HBM。
- NVIDIA 不直接卖 token 是为了不与客户竞争,并保持买家之间的竞争。
- 结尾:最善意的事是导师们让他看到从门级硅到互联网级服务的整条栈之美。
详细精要
- 给 100 位硬件创业者的建议:聚焦供应链瓶颈
- 第一件事是让我或投资者相信你理解现代芯片供应的 3-5 个瓶颈。
- 这些瓶颈包括:TSMC 晶圆产能、HBM 产能、先进封装,第四个可能是电力。
- 创业者必须对每个瓶颈都有好答案:你从哪里获得电力?如何搭建机架?
- 因为归根结底一切都是套利:你建芯片,是因为你认为 NVIDIA 做出了难以改变的选择。
- NVIDIA 确实做了很多难改变的选择;他们不是完美,只是非常平衡。
-
所以创业者要"尖锐":挑一个方向说"我认为他们低估了未来 HBM 短缺的影响,我们要朝另一方向猛攻"。
-
为什么最该攻击 HBM
- HBM 有最少的路径来快速增加供给;内存行业在 Boise 的厂商对周期性业务的巨额 capex 很谨慎,已经多次吃亏。
- 因为 HBM 短缺,世界会绕路,让系统其他部分更高效。
-
嘉宾认为这会让其他部分变得更贵:iPhone 会削减内存,iPhone 会涨价,消费者只能接受。
-
为什么 NVIDIA 不一路做到底卖 token
- NVIDIA 很聪明,不跟客户竞争;他们长期视角看一切。
- Jensen 很擅长让朋友成为亿万富翁:他让 CoreWeave 成为数十亿美元公司。
- 没有必要毁掉这些善意。
- 他更想创造多样化的 NeoCloud 和推理提供商社区,它们都在竞相为 NVIDIA 创造需求。
-
如果某一家决定垂直整合或转向 AMD,还有另外三家饥饿的人准备填补位置;买家之间的竞争对 NVIDIA 是好事。
-
最善意的事:导师与全栈理解
- 嘉宾想到所有导师:稀少的人愿意花费大量时间,把让你理解某件事或灌输价值当作个人兴趣。
- NVIDIA 中很多人向他灌输了性能工程的热爱。
- 大学导师的故事:大二时他很不耐烦,去办公时间问"我想做 AI 芯片,为什么要浪费时间上基础课、网络、操作系统"。
- 导师看着他,列出整个栈的深度,展示理解每一个拼图件之美。
- 导师说:很少有人能从门级硅一路理解到构建互联网级服务,你应该立志用一生去实现这种理解。
- 这种专业水平很高贵,值得追求;这句话一直留在嘉宾心中。
💬 精华片段(中文)
"你建芯片,是因为你认为 Nvidia 做出了难以改变的选择。他们不完美,只是非常平衡。所以你要尖锐:挑一个方向猛攻。"
"You're building a chip because you think Nvidia has made some choices that are difficult for them to change. They're not perfect. They're just really well balanced. So you want to be spiky."
专业术语注释
| 术语 |
解释 |
| Token |
语言模型处理文本的最小单位;本集中也泛指"智能的计价单位",目标是把每 token 成本降到极低。 |
| 长时程智能体(Long-horizon agent) |
运行数小时、数天甚至数周的智能体,区别于即时交互式的聊天机器人;是 Sal Research 的核心场景。 |
| 吞吐导向 vs 延迟优化 |
GPU 上两种目标:批量处理提升总吞吐但单请求慢,或单请求极快但总吞吐低;本集主张长时程场景下选择吞吐。 |
| NVLink |
NVIDIA 的 GPU 间高速互联技术,主要用于低延迟推理中的张量并行;嘉宾认为它对吞吐优化非必需。 |
| Tensor Core |
NVIDIA GPU 上加速矩阵乘法的专用单元,2016 年首次以 5-10% 硅片面积引入,是 AI 算力的核心。 |
| 内核(Kernel) |
GPU 上运行的任何程序;历史上每种操作(矩阵乘、加法)都有独立内核,现在越来越多融合内核。 |
| FlashAttention |
现代 Transformer 依赖的高效注意力内核,由 Tri Dao 等人开发,是深度学习软件栈的基石。 |
| SRAM |
片上静态内存,用 6T 晶体管单元,速度快但面积大、密度低;Cerebras 等依赖它做极快访问。 |
| DRAM |
片外动态内存,用电容存储并需每 50ms 刷新,密度高但访问慢;HBM 是其高带宽堆叠形式。 |
| HBM |
高带宽内存,堆叠在逻辑 die 周围,提供数百 GB 容量;当前 AI 芯片最大供给瓶颈之一。 |
| KV cache |
推理过程中存储每个 token 表示的内存,用于维护上下文;通常比模型权重更占内存,是长上下文推理的痛点。 |
| 测试时计算扩展(Test-time compute scaling) |
给智能体更多推理时间/计算量,以获得更好答案;长时程智能体的理论基础。 |
| MoE(混合专家) |
模型中只激活一小部分专家;现代模型常只有 1-10% 的 dense 激活,是计算效率方面的成功优化。 |
| ROPE |
一种旋转位置编码方式;模型对位置编码的微小改动就可能导致旧内核不再适用。 |
| 光罩极限(Reticle limit) |
TSMC 对单 die 面积约 800mm² 的限制;Cerebras 通过整晶圆互连绕过它。 |
| 工艺角(Process corner) |
芯片生产中最差/最佳芯片之间的特性差异区间;晶圆厂收紧工艺角会增加成本。 |
| 先进封装(Advanced packaging) |
将多块 die、DRAM 等封装在一起的工艺;现代芯片供应链关键瓶颈之一。 |
| P99 延迟 |
99% 请求的延迟上限;Sal Research 明示不控制 P99,以换取便宜经济学。 |
| RL 环境(RL environment) |
用于模型通过可验证任务自我改进的"健身房";下一阶段数据的主要来源。 |
| 蒸馏(Distillation) |
用大模型/闭源模型输出训练小模型;嘉宾认为信息扩散无法阻止,长期会形成潜在蒸馏。 |
| TPU / Tranium |
Google 和 AWS 的自研 AI 芯片;嘉宾愿意让它们融入异构服务系统。 |
| PPA(Power Purchase Agreement) |
电力购买协议;嘉宾倾向于通过协议获取电力,而非自建发电。 |
| NeoCloud |
面向 AI 负载的新型云计算提供商,如 CoreWeave;NVIDIA 通过培养多家 NeoCloud 维持买家竞争。 |
延伸思考
- 如果 P99 延迟不可控,哪些应用能真正接受? 长时程后台智能体可能是答案,但企业级用户对 SLA 的依赖程度是否被低估?
- 95% uptime 的数据中心是否会引发新的工程范式? 当弹性调度、负载迁移和异构算力足够成熟,能否把"低 uptime"变成真正的成本护城河?
- HBM 短缺会否推动架构变革? 嘉宾坚信 KV cache 可以卸载到闪存,但模型架构需要多大改动,是否足以威胁现有 HBM 供应商?
- 闭源领先 3-6 个月的溢价能持续多久? 企业部署速度远慢于前沿迭代,这是否意味着闭源实验室的商业模式会从卖 token 转向卖结果?
- "清道夫"策略的可复制性: 通过购买被忽视芯片、电力和土地构建低成本推理网络,是否会被巨头复制,从而压缩套利空间?
原文发表:2026-08-25 · 纪要生成:2026-09-02