▶ 原文链接

前英伟达工程师:为什么 AI 成本即将下降 1000 倍

来源: Invest Like the Best | Neil(Sal Research 创始人兼 CEO) | 2026-08-25 播客: Invest Like the Best 分类: NVIDIA 原文发表: 2026-08-25 纪要生成: 2026-09-02


全集重点


嘉宾/话题简介

本集嘉宾 Neil 是 Sal Research 的创始人兼 CEO。他曾是 NVIDIA 工程师,大学期间就在 NVIDIA 从事 GPU 内核与软件工作,亲历了 Tensor Core 从争取硅片面积到成为 AI 基础设施核心的全过程。Sal Research 定位为"token 工厂":通过 API 以市场最低价格提供开源大模型推理服务,并托管长时程智能体沙箱。本集围绕软件、硬件、电力三个层面展开,讨论如何把 AI 推理成本降低三到六个数量级,并重新设计数据中心、芯片组合与计算编排。


分节详述

00:00 公司定位:Token 工厂与"丰裕"哲学

本节重点

详细精要

💬 精华片段(中文)

"最好的延迟是根本没有延迟。早上醒来时,工作已经在夜里完成了,你甚至不需要提出要求。"

"The best latency is no latency at all. When you wake up in the morning, the work's already been done overnight. You didn't even have to ask for it."


05:12 长时程智能体的证据与应用场景

本节重点

详细精要

💬 精华片段(中文)

"安全已经变成了工作量证明:你想要安全的软件,真正的问题是你在 Anthropic API 上花了多少美元来试图攻破自己的软件。"

"Security has become proof of work. When you want secure software, it's really a question of how many dollars did you spend on Anthropic's APIs trying to break into your software."


08:50 主动智能体、可验证任务与丰裕愿景

本节重点

详细精要

💬 精华片段(中文)

"你必须愿意在没有回报承诺的情况下花费 token。这就是解锁。"

"You have to be willing to spend tokens without any promise of return. That's the unlock."


13:00 全栈方法:从 NVIDIA 内核到"速度光速"文化

本节重点

详细精要

💬 精华片段(中文)

"GPU 本质上是一台吞吐机器。当你给它大量工作、让它以计算单元的峰值利用率咀嚼时,它最快乐。"

"The GPU is fundamentally a throughput machine. The GPU is happiest when you give it a lot of work to do and let it chew through that work at peak utilization of its compute units."


本节重点

详细精要

💬 精华片段(中文)

"如果你想去旧金山市中心,你可以坐公交,也可以坐私人交通。私人交通走最直接的路径;公交必须服务更多人,走更慢路线,还会停下来等人上下车。"

"If you want to get downtown in SF, you can take the bus or you can take private transit. The private transit is going to have its own direct path; a bus, it's going to have to serve many more people, and it has to fundamentally do something that works for everyone."


23:27 低延迟硬件:SRAM、DRAM、Cerebras 与 Groq

本节重点

详细精要

💬 精华片段(中文)

"模型权重是结晶化的知识,而 KV cache 是我们正在进行的这段对话的动态知识。"

"The model weights are crystallized knowledge, and the KV cache is the dynamic knowledge of the exact conversation we're having."


32:41 Transformer 架构、扩展定律与数据未来

本节重点

详细精要

💬 精华片段(中文)

"互联网是对数据的一次性补贴。我们免费得到了它。"

"The internet was a one-time subsidy on data. We got it for free."


38:53 内核工程、GPU 效率与机架规模计算

本节重点

详细精要

💬 精华片段(中文)

"我们是在白板上写内核。先去白板上描述我们觉得机器该做什么,然后用自然语言简洁地描述给模型,模型去实现。"

"We write kernels on the whiteboard. We go to the whiteboard, describe what we think the machine should be doing, then we succinctly describe that in natural language to a model, and the model implements it."


44:36 芯片市场、AMD 套利与投资者担忧

本节重点

详细精要

💬 精华片段(中文)

"没有坏芯片,只有非常糟糕的定价。我会在合适的价格下让任何芯片工作。"

"There are no bad chips. There's really bad pricing. And I will make any chip work at the right price."


52:49 数据中心:从千兆瓦到 1MW 分布式,以及 95% uptime

本节重点

详细精要

💬 精华片段(中文)

"我们是第一个买家——我们会买 95% 正常运行时间。对其他人来说,这是致命的;对我们来说,这只是线性地好或坏。"

"I'm that first buyer. I will buy 95% uptime. It's fatal for anyone else; for me, it's just linearly good or bad."


58:58 电力、可再生能源与"清道夫"战略

本节重点

详细精要

💬 精华片段(中文)

"首先我们清道夫芯片,然后我们为这些芯片清道夫电力。在两种情况下,我都不想和 Anthropic 或 OpenAI 竞标算力。我赢不了,也不想赢。"

"First we scavenge chips, and then we scavenge power for those chips. In both cases I do not want to be bidding against Anthropic or OpenAI for compute capacity. I'm not going to win, and I don't want to."


01:03:38 全系统效率短板、晶圆厂与公司文化

本节重点

详细精要

💬 精华片段(中文)

"我无法教会的是对性能的热爱——挖掘机器工作的每一微秒,理解那一刻机器上正在发生什么。"

"The one thing I cannot teach is love for performance—love for digging into every microsecond that the machine is working and understanding what's happening on the machine at that time."


01:10:21 实验室格局、闭源与开源、蒸馏与异见观点

本节重点

详细精要

💬 精华片段(中文)

"我们仍把智能体当成一个昂贵的咨询顾问,只有在遇到难题时才去问它。但这不是思考智能的方式。机器会思考这件事太不可思议了,我们应该让尽可能多的人拥有它。"

"We still treat the agent as a person that is expensive to consult and you should ask them when you have a hard question. That's not the way to think about intelligence. It's incredible that the machine can think, and we should try to get that into as many hands as possible."


01:18:33 给硬件创业者的建议与结尾

本节重点

详细精要

💬 精华片段(中文)

"你建芯片,是因为你认为 Nvidia 做出了难以改变的选择。他们不完美,只是非常平衡。所以你要尖锐:挑一个方向猛攻。"

"You're building a chip because you think Nvidia has made some choices that are difficult for them to change. They're not perfect. They're just really well balanced. So you want to be spiky."


专业术语注释

术语 解释
Token 语言模型处理文本的最小单位;本集中也泛指"智能的计价单位",目标是把每 token 成本降到极低。
长时程智能体(Long-horizon agent) 运行数小时、数天甚至数周的智能体,区别于即时交互式的聊天机器人;是 Sal Research 的核心场景。
吞吐导向 vs 延迟优化 GPU 上两种目标:批量处理提升总吞吐但单请求慢,或单请求极快但总吞吐低;本集主张长时程场景下选择吞吐。
NVLink NVIDIA 的 GPU 间高速互联技术,主要用于低延迟推理中的张量并行;嘉宾认为它对吞吐优化非必需。
Tensor Core NVIDIA GPU 上加速矩阵乘法的专用单元,2016 年首次以 5-10% 硅片面积引入,是 AI 算力的核心。
内核(Kernel) GPU 上运行的任何程序;历史上每种操作(矩阵乘、加法)都有独立内核,现在越来越多融合内核。
FlashAttention 现代 Transformer 依赖的高效注意力内核,由 Tri Dao 等人开发,是深度学习软件栈的基石。
SRAM 片上静态内存,用 6T 晶体管单元,速度快但面积大、密度低;Cerebras 等依赖它做极快访问。
DRAM 片外动态内存,用电容存储并需每 50ms 刷新,密度高但访问慢;HBM 是其高带宽堆叠形式。
HBM 高带宽内存,堆叠在逻辑 die 周围,提供数百 GB 容量;当前 AI 芯片最大供给瓶颈之一。
KV cache 推理过程中存储每个 token 表示的内存,用于维护上下文;通常比模型权重更占内存,是长上下文推理的痛点。
测试时计算扩展(Test-time compute scaling) 给智能体更多推理时间/计算量,以获得更好答案;长时程智能体的理论基础。
MoE(混合专家) 模型中只激活一小部分专家;现代模型常只有 1-10% 的 dense 激活,是计算效率方面的成功优化。
ROPE 一种旋转位置编码方式;模型对位置编码的微小改动就可能导致旧内核不再适用。
光罩极限(Reticle limit) TSMC 对单 die 面积约 800mm² 的限制;Cerebras 通过整晶圆互连绕过它。
工艺角(Process corner) 芯片生产中最差/最佳芯片之间的特性差异区间;晶圆厂收紧工艺角会增加成本。
先进封装(Advanced packaging) 将多块 die、DRAM 等封装在一起的工艺;现代芯片供应链关键瓶颈之一。
P99 延迟 99% 请求的延迟上限;Sal Research 明示不控制 P99,以换取便宜经济学。
RL 环境(RL environment) 用于模型通过可验证任务自我改进的"健身房";下一阶段数据的主要来源。
蒸馏(Distillation) 用大模型/闭源模型输出训练小模型;嘉宾认为信息扩散无法阻止,长期会形成潜在蒸馏。
TPU / Tranium Google 和 AWS 的自研 AI 芯片;嘉宾愿意让它们融入异构服务系统。
PPA(Power Purchase Agreement) 电力购买协议;嘉宾倾向于通过协议获取电力,而非自建发电。
NeoCloud 面向 AI 负载的新型云计算提供商,如 CoreWeave;NVIDIA 通过培养多家 NeoCloud 维持买家竞争。

延伸思考

原文发表:2026-08-25  ·  纪要生成:2026-09-02