来源: Latent Space | Philip Kiely & Ali Taha | Aug 03, 2026
播客: Latent Space
分类: AI 资讯
原文发表: Aug 03, 2026
纪要生成: 2026-08-10
Philip Kiely 是 Baseten 的核心团队成员,同时也是《Inference Engineering》一书的作者。Ali Taha(ID“Waterloo intern”)是 Baseten 的研究实习生,深度参与模型量化、投机解码和视频扩散等前沿推理优化工作。本期节目两位专家携手 Swyx 与 Vibhu,以高密度的技术细节描绘了从用户发出一个 200K token 请求开始,到底层 GPU 内核、硬件架构、模型持续学习的全链路推理工程全景。
本节重点
详细精要
在支持的模型上,预填(prefill,处理整段输入并生成第一个 token)和 解码(decode,逐个生成后续 token)由不同 GPU 组完成,预填阶段产出的 KV 缓存会传递给解码 GPU 迭代生成。
投机解码模型参与加速:系统前端会搭载一个轻量投机模型,专门针对常见流量(如编码)预测多个后续 token。
若用户实际请求偏离训练分布(例如概括哈利波特),草稿 token 接受率降低,速度会变慢,因此流量特化对性能影响很大。
实际计费与专用部署的考量:公有多租户 API 按 token 计费,而若切换到 专用部署(dedicated deployment),用户只需按 GPU 时长付费。
💬 精华片段(中文)
"We want to send this one to something with, number one, available prefill workers, and number two, ideally some cached input already there so that we can skip prefill on at least part of these two hundred thousand tokens."
“我们要把它路由到一个既有空闲预填 worker,又最好已经缓存了部分输入的地方,这样至少能跳20万 token 中的部分预填。”
本节重点
详细精要
用户还可以自行设定批尺寸、并行策略、使用更高精度等,避免与其他租户的测试流量争抢资源。
投机解码的内在机制:指在大模型基础上外挂一个小型草稿模型,该模型快速生成多个候选 token,再由大模型在一轮前向中统一校验。
草稿模型通常参数在十亿级,约为大模型的 1/60,且必须与大模型共驻同一硬件,资源竞争是其实际部署的主要约束。
工具调用与结构输出的难点:模型本质只能提出建议,并不执行动作。
推理侧通过构建状态机约束输出,确保语法符合 JSON Schema,但这只能解决格式结构,不能解决“调错工具”或“不调工具”的问题。
JSON 仍是工具调用的主导格式:尽管流式输出 JSON 较困难,且有人尝试 YAML、TOML 等替代,但工具调用的中位数 token 量很小,投机解码器足以快速处理,且企业系统多为 JSON 接口,迁移成本高。
💬 精华片段(中文)
"The LLM is not capable of doing anything. It’s only capable of making suggestions of what to do and then if those suggestions are formatted in a certain way and applied to a system that knows what to do with them, then an action occurs."
“LLM 本身做不了任何事。它只能给出做什么的建议,然后只有当这些建议被格式化成特定方式,并被一个知道怎么执行它们的系统所应用时,动作才会发生。”
本节重点
详细精要
基础架构搭建与测试:加载模型、压测、调优,并在一周甚至一个月内持续修复真实流量下暴露的 bug。
应对架构变化的案例:
MiniMax M3 的 head 使用全注意力,导致投机解码时 KV 缓存膨胀计算量暴增,实际运营中可能替换为 GQA 层并进行重训以保持相同的草稿接受率。
模型嫁接实践:GLM-5.2 + Kimi 视觉:团队将 Kimi 的视觉编码器冻住,搭配一个仅数百万参数的投影器训练对齐。
💬 精华片段(中文)
"The brain is frozen and the eyes are frozen. It’s just we’re trying to align the interconnect between the eye and the brain."
“大脑(LLM权重)是冻结的,眼睛(视觉编码器)也是冻结的。我们只是在训练连接眼睛和大脑之间的投影器。”
本节重点
详细精要
当前系统中,若同一 token 连续输出 4 次以上,API 将自动切断并重试,但对部分特殊字符和表格横线会豁免。
非确定性失败的深因:即使温度设为 0,同一模型也可能产生不同输出,根源在硬件与内核竞态。
同一模型部署在不同集群上,因节点间 KV 缓存传输所用的互连速度不同,快互连下竞态不一定暴露,慢互连下则可能触发崩溃,最终决定“此模型不部署在A集群,只在B集群”。
层替换策略:针对 MiniMax M3 等存在的性能瓶颈,可以将其全注意力层换为另一个模型的 GQA 注意力层,并通过适配训练保持质量。
💬 精华片段(中文)
"The KV cache transfer from a node to node in that one cluster is using a slower interconnect than the node to node in another cluster. So that exposes the race, whereas in another cluster it doesn't."
“某一个集群内节点间的 KV 缓存传输用的互连速度比其他集群更慢,这就暴露了竞态,而在另一个集群里则不会。”
本节重点
详细精要
无损与有损优化:KV 缓存、投机解码等均为无损,仅 量化 会引入信息损失。维持模型保真度(fidelity)的要点在于数据格式(如 NVFP4)、针对哪些层做量化以及大量的校准,以保护离群值。
误差抵消的新发现:Baseten 实习研究员 Joshua 的论文指出,传统“越量化越差”的直觉并不总是成立。
结果表明,量化层数多于竞品 20%(吞吐量提升 20%)的同时,模型忠实度更高。验证手段使用了 KL 散度 来比对量化后模型的 logits 分布与全精度模型的差异。
量化策略的价值:以图像模型为例,不量化调制层与输出投影层,保护用户所见与模型所见的关键环节。该方法使推理引擎在达到更快吞吐的同时,实现“你的 API 应与官方 API 难以区分”的内部基准。
💬 精华片段(中文)
"It is very possible that the model in which I quantized more information is going to perform better because the quantization errors have canceled out."
“量化了更多信息的模型完全可能表现更好,因为那些量化误差彼此抵消了。”
本节重点
详细精要
巨大优化空间:与金融领域追求几个基点不同,推理工程圈每项优化动辄 20%、100% 甚至 200% 的提升。以万亿参数模型 30-50 token/s 为起点,堆叠三个各自翻倍的优化可达 8 倍,目标直指 300-400 token/s。
各项增益拆解:
更好的运行时与内核:追加高两位数百分比提升。
捷径与难度:对于普通开发者,可直接使用开源社区的 NVFP4 权重和已训好的通用投机模型,无需从头训练;但要实现完全的 10 倍优化,必须在硬件(如 B200 节点集群)、缓存命中率和延迟调优上做出巨大投入。GLM-5.2 自带 多头预测(MTP) 可做自投机的解码加速,进一步降低了外部投机模型的需求。
💬 精华片段(中文)
"When we publish optimizations, it’s 20%, it’s 100% it’s 200%. So there’s still probably like a lot further to go."
“我们发布优化成果时,常常是 20%,100% 乃至 200%。所以可挖掘的空间还非常非常大。”
本节重点
详细精要
Dynamo 的本质:NVIDIA Dynamo 作为一个开源库,核心功能是协调 NIXL 完成集群内 KV 缓存的移动,支持多种推理框架和硬件。官方提供一套默认配置,但开发者需根据自身部署深度定制才能真正达到顶级性能,因此它更像基础设施组件而非标杆。
投机解码方法演变:从最早的 Medusa(已作为教学基线写入书中)到被广泛使用的 EAGLE,再到 Tri Dao 提出的 SpecSpecta(用投机解码去加速投机解码器本身),该领域的发展速度极快。
投机解码器本身也要做自回归,因此理论上可以无限递归地套用小模型,但其带来的资源争用和软件复杂度使其落地存在上限。
两大推理领域的对比:
💬 精华片段(中文)
"With local AI, it’s how do I fit this model onto my hardware and then make it less dumb? And with data center inference, it’s how do I load this model and then make it less slow?"
“对本地 AI,问题是我怎么把模型塞进硬件,然后让它别太笨?对数据中心推理,问题是我怎么加载这个模型,然后让它别太慢?”
流水线并行:将模型按层切分到不同节点,仅在跨节点互连太慢(如 H100 跨节点只有较慢的网络)而单卡又装不下整个模型时才用,通常是最后的选择。
自动调优成为主打方法:无论是确定张量并行度(TP1/TP2)还是内核的线程数和共享内存配置,当前都难以通过纯数学推理得出最佳方案,而是采用 自动调优。
通过镜像生产流量,对每 token 时间和总吞吐进行参数空间的暴力搜索,选择最优配置。这与训练阶段通过数学最大化 FLOPS 不同,推理更受延迟和带宽影响。
超级内核(Mega Kernels)争议:
💬 精华片段(中文)
"The GPU is designed in such a way that it kills mega kernels. You don’t need to use mega kernels that much anymore."
“GPU 本身的设计就消灭了超级内核。你已经不太需要再去融合内核了。”
本节重点
详细精要
Rubin 时代的推理:从 Ampere 到 Hopper 再到 Blackwell,每次硬件迭代都迫使推理引擎重写底层支持。Rubin 将更多押注在 系统思维上:强调 CPU 到 GPU 的互连、GPU 间的数据传输,以及通过 Dynamo 这类工具实现 KV 缓存卸载和缓存感知路由。推理工程师不再只是优化 CUDA 内核,还需处理传统硬件基础设施问题。
GPU 的“ASIC 化”趋势:Ali 提出,随着每一代 GPU 增加更专用的 张量核心(Tensor Cores)、张量内存加速器(TMA) 和专门为 Transformer 头维度优化的 MMA 指令,GPU 已变成一组可编程的 ASIC 阵列。开发者将更多在“数据瓦片”层面工作,而不是控制每一个线程的精确行为。
对第三方 ASIC 公司的看法:
💬 精华片段(中文)
"Compared to Ampere or a T4, Rubin is an ASIC. It’s just a thing that is used — it has systolic arrays and tensor cores that are almost exclusively useful for loading model weights."
“跟 Ampere 或 T4 相比,Rubin 就是个 ASIC。它的脉动阵列和张量核心几乎完全就是为了加载模型权重而存在的。”
本节重点
详细精要
Kimi K3 的硬件要求:2.8 万亿参数在 NVFP4 下约占 1.4 TB 存储,加上为 KV 缓存预留的空间,只有 GB300(单卡 288 GB,8 卡节点约 2.3 TB)才能勉强装入单个节点。这解释了为何巨模型时代对 KV 缓存卸载等技术的需求愈发迫切。
模型尺寸与硬件推广:DeepSeek R1 的 671B 参数曾在当时推动业界快速转向 Blackwell 以获得足够的 HBM 和 NVFP4 支持。模型设计者会基于当前推理硬件的极限来设定参数规模,形成“硬件划定模型上限、模型倒逼硬件升级”的循环。
旧模型的生命力:在企业场景,模型一旦验证稳定可靠并通过内部审计,往往不会被轻易替换。即使 GLM-5.2 等新模型出现,仍有很多人使用 Llama 3 甚至 GPT-4o。这意味着开源模型生态天然具有“持久战”优势:只要有几台 H100,你就能永远运行被信任的旧模型,无需受 API 关停影响。
💬 精华片段(中文)
"You don’t gotta have a save Llama 3 movement. You just gotta have an H100 somewhere."
“你不需要发起‘拯救 Llama 3’运动,你只需要在某个角落里还有一台 H100。”
本节重点
详细精要
视频模型的供需死结:虽然开源 LLM 已与闭源几乎持平,但开源视频生成(如 Wan 2.2)远落后于 Kling、Veo。由于媒体公司宁可付一千美元用闭源也不接受开源十美元的低质输出,导致开源创新乏力,甚至连 Wan 的最新版 2.7 都已闭源。
平方注意力的物理瓶颈:以 480p、16 FPS、5 秒视频为例,压缩到潜在空间后仍需处理约 30×50×21 = 35,000 个 token,全注意力计算量呈 O(n²) 爆炸。若要生成一分钟连贯视频,几乎不可能在合理时间和计算内完成。稀疏注意力(如只关注 top 12.5% 的空间与时间邻近像素)可降低计算,但会严重牺牲画质。
自回归视频的现状与展望:
工业界如 Grok Video 采取折中:用扩散模型生成 7 秒片段,再用最后一帧引导生成下一段,虽非原生自回归,但能在一定程度上实现长视频拼接。
混合架构的前景:扩散模型可同时关注前后文以保持全局一致性,自回归模型则能无界延长。最终可能采用两者结合的架构,用扩散保证片段内质量,用自回归实现帧间衔接,就像 GPT Image 与 Nano Banana 在图像领域所尝试的。
💬 精华片段(中文)
"With video, there is no sequential. The pixel in the top left corner and the pixel in the bottom right corner, they both need to attend to each other to understand how the video quality is gonna be almost as equally."
“视频没有先后之分。左上角的像素和右下角的像素几乎同等重要地需要互相关注,才能知道视频的整体质量。”
本节重点
详细精要
语音与音乐的自回归路径:早在一年半前的 Orpheus 架构中,就已将音频波形 token 直接加入 LLM 词表,实现语音的自回归输出。音乐模型曾处于扩散与自回归的十字路口,但目前还未看到明显胜利者。总体上,推理任务可粗略二分:自回归模型负责文本、嵌入、语音;扩散模型负责图像、视频,二者存在交叉但各自优化技术栈独立。
扩散文本的未竟潜力:Diffusion Gemma 25B 等模型证明了扩散在文本上的可能性,尤其在需要全局约束的场景(如十四行诗的韵律)下,扩散能同时关注所有 token,确保音节和押韵正确,而自回归模型即使是最先进版本也常算错音节。但迄今为止,尚无大规模扩散 LLM,其 API 形态也未被认真设计为“从混沌中逐步浮现的文本”体验,导致市场无视这一方向。
跨模态启示:就像将 Kimi 视觉编码器嫁接到语言模型上一样,反过来,将语言能力嫁接到扩散模型中也是可预见的。David Holtz 曾设想用文本扩散来故事板电影长片,然后在各场景生成视频,体现“从始至终的一致性”在创作中的核心价值。
💬 精华片段(中文)
"I've done a lot of LLM sonnets... even models today don’t get the syllables right. And if you can attend across all of the different tokens, you can get the syllables right."
“我用 LLM 写过很多十四行诗……即使是现在的模型也搞不对音节数。而如果能同时关注所有 token,就能把音节数做对。”
本节重点
详细精要
训练为推理服务:为了让模型在 NVFP4 量化后保持高质量,往往不能只做 后训练量化,还需进行 量化感知蒸馏——让全精度模型与量化后的模型在 logits 上做蒸馏对齐,使量化模型“学会”在低精度下保持原分布。
模型优化自身的真实案例:Baseten 内部使用 GLM-5.2 接入 Cloud Code Harness,自动完成以下循环:
再次剖析验证,构建新镜像并部署,部分 GLM-5.2 服务的内核就是由 GLM-5.2 自己编写和调优的。这标志着“模型训练/优化模型”的闭环已初步成立。
持续学习的两种前景:
基于 KV 缓存的无限记忆:通过与 Still 等论文类似的 KV 缓存压缩技术,将对话历史压缩进几乎无限的内存,模型通过直接读取“外部记忆”而非改变权重来实现持续学习。这种方法保留了模型原始的推理能力,不会因权重更新而畸变,可能是更可行的长期方案。
对推理工程未来的影响:若走 KV 缓存路径,推理本身的架构无需巨变,只增加一个“更新缓存”步骤;投机解码、内核优化等现有技术依然适用。
💬 精华片段(中文)
"We had literally GLM-5.2 optimizing GLM-5.2. Some of the GPU kernels within our inference engine are written by GLM-5.2, and the trace and kernels were guided by GLM-5.2 as the driver."
“我们真的让 GLM-5.2 去优化 GLM-5.2。我们推理引擎里的某些 GPU 内核就是 GLM-5.2 自己写的,剖析路径和内核代码全由它驱动。”
本节重点
详细精要
高速网络的梦想:Ali 指出,当前推理中节点间 KV 缓存传递的延迟极大,因为数据需要经过“源 GPU → CPU 内存 → NIC → 网线 → 目标 CPU 内存 → 目标 GPU”的多次搬运。如果未来网卡速度能提升到接近 HBM(4.5 TB/s 级别),理论上分布式解码可实现 100 倍的速度飞跃,彻底改变分离式架构的瓶颈。
未来挑战清单:
行业规模持续膨胀:全球 AI 使用量远未达到消费或商业技术的成熟度,未来仍有大量 token 生成需求等待基础设施的承载。
最终的自我颠覆精神:Philip 以“希望一年后我们再回来,指着今天的内容说‘全是错的’”作结,呼应了整个推理工程领域快速迭代的本质。
💬 精华片段(中文)
"If someone were to figure out faster NICs, it would literally be like two orders of magnitude faster to do decode."
“要是有人能把网卡做得更快,解码速度直接就是两个数量级的提升。”
| 术语 | 解释 |
|---|---|
| KV 缓存 | 推理时为避免重复计算,将自注意力层中已计算过的键-值对存储下来,供后续 token 生成的缓存结构。 |
| 预填/解码分离 | 将推理过程拆分为两个阶段:预填阶段用高并行处理输入创建 KV 缓存,解码阶段用低延迟逐 token 生成,二者常在不同 GPU 上运行。 |
| 投机解码 | 用一个轻量小模型快速预测多个未来 token,再由大模型一次性验证,加速自回归生成的技术。 |
| NVFP4 | NVIDIA Blackwell 架构支持的低精度浮点数格式,每个参数仅占半字节,极大节省显存带宽。 |
| 动态量化 | 在推理过程中根据输入动态选择量化参数的技术,多用于本地设备,数据中心较少使用。 |
| GQA | 分组查询注意力,通过减少注意力头共享的 key/value 投影来降低 KV 缓存大小,提升吞吐。 |
| MoE | 混合专家模型,由多个子网络(专家)和路由模块构成,每次推理仅激活部分专家以节约算力。 |
| 张量并行 | 将单层权重切分到多张 GPU,每步计算后需聚合部分结果,高度依赖 GPU 间高速互连。 |
| 专家并行 | 在 MoE 模型中将不同专家完整放置于不同 GPU,路由复制到每张卡,减少跨 GPU 通信。 |
| 流水线并行 | 将模型按层拆分到不同节点顺序执行,仅在模型太大单卡装不下且互连速度不足以张量并行时使用。 |
| 超级内核 | 将多个 GPU 微内核融合成一个大内核以减少启动开销的理念,因硬件趋势和开发难度受质疑。 |
| Dynamo | NVIDIA 开源分布式推理框架,主要解决集群内 KV 缓存卸载、转移和缓存感知路由问题。 |
| Rubin | NVIDIA 计划中的下一代 GPU 架构,强调系统级互连和 CPU-GPU 协同。 |
| ASIC | 专用集成电路,相对 GPU 牺牲通用性以换取特定负载的极限性能和能效。 |
| 平方注意力 | Transformer 注意力机制的 O(n²) 复杂度,在长序列或高帧率视频下成为核心计算瓶颈。 |
| 自回归视频模型 | 像语言模型一样逐帧生成视频的架构,可流式输出但当前画质较差。 |
| 扩散模型 | 通过逐步去噪生成数据,能够同时关注全体信息,在图像/视频领域占据主导。 |
| KL 散度 | 衡量两个概率分布差异的指标,文中用于比对量化模型与全精度模型的 logits 分布相似度。 |
| 量化感知蒸馏 | 训练中让全精度教师模型指导低精度学生模型,使后者在量化后仍保持教师模型的行为分布。 |
| KV 缓存压缩 | 对长对话历史的关键-值缓存进行总结或裁剪,在有限显存中保留尽可能多的上下文信息。 |