▶ 原文链接

推理规模将增长十亿倍:Baseten创始人Tuhin谈AI推理的未来

来源: Stanford Online | Tuhin (Baseten CEO) | Jun 05, 2026
播客: Stanford Online 分类: 其他
原文发表: Jun 05, 2026
纪要生成: 2026-07-21


全集重点


嘉宾/话题简介

Tuhin 是 Baseten 的联合创始人兼 CEO,Baseten 是一家已成立约七年的AI推理基础设施公司,为全球增长最快的AI公司提供生产环境的模型推理服务。Tuhin 原籍澳大利亚悉尼,在金融领域起步,后转向机器学习研究,最终在旧金山扎根于早期技术创业。本集节目中,他与斯坦福的学生深入探讨了推理市场的爆发性增长、为什么企业从闭源转向开源和后训练模型、计算硬件的未来格局以及创业者的机遇与策略。


分节详述

00:00 开场:推理将增长十亿倍

本节重点

详细精要

💬 精华片段(中文)

"Inference is about to go up a billion x, not 1,000, not a million x. A billion x."

“推理即将增长十亿倍,不是一千倍,也不是一百万倍,是十亿倍。”

00:31 Tuhin 的创业旅程:从金融到AI基础设施

本节重点

详细精要

💬 精华片段(中文)

"I fell in love with early stage technology and small teams and building products, and where no one really cares."

“我彻底爱上了早期技术、小团队和构建产品,以及那种没人真正在意你正在做什么的感觉。”

03:44 客户案例:Wispr Flow 与 Abridge 的推理架构

本节重点

详细精要

💬 精华片段(中文)

"Our thesis is that AI is going to be absolutely massive. Inference is the cogs of AI value being delivered."

“我们的核心理念是AI将变得极其庞大。推理就是传递AI价值的齿轮。”

06:25 95% vs 5%:前沿模型与自定义模型的格局

本节重点

详细精要

💬 精华片段(中文)

"Today, about 90% or 95% of spend on inference is going to frontier models, and about 5% is going to custom models. And we believe that the way that all these folks who are building amazing applications with AI are going to build profitable, viable, defensible companies is with custom models."

“今天,大约90%到95%的推理支出流向前沿模型,只有约5%流向自定义模型。而我们相信,所有这些正在构建出色AI应用的人,要想打造能盈利、能生存、有护城河的公司,都必须依靠自定义模型。”

08:33 为什么要转向开源和后训练:生存与防御

本节重点

详细精要

💬 精华片段(中文)

"He likened the frontier labs to the East India Company. [...] Really, what they're doing is you're giving them all the tricks on how to rule that. And before you know it, they're post training models kind of against those workflows that are sacred to you, that only you know."

“他把前沿实验室比作东印度公司……实际上,你是在把所有统治那个领域的诀窍都交给它们。在你还没来得及反应之前,它们就已经针对那些对你而言极其神圣、只有你知道的工作流,后训练出了模型。”

13:48 性能差距与用户体验:切换模型底层引擎的风险

本节重点

详细精要

💬 精华片段(中文)

"You would hope that as they post trained models to user signals that they have the experience of the user gets better. And hopefully it also drives both performance from a latency perspective and reliability perspective higher because there's a lot more control."

“你自然会期望,当他们根据用户信号对模型进行后训练时,用户体验会变得更好。而且希望这样一来,因为有了更多控制权,延迟和可靠性表现也会更高。”

14:41 Baseten的商业模式:从加价计算到按token计价

本节重点

详细精要

💬 精华片段(中文)

"We're moving towards a world, especially as we unlock more of those post-training training workflows within Baseten itself where the narrative changes from how much are you paying for compute to how much are you paying per token?"

“我们正在走向一个世界,特别是当我们在 Baseten 内部解锁更多后训练工作流之后,叙事会从‘你为计算支付了多少’变成‘你为每个 token 支付了多少’。”

16:20 后训练工作流详解:从数据到专用模型的全闭环

本节重点

详细精要

💬 精华片段(中文)

"Our customers who are coming to us with that, really they come with data and what they about their workflows. And they leave with a post-trained specialized model running on Baseten."

“来找我们做这件事的客户,他们真的是带着数据以及他们对工作流的理解而来,最后带着一个运行在Baseten上的、后训练过的专用模型离开。”

18:35 数据信任与安全:将“王国钥匙”交给Baseten

本节重点

详细精要

💬 精华片段(中文)

"We work with multiple competitors and we have access to their models and their data. And we have set up the boundaries internally to make sure that there's no leakage between that."

“我们同时与多个竞争对手合作,并且能接触到他们的模型和数据。但我们在内部设置了严格的边界,确保彼此之间没有任何泄漏。”

19:39 开源模型的地缘政治未来:美国必须拥有顶尖开源

本节重点

详细精要

💬 精华片段(中文)

"I genuinely believe in life, before you make any points, you should make your biases and your incentive functions very clear. I don't think they acknowledge that."

“我真诚地相信,在人生中,在提出任何观点之前,你都应该先明确地讲清楚自己的偏见和利益函数。我不认为他们承认了这一点。”

25:22 异构计算硬件:NVIDIA 的统治与新挑战者

本节重点

详细精要

💬 精华片段(中文)

"Cuda is insane. I think these new architectures are breaking out. [...] This idea that all this will also just run on one chip, which is historically what's happened, probably isn't the end state."

“CUDA 简直不可思议。我觉得这些新架构正在从底层爆发……推理所有环节都只跑在一块芯片上的想法,虽然是历史常态,但大概不会是这个行业的最终结局。”

29:37 解决计算危机:聚合 20+ 云并让 GPU 变得“可替代”

本节重点

详细精要

💬 精华片段(中文)

"It's also just was with one of the great founders you had listed on here this morning. They said that inference is so sticky for us because ultimately, this is the product that we deliver to our customers."

“今天早上我和您名单上的一位杰出创始人聊,他说推理之所以对我们来说那么粘人,是因为归根结底,这就是我们向客户交付的产品本身。”

32:17 租用 vs 自有:掌控计算命运的必然选择

本节重点

详细精要

💬 精华片段(中文)

"No matter how much people tell you that there's a supply problem, it is 10 times worse."

“无论多少人告诉你现在有供应问题,实际情况都要比那糟糕十倍。”

37:07 计算稀缺何时终结?类比永远拥堵的 JFK 机场

本节重点

详细精要

💬 精华片段(中文)

"Unlike JFK, which closes down from 11:00 PM to 4:00 AM, we don't have any reset period. And so it just keeps compounding."

“和晚上11点到早上4点会关闭一阵子的肯尼迪机场不同,我们没有那种重置周期。所以需求只会不断地叠加上去。”

39:17 下一个创业风口:模块化数据中心与能源

本节重点

详细精要

💬 精华片段(中文)

"Containers are one of the biggest economic drivers in history because they normalize the unit of trade. And so one of the things that I'm really excited about is modular data centers — standardize the unit of compute."

“集装箱是历史上最伟大的经济驱动力之一,因为它们把贸易单元标准化了。所以让我特别兴奋的一个东西就是模块化数据中心——把计算单元也标准化。”

41:29 长远与短期:看多创新,看空不创新的企业

本节重点

详细精要

42:00 给学生的建议:快速学习和观察新型金融需求

本节重点

详细精要

💬 精华片段(中文)

"You could become an expert in anything in six months. So just do the thing that's fun."

“你可以在六个月内成为任何领域的专家。所以去做那些你觉得有意思的事就好。”

43:04 问答精选

本节重点

详细精要

💬 精华片段(中文)

"You saw the other side happen two days ago, the Chinese government invested in DeepSeek."

“两天前你们也看到另一边发生了什么,中国政府投资了 DeepSeek。”


专业术语注释

术语 解释
Inference(推理) AI模型训练完成后,在实际应用中接受输入并产生输出的运行过程,本集讨论的中心。
Baseten 成立于2019年的AI推理基础设施公司,为大量AI公司提供生产环境模型部署与优化服务。
Frontier models(前沿模型) 指由OpenAI、Anthropic等实验室研发的最先进、能力最强的闭源大语言模型。
Post-training(后训练) 在预训练的基座模型基础上,使用特定领域或工作流的数据进行微调,以优化其在特定任务上的表现。
Open source models(开源模型) 模型权重对公众开放的模型,企业可自行下载、修改和部署,如来自阿里、Moonshot等的模型。
Utility function(效用函数) 在后训练中定义的优化目标,例如“最小化医疗转录错误率”,客户必须自行提供。
Multi-cloud(多云) 使用多个不同云服务提供商的基础设施,Baseten聚合20+云以避免单一故障点并保障计算获取。
GPU fungibility(GPU可替代性) Baseten的核心技术之一,使来自不同来源的GPU可以在其平台上被无缝拼接和调度。
B200(Blackwell B200) NVIDIA推出的一款GPU芯片,本集中被提及作为主要推理算力单元,其市场价格在一年内从$263/时飙升至$510/时。
CUDA NVIDIA的并行计算平台和开发环境,被认为是NVIDIA最深的护城河,几乎所有的AI推理框架都依赖它。
TRT-LLM NVIDIA开发的用于大语言模型推理的运行时,深度绑定了NVIDIA硬件与CUDA。
Prefill / Decode(预填充/解码) 大模型推理的两个主要阶段:Prefill一次性处理输入提示,计算密集;Decode逐token生成输出,内存密集。
EMR(电子病历) Electronic Medical Records,本集以Abridge公司为例,其产品深度集成于EMR系统以生成临床笔记。
Project financing(项目融资) 一种特殊的基础设施融资方式,Tuhin提到学生们可以研究如何将其应用于数据中心的建设。
Modular data centers(模块化数据中心) 将数据中心建设单元标准化的概念,类似于集装箱,旨在降低扩建成本和提供统一的“计算API”。
Disaggregated architecture(解耦架构) 将计算与内存/存储等资源分离的技术架构,在推理硬件中可能体现为用不同芯片分别处理Prefill和Decode。

延伸思考

  1. 美国开源模型如何正面突围:在DeepSeek等中国开源模型持续冲击下,美国仅依靠NVIDIA、Google的非营利性或防御性开源能否真正生成竞争力?这是否需要类似半导体法案那样的国家级顶层设计?
  2. 推理粘性能和垄断风险:Tuhin将推理比作数据库选型,高度粘性可能最终导致少数据推理平台形成寡头。这对应用层创业者意味着什么?他们应该从第一天就采用多云推理以降低锁定风险吗?
  3. 自建数据中心的财务可行性:Baseten计划从纯租用转向自建,那对于规模次一级的AI公司,自建与租用的盈亏平衡点在哪里?Tuhin提到的$70亿支出体量是绝大多数公司无法企及的,那么中等体量公司的最佳计算策略是什么?
  4. 模块化数据中心的商业化时机:集装箱革命依赖于全球统一标准。由谁来定义模块化数据中心的“标准计算API”?这会是AWS等巨头主导,还是有创业公司将率先推出类似“开源的OCP(开放计算项目)模型”?
  5. 后训练与数据资产的归属:如果所有企业都使用Baseten这样的平台进行后训练,训练产生的专有模型权、用户反馈数据的所有权和未来迁移性如何界定?这种“西印度公司”模式能否真的避免走上“东印度公司”的道路?

原文发表:Jun 05, 2026  ·  纪要生成:2026-07-21