来源: Stanford Online | Tuhin (Baseten CEO) | Jun 05, 2026
播客: Stanford Online
分类: 其他
原文发表: Jun 05, 2026
纪要生成: 2026-07-21
Tuhin 是 Baseten 的联合创始人兼 CEO,Baseten 是一家已成立约七年的AI推理基础设施公司,为全球增长最快的AI公司提供生产环境的模型推理服务。Tuhin 原籍澳大利亚悉尼,在金融领域起步,后转向机器学习研究,最终在旧金山扎根于早期技术创业。本集节目中,他与斯坦福的学生深入探讨了推理市场的爆发性增长、为什么企业从闭源转向开源和后训练模型、计算硬件的未来格局以及创业者的机遇与策略。
本节重点
详细精要
💬 精华片段(中文)
"Inference is about to go up a billion x, not 1,000, not a million x. A billion x."
“推理即将增长十亿倍,不是一千倍,也不是一百万倍,是十亿倍。”
本节重点
详细精要
2011-2012年左右,他搬到波士顿,利用传统机器学习技术进行神经肌肉疾病预后跟踪研究,为期约一年半,期间发表了多篇论文。
意识到必须去旧金山:在波士顿的研究经历让他很快明白,如果想在机器学习领域有所作为,就必须去 旧金山。
从2015年起,他连续创办了几家公司,但都以失败告终,“它们都没成”。然而,创业的“虫子”已经咬住了他。
Baseten的创立时机:2019年,Tuhin 与两位共事 10到15年 的老搭档 Phil 和 Amir 共同创立了 Baseten。他们的初始想法是“机器学习会变得非常大,我们构建一个基础设施业务来捕捉这个趋势”。
💬 精华片段(中文)
"I fell in love with early stage technology and small teams and building products, and where no one really cares."
“我彻底爱上了早期技术、小团队和构建产品,以及那种没人真正在意你正在做什么的感觉。”
本节重点
详细精要
Baseten 为之承担所有优化工作和基础设施,确保从用户说话到文本出现的端到端延迟降到最低。
Abridge:医疗环境录音与临床笔记生成:Shiv 领导的 Abridge 是一款深度集成于 EMR(电子病历) 系统的环境录音笔,已在美国绝大多数医疗系统中使用。
据 Tuhin 称,“每一个模型”都运行在 Baseten 上。
Baseten的三大核心价值:
💬 精华片段(中文)
"Our thesis is that AI is going to be absolutely massive. Inference is the cogs of AI value being delivered."
“我们的核心理念是AI将变得极其庞大。推理就是传递AI价值的齿轮。”
本节重点
详细精要
💬 精华片段(中文)
"Today, about 90% or 95% of spend on inference is going to frontier models, and about 5% is going to custom models. And we believe that the way that all these folks who are building amazing applications with AI are going to build profitable, viable, defensible companies is with custom models."
“今天,大约90%到95%的推理支出流向前沿模型,只有约5%流向自定义模型。而我们相信,所有这些正在构建出色AI应用的人,要想打造能盈利、能生存、有护城河的公司,都必须依靠自定义模型。”
本节重点
详细精要
尤其是从“产品市场契合”阶段转向“规模化盈利”阶段时,企业必须把毛利率从 0 提升到 40%、50%、60%甚至70%,而前沿模型按token计费的成本吞噬了大部分利润。此时迁移到开源模型成为财务上的刚需。
防御性与东印度公司的比喻:Tuhin 分享了一个来自某位知名上市公司 CEO 的比喻——前沿实验室就像当年的 东印度公司。
他将 Baseten 定位为“西印度公司”,是“武装反抗军的”角色。
规模决定紧迫性:Shiban(主持人)追问是大型公司还是小型公司更容易转向自定义模型,Tuhin 明确回答“前者”。
💬 精华片段(中文)
"He likened the frontier labs to the East India Company. [...] Really, what they're doing is you're giving them all the tricks on how to rule that. And before you know it, they're post training models kind of against those workflows that are sacred to you, that only you know."
“他把前沿实验室比作东印度公司……实际上,你是在把所有统治那个领域的诀窍都交给它们。在你还没来得及反应之前,它们就已经针对那些对你而言极其神圣、只有你知道的工作流,后训练出了模型。”
本节重点
详细精要
💬 精华片段(中文)
"You would hope that as they post trained models to user signals that they have the experience of the user gets better. And hopefully it also drives both performance from a latency perspective and reliability perspective higher because there's a lot more control."
“你自然会期望,当他们根据用户信号对模型进行后训练时,用户体验会变得更好。而且希望这样一来,因为有了更多控制权,延迟和可靠性表现也会更高。”
本节重点
详细精要
这种模式意味着客户为一套整合好的推理引擎买单,而不只是买原始算力。
向 token 计价演进:Tuhin 坦承目前的定价体系“相对不够成熟”,但正有意识地向按 token 定价转移,特别是当 Baseten 把后训练工作流等能力也集成进来之后,叙事将自然地从“为计算付费”切换到“为每个 token 付费”。
💬 精华片段(中文)
"We're moving towards a world, especially as we unlock more of those post-training training workflows within Baseten itself where the narrative changes from how much are you paying for compute to how much are you paying per token?"
“我们正在走向一个世界,特别是当我们在 Baseten 内部解锁更多后训练工作流之后,叙事会从‘你为计算支付了多少’变成‘你为每个 token 支付了多少’。”
本节重点
详细精要
接着客户选择一个开源基座模型(如某个 Whisper 类模型),并提供自己的标注数据集。
Baseten 的脚手架角色:Baseten 在后台准备好所有所需的训练框架与工程管道,将数据与基座模型转化为一个非常适合该特定场景的后训练专用模型。
💬 精华片段(中文)
"Our customers who are coming to us with that, really they come with data and what they about their workflows. And they leave with a post-trained specialized model running on Baseten."
“来找我们做这件事的客户,他们真的是带着数据以及他们对工作流的理解而来,最后带着一个运行在Baseten上的、后训练过的专用模型离开。”
本节重点
详细精要
公司内部有“极其强烈的安全姿态”,由于同时服务多个竞争对手并接触他们的模型与数据,Baseten 在内部建立了严格的 数据隔离边界,确保无任何泄漏。
速度优先于一切:更重要的是,这些客户追求的是“非常、非常、非常快地”解决用户问题,而不是从零自己搭建一切。因此,他们通常更关注“能不能帮我把问题解决”,而不是“我必须一切自己掌控”。
💬 精华片段(中文)
"We work with multiple competitors and we have access to their models and their data. And we have set up the boundaries internally to make sure that there's no leakage between that."
“我们同时与多个竞争对手合作,并且能接触到他们的模型和数据。但我们在内部设置了严格的边界,确保彼此之间没有任何泄漏。”
本节重点
详细精要
几年前的 Meta 也曾是开源的有力推手,但如今已经明显转向。
国家安全与成本分化:如果开源模型由东方主导,将导致 智能成本出现极端的区域分化,东方用智能的成本可能仅为西方的十分之一到三之分之一,这在 Tuhin 看来对西方极为不利。
Tuhin 认为,开源模型的持续存在是“不可避免的”,未来10年内如果美国还没有强大的开源模型,将是非常糟糕的局面。
对 Anthropic 政策建议的回应:主持人在录制当天早上提到 Anthropic 刚刚发布了一篇关于中美AI关系未来的长文,文章提出要么美国领先并关停它,要么双方不相上下就会发生战争,结论是建议保持领先并关停。Tuhin 对此保持批判。
💬 精华片段(中文)
"I genuinely believe in life, before you make any points, you should make your biases and your incentive functions very clear. I don't think they acknowledge that."
“我真诚地相信,在人生中,在提出任何观点之前,你都应该先明确地讲清楚自己的偏见和利益函数。我不认为他们承认了这一点。”
本节重点
详细精要
他认为,任何其他芯片厂商要与 NVIDIA 在供应链完备程度、资本成本以及同 台积电(TSMC) 的关系上竞争,目前都是“fanciful”(不切实际的)。
CUDA 生态的可怕价值:Tuhin 特别强调了 CUDA 和围绕它建立的开发者生态,“没有什么能比得上 CUDA,CUDA 简直疯狂”。
这使得客户和 Baseten 本身都能以极快的速度推进创新,这是目前他们最看重的因素。
推理架构的拆解趋势:从技术角度,推理分为 预填充(prefill,计算密集型) 和 解码(decode,内存密集型) 两个阶段。Tuhin 观察到,很多新兴芯片正在试图把这两种负载分离到不同芯片上,实现异构架构。
💬 精华片段(中文)
"Cuda is insane. I think these new architectures are breaking out. [...] This idea that all this will also just run on one chip, which is historically what's happened, probably isn't the end state."
“CUDA 简直不可思议。我觉得这些新架构正在从底层爆发……推理所有环节都只跑在一块芯片上的想法,虽然是历史常态,但大概不会是这个行业的最终结局。”
本节重点
详细精要
通过将 GPU 变得可替代,Baseten 极大地缓解了客户的供应焦虑。
高粘性的推理层:Tuhin 以当天早上与一位榜单上头部创始人的会面为例,那位创始人告诉他,推理之所以极具粘性,是因为它最终直接交付给终端用户,任何中断都是灾难性的。
💬 精华片段(中文)
"It's also just was with one of the great founders you had listed on here this morning. They said that inference is so sticky for us because ultimately, this is the product that we deliver to our customers."
“今天早上我和您名单上的一位杰出创始人聊,他说推理之所以对我们来说那么粘人,是因为归根结底,这就是我们向客户交付的产品本身。”
本节重点
详细精要
他承认双方可能都有点傲慢,但以前 Baseten 回避自建数据中心是因为“没那个商业去做这件事”。
触目惊心的价格暴涨:Tuhin 分享了一个切身案例——他们在某个云中部署的一小集群(当时来看规模已很大)B200 Blackwell 芯片,目前的单价是 每小时 263 美元,合同将在 10月续约。
他认为整个云GPU的供应,比任何人描述的“供应紧张”还要糟糕 十倍。引用 Google 云财报披露的“10倍以上积压需求”作为佐证,现在下单1000块 GPU 可能要到 下一年第二季度甚至15个月后 才能交付。
7亿美元的必然赌注:Baseten 现在的全平台日处理 token 量已达 30万亿个,Tuhin 称 Baseten 的推理服务量已经比 OpenAI API 产品 和 Gemini 都大(但不含ChatGPT)。
💬 精华片段(中文)
"No matter how much people tell you that there's a supply problem, it is 10 times worse."
“无论多少人告诉你现在有供应问题,实际情况都要比那糟糕十倍。”
本节重点
详细精要
他提到 GM 研究机构的 Gnome Brown(OpenAI 的 o3 模型核心成员)最近分享的一页幻灯片也指出,“访问计算”已经成为推理层面的战略优势。
没有休息时间的机场:Tuhin 用 JFK机场 作类比——清晨5点机场没有人排队,到早上8点门外已经大排长龙,而现在的推理市场就常年处在“门外排长队”的状态。
💬 精华片段(中文)
"Unlike JFK, which closes down from 11:00 PM to 4:00 AM, we don't have any reset period. And so it just keeps compounding."
“和晚上11点到早上4点会关闭一阵子的肯尼迪机场不同,我们没有那种重置周期。所以需求只会不断地叠加上去。”
本节重点
详细精要
能源是根本瓶颈:Tuhin 直言会像 Crusoe 一样投资于能源,因为大量算力的落地最终受制于物理空间和电力供给,这是一个无比巨大的基础设施缺口。
集装箱逻辑:他分享了一个具体场景——开车从奥克兰到旧金山,看到港口堆积如山的集装箱,意识到 标准化货柜是最伟大的经济驱动力之一,因为它将贸易的物理单元统一了。
💬 精华片段(中文)
"Containers are one of the biggest economic drivers in history because they normalize the unit of trade. And so one of the things that I'm really excited about is modular data centers — standardize the unit of compute."
“集装箱是历史上最伟大的经济驱动力之一,因为它们把贸易单元标准化了。所以让我特别兴奋的一个东西就是模块化数据中心——把计算单元也标准化。”
本节重点
详细精要
本节重点
详细精要
💬 精华片段(中文)
"You could become an expert in anything in six months. So just do the thing that's fun."
“你可以在六个月内成为任何领域的专家。所以去做那些你觉得有意思的事就好。”
本节重点
详细精要
计算的黑市形态:Tuhin 形容 GPU 的现货或期货交易完全像一个“毒品市场”,公司内部有一位同事(Ed)每天坐在角落不断打电话四处找算力。期货市场不透明、不高效,存在大量摩擦(slippage)。
Baseten 的反向风险:
真正实现 AGI,不断追求能力极限的话,应用层都被碾压。但 Tuhin 认为,到那时推理反而是唯一剩下的市场,Baseten 依然能活。
美国开源的激励问题:学生问及美国政府角色时,Tuhin 认为政府已经在参与,但更需要有意图的联盟和自上而下的激励。他指出 两天前中国政府对 DeepSeek 的投资 就是明显的逆方做法。但好消息是,美国大公司的实际投入不低,只是还未看到成果。
为什么前沿实验室不做低端开源:他们认为做后训练等于放弃自己的立队(AGI thesis)。每花在微调上的一美元,都不如花到预训练去。他们最大的驱动力是 最大化能力差距,以便卖出最贵的最先进的模型。所以即使 OpenAI 已经做了部分,内在动机仍然不足以支撑真正的生态建设。
模块化数据中心与虚拟机的区别:学生问及此,Tuhin 解释虚拟机处于软件栈上层,而模块化数据中心是物理基础设施层面的标准化,类似于集装箱比操作系统更底层。目标直指“如何用最便宜的方式快速扔下更多计算”。
技术栈的快速洗牌:在被问及内核或架构的机会时,Tuhin 提到解耦计算/存储、Thunder Kittens 等项目上有很多机会。但整个市场像流沙,Ilya Sutskever 可能随时拿出一个全新的模型架构,然后一切都要推倒重来。
💬 精华片段(中文)
"You saw the other side happen two days ago, the Chinese government invested in DeepSeek."
“两天前你们也看到另一边发生了什么,中国政府投资了 DeepSeek。”
| 术语 | 解释 |
|---|---|
| Inference(推理) | AI模型训练完成后,在实际应用中接受输入并产生输出的运行过程,本集讨论的中心。 |
| Baseten | 成立于2019年的AI推理基础设施公司,为大量AI公司提供生产环境模型部署与优化服务。 |
| Frontier models(前沿模型) | 指由OpenAI、Anthropic等实验室研发的最先进、能力最强的闭源大语言模型。 |
| Post-training(后训练) | 在预训练的基座模型基础上,使用特定领域或工作流的数据进行微调,以优化其在特定任务上的表现。 |
| Open source models(开源模型) | 模型权重对公众开放的模型,企业可自行下载、修改和部署,如来自阿里、Moonshot等的模型。 |
| Utility function(效用函数) | 在后训练中定义的优化目标,例如“最小化医疗转录错误率”,客户必须自行提供。 |
| Multi-cloud(多云) | 使用多个不同云服务提供商的基础设施,Baseten聚合20+云以避免单一故障点并保障计算获取。 |
| GPU fungibility(GPU可替代性) | Baseten的核心技术之一,使来自不同来源的GPU可以在其平台上被无缝拼接和调度。 |
| B200(Blackwell B200) | NVIDIA推出的一款GPU芯片,本集中被提及作为主要推理算力单元,其市场价格在一年内从$263/时飙升至$510/时。 |
| CUDA | NVIDIA的并行计算平台和开发环境,被认为是NVIDIA最深的护城河,几乎所有的AI推理框架都依赖它。 |
| TRT-LLM | NVIDIA开发的用于大语言模型推理的运行时,深度绑定了NVIDIA硬件与CUDA。 |
| Prefill / Decode(预填充/解码) | 大模型推理的两个主要阶段:Prefill一次性处理输入提示,计算密集;Decode逐token生成输出,内存密集。 |
| EMR(电子病历) | Electronic Medical Records,本集以Abridge公司为例,其产品深度集成于EMR系统以生成临床笔记。 |
| Project financing(项目融资) | 一种特殊的基础设施融资方式,Tuhin提到学生们可以研究如何将其应用于数据中心的建设。 |
| Modular data centers(模块化数据中心) | 将数据中心建设单元标准化的概念,类似于集装箱,旨在降低扩建成本和提供统一的“计算API”。 |
| Disaggregated architecture(解耦架构) | 将计算与内存/存储等资源分离的技术架构,在推理硬件中可能体现为用不同芯片分别处理Prefill和Decode。 |