▶ 原文链接

从 fork() 到舰队:设计一个智能体沙箱云

来源: AI Engineer | Abhishek Bhardwaj | Jul 13, 2026 播客: AI Engineer 分类: OpenAI 原文发表: Jul 13, 2026 纪要生成: 2026-07-20


全集重点


嘉宾/话题简介

Abhishek BhardwajOpenAI 强化学习与智能体基础设施团队的成员,曾参与 GoogleCrosVM 项目。本集演讲从第一性原理出发,系统性地探讨了为什么需要沙箱、如何在单节点上安全运行不可信代码(如 ChatGPT 或 Codex 生成的代码),并深入解析了从简单的 fork() 调用逐步演进到基于硬件的微虚拟机的完整逻辑链。此外,他还详细阐述了基于 写时复制 的快照持久化方案,以及如何构建大规模、低延迟、高可靠的智能体沙箱云。


分节详述

为什么模型需要执行代码

本节重点

详细精要

💬 精华片段(中文)

"The key unlock was that given the model tool calling capability or a way to execute code, the model gets these verifiable reward questions around code and math correctly."

"关键的解锁点在于,赋予模型工具调用能力或执行代码的途径后,模型就能正确解答这些围绕代码和数学且具有可验证奖励的问题。"

沙箱的必要性与核心支柱

本节重点

详细精要

💬 精华片段(中文)

"If you fail constantly, you've wasted like GPU tokens on both sides. And GPU is like gold right now."

"如果你经常失败,你就浪费了双方珍贵的 GPU 算力。GPU 现在就跟黄金一样。"

Linux 代码执行与攻击面分析

本节重点

详细精要

💬 精华片段(中文)

"If you get kernel exploit, it's like it's a New York Times article waiting to happen."

"一旦你被内核攻击利用成功,那基本上就是等着上《纽约时报》头版的重大安全事件了。"

方案演进:从 fork-exec 到 gVisor

本节重点

详细精要

💬 精华片段(中文)

"The fundamental problem with containers is that they're still native processes running on the host...a process in a container can still exploit the kernel boundary and try to get root or a kernel exploit."

"容器的根本问题在于,它们仍然是运行在宿主机上的原生进程……容器内的进程依然可以利用内核边界,尝试获取 root 权限或发起内核攻击。"

终极方案:基于硬件的微虚拟机

本节重点

详细精要

💬 精华片段(中文)

"My view is that security like system tricks can cover performance issues, but they cannot hide security breaches... I would call it the seven stages of grief, the seven stages of sandboxing. In the end, everyone always wants a VM."

"我的观点是,性能问题可以用系统层面的技巧弥补,但安全漏洞却无法被掩盖……我愿意称此为 "沙箱七阶段悲伤" 。最终,所有人都还是会选择虚拟机。"

持久化:解锁智能体的下一把钥匙

本节重点

详细精要

💬 精华片段(中文)

"If you give them a computer with an actual disk that can be saved, then they become a true knowledge worker. I think storage is the next unlock here."

"如果你给他们一台有真实硬盘的电脑,并且数据可以保存下来,他们就能成为真正的知识工作者。我认为,存储是下一步要被解锁的关键能力。"

编排:从单节点到全球舰队

本节重点

详细精要

💬 精华片段(中文)

"You can actually take a memory snapshot of a micro VM and just-in-time start it in milliseconds as the request comes. So you can leverage this nice micro VM property."

"你实际上可以保存微虚拟机的内存快照,当请求到来时,能以毫秒级的速度即时启动它。这就是你可以利用的微虚拟机的优秀特性。"


专业术语注释

术语 解释
Harness 在模型训练或产品推理中,负责解析模型输出、实际调度执行代码或工具调用的脚手架程序。
可验证奖励 一种问题属性,指该问题的答案可以通过一个确定的程序(如代码)来验证其对错。
沙箱 一个安全隔离的执行环境,用于运行不可信代码,限制其对宿主机、网络或其他用户资源的访问。
Rollout 在强化学习中,特指让模型根据一个任务指令生成的一条完整应答或执行轨迹。
系统调用 用户空间程序请求操作系统内核执行特权操作的接口,如访问磁盘、网络和创建进程。
Ring 0/Ring 3 X86 架构中 CPU 的执行特权级别。Ring 0 拥有最高权限(内核),Ring 3 权限最低(用户应用)。
命名空间 Linux 内核特性,用于隔离一组进程对某一类系统资源的“视图”,如独立的 PID 列表、挂载点等。
Cgroup 即 Control Group, Linux 内核特性,用于限制、控制和统计一组进程所能使用的资源总量(CPU, 内存等)。
Seccomp 一种 Linux 内核的安全特性,允许进程定义一个精细的系统调用过滤器,以缩减内核攻击面。
gVisor 一个应用级内核,在用户空间模拟 Linux 系统调用,减少了应用对宿主机内核的直接接触。
Sentry/Gofer gVisor 的核心组件之一,负责在用户空间处理系统调用/负责通过 9p 协议代理文件系统操作。
KVM 基于内核的虚拟机,是 Linux 内核中的一个模块,将内核转换为 Hypervisor。
Hypervisor 虚拟化监视器,在宿主机上创建并运行虚拟机的软件、固件或硬件。
VMX root/non-root mode Intel 硬件虚拟化技术中的两种执行模式,为 Hypervisor 和客户机提供硬件隔离的执行环境。
VMM 虚拟机监视器,一个负责管理虚拟机生命周期,并利用 KVM API 的用户态进程。
QEMU 一个流行的开源机器模拟器和 VMM,功能强大但代码庞大。
半虚拟化 一种虚拟化技术,客户机 OS 知道自己运行在虚拟环境中,并通过特定 API 与 Hypervisor 高效协作。
Virtio 半虚拟化框架的标准 I/O 接口,允许客户机与宿主机进行高效的块设备和网络 I/O。
微虚拟机 相对于 QEMU 等重型 VMM,指用 Rust 等语言实现的内存安全、启动快、代码精简的新型 VMM。
CrosVM/ Firecracker / Cloud Hypervisor 三个主流的 Rust 微虚拟机代表,分别起源于 Chromium OS/AWS/多家厂商合作。
VSock 一种基于地址族 AF_VSOCK 的套接字,为宿主机和其管理的客户机提供高效的通信方式。
检查点 在某一时刻保存进程或系统完整运行状态的快照,以便未来从该点恢复执行。
蒙特卡洛树搜索 一种用于决策的启发式算法,通过随机抽样模拟结果来构建搜索树,以此寻找最优行动路径。
增量快照 一种数据备份技术,只保存自上次快照以来发生变化的数据块,而非全量拷贝。
inode 索引节点,Linux 文件系统中用于存储文件的元数据(如大小、权限)以及指向数据块指针的数据结构。
写时复制 一种优化策略,多个调用者在请求资源时获取相同的指针,只有当调用者试图修改资源时,系统才真正创建私有副本。
FIE map 一个 Linux ioctl 命令,用于获取文件的物理盘区布局,可精确找出文件数据在磁盘上的物理块分布。
NBD 网络块设备,允许一台机器通过网络将一个块设备提供给另一台机器使用。
快照感知调度 在编排系统中,调度器根据目标节点上已缓存所需状态的快照层,来智能分配任务以加速恢复。

延伸思考

  1. 攻击链的有效性争论:虽然微虚拟机攻击链长且复杂,但随模型能力指数级增强,它们发现和组合零日漏洞的能力也在提升。这种军备竞赛的未来会是怎样?硬件级隔离是终点,还是仅仅是安全演进的一个阶段?
  2. 性能与安全的动态平衡:演讲者旗帜鲜明地优先选择了安全。但在延迟极度敏感的消费级 AI 产品中,微虚拟机的 VM exit 开销是否真的能被完全“掩盖”?在没有详尽 Benchmark 的情况下,工程团队如何设定可接受的性能退化阈值?
  3. 快照一致性与应用层逻辑:基于块级别的快照虽然干净,但它等同于给整个机器按了“暂停-保存”。对于在沙箱内运行的有状态应用(如数据库、缓存),这种形式的快照可能产生“崩溃一致性”数据,应用是否要为此投入额外的恢复逻辑?
  4. 持久化存储的未来:演讲提到用 S3/GCS 作为最终存储后端。对于高频读写的智能体工作负载,这种分层缓存架构的成本和延迟尾部效应如何?这是否会催生专门针对智能体工作负载设计的新一代分布式存储系统?

原文发表:Jul 13, 2026  ·  纪要生成:2026-07-20