来源: ICML 大会 | Aviv Regev | 无明确发布日期 分类: 其他 原文发表: 未知 纪要生成: 2026-07-10
Aviv Regev 是基因泰克(Genentech)/罗氏(Roche)的执行副总裁兼基因研究与早期开发负责人,此前曾任 MIT 生物学系教授、Broad 研究所核心教员,也是人类细胞图谱(Human Cell Atlas)的联合创始成员。她因开发单细胞基因组学与计算生物学方法而屡获殊荣,包括 L’Oréal-UNESCO 女性科学奖、Lurie 生物医学奖等。本场 ICML 特邀报告系统阐述了她团队近六年构建的“实验室在环”药物研发体系:如何将大规模扰动实验、多模态细胞数据、基础模型与自主智能体环环相扣,以应对从靶点发现到临床开发的极端复杂性。
本节重点
详细精要
Fenebrutinib:选择性抑制 BTK,在中枢神经系统内对 小胶质细胞 和 B 细胞 实现近乎最大的抑制;III 期试验中显著减少复发与脑病灶,患者平均约每 16–19 年 才经历一次复发
尽管已有成功案例,药物研发依然极度困难:每一步都必须精密对齐——靶点、药物、剂量、分子、患者,绝大多数尝试最终失败
生物学和医学在四个维度上根本性地困难:这些特性导致传统手段难以规模化求解
💬 精华片段(中文) “There's about 37 trillion cells in the human body, 10 to the power of 19 ways in which they could hypothetically combine in five way combinations... about 10 to the 60 possible drug like small molecules... we can never, ever test all of these possibilities.” 人体大约有37万亿个细胞,五向组合的假设方式多达10的19次方……可能的小分子药物数量约10的60次方……我们永远不可能在实验室或人群中测试所有可能性。
本节重点
详细精要
变异且难以自动化 → Agentic AI 正逐渐展现能力
单一要素不足以解决问题:业内争论“模型重要”“数据重要”或“实验重要”,实际上三者缺一不可
💬 精华片段(中文) “What we need to do is to put these together in what we call the lab or sometimes the clinic in the loop, start with an experiment, collect data, train a model, use the model to define the next set of experiments. And repeat.” 我们需要把它们整合起来,即我们所说的“实验室在环”或者“临床在环”:从实验开始,收集数据,训练模型,用模型定义下一批实验,然后不断重复。
本节重点
详细精要
得到的 Oracle 能准确预测任何序列(自然或随机)驱动的表达,并成功设计出极高或极低表达的人工序列
将酵母中的概念扩展到人类细胞类型特异的 Decima 模型:人体不同细胞拥有同一基因组,但疾病风险取决于哪些细胞使用哪些基因
可模拟每个人类遗传变异在特定疾病细胞环境中的功能效应:例如,在 IBD 中,超过 200 个基因组位点 与疾病关联,Decima 帮助团队解析出一个新靶点,现正推进
从非编码到编码基因:Perturb-seq 扰动筛选构建调控回路:针对蛋白质层面
将回路模块与人类遗传区域关联,可从数百个自身免疫疾病相关遗传区域收敛到 6 个优先基因,精确靶向所关注的治疗表型
Perturb-seq 闭环可广泛应用于多种场景:不仅用于通路解析与人类遗传学结合,还可寻找产生所需治疗效应的靶点、评估细胞类型影响、识别组合干预——这些大规模实验此前只观察了 RNA 这一个视角
💬 精华片段(中文) “The interpretable model that we learn from one such screen... groups perturbations into modules with similar impacts, and it groups the impacted RNAs into co‑regulated genes.” 我们从一次这样的筛选中学习到的可解释模型,将扰动按相似影响归入模块,并将受影响的RNA归为共调控基因。
本节重点
详细精要
细胞在池中遗传扰动,成像后用显微镜下测序条形码来识别扰动身份;PerturbView 还支持使用原代细胞和组织
在巨噬细胞上平行开展两种实验,并用 Mukave 进行整合:一套获取 RNA 视图,另一套获取显微镜图像
通过 摊销变分推断 和每个模态独立编码器进行拟合
跨模态一致性带来强大的解释能力:基于 RNA 和基于图像的扰动相似性高度一致,甚至在极细粒度级别也成立
结合人类遗传学,推导出调控因子 → 程序 → 人类性状的因果链,揭示了 IBD 和 2 型糖尿病 中多条由巨噬细胞介导的因果链
从对齐到生成:EB-Mukave 用图像数据生成未测量 RNA 实验数据:测量 RNA 远比成像昂贵和费时,训练集中图像数据量是 RNA 的 3 倍(扰动数) 和 10 倍(细胞数)
💬 精华片段(中文) “The results measured in the secondary screen for these 117 were highly concordant with the predictions or imputations from Ebi McCarthy, and they clearly outperform other models.” 在二次筛选中测得的这117个扰动结果与Ebi Mukave的预测或插补高度一致,并明显优于其他模型。
本节重点
详细精要
聚焦于一种免疫细胞和一种刺激(LPS),约 600 个 单扰动显著的基因,成对组合约 180,000 对,需要 1,800 万细胞,实验上勉强可行,但仍昂贵且复杂
用 AI 迭代式选择最信息量的 600 对进行实验:初始用模型预测所有组合的效果,先选 600 对 合成并实验,用真实数据训练模型,再由模型预测并选择下一批 600 对,循环数次
这种“实验室在环”的主动学习思路,在生物学实验的预算约束下尤为有效
持续积累分子、组织和患者层面的基础数据集,以构建虚拟细胞:这些循环迭代最终可能催生一个 细胞生物学基础模型(Virtual Cell),其建模能力有望匹配生物学巨大的数量级
💬 精华片段(中文) “We can imagine building a foundation model of cell biology. Sometimes we call them virtual cells, which possibly no one knows might end up matching these massive numbers of biology.” 我们可以想象构建一个细胞生物学基础模型,有时我们称之为虚拟细胞,也许它最终真的能匹配住生物学那巨大的数量级。
本节重点
详细精要
数据涵盖肿瘤、COVID‑19、IBD、心血管、痴呆症等多种疾病,且近些年每 六个月 翻一番
数据增长使自主智能体成为必需:多样的格式与难以自动化的分析工作催生了专用 Agent
这些 Agent 大多利用已有的分析方法,但 AI 模型也可实现新方式的数据查询
三个互联模型回答适应症选择的核心问题:“该基因对患者细胞功能是否重要?” “该细胞对患者疾病是否重要?”
应用结果揭示了 MS1 细胞 可能在 川崎病、AGE、SFTS 及 COVID‑19 与脓毒症 中扮演共同角色,并在川崎病患者血清中实验验证
将所有数据维度编织为“病理地图”:整合临床、组织学、空间、扰动、细胞和人类遗传学等一切数据,形成疾病基础模型
💬 精华片段(中文) “The first pathology map that we built, we assembled was almost three years ago... about a year later, we built four of them in four neuro indications in six weeks. And today, two years in... we increased our discovery Li entries, the start of our portfolio 2.3 fold.” 我们构建的第一个病理地图大约是三年前……大约一年后,我们在六周内为四个神经适应症建了四个病理地图。到今天,引入这个方法的两年后,我们的发现管线新条目增加了2.3倍。
本节重点
详细精要
可药性、hit 发现和优化层级的模型,每数月通过数据驱动改善架构
可药性评估:通过 Boltz Jump 捕捉蛋白质动态构象系综并定位可靶向口袋:蛋白高度动态,需理解构象分布才能找到口袋
在精炼后的系综上运行口袋发现算法,识别最可药的口袋,然后循环迭代
hit 发现:生成模型与虚拟筛选的结合:已知口袋后,用生成模型设计结合分子或用 Oracle 对虚拟化合物进行评分
成果:在 免疫学 某 first‑in‑class 靶点上,Sage 发现了一个全新骨架,速度远超第一代尝试
从表型出发的虚拟筛选:PhenoCompass:许多项目没有明确靶点,只有细胞表型(如存活/死亡)
进一步推出 PhenoCompass:为高内涵图像筛选开发虚拟方法
先导化合物优化:每周主动学习同步提升分子和模型:每次用新实验结果指导分子设计,同时更新效价和 ADME 预测模型;选择待合成分子时,平衡分子性质改进与模型信息增益
💬 精华片段(中文) “The AI was about 100 fold better in these screens... then the original approach, which was kind of the best medicinal chemist in 2017.” 在这些筛选中,AI的表现比2017年最好的药物化学家的原始方法大约提高了100倍。
本节重点
详细精要
但仅仅结合靶点远远不够——候选分子还必须具备 低免疫原性 和 良好药代动力学 才能开发为药物
实验与模型协同消除免疫原性和药代风险:在多个免疫学项目中,模型基于历史数据预测出某个臂存在高免疫原性和差药代
模型由此优化序列,在保持亲和力的同时,去除了免疫原性和药代风险
一个 first‑in‑class 免疫学靶点的实际案例:AI 助力识别并清除免疫原性风险,快速获得最终临床候选分子,并已进入临床管线
💬 精华片段(中文) “Models that were trained on past data help us predict that a particular arm would have both high immunogenicity and poor pharmacokinetics in patients... our model... optimized the sequence, so it now retains its affinity and got rid of the immunogenicity and the pharmacogenetic risk.” 基于以往数据训练的模型帮助我们预测某个臂在患者中会同时具有高免疫原性和差的药代动力学……我们的模型优化了序列,使其在保留亲和力的同时消除了免疫原性和药代风险。
本节重点
详细精要
Carla Fang 将在后续 workshop 展示一个统计框架,支持 善用离线数据的主动设计,在追求新颖性的同时,对新颖设计的性质提供理论保证
自主智能体平台“Agency”统一编排数千工具与技能:自 2024 年起,科学家的任务设定已简化为单一句目标(如“设计一种更好的抗体”)
💬 精华片段(中文) “The scientist is setting a single goal, design me a better antibody. And from here, the agent is running the whole campaign on its own... and then write its own report and shows the design in three dimensions.” 科学家只设定一个目标:为我设计更好的抗体。然后智能体就自行管理整个流程……最终撰写自己的报告,并展示三维设计。
本节重点
详细精要
在 转移性乳腺癌 中,配对 Shaft 生成的空间图谱与新患者真实数据高度匹配;非配对 Shaft 在 小细胞肺癌 单细胞 RNA 资料上复现类似效果
联合临床与分子数据的模型实现反事实推理:历史上具备深度分子图谱和纵向病历的数据集非常稀缺
可从组织学和临床轨迹 生成 分子谱,进而生成 合成患者队列,比较不同组的表达状态差异,对生物标志物策略和试验设计至关重要
眼科疾病中的临床在环案例:地理萎缩(GA):利用 2,000 多名患者 的 3D OCT 影像数据训练 AI,预测病灶增长
该模型不再仅作回顾分析,已前瞻性用于试验设计和解读
AI 赋能的个性化新抗原癌症疫苗:对患者肿瘤 DNA 测序,识别突变,用 AI 模型(基于历史数据训练)预测哪些突变会引发免疫反应
💬 精华片段(中文) “The power gained by the AI for estimating presence or lack of efficacy is equivalent to more than a two fold increase in the study size.” AI在评估疗效存在或缺失时得到的统计效力提升,等同于研究规模扩大两倍以上。
本节重点
详细精要
大模型的长尾学习、智能体 对科学过程的模仿,都会帮助基础模型变得更好
问:AI 在药物发现中最大的挑战是什么?人类数据如何获取?
💬 精华片段(中文) “If I train a foundation model on human genetics data, good luck to me. If I release the model, the data is baked inside. That is a big problem.” 如果我在人类遗传学数据上训练了一个基础模型,一旦我把模型发布出去,数据就内嵌在里面——这是一个大问题。
| 术语 | 解释 |
|---|---|
| PI3 激酶 α(PI3Kα) | 一种常见的癌蛋白,参与细胞生长、存活和增殖信号通路,Inavolisib 即针对其设计 |
| SERD | 选择性雌激素受体降解剂,如 Giredestrant,可结合并“降解”雌激素受体,彻底阻断信号 |
| KRAS G12C | KRAS 基因上第 12 位甘氨酸突变为半胱氨酸的特定致癌突变,Divarasib 将其锁定在失活态 |
| BTK | 布鲁顿酪氨酸激酶,在 B 细胞和髓系细胞信号传导中起关键作用,Fenebrutinib 可近乎完全抑制中枢内的 BTK |
| Perturb-seq | 单细胞扰动测序:在池中对每个细胞进行基因扰动后,使用单细胞 RNA 测序同时读取扰动身份和全转录组 |
| 单细胞 RNA 测序(scRNA-seq) | 在单细胞水平上测量全基因表达谱的技术,是 Perturb-seq 等方法的读出端 |
| 非编码区 | 基因组中不编码蛋白质的部分,含有大量调控元件,多数疾病相关变异位于此 |
| Human Cell Atlas | 人类细胞图谱计划,旨在构建所有人类细胞的参考图谱,Regev 为联合创始成员 |
| Decima | 一种序列‑功能模型,专为约 7,000 个人类细胞类型和状态设计,可预测非编码变异在特定细胞环境中的功能效应 |
| 树突状细胞 | 一种专业的抗原呈递免疫细胞,在启动和调控免疫应答中居核心地位 |
| Optical Pool Screens | 光学池筛选:在显微镜下对包含条形码的扰动细胞成像,并通过原位测序读取扰动身份的方法 |
| PerturbView | 一种升级版工作流,可对原代细胞和组织进行光学池筛选 |
| Mukave / EB-Mukave | 对比式多模态单细胞模型,Mukave 用于对齐 RNA 与图像并解耦扰动效应;EB-Mukave 则利用图像嵌入为经验贝叶斯先验,生成或去噪 RNA 数据 |
| 摊销变分推断 | 一种利用神经网络统一编码后验分布的变分推断变体,用于加速模型训练 |
| Boltz Jump | 结合蛋白折叠与 ML 采样的方法,用于生成可信的蛋白质构象系综 |
| HDX(氢氘交换) | 一种用溶剂可及性探针研究蛋白质动态和相互作用的实验技术 |
| VoxBind | 一种基于体素去噪模型和 Walk‑Jump 采样的生成式小分子设计方法 |
| Sage | 用进化算法同时优化结合亲和力与 ADME 性质的生成式方法 |
| ADME | 药物的吸收、分布、代谢、排泄性质,合称药代动力学特征 |
| PhenoCompass | 虚拟高内涵成像筛选方法,以细胞形态学嵌入为基础,寻找可重现锚点表型的化合物 |
| FOXO3a | 一种转录因子,其核转位是 PI3K 通路被抑制后的标志性读出 |
| VHH / 单链 Fv | 分别指来源于骆驼科动物的仅重链抗体片段,以及由抗体可变区重组构成的单链片段,为构建多特异性抗体的基础模块 |
| Agency | Genentech 的内部智能体平台,整合数千工具与技能,可端到端执行药物设计任务 |
| Shaft | 从组织学染色图像生成单细胞/空间组学数据的模型 |
| 3D OCT | 光学相干断层扫描,一种高分辨率的眼底成像技术,用于地理萎缩等视网膜疾病的监测 |
| 新抗原(Neoantigen) | 由肿瘤体细胞突变产生、能被免疫系统识别的独特蛋白片段,是个体化癌症疫苗的核心 |
| Autogene cevumeran (inest) | 与 BioNTech 合作开发的个体化 mRNA 新抗原癌症疫苗 |