▶ 原文链接

ICML 特邀报告:实验室在环的 AI 药物研发

来源: ICML 大会 | Aviv Regev | 无明确发布日期 分类: 其他 原文发表: 未知 纪要生成: 2026-07-10


全集重点


嘉宾/话题简介

Aviv Regev 是基因泰克(Genentech)/罗氏(Roche)的执行副总裁兼基因研究与早期开发负责人,此前曾任 MIT 生物学系教授、Broad 研究所核心教员,也是人类细胞图谱(Human Cell Atlas)的联合创始成员。她因开发单细胞基因组学与计算生物学方法而屡获殊荣,包括 L’Oréal-UNESCO 女性科学奖、Lurie 生物医学奖等。本场 ICML 特邀报告系统阐述了她团队近六年构建的“实验室在环”药物研发体系:如何将大规模扰动实验、多模态细胞数据、基础模型与自主智能体环环相扣,以应对从靶点发现到临床开发的极端复杂性。


分节详述

26:35 开场:药物案例与研发之难

本节重点

详细精要

💬 精华片段(中文) “There's about 37 trillion cells in the human body, 10 to the power of 19 ways in which they could hypothetically combine in five way combinations... about 10 to the 60 possible drug like small molecules... we can never, ever test all of these possibilities.” 人体大约有37万亿个细胞,五向组合的假设方式多达10的19次方……可能的小分子药物数量约10的60次方……我们永远不可能在实验室或人群中测试所有可能性。


33:44 AI 的契合性与“实验室在环”范式

本节重点

详细精要

💬 精华片段(中文) “What we need to do is to put these together in what we call the lab or sometimes the clinic in the loop, start with an experiment, collect data, train a model, use the model to define the next set of experiments. And repeat.” 我们需要把它们整合起来,即我们所说的“实验室在环”或者“临床在环”:从实验开始,收集数据,训练模型,用模型定义下一批实验,然后不断重复。


35:24 靶点发现:从非编码序列到因果调控网络

本节重点

详细精要

💬 精华片段(中文) “The interpretable model that we learn from one such screen... groups perturbations into modules with similar impacts, and it groups the impacted RNAs into co‑regulated genes.” 我们从一次这样的筛选中学习到的可解释模型,将扰动按相似影响归入模块,并将受影响的RNA归为共调控基因。


42:59 多模态整合与数据生成

本节重点

详细精要

💬 精华片段(中文) “The results measured in the secondary screen for these 117 were highly concordant with the predictions or imputations from Ebi McCarthy, and they clearly outperform other models.” 在二次筛选中测得的这117个扰动结果与Ebi Mukave的预测或插补高度一致,并明显优于其他模型。


48:30 组合筛选与虚拟细胞

本节重点

详细精要

💬 精华片段(中文) “We can imagine building a foundation model of cell biology. Sometimes we call them virtual cells, which possibly no one knows might end up matching these massive numbers of biology.” 我们可以想象构建一个细胞生物学基础模型,有时我们称之为虚拟细胞,也许它最终真的能匹配住生物学那巨大的数量级。


53:04 患者数据与疾病基础模型

本节重点

详细精要

💬 精华片段(中文) “The first pathology map that we built, we assembled was almost three years ago... about a year later, we built four of them in four neuro indications in six weeks. And today, two years in... we increased our discovery Li entries, the start of our portfolio 2.3 fold.” 我们构建的第一个病理地图大约是三年前……大约一年后,我们在六周内为四个神经适应症建了四个病理地图。到今天,引入这个方法的两年后,我们的发现管线新条目增加了2.3倍。


57:44 小分子药物设计

本节重点

详细精要

💬 精华片段(中文) “The AI was about 100 fold better in these screens... then the original approach, which was kind of the best medicinal chemist in 2017.” 在这些筛选中,AI的表现比2017年最好的药物化学家的原始方法大约提高了100倍。


1:08:11 抗体设计与优化

本节重点

详细精要

💬 精华片段(中文) “Models that were trained on past data help us predict that a particular arm would have both high immunogenicity and poor pharmacokinetics in patients... our model... optimized the sequence, so it now retains its affinity and got rid of the immunogenicity and the pharmacogenetic risk.” 基于以往数据训练的模型帮助我们预测某个臂在患者中会同时具有高免疫原性和差的药代动力学……我们的模型优化了序列,使其在保留亲和力的同时消除了免疫原性和药代风险。


1:10:30 AI 驱动的决策与自主智能体

本节重点

详细精要

💬 精华片段(中文) “The scientist is setting a single goal, design me a better antibody. And from here, the agent is running the whole campaign on its own... and then write its own report and shows the design in three dimensions.” 科学家只设定一个目标:为我设计更好的抗体。然后智能体就自行管理整个流程……最终撰写自己的报告,并展示三维设计。


1:13:06 临床与患者生物标志物

本节重点

详细精要

💬 精华片段(中文) “The power gained by the AI for estimating presence or lack of efficacy is equivalent to more than a two fold increase in the study size.” AI在评估疗效存在或缺失时得到的统计效力提升,等同于研究规模扩大两倍以上。


1:20:10 问答环节

本节重点

详细精要

💬 精华片段(中文) “If I train a foundation model on human genetics data, good luck to me. If I release the model, the data is baked inside. That is a big problem.” 如果我在人类遗传学数据上训练了一个基础模型,一旦我把模型发布出去,数据就内嵌在里面——这是一个大问题。


专业术语注释

术语 解释
PI3 激酶 α(PI3Kα) 一种常见的癌蛋白,参与细胞生长、存活和增殖信号通路,Inavolisib 即针对其设计
SERD 选择性雌激素受体降解剂,如 Giredestrant,可结合并“降解”雌激素受体,彻底阻断信号
KRAS G12C KRAS 基因上第 12 位甘氨酸突变为半胱氨酸的特定致癌突变,Divarasib 将其锁定在失活态
BTK 布鲁顿酪氨酸激酶,在 B 细胞和髓系细胞信号传导中起关键作用,Fenebrutinib 可近乎完全抑制中枢内的 BTK
Perturb-seq 单细胞扰动测序:在池中对每个细胞进行基因扰动后,使用单细胞 RNA 测序同时读取扰动身份和全转录组
单细胞 RNA 测序(scRNA-seq) 在单细胞水平上测量全基因表达谱的技术,是 Perturb-seq 等方法的读出端
非编码区 基因组中不编码蛋白质的部分,含有大量调控元件,多数疾病相关变异位于此
Human Cell Atlas 人类细胞图谱计划,旨在构建所有人类细胞的参考图谱,Regev 为联合创始成员
Decima 一种序列‑功能模型,专为约 7,000 个人类细胞类型和状态设计,可预测非编码变异在特定细胞环境中的功能效应
树突状细胞 一种专业的抗原呈递免疫细胞,在启动和调控免疫应答中居核心地位
Optical Pool Screens 光学池筛选:在显微镜下对包含条形码的扰动细胞成像,并通过原位测序读取扰动身份的方法
PerturbView 一种升级版工作流,可对原代细胞和组织进行光学池筛选
Mukave / EB-Mukave 对比式多模态单细胞模型,Mukave 用于对齐 RNA 与图像并解耦扰动效应;EB-Mukave 则利用图像嵌入为经验贝叶斯先验,生成或去噪 RNA 数据
摊销变分推断 一种利用神经网络统一编码后验分布的变分推断变体,用于加速模型训练
Boltz Jump 结合蛋白折叠与 ML 采样的方法,用于生成可信的蛋白质构象系综
HDX(氢氘交换) 一种用溶剂可及性探针研究蛋白质动态和相互作用的实验技术
VoxBind 一种基于体素去噪模型和 Walk‑Jump 采样的生成式小分子设计方法
Sage 用进化算法同时优化结合亲和力与 ADME 性质的生成式方法
ADME 药物的吸收、分布、代谢、排泄性质,合称药代动力学特征
PhenoCompass 虚拟高内涵成像筛选方法,以细胞形态学嵌入为基础,寻找可重现锚点表型的化合物
FOXO3a 一种转录因子,其核转位是 PI3K 通路被抑制后的标志性读出
VHH / 单链 Fv 分别指来源于骆驼科动物的仅重链抗体片段,以及由抗体可变区重组构成的单链片段,为构建多特异性抗体的基础模块
Agency Genentech 的内部智能体平台,整合数千工具与技能,可端到端执行药物设计任务
Shaft 从组织学染色图像生成单细胞/空间组学数据的模型
3D OCT 光学相干断层扫描,一种高分辨率的眼底成像技术,用于地理萎缩等视网膜疾病的监测
新抗原(Neoantigen) 由肿瘤体细胞突变产生、能被免疫系统识别的独特蛋白片段,是个体化癌症疫苗的核心
Autogene cevumeran (inest) 与 BioNTech 合作开发的个体化 mRNA 新抗原癌症疫苗

延伸思考

原文发表:未知  ·  纪要生成:2026-07-10