清华 DrugCLIP 登《科学》:药物筛选提速百万倍

新药研发迎来了”搜索引擎时刻”。1 月 9 日,清华大学智能产业研究院(AIR)团队在顶级期刊《科学》在线发表研究成果 DrugCLIP——一个 AI 驱动的药物虚拟筛选平台,能把传统方法需要数百年算力的工作压缩到一天完成,筛选速度提升达百万倍级,并首次实现人类基因组规模的虚拟筛选。

事件详情

DrugCLIP 由清华智能产业研究院牵头,联合生命学院、化学系等团队共同研发。其核心思路借鉴了对比学习:用两个神经网络分别把蛋白质结合口袋和小分子编码为数学向量,放入同一个共享向量空间;若两者匹配,向量距离就近。如此一来,筛选不再依赖缓慢的物理对接模拟,而变成一次”语义搜索”——据团队称,单个计算节点每天可对万亿级蛋白-配体对打分。

借助 AlphaFold 2 预测的约 1 万个人类蛋白质三维结构和约 5 亿个类药小分子库,团队完成了约 2 万个结合口袋与 5 亿分子的全基因组规模筛选,识别出超过 200 万个候选活性分子,形成迄今最大规模的蛋白-配体筛选数据库。该数据库与配套筛选服务已免费向全球科研社区开放,无需编程、一键使用;平台上线后已为 1400 多名用户完成超过 1.35 万个筛选任务。

背景分析

传统虚拟筛选是药物研发的最大瓶颈之一:用最先进的分子对接工具,在 1 万个 CPU 核心上针对单一靶点筛选 10 亿个化合物仍需两周以上;若要覆盖 1 万个人类蛋白靶点,单台计算机需连续运算数百年。而人类基因组编码 2 万多种蛋白质,其中绝大多数尚未被探索为药物靶点——”算不起”长期制约着新靶点与新分子的匹配。

DrugCLIP 恰好补上了 AlphaFold 留下的拼图:2024 年诺贝尔化学奖解决了蛋白质结构预测问题,而 DrugCLIP 建立了”从结构到药物发现”的关键桥梁。团队还在 TRIP12 等靶点上获得了早期实验验证命中,证明这套方法不只是算得快,还找得准。

影响展望

团队表示,下一步将与学术界和产业界合作,瞄准肿瘤、感染性疾病和罕见病靶点。对制药行业而言,基因组规模的”先筛一遍再实验”可能显著降低早期研发成本与周期;对中国科研生态,这也是 AI for Science 领域的又一次顶级期刊原创突破。随着数据库持续开放,一个由全球研究者共同挖掘的”虚拟药库”正在形成——下一款重磅药物的起点,或许就藏在这 200 万个候选分子之中。

发表评论