AI医疗药物研发面临的核心数据瓶颈,在于化学空间预计评估的化合物数量级高达10的60次方,而目前仅对约2亿个类药分子进行了实验表征,这一巨大落差直接塑造了下游应用场景的需求结构:越是依赖高质量标注数据、需要明确正负反馈的环节,AI落地节奏越慢;越是能借助生成式模型绕开标注依赖的环节,落地优先级越高。
数据瓶颈如何分化下游场景
按对数据的依赖程度,AI医疗药物研发的下游场景可划分为两类:
高数据依赖场景以ADMET预测(吸收、分布、代谢、排泄、毒性)为代表。这类场景需要大量与有效性、安全性直接相关的实验和临床反馈数据,但药物在细胞体系表现出的效果,迁移到小动物模型已有很大差距,再到人类个体差异更大,反馈周期长、成本高、速度慢。因此该场景的AI应用受到明显制约,落地节奏偏慢。
低数据依赖场景以分子生成为代表。这类场景借助大模型学习已有蛋白质序列和化合物特征,可以生成自然界不存在但具备类似功能的分子或蛋白,对“好坏标签”的依赖相对较低。例如在蛋白质设计方面,以GPT为代表的大模型已展现出较强的生成能力,AI甚至能找到违背人类直觉但能提升稳定性的突变点位。
场景差异决定需求优先级
不同场景对数据“量”与“质”的需求存在显著差异:
| 场景类型 | 数据需求特征 | 落地节奏 |
|---|---|---|
| ADMET预测等高依赖场景 | 需大量与药效、安全性相关的实验反馈,数据积累成本高、周期长 | 较慢,受数据瓶颈制约明显 |
| 分子生成等低依赖场景 | 依赖已有序列/结构数据,可借生成模型绕开部分标注需求 | 较快,AI优势更易发挥 |
目前AI在药物发现上的作用仍局限在速度和成本上,而非决策质量。将配体-蛋白质活性、靶点识别以及PK性质等进行综合考虑,依然是所面临的一大挑战。整体来看,AI药物研发仍处于发展初期,技术上面临数据、算法和专业人才方面的挑战,企业商业模式也需要市场进一步验证。
常见问题
AI能解决化学空间10的60次方的探索问题吗?
化学空间极其广阔,人类已了解的只是冰山一角。AI的本质是复制并优化人类经验,当人类对生物和化学尚未充分理解时,AI难以独立完成全部探索。但在蛋白质设计等特定方向,AI已能通过高维特征学习抓住更本质的因素,实现部分突破。
数据瓶颈对哪个环节影响最大?
对需要明确正负反馈的环节影响最大,如ADMET预测和临床前研究。药物是否真正有效、什么样的药是“好药”,只有通过实验和临床反馈积累经验数据,而这些数据积累成本高、反馈周期长,直接制约了AI在这些环节的发挥。
未来AI医疗药物研发的突破口在哪里?
随着算法更新、算力突破及大数据发展,AI技术将深入应用到新药研发的各个环节。目前较明确的突破口在蛋白质工程领域——AlphaFold等成果已解决了蛋白结构预测问题,并启发了基于深度学习的蛋白质设计新方法,这类相对绕开数据瓶颈的方向有望率先落地。