从AlphaFold2到AI-ready三标准,AI医疗药物研发走过的最关键拐点,是2021年AlphaFold2解决了蛋白结构预测问题,让AI在蛋白质工程领域率先跨过“AI ready”门槛;而小分子药物研发因数据不足与反馈周期过长,拐点尚未到来。判断一个行业是否到了广泛引入AI的阶段,可以依据三个标准:行业积累了丰富的人类经验、经验能被量化成算法、经验有分级且能判断好坏。用这三条标准对照,蛋白质工程已率先满足条件,而传统小分子药物研发仍受制于“AI的快和制药的慢不可调和”的深层矛盾。

从基因组计划到AlphaFold2:漫长铺垫与关键突破

在AlphaFold2出现之前,AI药物研发经历了长期的积累与受限期。人类基因组计划之后的20年里,科学界解读了DNA层面的遗传图谱,但对大部分蛋白质的功能、修饰变化以及细胞信号通路中蛋白质之间的“对话”机制,理解仍然有限。化学结构空间广阔,但人类已了解的只是冰山一角。深度学习早期在药物研发中的应用,恰恰受限于“人类经验不足,AI难以复制”的瓶颈——AI的本质是复制并优化人类经验,如果人类自身对生物和化学尚未充分理解,就很难让AI去操作。

2021年,AlphaFold2横空出世,解决了蛋白结构预测问题,精度与实验相当。 这一突破的意义在于:它找到了一个将一维序列和三维结构联系起来的“数学公式”,并启发了基于深度学习的蛋白质设计新方法。此后,AI在蛋白质设计领域的能力进一步释放,以GPT为代表的大模型在蛋白质设计上展现了超越人类经验总结的能力——AI不仅能学习已有蛋白质序列,还能创造自然界不存在但具备类似功能的蛋白,甚至能发现违背人类直觉却有效的优化点位。

用三标准衡量:为何蛋白质工程先迎来拐点

对照“AI ready”三标准,可以清晰看出蛋白质工程与小分子药物研发的阶段性差异:

判断标准蛋白质工程小分子药物研发
经验积累天然蛋白质经自然选择已具备优秀性能,且有深海耐高温蛋白等明确数据可供训练海量信息中未知更多,对蛋白功能、修饰变化及信号通路机制理解有限
经验量化序列与结构关系已被AlphaFold2量化,深度学习可用高维向量描述蛋白质特征疾病分类粗糙,健康与表型的定量测量刚起步,高质量生物医学数据缺乏
优劣分级稳定性、结合力、催化活性等指标明确,反馈可直接用于优化药物从细胞到动物模型再到人体的效果差异大,反馈周期长、成本高

在蛋白质工程领域,AI已经能够针对稳定性、结合力、亲和力、催化活性、底物选择性等具体指标进行优化,且反馈路径清晰。而在小分子药物研发中,AI的作用仍局限在速度和成本上,而非决策质量——过多使用靶点活性等替代量度,而非与有效性或安全性直接相关的数据结果;化合物-蛋白质-作用机理-药效之间的联系尚难理清,AI在缺少标签的数据集中难以发挥。

小分子研发的“慢”与AI的“快”:拐点未至的深层原因

AIDD的困难之处,在于药品研发是一个极度漫长严谨的过程,AI的快和制药的慢有着不可调和的矛盾。 在第一个AIDD药物跑完全程之前,无论是科学界还是资本市场都很难完全承认AIDD。一个药物是否真正有效,什么样的药是“好药”、什么样的药是“毒药”,只有通过实验和临床反馈来积累经验,而这些数据积累成本高、速度慢、反馈周期太长。

目前AI药物研发整体仍处于探索阶段,技术上面临数据、算法和专业人才方面的挑战,企业商业模式也需要市场进一步验证。但前景依然值得期待——随着算法更新、算力突破及大数据发展,AI技术将深入应用到新药研发的各个环节,在化合物合成、药效预测及自动化研发等阶段扮演越来越重要的角色。

常见问题

AlphaFold2为什么被视为关键拐点而不是此前的研究?

因为AlphaFold2解决了蛋白结构预测问题,精度与实验相当,并启发了基于深度学习的蛋白质设计新方法。它找到了连接一维序列和三维结构的数学关系,使AI从“理解”蛋白质迈向了“设计”蛋白质,为蛋白质工程率先达到AI ready标准提供了基础。

为什么AI在小分子药物研发上进展较慢?

小分子药物研发面临数据瓶颈:人类对大部分蛋白功能、修饰变化及信号通路机制理解有限,疾病分类粗糙,高质量生物医学数据缺乏且存在数据孤岛。同时药物研发反馈周期太长,从细胞到动物再到人体的效果差异大,AI的快和制药的慢存在不可调和的矛盾。

蛋白质工程领域AI的优势体现在哪里?

AI进行蛋白质设计的逻辑与人类完全不同,它能用高维向量描述蛋白质特征,抓住更本质的因素,甚至发现违背人类直觉却有效的优化点位。例如利用深海耐高温蛋白数据训练大模型,AI就能轻松设计出具备耐高温特性的目标蛋白。

延伸阅读