生物医学数据孤岛问题由来已久,AI医疗行业的关键拐点并非单一事件,而是沿着“数据稀缺—算法突破—范式转移”的路径演进:从早期受困于数据难以量化,到AlphaFold 2在2021年解决蛋白结构预测问题,再到后AlphaFold 2时代AI驱动的蛋白质工程开启新范式。这一历程的核心逻辑是:AI的本质是复制并优化人类经验,当人类经验不足时,AI便无从发力;而一旦算法找到突破口,AI便能反哺人类认知。
拐点一:数据稀缺与人类经验的局限
AI医疗早期最大的瓶颈并非算力,而是数据。药物开发领域虽积累了海量信息,但未知的更多——人类对大部分蛋白质的功能、修饰变化及细胞信号通路的“对话”机制理解仍然局限。以化合物空间为例,预计评估的化合物数量级高达10的60次方,而目前仅对约2亿个类药分子进行了实验表征。与此同时,高质量生物医学数据缺乏,数据孤岛一直是难以解决的问题;对健康和表型的定量测量也刚刚起步。人类经验不足,AI便难以复制和优化,这是行业面临的第一个关键拐点——意识到“AI ready”需要行业经验能被量化、被定义成算法。
拐点二:从数据难以量化到算法突破
当行业普遍对数据困境感到绝望时,2021年AlphaFold 2横空出世,解决了蛋白结构预测问题,且精度与实验相当。这一突破的关键意义在于:DeepMind找到了一个数学公式,将蛋白质的1D序列和3D结构联系了起来,并启发了基于深度学习的蛋白质设计新方法。在此之前,AI在药物发现上的作用仍局限在速度和成本上,而非决策质量;AlphaFold 2则证明,AI能够通过学习已有蛋白质序列,创造出自然界不存在但具备类似功能的蛋白——从序列上讲,与自然界的蛋白序列相似度可低于30%。这是AI医疗从“工具辅助”迈向“科学发现”的关键拐点。
拐点三:后AlphaFold 2时代与蛋白质工程
后AlphaFold 2时代,AI医疗的重心从“预测”转向“设计”,蛋白质工程成为柳暗花明的新领域。天然蛋白质经过自然选择已具备优秀的性能,但工业或医药应用环境要求不同,需要通过突变5-20个氨基酸来优化其稳定性、结合力、催化活性等性质。在蛋白质设计方面,以GPT为代表的大模型已展现出超越人类经验的能力——AI找到的某些优化点位甚至违背人类直觉,却同样能提高稳定性。这是因为人类总结的规律多具相关性而非因果性,而深度学习用高维向量描述蛋白质特征时,有可能抓住更本质的因素。在某些学科研究上,AI可能比人类更精准——生物医学领域人类提取的特征太少,而AI通用大模型提取的高维数据精度更高、成本更低。
常见问题
AI医疗目前整体处于什么阶段?
目前AI药物研发仍处于发展初期,技术上面临数据、算法和专业人才方面的挑战,企业商业模式也需要市场进一步验证。AI在药物发现上的作用仍局限在速度和成本上,而非决策质量;受生物系统内在复杂性和疾病异质性制约,AI尚不能为药物研发的效率和成功率带来革命性改变,整体仍处于探索阶段。
为什么AI制药与AI蛋白质工程的前景不同?
AIDD的困难在于药品研发是极度漫长严谨的过程,AI的快和制药的慢存在不可调和的矛盾——在第一个AIDD药物跑完全程之前,科学界和资本市场都很难完全承认AIDD。而蛋白质工程领域则不同,AlphaFold 2解决了结构预测问题后,AI可以直接参与蛋白质设计与优化,反馈周期相对更短,应用路径更加清晰。
数据孤岛问题未来会如何演变?
数据孤岛的本质是行业经验难以被数据化。未来随着算法的更新、算力的突破及大数据的发展,AI技术将深入应用到新药研发的各个环节,在化合物合成、药效预测及自动化研发等阶段扮演越来越重要的角色。但前提是行业持续积累可量化、有分级反馈的经验数据,逐步满足“AI ready”的三个标准。