生物医学数据孤岛问题是AI医疗落地的核心瓶颈,但通过AI在数据采集、存储、标注、交易等环节的产业链整合,以及蛋白质工程等新兴领域的突破,有望逐步打通数据流通的上下游。关键在于,AI医疗目前仍处于发展初期,数据质量、算法优化和反馈周期长是主要障碍,而蛋白质设计领域已展现出AI超越人类经验的潜力。
数据孤岛的根源:生物医学数据的固有挑战
生物医学数据孤岛的形成,源于行业经验的复杂性。高质量的生物医学数据缺乏,数据孤岛是一直难解决的问题。 具体表现为:
- 人类经验不足:药物开发领域虽积累了海量信息,但未知的更多。例如,化学结构空间广阔,预计评估的化合物数量级在10的60次方,目前仅对约2亿个类药分子进行了实验表征。AI的本质是复制并优化人类经验,如果人类对生物和化学的理解尚不充分,就很难让AI有效操作。
- 数据量化困难:对部分疾病进行了较为粗糙的分类量化,但对健康和表型的定量测量刚刚起步。行业经验如果难以被数据化,短时间内用上AI就比较难。
- 反馈周期长:药物从细胞体系表现到小动物模型,再到人类个体,效果差异巨大。一个药物是否真正有效,需要通过实验和临床反馈来积累数据,这些数据积累成本高、速度慢,反馈周期太长。
AI打通产业链的关键环节
在数据采集、存储、标注、交易等环节,AI医疗的产业链格局正在逐步形成。AI在药物发现上的作用仍局限在速度和成本上,而不是决策的质量。 例如,过多使用替代量度(如靶点活性),而不是与有效性或安全性相关的数据结果,是当前面临的一大挑战。通过作用机理和适应症来对药物进行标签注释十分困难,这使得AI方法在缺少标签的数据集中很难发挥作用。
不过,在蛋白质工程领域,AI已经展现出突破性进展。AlphaFold 2解决了蛋白结构预测的问题,和实验一个精度,并启发了基于深度学习的蛋白质设计新方法。AI可以通过学习已有的蛋白质序列,创造出自然界不存在但具备类似功能的蛋白,从序列上讲与自然界的蛋白相似度低于30%。在蛋白质设计方面,以GPT为代表的大模型已经完全碾压了人类,例如利用深海蛋白数据训练的大模型,能够轻松设计出具备耐高温的目标蛋白。
常见问题
AI医疗能否彻底解决数据孤岛问题?
目前不能。AI药物研发处于发展初期,技术上面临着数据、算法和专业人才方面的挑战,整体仍处于探索阶段。未来随着算法的更新、算力的突破及大数据的发展,AI技术将深入应用到新药研发的各个环节,但短期内数据孤岛问题仍将持续。
蛋白质工程为何比小分子药物更适合AI?
因为蛋白质工程的数据瓶颈较小。AIDD的困难之处在于药品研发极度漫长严谨,AI的快和制药的慢有着不可调和的矛盾。而蛋白质工程中,AI通过高维向量描述蛋白质特征,能够抓住更本质的因素,甚至找到违背人类直觉但能提高稳定性的点位。
AI在生物医学数据标注中的角色是什么?
AI主要用于辅助解决标签数据缺乏的问题。通过作用机理和适应症对药物进行标签注释十分困难,AI方法在这种缺少标签的数据集中很难发挥作用。但在蛋白质设计等数据相对充足的领域,AI能够通过深度学习实现高精度、低成本的分析。