AI医疗药物研发的数据自主可控,核心破局点在于从依赖国外公共数据库转向自主积累高质量实验数据,并建立本土数据标准。当前行业公认的瓶颈并非算力或算法,而是高质量生物医学数据缺乏与数据孤岛问题;化学结构空间广阔,目前人类仅对约2亿个类药分子进行了实验表征,这一积累差距决定了单纯依赖算法优化难以突破天花板。破局路径在于自主搭建高通量实验平台、以自主实验表征数据反哺模型,并推动建立符合本土研发逻辑的数据标准。
数据依赖的现状与差距
药物研发领域虽积累了海量信息,但未知的更多。化学结构空间预计评估的化合物数量级在10的60次方,目前我们了解的只是冰山一角,仅对约2亿个类药分子进行了实验表征。AI的本质是复制并优化人类经验,如果人类经验不足,对生物和化学尚未充分理解,就很难让AI去操作。
当前行业普遍依赖国外公共数据库(如ChEMBL、PubChem)作为训练数据来源,但这些数据存在两个问题:一是数据口径与本土药物研发的靶点偏好、化合物库结构存在差异;二是高质量生物医学数据缺乏,数据孤岛一直是难以解决的问题。过多使用替代量度(如靶点活性)而非与有效性或安全性相关的数据结果,也限制了模型决策质量。
自主数据生态的建设路径
破局的关键在于把数据生产环节掌握在自己手中。具体路径包括:
- 自主实验表征:通过自建高通量实验平台,对化合物-蛋白质相互作用、药效与毒性数据进行系统性标注,形成区别于公共数据库的差异化数据资产。将配体-蛋白质活性、靶点识别以及PK性质等进行综合考虑,依然是行业面临的一大挑战,这正是自主数据的价值空间。
- 建立本土数据标准:通过作用机理和适应症对药物进行标签注释十分困难,尚难以理清化合物-蛋白质-作用机理-药效等几方面的联系。建立统一、可互操作的本土数据标准,有助于打破数据孤岛,让分散的实验数据形成可训练的语料。
- 以应用场景反哺数据积累:AI在药物发现上的作用目前仍局限在速度和成本上,而非决策质量。在蛋白质工程等反馈周期更短、数据质量更可控的领域先行积累,逐步向小分子药物研发延伸。
自主可控的长期价值
数据层面的自主可控,不仅是供应链安全议题,更是AI模型效能的根本保障。AI进行蛋白质设计时,用高维向量描述蛋白质特征,有可能抓住更本质的因素——但这种能力高度依赖训练数据的质量与覆盖面。自主积累的数据越厚实,模型对本土疾病谱、药物反应差异的适配能力越强。
未来随着算法的更新、算力的突破及大数据的发展,AI技术将深入应用到新药研发的各个环节。而这一切的前提,是先把数据根基扎在自己手里。
常见问题
数据孤岛问题具体指什么?
指高质量的生物医学数据分散在不同机构和企业中,缺乏统一标准和共享机制,难以形成规模化、可训练的数据集。目前行业对健康和表型的定量测量刚刚起步,数据积累成本高、速度慢、反馈周期长,进一步加剧了孤岛效应。
自主实验表征与使用公共数据库的核心区别是什么?
公共数据库的数据是他人实验的“二手结果”,口径和质控标准不受自己控制;自主实验表征获得的是“一手数据”,可以针对本土研发需求定制标注维度。仅对约2亿个类药分子进行了实验表征的现状说明,谁能在增量数据上建立优势,谁就掌握了模型迭代的主动权。
蛋白质工程为何被视为数据自主的突破口?
相比小分子药物研发的漫长周期,蛋白质工程(酶工程)的反馈更快、数据质量更可控,适合作为自主数据积累的起点。以GPT为代表的大模型在蛋白质设计上已展现出超越人类经验的能力,而这类能力正建立在高质量训练数据之上。