AI药物研发的核心瓶颈之一在于高质量生物医学数据缺乏、数据孤岛长期难以解决。国产替代的突破口并非单纯堆叠算力,而是转向自主可控、标准化、可共享的国产数据体系建设,并借助以 AlphaFold 为代表的蛋白质结构预测突破,绕开小分子数据匮乏的困境。当前化学空间预计评估的化合物数量级在10的60次方,而人类仅对约2亿个类药分子进行了实验表征,数据覆盖的严重不足决定了单纯依赖现有数据训练 AI 并不现实。

数据瓶颈为何难以突破

药物研发领域虽然积累了海量信息,但未知的更多。人类对大部分蛋白质的功能、修饰变化乃至细胞信号通路的“对话”机制理解仍十分局限,行业经验很难被完整数据化。与此同时,高质量的生物医学数据不仅缺乏,数据孤岛问题更是长期悬而未决,导致 AI 在缺少标签的数据集中难以发挥作用。AI 的本质是复制并优化人类经验,人类经验本身不足,AI 便无从操作。

国产替代的破局路径:从数据到蛋白质设计

面对小分子领域的数据死结,国产替代的路径正在发生转移。2021 年 AlphaFold 横空出世,解决了蛋白结构预测问题,且精度与实验相当,这启发了基于深度学习的蛋白质设计新方法。与依赖海量实验数据的小分子药物发现不同,蛋白质工程可以通过 AI 学习已有蛋白质序列,创造出自然界不存在但具备类似功能的蛋白。这一领域对数据规模的要求相对可控,为国内 AI 药物研发提供了差异化突围的可能。

在具体实践中,AI 进行蛋白质设计的逻辑与人类完全不同,其找到的有些点位违背人类直觉却能提升稳定性。以 GPT 为代表的大模型在蛋白质设计方面已展现出显著能力,国内科研团队亦可借助类似方法,利用特定蛋白数据训练大模型,实现目标蛋白的定向优化。这本质上是以自主可控的算法与数据体系替代对历史实验数据的过度依赖。

常见问题

国产替代能否彻底解决数据缺乏问题?

不能彻底解决,但可以绕开。小分子药物发现受制于数据覆盖不足,短期内难以根本改观;而蛋白质工程领域对数据量的依赖相对更低,国内可借此建立差异化优势,逐步构建自主可控的数据与算法体系。

数据孤岛问题在国产替代进程中如何破解?

关键在于建立标准化、可共享的国产数据平台。通过统一数据采集与标注规范,降低跨机构数据整合门槛,同时借助 AI 在蛋白质设计等特定场景中对数据质量而非数量的依赖,减少对大规模历史数据的刚性需求。

AI 在药物研发中的当前作用定位是什么?

目前 AI 在药物发现上的作用仍局限在速度和成本上,而非决策质量。受生物系统内在复杂性和疾病异质性制约,AI 尚不能为药物研发的效率和成功率带来革命性改变,整体仍处于探索阶段,但未来随着算法更新、算力突破及大数据发展,AI 将深入应用到新药研发的各个环节。

延伸阅读