AI医疗的国产替代进程,卡点并不在单一技术环节,而在于从数据到算法的底层能力尚未形成闭环。当前我国AI药物研发主要应用于药物发现和临床前研究环节,整体仍处于探索阶段,核心障碍在于高质量生物医学数据缺乏、数据孤岛难以打破,以及底层算法框架对海外基础模型的依赖。破局的关键,在于在蛋白质设计等新兴赛道构建自主数据生态,实现从“跟随式替代”到“换道超车”的转变。
国产替代的两大现实障碍
数据层面,药物开发领域虽然积累了海量信息,但未知的更多。人类对大部分蛋白质的功能及修饰变化并不完全知晓,对细胞信号通路中蛋白质间的“对话”机制理解仍很局限。化学结构空间广阔,目前人类仅对约2亿个类药分子进行了实验表征,而高质量生物医学数据的缺乏与“数据孤岛”问题,一直是难以解决的痛点。经验难以被量化定义成算法,AI便难以有效发挥作用。
算法与算力层面,海外在基础模型与算力上的先发优势明显。AI的本质是复制并优化人类经验,当人类对生物与化学的认知尚不充分时,AI的操作空间就受到限制。此外,药物研发的反馈周期极长——药物在细胞体系的表现迁移到小动物模型已有很大差距,再到人类个体则更为复杂,这种漫长的正负反馈循环使得数据积累成本高、速度慢,进一步拉大了与先发者的差距。
蛋白质设计:换道超车的突破口
在传统小分子药物领域,AI受制于数据瓶颈,但蛋白质工程领域却展现出截然不同的前景。AlphaFold 2解决了蛋白结构预测问题,其精度可与实验媲美,并启发了基于深度学习的蛋白质设计新方法。AI可以通过学习已有蛋白质序列,创造出自然界不存在但具备类似功能的蛋白,且从序列上讲与天然蛋白相似度可低于30%。
在蛋白质设计方面,以GPT为代表的大模型展现出显著优势。AI进行蛋白质设计的逻辑与人类完全不同,其找到的某些优化点位甚至违背人类直觉,却能有效提升蛋白质的稳定性。这是因为深度学习用高维向量描述蛋白质特征时,有可能抓住比人类经验总结更本质的因素——人类的科学知识多是从实验观测中归纳低维特征,而在生物医学这类复杂学科中,AI通用大模型提取的高维数据精度更高、成本更低。
自主数据生态的建设路径
实现底层技术自主,核心在于构建从数据到模型的自主能力闭环。这需要行业经验能够被量化、被定义成算法,并具备清晰的分级与正负反馈机制。具体而言,企业应聚焦于特定场景的深度数据积累——例如利用深海蛋白等特殊数据源训练大模型,在稳定性、结合力、催化活性等维度形成差异化数据资产。同时,随着算法更新、算力突破及大数据发展,AI技术将逐步深入应用到新药研发的各个环节,在化合物合成、药效预测及自动化研发等阶段扮演越来越重要的角色。
常见问题
AI医疗国产替代目前处于什么阶段?
我国AI药物研发主要应用于药物发现环节和临床前研究环节,受生物系统内在复杂性和疾病异质性特征的制约,AI技术尚不能为药物研发的效率和成功率带来革命性改变,整体仍处于探索阶段。AI在药物发现上的作用目前仍局限在速度和成本上,而非决策质量。
数据孤岛问题为何如此难以解决?
药物开发领域虽然积累了海量信息,但人类对大部分蛋白质功能、细胞信号通路机制的理解仍很局限,经验难以被量化定义成算法。同时,药物研发的反馈周期极长,从细胞体系到动物模型再到人类个体,数据积累成本高、速度慢,这使得高质量生物医学数据的缺乏成为长期难题。
蛋白质设计为何被视为国产替代的新机会?
蛋白质工程与药品研发的逻辑不同,AI的“快”与制药的“慢”之间的矛盾在蛋白质设计领域并不突出。AlphaFold 2解决了蛋白结构预测问题并启发了新的设计方法,AI能够设计出自然界不存在的功能蛋白,且其优化逻辑可能抓住比人类经验更本质的高维特征,这为中国企业提供了绕开传统小分子数据瓶颈的差异化赛道。