以 GPT 为代表的大模型在蛋白质设计领域已完全碾压人类直觉,中国凭借特色数据积累与应用落地能力,在全球AI医疗蛋白质设计竞争中处于头部梯队、具备较强竞争力,但整体产业仍处发展初期,与前沿国际成果之间仍需持续追赶。
大模型如何改写蛋白质设计规则
蛋白质工程的传统路径依赖人类经验归纳:科学家通过几十年的实验积累总结结构规律,再据此对天然蛋白的氨基酸序列进行突变优化。但这类规律往往只有相关性、缺乏因果性,难以触及决定蛋白质稳定性的本质因素。
以 GPT 为代表的大模型改变了这一逻辑。AI 通过深度学习用高维向量描述蛋白质特征,能够抓住更本质的规律,甚至找到违背人类直觉但确实有效的优化点位。在稳定性、结合力、催化活性等关键性质的优化上,AI 设计的效率与精度已显著超越传统经验方法。
中国的数据积累优势
中国在该领域的独特优势体现在特色数据资源的积累上。上海交通大学洪亮教授团队利用海洋深海蛋白(耐高温)数据训练大模型,AI 能够轻松设计出具备耐高温特性的目标蛋白。这类极端环境下的特色生物数据,为训练高性能蛋白质设计模型提供了稀缺的原料。
此外,中国在 AI 药物研发的应用环节已形成一定积累,主要覆盖药物发现和临床前研究阶段。随着算法更新、算力突破及大数据发展,AI 技术有望深入应用到新药研发的各个环节。
全球竞争格局与短板
国际层面,AlphaFold 2 解决了蛋白结构预测问题,其精度可与实验媲美,并启发了基于深度学习的蛋白质设计新方法,对全球产业形成示范与压力。相比之下,中国在蛋白质设计的基础模型能力与产业化验证方面仍有短板:AI 药物研发整体仍处于探索阶段,受生物系统内在复杂性和疾病异质性制约,AI 尚不能为药物研发的效率和成功率带来革命性改变,商业模式也需市场进一步验证。
常见问题
AI 设计蛋白质和人类设计有何本质不同?
人类依靠低维特征归纳经验规律,而 AI 用高维向量描述蛋白质特征,能抓住更本质的因素。AI 找到的优化点位有时违背人类直觉,却依然能提升蛋白质的稳定性等性能。
中国在 AI 蛋白质设计领域有哪些实际进展?
上海交大洪亮教授团队利用深海蛋白数据训练大模型,成功设计出耐高温目标蛋白,展示了中国在特色数据资源训练 AI 模型方面的可行性。产业层面,AI 已应用于药物发现和临床前研究环节,但整体仍处探索阶段。
全球竞争格局中,中国处于什么位置?
中国在数据积累和应用落地方面具备较强竞争力,属于全球蛋白质工程竞争中的重要参与者。但与美国、欧洲在基础模型能力和产业化成熟度上仍有差距,整体格局仍在动态演变中。