AI 已能通过学习已有蛋白质序列,设计出与自然界蛋白序列相似度低于30%、但具备类似功能的全新蛋白,这标志着蛋白质工程进入"设计"而非"改造"的新阶段。在这一全球性格局中,中国并非追随者,而是以特色数据资源(如深海耐高温蛋白)、大模型研发能力和丰富应用场景,成为蛋白质工程领域的重要参与者。 上海交大洪亮教授利用海洋所取得的深海蛋白数据训练大模型,AI 即可设计出具备耐高温特性的目标蛋白,是这一路径的典型代表。整体而言,AI 蛋白质设计仍处发展初期,中国的优势集中在数据与场景两端,短板则在于底层算法与高质量数据的开放共享。

从"改造"到"设计":AI 重塑蛋白质工程

传统蛋白质工程的做法,是把天然蛋白质序列上的5—20个氨基酸突变成别的氨基酸,使其在工业或医药的真实应用环境中达到更优的稳定性、结合力、亲和力、催化活性与底物选择性。天然蛋白经过自然选择,性能、稳定性、活性、特异性本已优秀,但工业与医药的使用环境不同,需要定向优化。

AI 带来的变化是范式级的:它可以学习已有蛋白质序列,创造出自然界不存在、却具备类似功能的蛋白,且与自然界序列相似度低于30%。在蛋白质设计方面,以 GPT 为代表的大模型已经完全碾压了人类。更关键的是,AI 的设计逻辑与人类不同——有些 AI 找到的优质位点违背人类直觉,却能提高稳定性。人类几十年经验总结出的蛋白质结构规律只有相关性、没有因果性;而深度学习用高维向量描述蛋白质特征时,有可能抓住更本质的因素。

全球格局与中国位置

从技术路线看,AlphaFold 2 解决了蛋白结构预测问题,达到与实验相当的精度,并启发了基于深度学习的蛋白质设计新方法——DeepMind 找到数学公式,将1D序列与3D结构联系起来。这构成了后 AlphaFold2 时代全球蛋白质设计的共同基础。

中国的相对位置可从三个维度理解:

维度中国的相对位置
特色数据资源具备深海蛋白(耐高温)等特色数据,并已用于大模型训练
大模型研发能力已有团队利用上述数据训练大模型并实现目标蛋白设计
产业化应用场景工业与医药对稳定性、活性、选择性优化需求丰富,应用空间广阔

需要客观看待的是,AI 药物研发整体仍处发展初期,面临数据、算法和专业人才方面的挑战,商业模式也需市场进一步验证。中国 AI 药物研发主要应用于药物发现环节和临床前研究环节,受生物系统内在复杂性和疾病异质性制约,AI 尚不能为研发效率和成功率带来革命性改变,整体仍处探索阶段。这一判断同样适用于蛋白质设计的产业化落地节奏。

优势与短板并存

中国的长板在于数据与场景。深海蛋白等特色数据是稀缺资源,而 AI 的本质是复制并优化人类经验——谁掌握高质量、可量化的领域数据,谁就更容易训练出可用的设计模型。同时,工业酶、医药蛋白等应用端对耐高温、高稳定性蛋白的需求明确,为设计成果提供了验证与落地空间。

短板同样清晰。高质量生物医学数据缺乏、数据孤岛难解,是长期存在的问题;人类对大部分蛋白功能、修饰变化及蛋白质间相互作用机制的理解仍然有限。此外,AI 在药物发现上的作用目前仍局限在速度和成本上,而非决策质量,过多使用靶点活性等替代量度、缺少与有效性或安全性直接相关的数据结果,仍是待解难题。这些不是中国独有的问题,但决定了从"能设计"到"能规模化应用"之间仍有距离。

常见问题

AI 真的能设计出自然界不存在的蛋白质吗?

可以。AI 通过学习已有蛋白质序列,能够创造与自然界不存在但具备类似功能的蛋白,且从序列上看与自然界蛋白的相似度低于30%。上海交大洪亮教授利用深海蛋白数据训练大模型,AI 即可设计出具备耐高温特性的目标蛋白。

中国在 AI 蛋白质设计中的核心优势是什么?

核心优势集中在特色数据资源与产业应用场景两端。深海耐高温蛋白等数据为模型训练提供了差异化素材,而工业与医药领域对蛋白稳定性、活性、选择性的优化需求,为设计成果提供了落地空间。底层算法与高质量数据的开放共享,则是需要持续补强的方向。

AI 蛋白质设计目前处于什么阶段?

整体仍处发展初期,技术上面临数据、算法和专业人才方面的挑战,商业模式也需市场进一步验证。AI 在相关发现环节的作用目前仍局限在速度和成本上,而非决策质量,距离广泛、成熟的产业化应用仍有距离。