AI设计出与天然蛋白序列相似度低于30%的全新蛋白,其真正的技术壁垒并不在于“生成序列”本身,而在于从海量虚拟候选里筛选出真正可折叠、可溶、有活性蛋白的闭环能力——这背后是高质量数据、结构预测精度与湿实验验证效率的长期较量。

核心壁垒:功能与序列的映射空间极大

蛋白质由20种氨基酸按特定顺序组成肽链,折叠成三维结构后才具备功能。AI通过学习已有蛋白质序列,可以创造自然界不存在但具备类似功能的蛋白,这类蛋白与天然序列的相似度通常低于30%。然而,天然蛋白质经过自然选择,在性能、稳定性、活性、特异性上已达到优秀平衡;工业或医药应用环境不同,往往还需在序列上突变5-20个氨基酸,使其在真实场景中达到最优性质。

真正的难点在于:从近乎无限的序列组合中,高效筛选出可折叠、可溶、有活性的候选。人类经验总结出的蛋白质规律多为相关性而非因果性,而深度学习用高维向量描述蛋白质特征,有可能抓住更本质的因素。官方资料指出,以GPT为代表的大模型在蛋白质设计方面已展现出较强能力——例如利用深海耐高温蛋白数据训练模型,即可设计出具备耐高温特性的目标蛋白,且部分AI找到的优化点位甚至违背人类直觉。

技术路线对比:结构预测与序列生成

AlphaFold 2在蛋白结构预测上取得突破,其精度可与实验相媲美,并启发了基于深度学习的蛋白质设计新方法。这一进展相当于找到了连接氨基酸序列(1D)与三维结构(3D)的数学关系,使网络能有效判别“什么像蛋白、什么不像蛋白”。

当前主流路线各有侧重:基于结构的设计(如Rosetta/AlphaFold路线)从目标折叠出发反向搜索序列;基于序列的生成模型(扩散模型、语言模型)则直接学习海量天然序列的分布规律。两条路线都面临同一瓶颈——AI预测与湿实验验证的闭环效率。序列相似度低于30%的全新骨架,其表达量、免疫原性、稳定性等可开发性指标,都需要通过实验迭代来验证,这一环节的速度与成本往往决定成败。

数据与专利:先行者的双重护城河

AI蛋白质设计的底层制约仍是数据质量。药物开发领域虽积累了海量信息,但未知更多:化学结构空间广阔,目前仅对约2亿个类药分子进行了实验表征;高质量生物医学数据缺乏、数据孤岛问题长期存在。官方资料指出,AI的本质是复制并优化人类经验,若人类对生物、化学的理解尚不充分,AI便难以有效操作。

此外,专利制度对“AI凭空设计蛋白”的可专利性构成新挑战——这类蛋白既非天然存在,其设计过程又涉及算法与数据,知识产权边界尚待厘清。率先建立“AI设计—实验验证—专利布局”完整闭环的企业,反而因此获得结构性优势。当前AI在药物发现上的作用仍局限在速度与成本层面,而非决策质量;但展望未来,随着算法更新、算力突破与大数据发展,AI在蛋白质工程等领域的角色将日益重要。

常见问题

序列相似度低于30%意味着什么?

序列相似度低代表AI生成的是全新骨架,而非对天然蛋白的简单修改。这类蛋白的功能与天然蛋白类似,但序列差异大,其可开发性(表达量、稳定性、免疫原性等)需通过大量实验重新验证,这正是技术壁垒所在。

AlphaFold解决了蛋白质设计的所有问题吗?

没有。AlphaFold 2主要解决结构预测问题,精度可与实验媲美,但它回答的是“序列如何折叠”,而非“什么序列具备目标功能”。从预测结构到设计出有活性的蛋白,仍需AI生成模型与湿实验验证的反复迭代。

AI设计蛋白的主要瓶颈是什么?

核心瓶颈在于数据质量与闭环验证效率。高质量生物医学数据缺乏、反馈周期长,且AI预测结果必须经实验验证才能确认其真实性能。能够高效运转“AI预测—实验反馈—模型优化”闭环的团队,才具备真正的竞争壁垒。