AI设计蛋白质的序列相似度低于30%,意味着AI并非在天然蛋白上做简单修补,而是直接生成了自然界不存在的全新蛋白骨架。这一能力被业内视为AI医疗从“预测工具”走向“创造引擎”的分水岭——掌握低序列相似度蛋白质从头设计能力,且具备高通量湿实验闭环验证的企业,才真正握有底层技术壁垒。
从结构预测到生成式设计:底层逻辑的跃迁
2021年AlphaFold2解决了蛋白结构预测问题,其精度可与实验媲美。但预测结构只是第一步,真正的难点在于“反向设计”:给定一个期望功能,生成一条自然界不存在的氨基酸序列,使其折叠后具备该功能。官方资料指出,AI可以通过学习已有蛋白质序列,创造与自然界不存在但具备类似功能的蛋白,从序列上讲,与自然界的蛋白序列相似度低于30%。
这背后的技术路线差异极大。传统蛋白质工程依赖人工经验,在天然序列上做5-20个氨基酸的点突变,以优化稳定性、结合力、亲和力等性质。而生成式AI蛋白设计的逻辑完全不同——以GPT为代表的大模型在蛋白质设计上展现出显著优势,AI找到的优化点位有时违背人类直觉,却依然能提升蛋白稳定性。原因在于人类经验总结的是低维特征与结果的相关性,而深度学习用高维向量描述蛋白质特征,可能抓住更本质的因素。
真自研与包装概念:算法壁垒的识别框架
判断一家AI医疗企业是否真正掌握底层技术,可从三个维度交叉验证:
| 验证维度 | 核心技术指标 | 伪技术包装的典型特征 |
|---|---|---|
| 算法架构 | 是否具备生成式蛋白大模型,而非仅依赖公开的判别式预测工具 | 只宣传“使用AI辅助”,无自研模型细节 |
| 数据闭环 | 是否拥有高通量湿实验(表达、纯化、活性检测)反馈迭代 | 仅有干实验计算,无实验验证数据 |
| 验证进度 | 设计蛋白是否在工业酶、抗体、疫苗等场景进入真实应用验证 | 停留在论文或概念演示阶段 |
拥有高通量湿实验闭环的企业更具竞争力。AI设计出的蛋白序列是否真实可折叠、有功能,必须通过实验反馈来验证和迭代。缺乏实验闭环的纯计算公司,其设计能力难以被证实,也难以持续优化。此外,AI药物研发目前仍处于发展初期,在药物发现环节的作用更多体现在速度和成本上,而非决策质量。相比之下,蛋白质工程领域的商业化验证周期更短,更可能率先跑通“AI设计—实验验证—规模应用”的闭环。
常见问题
序列相似度低于30%意味着什么?
意味着AI设计出的蛋白在氨基酸序列层面与任何已知天然蛋白都有显著差异,属于真正的从头设计。这不同于在天然蛋白上做少数位点突变的定向进化——后者序列相似度通常在90%以上。低于30%的相似度说明AI已经掌握了蛋白质折叠的底层规律,而非简单的局部优化。
蛋白质设计比小分子AI制药更容易落地吗?
是的。AI制药在小分子领域面临数据不足的瓶颈,药物研发是极度漫长严谨的过程,AI的快与制药的慢存在矛盾,在第一个AI设计的药物跑完全程之前,行业很难完全认可其价值。而蛋白质工程的应用场景(工业酶、诊断试剂等)验证周期短、反馈直接,更利于AI技术的快速迭代和商业化。
如何识别真正有技术壁垒的AI蛋白设计公司?
重点看三点:一是是否拥有自研的生成式蛋白大模型及相应训练数据规模;二是是否建立“设计—合成—表达—活性检测”的湿实验闭环,形成数据飞轮;三是是否有进入真实应用场景验证的候选蛋白。只宣传概念、缺乏实验数据支撑的企业,难以构成真正的技术壁垒。