在AI医疗设计蛋白质的产业链中,上游数据商(如提供深海蛋白数据的机构)凭借稀缺性和高壁垒,议价权显著强于下游应用方(如工业酶企、药企)。这是因为高质量、有标签的蛋白质数据是训练AI模型的核心瓶颈,而下游应用方在短期内难以绕开这些独家数据源。

数据壁垒:上游议价权的根基

AI蛋白质设计的关键在于数据质量。上海交大洪亮教授团队使用海洋所的深海蛋白(耐高温)数据训练大模型,成功设计出具备耐高温特性的目标蛋白。这类深海蛋白数据具有天然稀缺性——获取成本高、环境要求苛刻,且经过自然选择的蛋白质在稳定性、活性等方面已十分优秀,但工业或医药应用需要针对特定环境(如高温)进行优化,因此这类高价值数据成为稀缺资源。上游数据商凭借对这类独特数据的独占性,在产业链中掌握了较强的定价话语权。

模型开发商:技术门槛高但可替代性弱

以AlphaFold 2为代表的AI模型解决了蛋白质结构预测问题,并启发了基于深度学习的蛋白质设计新方法。模型开发商(如DeepMind、洪亮团队)拥有算法和算力优势,但其模型训练高度依赖上游数据。虽然技术门槛高,但若上游数据商选择与其他模型开发商合作,下游应用方的可替代性依然有限。因此,模型开发商在产业链中处于中间位置,议价能力中等,更多依赖与数据商的独家合作或数据独占性来增强自身地位。

下游应用方:选择受限,议价权相对弱势

下游应用方(工业酶企、药企)是AI设计蛋白质的最终使用者,但它们在产业链中议价权相对较弱。原因在于:AI设计的蛋白质(如耐高温酶)需要满足特定工业或医药环境要求,而这类定制化设计高度依赖上游数据和模型。下游企业若想获得高性能的定制蛋白,通常需要与拥有独家数据或模型能力的供应商合作。此外,AI在药物发现中的作用仍局限在速度和成本上,而非决策质量,且药物研发周期长、反馈慢(如临床反馈周期长),进一步限制了下游企业快速切换供应商的能力。

常见问题

为什么蛋白质数据比小分子药物数据更难获得?

蛋白质功能涉及序列、结构和复杂的修饰变化,而人类对大部分蛋白的功能及蛋白间相互作用机制理解有限。相比之下,小分子药物领域已有约2亿个类药分子被实验表征,但蛋白质数据的高质量标注(如耐高温、高活性等)成本高、周期长,导致稀缺数据集中在少数机构手中。

下游企业能否通过自建数据池来增强议价权?

理论上可行,但实践难度极大。自建高质量蛋白质数据池需要长期、高成本的实验验证(如深海采样、高温环境模拟等),且反馈周期长(如药物从细胞到动物模型再到人体的效果差异巨大)。对于大多数工业酶企或药企,短期内难以复制上游数据商的独家数据资源。

专利布局如何影响议价权?

上游数据商和模型开发商可通过专利保护数据采集方法、模型算法及设计出的蛋白质序列,形成技术壁垒。例如,洪亮团队利用深海蛋白数据训练的大模型,其设计的耐高温蛋白若申请专利,将直接限制下游应用方的自由使用。这进一步强化了上游和中间环节的议价能力。

延伸阅读