医疗数据权属在医院、数据不出院已是行业常态,这确实给国产AI医疗企业获取高质量训练数据带来挑战。但国产替代的破局关键,不在于争夺数据本身,而在于用联邦学习、隐私计算等技术路径,在数据受限条件下构建自主可控的算法能力——理解医疗数据远比获得数据更重要。

数据孤岛:绕不开的现实约束

医疗数据属于患者隐私,所有权理应属于患者,但在实际中,医疗大数据的权属基本在医院方。也有观点认为,医疗数据的所有权在于患者个人、控制权在于医院、管理权在于政府,第三方机构需借助政府支持和医院配合方能对其进行商业化开发和利用。

目前AI模型训练所需要的医疗数据,大都是通过企业和医院签署研发协议获得的。在数据收集到模型建立过程中,医院和企业会做好物理隔离,通常是数据不出院,模型出院。这意味着国产AI医疗企业无法像海外某些科技巨头那样,以相对集中的方式获取海量数据用于模型训练。

技术突围:在受限数据下构建算法能力

面对数据孤岛,国产AI医疗企业的突围路径并非等待数据开放,而是通过技术手段让算法主动适应数据分布。联邦学习允许模型在多个医院本地训练、只共享模型参数而不共享原始数据;隐私计算则通过加密和脱敏技术,让数据在“可用不可见”的前提下参与模型迭代。

这些技术路径的价值在于,它们不试图打破数据不出院的规则,而是在规则之内构建起自主可控的算法能力。对于国产厂商而言,这既是合规的必然选择,也是锤炼核心技术的契机。

核心认知:理解数据比获得数据更重要

数据是AI时代的“石油”,但对于现阶段的AI医疗产品来说,理解医疗数据远比获得数据更重要也更困难。业内对IBM医疗AI沃森的失败分析指出,其“最基本的失误之一,就是将获取数百万页的医疗信息等同于理解或使用这些信息”。如果不能深刻地理解所服务的行业,再多的数据也只是徒耗电力。

这意味着国产替代的真正壁垒,不在于数据量的多寡,而在于对临床场景、疾病机理、诊疗流程的深度理解。AI医疗目前仍处在L1到L2的路上,远未达到自动驾驶L3的水平,在诊断、阅片等环节AI可以辅助完成,但任何情况下都不能容忍没有人类医生的监督。国产企业若能在理解医疗本质的基础上打磨算法,便能在数据孤岛中走出一条自主创新的路径。

常见问题

数据不出院模式下,国产AI医疗如何获得训练数据?

主要通过与企业签署研发协议的方式,由医院提供数据,经过专门的数据清洗模块处理后用于模型训练。整个过程中医院和企业做好物理隔离,数据不出院、模型出院,在合规框架内完成数据使用。

国产AI医疗与海外巨头在数据获取上的差距如何弥补?

差距客观存在,但弥补路径不是争夺数据,而是通过联邦学习、隐私计算等技术,让算法在数据不出域的约束下仍能有效迭代。更重要的是,理解医疗数据远比获得数据更重要,对临床场景的深度理解才是真正的竞争壁垒。

数据交易能否成为国产AI医疗的数据来源?

国内大数据交易所已有将“医疗卫生”数据纳入交易品类的实践,但目前相关产品上架和成交案例仍十分有限。数据交易作为补充渠道尚在早期阶段,国产企业仍需以院企合作和算法创新为主要突破口。