医院数据的释放节奏受政策与医院内部流程影响,呈现明显的不均匀性,导致AI医疗企业的供需周期出现错配:模型训练对数据的持续需求,与数据获取、清洗的批次化供给之间,形成周期性波动。
数据获取的供给瓶颈
医疗数据被视为AI时代的“石油”,但其获取面临多重壁垒。医疗数据所有权归属于患者,但实际控制权在医院方,第三方机构需借助政府支持和医院配合才能商业化开发。目前,AI模型训练所需数据主要通过企业与医院签署研发协议获得,且为保护隐私,数据通常“不出院”,仅模型出院。这一流程导致数据供给呈现明显的批次化特征——医院按项目或政策窗口期分批释放数据,企业再按批次进行清洗与处理,供给节奏难以平滑。
需求侧与政策窗口期的波动
AI医疗企业对数据的需求是持续且高频的——模型训练需要大量、高质量、多样化的数据来迭代。然而,数据释放的时机往往与政策窗口期(如医疗信息化政策、数据交易试点等)高度相关。例如,国内大数据交易所虽已将“医疗卫生”数据纳入交易品类,但实际交易量极低:贵州大数据交易所上架的一款“儿童构音障碍早筛语音数据”产品,售价25万元,累计仅交易两笔。这种供需节奏的错配,使得AI医疗企业常面临“有需求时拿不到数据,拿到数据时模型训练需求已变化”的周期波动。
常见问题
AI医疗企业如何应对数据供给不稳定的问题?
企业通常通过与多家医院建立长期研发协议、参与政府支持的医疗数据开放试点,以及采用“数据不出院、模型出院”的隐私计算方案来缓解供给瓶颈。但整体上,数据获取仍高度依赖医院配合与政策推动。
医疗数据为什么不能像其他行业数据一样快速流通?
医疗数据涉及患者隐私,权属复杂(所有权属患者、控制权属医院、管理权属政府),且数据质量要求高,需经严格清洗与脱敏。当前大数据交易所的医疗数据交易品类极少、交易量低,反映了流通环节的合规与信任成本较高。
理解医疗数据比获得数据更重要吗?
是的。官方资料指出,对于现阶段的AI医疗产品来说,“理解医疗数据远比获得数据更重要也更困难”。以IBM医疗AI沃森为例,其失败的重要原因之一就是将“获取数百万页的医疗信息等同于理解或使用这些信息”。如果不能深刻理解服务行业,再多的数据也难以转化为有效能力。