AI医疗的监管重心,正从“要求算法像人一样思考”转向“用真实临床结局说话”。 黑火药在化学原理被阐明前已使用数百年,其管理依据是使用效果与安全事故记录,而非配方背后的科学解释——这一经验主义逻辑,为当下AI医疗的审批政策提供了极具参考价值的启示:当深度学习模型本身难以被完全解释时,监管是应该执着于打开“黑箱”,还是应该更务实地紧盯它在真实世界中的输出结果?
从技术现实看,当前主流的AI医疗算法多基于神经网络训练,其内部工作机制尚缺乏严格的数学定义,不具备传统意义上的可解释性。这与古代工匠知晓黑火药的制备方法、却无法解释其化学原理的情形高度相似。官方资料明确指出,在“可见的将来”,人类尚不接受AI医疗的“涌现”——无论是FDA还是NMPA,对AI医疗的可解释性都提出了很高要求。然而,对医学影像AI而言,要求其工作流程与人类认知完全一致,在逻辑上近乎苛求:完成目标任务的途径本质上有无穷多条,要求每一条都符合人类理解模式并不现实。更深层的矛盾在于,当前深度网络在挖掘因果性方面是弱项,即便网络构造出看似符合人类认知的逻辑链路,更大可能是人为设计的结果,而非机器自主发掘的因果规律。若一味追求这种“可解释性”,实质上可能陷入循环论证——从人类已知认知出发设计网络,再验证网络符合人类认知。
这一困境令人联想到一个思想实验:若黑火药的发明者被要求先解释清楚全部化学原理才能投入使用,这项改变人类文明进程的技术恐怕将胎死腹中。同理,对可解释性的过度苛求,可能抑制AI医疗在影像识别、辅助诊断等场景中的实际落地与迭代创新。监管的平衡点,或许在于区分两种不同维度的“可解释”:一是算法构造过程的理论透明,二是面向具体临床问题的处理流程是否被验证有效。前者是学术追求,后者才是监管应当聚焦的着力点。
从原理审查转向结果验证的监管逻辑
当前各国监管路径的分野,本质上是对上述矛盾的不同回应。一种思路侧重算法透明性的事前审查,要求开发者阐明模型的工作链路;另一种思路则更接近FDA基于结果的审批逻辑——以算法在既定临床场景中能否稳定产出可靠结论为核心评价指标。对于深度学习这类依赖海量参数训练的系统,要求其对每一个决策给出因果级解释,既不符合技术现状,也未必能提升患者安全。相反,若监管框架能围绕真实世界临床证据构建,通过上市后持续监测算法在不同人群、不同设备条件下的表现来动态管理风险,或许能更有效地平衡创新激励与患者保护。这种模式并不回避算法可能出错的事实,而是将监管重心从事前“看透原理”转移到事中事后的“看清结果”。
常见问题
为什么AI医疗算法难以做到完全可解释?
当前主流AI医疗算法多基于神经网络训练,其内部参数间的相互影响机制尚不完全清晰,工作原理缺乏严格的数学定义。这与人类对自身大脑运作机制的认识局限类似,并非简单的技术怠惰,而是深度学习范式的固有特征。
强调结果验证是否意味着放弃对算法质量的把关?
并非如此。结果验证导向的监管并非放任自流,而是将评价锚点从“黑箱内部如何运作”转移到“黑箱输出是否可靠”。这要求建立严谨的临床验证标准和上市后真实世界数据监测体系,本质上是对算法质量提出了更高、更贴近医疗实践的评价要求。
可解释性要求会阻碍AI医疗创新吗?
如果要求所有AI医疗算法都必须提供符合人类认知模式的工作流程解释,可能将研发资源从算法效能优化大量挤占至叙事构建,客观上抬高创新门槛。允许部分算法以“黑火药模式”通过结果验证进入应用,同时对其应用边界保持审慎标注,或许是更具可行性的路径。