医学影像辅助筛查、病理初筛等“辅助决策”类场景,会率先接纳这种工作原理类似黑火药的不可解释但可用的AI医疗工具;而需要严格因果关系、直接指导临床处置的环节,接纳速度会明显更慢。
AI医疗目前的主流技术路线是神经网络模型的训练,其内部如何相互影响并不清楚,工作原理尚未得到严格的数学定义,因而天然不具备可解释性——这正如古代中国工匠知道黑火药的制备方法,却无法解释其中的化学原理。这种“不可解释但可用”的特质,决定了它在不同诊疗场景中的落地节奏有显著差异。
为什么监管与临床对“可解释性”如此执着
无论是FDA还是NMPA,对AI医疗的可解释性都提出了很高要求。但问题的关键在于:可解释性本质上是要求AI的工作流程与人类对医学问题的认知一致。而深度学习在挖掘因果性方面其实是弱项,即便网络真的构造出一条看似符合人类认知的逻辑链路,更大概率也是人为网络结构设计的结果,而非机器学习本身发掘了因果性。
这意味着,在人类尚未充分理解某个医学问题的领域,指望AI训练“发现”一条新的因果链条并不现实——就算有所发现,得到的也更多是相关性而非因果性,仍需要人类去进一步验证。这种“循环论证”式的可解释性追求,在因果要求极高的场景中形成了天然瓶颈。
率先落地的场景:辅助筛查而非独立诊断
不同场景对可解释性的容忍度差异,决定了接纳顺序。具体而言:
| 场景类型 | 对可解释性的要求 | 接纳速度 |
|---|---|---|
| 医学影像辅助筛查、病灶标记 | 较低,人机协同复核 | 较快 |
| 病理初筛、风险分层提示 | 较低,作为“第二意见” | 较快 |
| 直接指导治疗决策、用药方案 | 高,需明确因果逻辑 | 较慢 |
| 独立出具诊断结论 | 极高,需可追溯依据 | 最慢 |
辅助筛查类场景可能先行,因为其定位是帮助医生“找线索”,而非替代医生“下结论”。医生看到AI标记的疑似病灶后,仍以自己的专业判断做最终决策,AI的不可解释性因此被人工复核环节有效对冲。而在需要AI直接给出处置建议的环节,不可解释性会成为难以逾越的门槛——不是工具不可用,而是责任归属与临床信任机制尚未准备好承接这种“黑火药式”的产出。
常见问题
AI医疗的“不可解释”和“不可用”是一回事吗?
不是。不可解释只说明其内部工作流程难以被人类完全理解,不等于输出结果没有参考价值。正如黑火药配方可用但原理不明,深度学习模型在大量训练后涌现出的能力是真实存在的,只是研究者对其内部细节并不完全掌握。
医生会信任一个说不清原理的AI工具吗?
取决于使用方式。在辅助筛查定位下,医生掌握最终判断权,AI作为效率工具被接受的门槛较低;但如果要求AI独立承担诊断责任,医生和监管方都会要求其推理过程可被追溯,这类场景的落地会显著滞后。
未来可解释性要求会放松吗?
短期内不会。FDA与NMPA对可解释性的高要求是明确的监管导向。更现实的路径是:在辅助筛查类场景中积累应用经验,同时通过人为网络结构设计让AI的工作流程尽量贴近人类认知,逐步建立信任基础。