深度学习在挖掘因果性方面是弱项,AI医疗系统基于相关性而非因果性做出判断,可能在因果倒置或混淆变量场景中给出错误建议,构成难以被常规测试发现的隐性临床安全风险。AI医疗落地中最大的安全隐忧,并非算法算力不足,而是因果性缺陷带来的“看似正确实则危险”的决策——这类错误难以通过常规测试发现,却可能在真实临床场景中造成误诊、错误用药建议和延误治疗。
相关性不等于因果性:AI医疗的认知短板
深度学习和神经网络模型的工作原理,目前尚未得到严格的数学定义,因而不具有可解释性。在医学影像AI等应用中,所谓可解释性,是要求其工作流程和人类对医学问题的认知一致,或者其工作流程可以被人类所理解。然而,深度网络在挖掘因果性方面是弱项,即使网络真的构造了一条看起来符合人类认知的逻辑链路,更大可能也是通过人为的网络结构设计获得的,而非机器学习本身发掘了这个因果性。
这意味着,AI系统更多是在学习数据中的相关性模式,而非真正理解疾病发生发展的因果链条。当训练数据中存在虚假关联时,系统可能将相关性误判为因果性,从而在临床判断中给出偏离真实病因的结论。
临床场景中的典型风险路径
| 风险类型 | 典型场景 | 潜在后果 |
|---|---|---|
| 把相关性当因果 | 症状与疾病的虚假关联被AI强化 | 误诊、错误诊断方向 |
| 忽略混淆变量 | 年龄、基础病等未纳入模型考虑 | 错误用药建议、延误治疗 |
| 因果倒置 | 将结果当作原因纳入推理链 | 诊断逻辑混乱、治疗方向偏差 |
上述错误在临床决策中可能引发连锁反应:误诊导致错误治疗路径、用药建议偏离患者真实状况、延误最佳治疗时机。由于这些错误源于模型内部的因果推理缺陷,而非简单的数据或参数问题,常规的测试集验证往往难以充分暴露。
现有验证体系为何难以发现因果性缺陷
目前,寻求AI医疗的可解释性,实质上是在追求人类对网络结构设计如何与医学问题自身逻辑匹配,这本质上还是在考验人类自己如何理解这个医学问题。极少可能出现人类在对相应医学问题没有足够了解的前提下,通过网络训练发现一个以前未知的逻辑链条——就算有所发现,应该也是相关性而非因果性,还需要人类去进一步验证相关性的存在。
这意味着,现有测试体系验证的是AI的输出与标注是否一致,而很难验证其推理路径是否真正符合医学因果逻辑。当AI给出“正确”答案时,测试者无法判断其内部推理是源于真正的因果理解,还是源于数据中的虚假相关。
常见问题
AI医疗的因果性缺陷可以通过增加训练数据解决吗?
不能从根本上解决。增加数据可以提升相关性学习的准确性,但无法让深度学习模型真正理解因果关系。数据中的虚假关联和混淆变量问题,会随着数据规模扩大而更加隐蔽。
可解释性要求能否消除AI医疗的因果性风险?
可解释性要求能提升人类对AI决策的监督能力,但当前的可解释性更多是“人类对网络结构设计如何与医学问题逻辑匹配”的验证,本质上仍是循环论证——从人类已知认知出发设计网络,构造与人类认知匹配的工作流程,而非真正发现新的因果链条。
如何降低AI医疗的因果性缺陷带来的临床风险?
需要将AI定位为辅助工具而非独立决策者,在临床应用中保留人类医生的最终判断权。同时,对AI系统在混淆变量场景下的表现进行专项测试,并持续关注其推理路径是否符合医学因果逻辑。