图灵测试争议的核心,在于机器智能能否以“结果不可分辨”作为判定标准;而在AI医疗的医学影像场景中,这一标准远远不够。临床对可解释性的要求,本质上不是要求AI“像人一样思考”,而是要求其工作流程与人类对医学问题的认知保持一致、能够被医生理解。因此,医学影像AI的可解释性,并非追求算法内部的“黑盒”透明化,而是聚焦于网络结构设计如何与医学问题的逻辑相匹配。

从图灵测试到临床可解释性:标准的转变

图灵测试提出了一种“行为主义”的智能判定:只要机器在对话中无法被分辨,即可认为其具备智能。然而,在医学影像领域,这种“唯结果论”并不适用。无论是 FDA 还是 NMPA,都对 AI 医疗的可解释性提出了很高的要求,而这一要求直接影响了产品设计的底层逻辑。

当前AI技术主要有两大路线:一类是基于模型的运算能力(如知识图谱),其工作原理有严格的数学定义,因此天然具备可解释性;另一类是基于神经网络模型的训练(如深度学习),其内部工作机制尚未得到严格的数学定义,因而不具有传统意义上的可解释性。医学影像AI多属于后者,这就带来了天然的挑战。

医学影像AI的可解释性:是循环论证,更是临床刚需

针对医学影像AI,所谓的可解释性,说白了就是要求其工作流程和人类对医学问题的认知一致,或者其工作流程可以被人类所理解。但这里存在一个关键认知:完成目标任务的途径本质上有无穷多条,并非所有途径都必须符合人类的理解模式。

因此,现阶段寻求的可解释性,实质上是在追求人类对网络结构设计如何与医学问题自身的逻辑匹配。这意味着,可解释性更像一个循环论证:从人类对问题的理解出发设计网络,再构造一个与已知认知匹配的工作流程。在这个过程中,极少可能出现通过网络训练发现一个人类此前未知的逻辑链条——即便有所发现,也更可能是相关性而非因果性,仍需人类进一步验证。

常见问题

医学影像AI一定要做到“完全透明”才算可解释吗?

不是。医学领域的可解释性实际上是要求看到因果关系,但深度网络在挖掘因果性方面是弱项。目前更务实的路径是:通过人为的网络结构设计,让工作流程在逻辑上符合人类对医学问题的认知,而非要求算法内部的每一个参数都被人类理解。

深度学习模型的可解释性为何难以从理论层面解决?

可解释性本质要从深度学习理论的角度来提供,但不存在针对某个特定应用的深度网络可解释性。面向问题的算法处理流程的可解释性,与构造这个算法的过程的可解释性,是两回事。前者是临床落地的关键,后者在理论上仍面临根本性局限。

如果AI的某个判断路径不符合人类认知,是否就不可用?

并非如此。除非找到一条符合人类认知特征的途径,否则不能断言不符合人类认知特征的途径就不可用。图灵本人也认为,计算机和人类可以以不同的方式实现智能,计算机智能以人类思维作为参照,但不一定必须作为模板。