神经网络训练参数规模越大越好?答案是否定的。在AI医疗领域,参数规模扩大不仅不必然带来更好效果,反而会加剧模型“黑箱”属性,放大可解释性缺失这一核心风险,进而推高监管审批与临床落地的难度。 大模型的能力提升与风险累积是同步的,AI医疗的落地瓶颈不在“更大”,而在“更可信”。
参数规模与“涌现”的黑箱代价
当前主流AI技术路线中,基于神经网络模型的训练法是绝对主流,但其工作原理尚未得到严格的数学定义,因而不具有可解释性。以ChatGPT为例,其核心是基于神经元模型的训练,研究人员使用算法训练拥有1500亿个参数的人工神经网络,但对于其中的细节其实并不掌握。OpenAI公司CEO萨姆·阿尔特曼在公开访谈中坦言,ChatGPT为何会出现归纳推理能力,研究者自己搞不明白——他们只知道在不断测试和训练中,人类突然发现ChatGPT开始出现了归纳推理能力。
这种“涌现”能力带来的副作用是:参数规模越大,内部相互影响的机制越复杂,人类对其工作流程的理解越困难。对于普通应用场景,黑箱或许可以容忍;但在医疗场景中,这一矛盾被急剧放大。
AI医疗的特殊性:可解释性是硬门槛
AI医疗与通用AI的本质区别在于,无论是FDA还是NMPA,对于AI医疗的可解释性都提出了很高的要求。在可见的将来里,人类不接受AI医疗的“涌现”。
针对医学影像AI问题,所谓的可解释性,说白了就是要求其工作流程和人类对医学问题的认知一致,或者其工作流程可以被人类所理解。但问题在于,完成目标任务的途径本质上有无穷多条,不可能要求任意一条途径都满足人类的理解模式。
更关键的结构性短板在于:目前深度网络和深度学习在挖掘因果性方面其实是弱项。医学领域的可解释性实际上要求看到因果关系,但深度网络即使构造了一条看起来符合人类认知的逻辑链路,更大可能上也是通过人为的网络结构设计获得的,而不是机器学习本身发掘了这个因果性。这意味着,大模型输出的结论更多是基于相关性而非因果性,在临床决策中可能带来潜在误诊风险。
行业不确定性:从监管到落地的多重挑战
参数规模扩大带来的风险并非单一维度,而是系统性扩散:
| 风险维度 | 核心问题 |
|---|---|
| 监管审批 | 可解释性要求与黑箱模型存在天然张力,参数规模越大,审批难度越高 |
| 临床决策 | 基于相关性而非因果性的输出,可能误导诊断与治疗方案选择 |
| 技术本质 | 寻求可解释性实质上是在追求人类对网络结构设计如何与医学问题自身逻辑匹配,近乎循环论证 |
此外,行业还面临数据隐私、算力成本、模型偏见等多重不确定性。AI医疗的落地,考验的不是模型的参数规模上限,而是人类对医学问题本身的理解深度——极少可能出现人类在对相应的医学问题没有足够了解的前提下,通过网络训练发现一个以前未知的逻辑链条,就算有所发现,其实应该也是相关性而非因果性,还需要人类去进一步验证。
常见问题
为什么大参数模型在医疗领域反而更危险?
参数规模越大,模型的“涌现”行为越不可控,内部工作机制越难以被人类理解。而医疗监管对可解释性有严格要求,两者之间存在结构性矛盾。更关键的是,深度网络在因果性挖掘上是弱项,大模型输出的相关性结论在临床决策中可能产生误导。
AI医疗的可解释性要求具体指什么?
针对医学影像AI问题,可解释性就是要求其工作流程和人类对医学问题的认知一致,或者其工作流程可以被人类所理解。但完成任务的途径有无数条,不可能要求每条都符合人类认知模式,这导致可解释性在实践中近乎“循环论证”——从人类自己的理解出发设计网络,再验证其与已知认知匹配。
参数规模扩大是否意味着AI医疗能力必然提升?
不一定。参数规模的扩大带来的是“涌现”能力,而非因果推理能力。在医疗领域,缺乏因果性的输出即便在统计上相关,也不能直接用于临床决策。AI医疗的未来更取决于能否在可解释性上取得突破,而非单纯堆叠参数。