人工智能行业从专用小模型迈向通用大模型,关键拐点在于模型架构的突破(如Transformer)、数据与算力的规模化提升,以及由此带来的“涌现能力”。这一转变的核心是:小模型需针对特定场景重复训练、成本高且泛化能力弱;而大模型在大规模无标注数据上训练,泛化能力强,可通过微调甚至不微调完成多场景任务,显著降低了AI应用研发门槛。
从小模型到大模型的转变
在深度学习理论突破后的前期,AI模型多为针对特定场景训练的小模型。这类模型通用性差,换到另一个应用场景往往需要重新训练,涉及大量调参、调优工作,成本高昂。同时,小模型依赖大规模标注数据,在数据量少的场景中模型精度不理想,导致研发效率低。
而随着数据、算力和算法的提升,大模型逐渐兴起。大模型在大规模无标注数据上学习特征和规则,相比小模型泛化能力更强。基于大模型进行应用开发时,只需利用下游特定任务的小规模标注数据进行微调,甚至不微调即可完成多个场景任务,有效降低了研发门槛,也解决了数据量少、精度低的问题。
大模型的涌现能力与关键节点
大模型最关键的突破在于具备涌现能力——当模型规模达到某个阈值时,模型对某些问题的处理性能突然呈现快速增长。正是基于这种能力,才催生了ChatGPT等划时代的应用。ChatGPT在发布后2个月内月活用户即突破1亿,成为史上增长最快的消费者应用,被英伟达CEO黄仁勋称为“AI的iPhone时刻”。
从产业格局看,在大模型领域,国内企业与美国的差距已缩小到1-3年。在全球超千亿参数大模型中,中国企业贡献了约1/3,美国贡献了约1/2;在全球大模型数量及参数量前十名的组织中,中国占4席,美国占6席。
常见问题
什么是小模型?它有什么局限?
小模型是早期针对特定应用场景需求训练的AI模型。它的主要局限是通用性差,换到另一个场景往往需要重新训练,涉及大量调参、调优工作,成本高且效率低。
大模型相比小模型的核心优势是什么?
大模型在大规模无标注数据上训练,泛化能力强。基于大模型进行应用开发,只需微调甚至不微调即可完成多个场景任务,有效降低了AI应用研发门槛,并解决了小模型在数据量少场景下精度低的问题。
当前国内AI大模型处于什么水平?
国内AI大模型与美国的差距约1-3年,在参数量上部分国内模型甚至超过海外同类产品。但在原创算法和底层技术方面仍有追赶空间,部分算力约束可通过国产GPU或ASIC替代。