人工智能从小模型到大模型的演进,核心拐点集中在三次浪潮的交替之中:2006年深度学习理论突破带动第三次浪潮加速,2020年OpenAI发布GPT-3.0后中美差距拉大,以及2022年11月ChatGPT发布后引爆全球关注。其中,大模型涌现能力(模型规模达到阈值后性能突增)是催生ChatGPT现象级应用的根本原因,标志着AI从“专用工具”走向“通用能力平台”的范式切换。
小模型时代:针对特定场景的“专用工具”
在第三次浪潮前期,AI模型普遍是针对特定应用场景需求训练的小模型。这类模型的通用性差,换到另一个应用场景往往不适用,需要重新训练,牵涉大量调参、调优的工作和成本。同时,由于训练依赖大规模标注数据,某些场景数据量少时,模型精度不理想,最终导致AI研发成本高、效率低。
大模型时代:泛化能力与涌现能力
过去5年,随着数据、算力和算法的提升,AI从小模型发展到大模型。大模型在大规模无标注数据上训练,学习特征和规则,泛化能力强——基于大模型进行应用开发,微调或不微调即可完成多个场景任务,有效降低应用研发门槛,也解决数据量少、精度低的问题。
更重要的是,大模型具备涌现能力:当模型规模达到某个阈值时,模型对某些问题的处理性能突然呈现快速增长。正是基于这种能力,才有了ChatGPT这一现象级应用。
ChatGPT拐点:从技术突破到大众引爆
2022年11月,OpenAI发布基于GPT-3.5大模型的聊天机器人程序ChatGPT,短短5天注册用户超100万,60日月活破亿,成为史上增长最快的消费者应用。英伟达CEO黄仁勋断言:“我们正处在AI的iPhone时刻!”这标志着人工智能技术即将广泛应用于生产生活,深刻影响经济社会方方面面。
常见问题
小模型和大模型的核心区别是什么?
小模型针对特定场景训练,通用性差,换场景需重新训练,调参成本高且依赖标注数据;大模型在大规模无标注数据上训练,泛化能力强,通过微调或不微调即可完成多任务,显著降低AI应用研发门槛。
什么是大模型的涌现能力?
涌现能力指当模型规模达到某个阈值时,模型对某些问题的处理性能突然呈现快速增长,而非线性提升。这种能力是小模型不具备的,也是ChatGPT能够实现现象级应用的根本技术基础。
ChatGPT的发布为何被视为行业拐点?
ChatGPT发布后5天注册用户超100万、60日月活破亿,成为史上增长最快的消费者应用,被黄仁勋称为“AI的iPhone时刻”。它让AI从专业领域走向大众,标志着人工智能技术即将广泛进入生产生活,并带动国内百度、阿里、商汤等企业陆续发布各自的大模型。