人工智能的发展并非线性推进,而是由几个关键节点串联而成。从1956年“人工智能”概念首次提出,到2006年深度学习理论突破带动第三次浪潮加速,再到ChatGPT在60日内月活破亿、成为史上增长最快的消费者应用,行业完成了从小模型到大模型的范式切换。 在此过程中,大模型展现出“涌现能力”——当模型规模达到某个阈值时,对某些问题的处理性能会突然呈现快速增长。中国企业在大模型阶段明显追赶,百度文心大模型的参数量达到2600亿,超过了ChatGPT的1750亿,但中国原创模型仍相对匮乏,对算法的见解有待提升。
三个关键拐点
概念奠基(1956年)。 “人工智能”概念首次被提出,此后行业历经60余年、三次浪潮,曲折起伏。按技术阶段划分,人工智能可分为运算智能、感知智能、认知智能和意识智能,目前正处于认知智能阶段,终极探索目标是机器的意识智能。
理论突破(2006年)。 深度学习理论的突破,带动了人工智能第三次浪潮的加速进展。这一阶段前期,AI模型多为针对特定场景训练的小模型,通用性差、换场景需重新训练,且依赖大规模标注数据,导致研发成本高、效率低。
大模型兴起。 过去5年,随着数据、算力和算法的提升,AI技术从小模型走向大模型。大模型在大规模无标注数据上训练,泛化能力强,通过微调或不经微调即可完成多个场景任务,有效降低了应用研发门槛。正是基于涌现能力,才有了ChatGPT这类现象级应用的出现。
小模型与大模型的差异
| 维度 | 小模型 | 大模型 |
|---|---|---|
| 训练数据 | 需大规模标注数据 | 大规模无标注数据 |
| 通用性 | 差,换场景需重新训练 | 强,可微调或直接迁移 |
| 研发门槛 | 成本高、效率低 | 有效降低应用研发门槛 |
中国企业的追赶与短板
从产品模式看,ChatGPT属于生成式人工智能技术(AIGC),其并非简单分析已有数据,而是在学习归纳后进行模仿式、缝合式创作,生成全新内容。国内百度、阿里、商汤等企业也陆续发布了自己的人工智能大模型。
在数量上,根据国内OpenBMB开源社区统计,全球超千亿参数大模型中,中国企业或机构贡献了1/3,美国贡献了1/2;在拥有大模型数量及参数量前十名的组织中,中美分别占据4席和6席。但具体到技术层面,美国优势更大,原因并非中国缺乏大数据和参数量,而是原创模型匮乏、对算法的见解有待提升,加之部分高端GPU出口受限,一定程度上影响了模型训练速度。
常见问题
大模型的“涌现能力”指什么?
指当模型规模达到某个阈值时,模型对某些问题的处理性能突然呈现快速增长。资料中的多组曲线均显示,在规模跨过特定量级后,准确率等指标出现明显跃升,而非平滑上升。
百度文心大模型的参数量是多少?
百度文心大模型的参数量为2600亿,超过了ChatGPT的1750亿。不过参数量领先并不等同于综合技术能力领先,中国在原创模型和算法见解上仍有提升空间。
为什么说ChatGPT是“AI的iPhone时刻”?
ChatGPT发布后5天注册用户超100万,60日后月活破亿,成为史上增长最快的消费者应用,引发全社会广泛关注,英伟达CEO黄仁勋据此断言“我们正处在AI的iPhone时刻”。