ChatGPT的涌现能力来自大模型规模跃迁,产业链上游谁在受益?受益最直接的是人工智能产业链上游的算力基础设施环节,尤其是AI芯片与云服务供应商。 基于GPT-3.5大模型的ChatGPT在2022年11月发布后,短短五天注册用户超100万,60日月活破亿,成为史上增长最快的消费者应用。这一现象级爆发的背后,是大模型“涌现能力”带来的算力需求非线性增长——当模型规模达到特定阈值时,处理性能突然跃升,而支撑这种跃迁的,正是上游AI芯片、云计算等基础层的持续投入。
涌现能力如何推高算力需求
大模型与过去针对特定场景训练的小模型不同,它在大规模无标注数据上训练,泛化能力强,且具备涌现能力——当模型规模达到某个阈值时,模型对某些问题的处理性能突然呈现快速增长。这种能力正是ChatGPT这类现象级AIGC应用得以诞生的基础。
然而,涌现能力也意味着算力需求的非线性攀升。从模型训练数据看,当模型参数量处于10^18到10^20量级时,多项任务准确率几乎为零;而一旦跨过10^22量级,性能指标出现跃升式增长。这意味着,追求“涌现”的临界点,需要投入远超以往的算力资源,直接拉动了产业链上游的芯片与云计算需求。
上游硬件供应商议价能力增强
人工智能产业链上游包括云计算、芯片、数据供给方等环节。其中,芯片作为基础层为AI提供算力支持,未来越来越多AI应用的落地都离不开庞大算力的支撑,这也推动算力产业链快速增长。当大模型参数规模从10^22量级继续跃升时,上游硬件供应商的议价能力随之增强——因为模型训练对高端GPU等算力资源的依赖度极高,供给端的稀缺性显著提升。
值得注意的是,部分算力约束也会通过国产GPU或ASIC替代来缓解。而在算力之外,数据供给方同样位于产业链上游,大模型训练依赖大规模标注数据,高质量数据集的积累也是模型性能的重要支撑。
最值得关注的四个环节
综合产业链结构来看,最值得关注的四个方向是上游的AI芯片和光模块,中游的大模型,以及下游的落地场景。其中,光模块属于光通信系统的核心器件,AI技术的快速发展对光通信带宽容量和传输速率提出了更高要求,CPO技术是实现高速率、大带宽、低功耗网络的必经之路。下游方面,有优质应用场景的C端企业,以及有数据积累的B端企业,有望率先受益于AI赋能带来的降本增效。
常见问题
大模型的涌现能力具体指什么?
当模型规模达到某个阈值时,模型对某些问题的处理性能突然呈现快速增长,这就是涌现能力。这意味着性能提升不是平滑的,而是在特定规模临界点出现跃升,这也是大模型与传统小模型的本质区别之一。
为什么AI芯片在产业链中如此关键?
芯片为人工智能提供算力支持,是大模型训练和运行的基础层。由于涌现能力对算力需求呈非线性增长,AI芯片的供给能力直接决定了模型训练的速度和规模上限。
国内AI产业链处于什么位置?
国内大模型与美国的差距已缩小到1-3年,在全球超千亿参数大模型中,中国企业或机构贡献了约1/3。部分高端GPU的出口限制虽影响训练速度,但可通过国产GPU或ASIC替代来缓解算力约束。