人工智能自监督学习带动预训练算力需求,市场规模增长空间有多大?

自监督学习是当前大模型预训练的核心机制,其“海量数据+超大参数量”的训练模式,直接拉动AI芯片、服务器及算力服务的需求,为算力市场打开了可观的增长空间。 以 BERT 和 GPT 为代表的语言大模型,通过在大规模无标注数据上进行预训练,逐步掌握上下文语境,这一过程对算力的消耗呈指数级增长,构成了算力市场扩张的核心驱动力。

自监督学习如何驱动算力需求

自监督学习的核心逻辑,是让模型在海量语料中“自我学习”。以 NLP 大模型为例,训练时透过事先遮住一些文本片段,让 AI 模型通过自监督学习,借助海量语料库的预训练,把这些被遮住的片段以合乎逻辑的方式填上。这种训练范式彻底改变了以往依赖人工标注数据的模式,使得模型可以利用近乎无限的无标注数据。

模型参数量与训练数据量的同步增长,是算力需求攀升的根本原因。 从 2019 年的谷歌 T5 到 OpenAI GPT 系列,参数量爆炸的大模型不断涌现。模型越大,需要“阅读”的语料就越多,每一次前向传播和反向传播所需的计算量也越大,这直接转化为对 AI 训练芯片、服务器集群以及云端算力服务的强劲需求。

算力市场的增长驱动与结构

算力市场的增长,主要由两大因素叠加驱动:一是模型规模的持续扩大,二是应用端的快速普及。 自 ChatGPT 出现后,大模型引起了社会各界的广泛关注,国内百度、阿里等公司也陆续发布了自己的大模型,大模型从技术探索走向产业落地,训练和推理的算力需求被同步放大。

从市场结构看,算力需求贯穿大模型全产业链。除了上游的 AI 芯片和光模块(CPO)等硬件设施,中游的模型训练与调优同样需要巨额算力投入。对于国内企业而言,虽然大多数企业的产品还是以小模型为主,但头部厂商在大模型领域的布局,正带动整个 AI 算力基础设施的升级与扩容。

常见问题

自监督学习为什么比传统方法更“吃”算力?

因为自监督学习利用的是海量无标注数据,模型需要自行从数据中学习特征和规则,而非依赖人工标注的“标准答案”。这意味着模型必须在更大的数据集上进行更长时间的训练,计算量远超传统小模型,对算力的需求自然更高。

大模型算力需求的增长有天花板吗?

短期来看,增长天花板尚远。一方面,NLP 仍是主要发展方向,模型参数仍在膨胀;另一方面,CV 和多模态大模型受数据、算法限制,短期还难出现大的爆发,但长期看会开辟新的算力需求场景。算力需求的持续增长,主要取决于模型能力的迭代速度与应用落地的广度。

国产大模型的竞争对算力市场有何影响?

国内大模型领域的领先厂商,如百度的文心一言、腾讯的混元和华为的盘古,技术储备丰富、进展靠前。随着这些厂商在 NLP、CV、多模态及行业大模型上的持续投入,将直接带动国产 AI 芯片和算力服务市场的扩容,为整个算力产业链带来增长机遇。