小模型换场景需重训、大模型一劳永逸式泛化,人工智能算力与数据需求的供需节奏呈现“脉冲式集中爆发”与“分散式持续消耗”并存的格局。 大模型通过“无标注数据预训练+小规模标注数据微调”的方式,将算力需求高度集中于预训练阶段,单次训练消耗巨大;而小模型因泛化能力弱,每换一个场景就需重新训练,带来分散但持续的数据与算力消耗。两种路径叠加,使人工智能的算力与数据需求从“均匀分布”转向“高峰低谷交替”的周期形态。
大模型:预训练阶段的“脉冲式”算力洪峰
大模型的核心特征是泛化能力强。所谓大模型,是在大规模的无标注数据上进行训练,学习出特征和规则,基于大模型进行应用开发时,只需利用下游特定任务上的小规模标注数据进行微调(二次训练),甚至不微调,即可完成多个应用场景的任务。
这意味着大模型的算力消耗呈现明显的**“前重后轻”**特征:
- 预训练阶段:需要在大规模无标注数据上完成基础训练,这一阶段消耗的算力极为集中,构成算力需求的“洪峰”。
- 微调阶段:仅需下游特定任务的小规模标注数据做二次训练,算力需求显著小于预训练。
同时,大模型具备涌现能力——当模型规模达到某个阈值时,模型对某些问题的处理性能会突然呈现快速增长。这种“规模越大、性能跃升”的特性,进一步驱动厂商在预训练阶段投入更大规模的算力与数据,强化了需求的脉冲性。
小模型:场景重训带来的“分散式”持续需求
与“一劳永逸”的大模型泛化路径不同,传统小模型是针对特定应用场景需求进行训练的。由于小模型通用性差,换到另一个应用场景中往往并不适用,需要重新训练,牵涉大量调参、调优的工作和成本。
这决定了小模型的算力与数据需求节奏:
- 分散性:需求分散在各类垂直场景的独立训练任务中,单次规模不大。
- 持续性:每新增一个场景就触发一次训练,形成持续不断的需求流。
- 数据瓶颈:小模型训练需要大规模标注数据,而在某些应用场景中存在数据量少、模型精度不理想的问题,导致AI研发成本高、效率低。
两种路径叠加下的供需节奏
将两类模型的需求特征叠加,可得到清晰的供需节奏图谱:
| 维度 | 大模型 | 小模型 |
|---|---|---|
| 训练方式 | 无标注预训练+小规模微调 | 针对单一场景重新训练 |
| 算力需求节奏 | 预训练阶段集中爆发 | 每次场景切换触发,分散持续 |
| 数据需求特征 | 预训练需海量无标注数据 | 每次需场景化标注数据 |
| 需求整体形态 | 脉冲式高峰 | 平缓但绵长的低峰 |
整体而言,大模型的崛起并未消除算力与数据需求,而是将需求从“均匀分散”重塑为“高峰低谷交替”:预训练阶段形成集中的算力洪峰,而大量的场景化落地仍依赖微调或小模型重训,形成持续的需求底座。对算力与数据基础设施的供给方而言,既要应对大模型预训练的峰值压力,也要满足长尾场景的弹性需求。
常见问题
大模型出现后,小模型会完全消失吗?
不会。大模型泛化能力强,但在特定垂直场景中,小模型仍有其适用空间。小模型换场景需重新训练的模式,意味着其需求是分散且持续的,与大数据模型形成互补而非替代关系。
大模型的微调阶段为什么算力需求小?
大模型微调是利用下游特定任务上的小规模标注数据进行二次训练,数据量和训练规模都远小于预训练阶段,因此算力消耗相对有限。这也是大模型能有效降低AI应用研发门槛的原因之一。
算力需求的“脉冲式”特征对供应链意味着什么?
预训练阶段的海量算力消耗与微调、小模型重训的持续需求并存,要求算力供给体系既能应对集中爆发的峰值需求,也能覆盖长尾场景的弹性调用,供需匹配的复杂度显著上升。