大模型在达到涌现阈值(约1.0e+23 FLOPs)后,模型性能出现阶跃式提升,直接推高了训练与推理的算力需求。当前人工智能产业链的供需缺口主要受制于GPU芯片产能数据中心电力容量两大瓶颈。根据行业趋势判断,供需矛盾有望在2025-2026年随着芯片产能释放与电力规划调整而逐步缓解,但完全平衡仍需更长时间。

算力需求:涌现阈值带来的阶跃

大模型具备涌现能力——当模型规模达到某个计算量阈值时,其对特定任务的性能会突然快速增长。根据公开研究数据,当训练计算量达到1.0e+23 FLOPs时,模型准确率可从50%左右跃升至63%。这种性能跃迁直接刺激了各厂商对更大规模模型的追逐,进而引发对GPU等算力硬件的爆发式需求。

供给瓶颈:芯片与电力的双重制约

当前算力供给面临两大核心瓶颈:

GPU芯片产能紧张:高端AI训练芯片的封装产能(如CoWoS)长期供不应求,交货周期持续拉长。虽然官方未公布具体交货周期与租赁价格数据,但业界普遍反映GPU供应处于“一卡难求”状态。

数据中心电力容量受限:电力供给已成为新建数据中心的关键制约。例如,爱尔兰和新加坡曾因电力容量不足而暂停新数据中心项目审批。随着AI训练集群功耗持续攀升,电力瓶颈的影响范围正在扩大。

缓解路径:产能释放与效率提升

供需缺口的缓解主要依赖两个方向:

芯片产能扩张:台积电等厂商正积极扩充CoWoS等先进封装产能,新产线预计在2025-2026年陆续投产,届时GPU供给紧张状况有望明显改善。

算力效率优化:光模块中的CPO(共封装光学)技术是实现高速率、大带宽、低功耗网络的关键路径,有助于降低单次计算的能耗,间接缓解电力压力。

常见问题

涌现阈值具体是多少,对算力需求有何影响?

涌现阈值约为1.0e+23 FLOPs。当模型训练达到这一计算量后,性能会从50%左右突增至63%,这种阶跃式提升促使厂商竞相追求更大规模模型,导致算力需求呈指数级增长。

电力瓶颈为什么成为新制约因素?

AI训练集群功耗极高,单个数据中心的电力需求可达数百兆瓦。爱尔兰和新加坡已因电网容量不足而限制新数据中心建设,这标志着电力供给已成为与芯片产能并列的硬约束。

供需缺口何时能缓解?

随着台积电等厂商的先进封装产能于2025-2026年陆续释放,GPU供给紧张状况有望明显改善。同时,CPO等低功耗技术也将缓解电力压力,但完全实现供需平衡仍需更长时间。

延伸阅读