AI芯片的训练与推理需求正在明显分化,对应的下游应用场景也各有侧重:云端训练场景以GPU为主,追求绝对计算能力与通用性;云端推理场景中FPGA凭借灵活性和实时计算能力有望爆发;边缘推断场景则更看重低功耗异构芯片,FPGA在智能安防等终端领域已实现AI硬件加速落地。三类场景对GPU、FPGA、ASIC的需求结构差异,本质上源于训练与推理对芯片核心指标的不同要求。

训练与推理:两种截然不同的芯片需求

机器学习包含训练和推断两个步骤,对芯片的要求差异显著。训练是通过大数据训练出复杂神经网络模型的过程,计算量非常大,因此训练芯片更注重绝对的计算能力,要求能处理海量数据,同时具备一定通用性以完成多样的学习任务。目前训练环节应用最多的主要是GPU,这也是唯一已量产可用于AI训练的芯片。

推断则是利用训练好的模型对新数据得出结论,计算量相对小很多,更侧重能耗、时延、成本等综合指标。因此推断场景的芯片选择更加多元,CPU、GPU、FPGA乃至ASIC均可参与运算。

云端推理:FPGA的爆发窗口

在云端数据中心业务中,FPGA以其灵活性和可深度优化的特点,有望继GPU之后在云端推理市场爆发。FPGA(现场可编程门阵列)是一种硬件可重构的芯片,用户可通过软件重新配置内部资源实现不同功能,开发周期短、效率高。它能处理用户实时计算请求以及小批量大批次的计算任务,这一特性与云端推理的工作负载高度匹配。目前探索云服务器+FPGA芯片模式的公司包括阿里云、亚马逊、微软等。

边缘推断:低功耗异构芯片的主场

边缘推断场景对终端设备的推断能力要求更高。FPGA是低功耗异构芯片,开发周期快、编程灵活,在人工智能领域的解决方案正从软件演进到软件+芯片。基于CPU的传统计算架构无法充分满足AI高性能并行计算的需求,需要FPGA等AI专属架构芯片。在终端智能安防领域,已有厂商采用FPGA方案实现AI硬件加速,是边缘推断落地的典型案例。

常见问题

为什么训练芯片主要用GPU而不用FPGA?

训练阶段涉及大量训练数据和复杂的深度神经网络,计算规模庞大,对绝对计算能力要求极高。GPU通用性强、适合大规模并行计算,且设计制造工艺成熟,是目前唯一已量产的AI训练芯片。FPGA虽然灵活,但在训练场景下更常以云服务器+FPGA的协同模式出现,而非替代GPU。

ASIC在AI推断场景中处于什么阶段?

ASIC是为特定用途定制的集成电路,在性能、能效、成本方面具备优势,非常适合AI推断场景。不过受研发成本与研发壁垒限制,目前ASIC在AI行业的渗透率依然较低,是当前大部分AI初创公司开发的目标产品。随着AI行业成熟、下游应用带动芯片研发成本优化,ASIC有望凭借卓越性能与低功耗成为AI技术的重要选择。

未来推理类AI芯片的占比会如何变化?

当前大部分大模型仍处于开发阶段,所以对训练芯片的需求更大。未来随着各类大模型逐步成熟并在生产生活中应用,推断类AI芯片的占比有望逐步提升,FPGA和ASIC在AI推断市场的应用空间也将随之打开。