AI芯片架构的演变,本质上是一条从通用走向专用、从单一走向异构的路径。早期以GPU承担训练任务为主,随着算力需求分层,主流AI服务器逐步采用CPU+XPU的异构计算架构:CPU作为基础硬件负责读取和准备数据,并将数据传输到XPU;GPU、FPGA、ASIC等XPU作为加速芯片,处理大规模并行计算。四类芯片的通用性依次降低,运算效率则逐步提高,分别对应训练与推断两类场景的不同需求。

从训练到推断:需求分层催生架构分化

机器学习包含训练和推断两个步骤,对芯片的要求并不相同。训练需要处理海量数据、训练出复杂的神经网络模型,计算量非常大,更注重绝对计算能力,同时要具备一定通用性以完成各类学习任务;推断则是利用训练好的模型对新数据得出结论,计算量相对小很多,更侧重能耗、时延、成本等综合指标。

这一差异直接决定了芯片分工。GPU通用性较强,适合大规模并行计算,加之设计与制造工艺较成熟,在已量产芯片中是唯一可用于AI训练的,因而占据AI芯片市场的主要份额。随着各类大模型逐步成熟并在生产生活中落地,推断类AI芯片的占比有望逐步提升。

FPGA与ASIC:专用化路径上的两种选择

在CPU+XPU架构中,FPGA与ASIC是除GPU外最重要的两类加速芯片,但走的是不同路线。

FPGA即现场可编程门阵列,是一种硬件可重构的芯片,用户可在使用过程中通过软件重新配置芯片内部资源以实现不同功能,因而更加灵活,并具备开发周期短、效率高的特性。在人工智能、5G通信这类迭代升级周期频繁、技术不确定性较大的领域,FPGA是较为理想的解决方案。云端数据中心业务中,FPGA以其灵活性和可深度优化的特点,有望继GPU之后在该市场爆发;在终端智能安防等领域,也有厂商采用FPGA方案实现AI硬件加速。

ASIC是为特定用途而定制的集成电路,具有高性能、低能耗特点,专用化程度最高。在AI行业之前,ASIC已在网络交换芯片等领域得到应用。受研发成本与研发壁垒限制,ASIC目前在AI行业的渗透率依然较低,但其性能与功耗特性使其在AI推断场景具备较大成长潜力。

芯片类型通用性运算效率主要适用场景
CPU最高相对最低数据读取与准备、任务调度
GPU较高较高AI训练(已量产中唯一可用于训练)
FPGA较低更高AI推断,硬件可重构
ASIC最低最高AI推断,专用定制

常见问题

FPGA为什么被认为适合AI推理?

FPGA是硬件可重构芯片,用户可通过软件重新配置内部资源实现不同功能,具备开发周期短、效率高的特性。在人工智能、5G通信这类迭代频繁、技术不确定性较大的领域,它是较为理想的解决方案。在云端数据中心,FPGA以其灵活性和可深度优化的特点,有望继GPU之后迎来市场机会。

ASIC在AI领域目前处于什么阶段?

ASIC专用化程度最高,具有高性能、低能耗特点,非常适合AI推断场景。但受研发成本与研发壁垒限制,目前在AI行业的渗透率依然较低。随着人工智能行业愈加成熟,下游应用的蓬勃发展有望不断优化上游芯片研发成本,ASIC的成长潜力较大。

CPU在异构架构中承担什么角色?

在CPU+XPU的异构架构中,CPU是处理计算任务的基础硬件,负责读取和准备数据,并将数据传输到XPU进行计算。真正承担大规模并行计算的是GPU、FPGA、ASIC等XPU加速芯片,二者分工协作,共同构成主流的AI服务器计算架构。