随着大模型从开发阶段走向生产生活落地,AI芯片的需求结构正在发生变化:训练芯片更看重绝对计算能力,推理芯片更侧重能耗、时延与成本;现阶段大部分大模型仍处于开发阶段,训练芯片需求更大,未来随着大模型成熟并逐步应用,适用于推断的FPGA和ASIC占比有望逐步提升。 在主流AI服务器采用的CPU+XPU异构架构中,CPU负责读取、准备数据并将数据传输到XPU,GPU、FPGA、ASIC等XPU承担大规模并行计算。
训练与推理:需求重心为何转移
从机器学习流程看,训练是用大数据训练出复杂的神经网络模型,计算量非常大,因此训练芯片更注重绝对的计算能力,并要求一定的通用性,以完成各类学习任务。推断则是利用训练好的模型,用新数据推断结论,计算量相对小很多,更注重芯片的综合指标,侧重能耗、时延、成本等性能。目前应用最多的训练芯片仍是GPU;而随着各类大模型成熟并在生产生活中逐步应用,推断类AI芯片的占比可能逐步提升。
异构架构下,FPGA与ASIC的推理机会
在CPU+XPU的异构形式中,GPU通用性强、适合大规模并行计算,设计及制造工艺较成熟,是当前已量产芯片中唯一可用于AI训练的,因而占据AI芯片市场主要份额。FPGA具有开发周期短、可配置性等特点,在AI推断市场潜力巨大;ASIC根据特定需求设计,在性能、能效、成本等方面都极大超越了标准芯片,同样非常适合AI推断场景,是当前大部分AI初创公司开发的目标产品。
具体到场景,云端推断虽包含大量矩阵运算,但计算量较训练环节少,CPU、GPU、FPGA、ASIC均可参与运算;FPGA以其灵活性和可深度优化的特点,有望继GPU之后在该市场爆发,可处理用户实时计算请求以及小计量大批次的计算。边缘推断方面,FPGA是低功耗异构芯片,开发周期快、编程灵活;基于CPU的传统计算架构无法充分满足人工智能高性能并行计算的需求,需要FPGA等专属芯片,终端智能安防领域已有厂商采用FPGA方案实现AI硬件加速。
| 芯片类型 | 主要适用环节 | 关键特点(据资料) |
|---|---|---|
| GPU | 训练为主 | 通用性强,适合大规模并行计算,已量产芯片中唯一可用于AI训练 |
| FPGA | 推断 | 硬件可重构,开发周期短、效率高,适合云端与边缘推断 |
| ASIC | 推断 | 特定用途定制,高性能、低能耗,专用化程度最高 |
常见问题
FPGA和ASIC为什么更适合推理而不是训练?
训练环节计算规模庞大,涉及大量训练数据和复杂深度神经网络,更依赖绝对计算能力和通用性,目前应用最多的仍是GPU。FPGA与ASIC的优势集中在灵活性、能效、成本等综合指标上,因而更契合计算量相对较小的推断环节。
云端推断和边缘推断对芯片的要求有何不同?
云端推断计算量较训练环节少,CPU、GPU、FPGA、ASIC均可参与运算,FPGA凭借灵活性和可深度优化特点,可处理实时计算请求及小计量大批次计算。边缘推断则更看重低功耗与开发周期,FPGA作为低功耗异构芯片、编程灵活,已在终端智能安防等领域用于AI硬件加速。
ASIC目前在AI领域的渗透情况如何?
受研发成本与研发壁垒限制,ASIC目前在AI行业的渗透率依然较低。随着人工智能行业愈加成熟,蓬勃发展的下游应用将不断优化上游芯片研发成本,ASIC凭借卓越性能及低功耗,成长潜力较大。