在云端数据中心的推断场景中,FPGA(现场可编程门阵列)凭借硬件可重构这一底层特性切入:它允许用户在使用过程中通过软件重新配置芯片内部资源,从而实现不同功能,具备开发周期短、效率高的特点,能够处理用户实时计算请求以及小计量大批次的计算。其技术壁垒并不在单一芯片本身,而集中在架构灵活性向实际算力转化的工程能力上——可编程互连的时序收敛、高层次综合与 EDA 工具链的成熟度、面向推断的算子库与编译生态积累,以及先进制程与封装带来的设计难度,共同构成了从"可编程"到"可高效运行"之间的门槛。

一、为什么是 FPGA 切入云端推断

AI 芯片按功能可分为训练芯片与推断芯片两类。训练环节计算规模庞大,涉及大量训练数据和复杂的深度神经网络,目前应用最多的主要是 GPU;推断环节计算量相对较小,更加注重能耗、时延、成本等综合指标。在云端推断中,包括大量矩阵运算,CPU、GPU 可以进行运算,也可使用 FPGA 以及 ASIC。

FPGA 的核心优势来自架构层面:它是一种硬件可以重构的芯片,用户在使用的过程中,可以通过软件重新配置芯片内部的资源,来实现不同的功能。这使得它在人工智能或 5G 通信这类迭代升级周期频繁、技术不确定性较大的领域,成为较为理想的解决方案。在现阶段云端数据中心业务中,FPGA 以其灵活性和可深度优化的特点,有望继 GPU 之后在该市场爆发。

二、技术壁垒在哪里

架构灵活性本身即是双刃剑。 FPGA 以可编程互连换取通用性,但要把灵活的查找表与互连资源转化为接近专用芯片的实际效率,高度依赖后端设计与布局布线的优化能力,这构成第一道工程门槛。

EDA 工具链与编译生态是更深的护城河。 从算法模型到硬件配置的映射,需要高层次综合与成熟工具链支撑;面向推断的算子库和编译生态积累越薄,用户的迁移成本和调优难度就越高。这一层的差距不会因单颗芯片的可编程特性而自动抹平。

先进制程与封装抬高设计难度。 工艺制程直接影响芯片的功耗、性能和芯片成本,门级规模则代表产品可开发的潜力,门级规模增加意味着可开发功能更多。制程演进与封装复杂度同步上升,对设计能力提出更高要求。

从竞争格局看,全球 FPGA 市场主要由海外巨头占据,赛灵思和 Altera 的市占率分别为 52% 和 35%;国内市场同样由他们主导,国产厂商紫光国微、复旦微电和安路科技的合计市占率在 2021 年超过了 15%。在技术实力方面,国产厂商还有比较大差距:当前国产厂商先进制程集中在 28nm,落后于国际 16nm 水平;国产厂商旗舰产品处于 200K 水平,仅为 XILINX 高端产品的 25% 左右。在国产化加速推进的背景下,中国 FPGA 厂商有望快速追赶。

三、与 GPU、ASIC 的路线分工

CPU、GPU、FPGA 和 ASIC 四类 AI 芯片之间,通用性逐渐降低,运算效率逐步提高。GPU 通用性比较强,适合大规模并行计算,且设计及制造工艺较成熟,在目前已经量产的芯片中,是唯一可用于 AI 训练的,因此占据了 AI 芯片市场的主要份额。ASIC 根据特定需求设计,在性能、能效、成本等方面极大超越了标准芯片,同样非常适合 AI 推断场景,是当前大部分 AI 初创公司开发的目标产品,但受研发成本与研发壁垒限制,目前在 AI 行业的渗透率依然较低。

FPGA 的位置介于两者之间:比 ASIC 更能适应算法快速迭代,比 GPU 在特定推断任务上更具可深度优化的空间。目前大部分大模型仍处于开发阶段,对训练芯片的需求更大;未来随着各类大模型成熟并在生产生活中逐步应用,推断类 AI 芯片的占比可能逐步提升,FPGA 与 ASIC 的占比有望随之上升。

常见问题

FPGA 在云端推断中主要承担什么计算任务?

在云端数据中心业务中,FPGA 可以处理用户实时计算请求以及小计量大批次的计算。它适合推断环节中计算量相对较小、但对能耗、时延、成本等综合指标要求较高的场景。

FPGA 与 ASIC 在推断场景中如何取舍?

ASIC 专用化程度最高,在性能、能效、成本方面优势明显,但受研发成本与研发壁垒限制,目前在 AI 行业的渗透率依然较低。FPGA 则以硬件可重构、开发周期短见长,在技术不确定性较大、迭代频繁的领域更为适配,两者并非简单替代关系。

国产 FPGA 目前处于什么水平?

国内市场中,赛灵思、英特尔等海外厂商仍占主导,国产厂商已经开始崭露头角。技术层面,国产厂商先进制程集中在 28nm,落后于国际 16nm 水平;旗舰产品处于 200K 水平,仅为 XILINX 高端产品的 25% 左右。在国产化加速推进的背景下,中国 FPGA 厂商有望快速追赶。