GPU从图形加速卡演变为AI算力核心,其浮点算力跃迁是重塑芯片行业格局的关键拐点。这一跃迁的本质,是GPU从专用图形处理器走向通用计算平台,使其应用场景从“画三角形”扩展至高性能计算、AI训练等大规模并发领域,从而奠定了英伟达在独立GPU市场的领导地位,也为国产GPU的追赶提供了清晰的历史坐标。
从图形专用到通用计算:GPU的架构革命
GPU(图形处理器)诞生于上世纪70年代图形处理需求爆发的背景之下。与CPU擅长处理单个复杂任务不同,GPU将大量小型处理器集成在一起,通过多小核并行架构来实现大规模的简单计算任务,比如同时绘制多个三角形。这种“大吞吐量”设计,使GPU天然适合对密集数据进行并行处理。
如今,GPU内核已增加到数百或数千个,功能也从图形显示扩展到高性能计算领域。GPU与CPU形成互补:CPU基于低延时设计,适合串行运算;而GPU拥有更多性能相对较弱的ALU(运算器),擅长大规模并发计算,因此被广泛应用于挖矿、AI训练等需要大规模并行计算的场景。这种从“画图”到“算数”的功能扩展,正是GPU重塑芯片行业的关键起点。
算力跃迁的时间差:从英伟达GTX 1080到国产景嘉微JM9271
GPU通用计算能力的跃迁,直观体现在浮点算力的代际追赶中。英伟达2016年发布的GTX 1080,浮点性能已达8900 GFLOPS;而景嘉微2021年发布的9系产品JM9271,浮点性能为8000 GFLOPS,性能已可对标英伟达2016年的水平,足够满足信创要求。这一时间差折射出国产GPU的追赶进程。
从产品定位看,景嘉微JM9271面向人工智能、云计算等领域,应用覆盖智能安防、语音识别等场景,主机接口采用PCIe 4.0 x 16,显存带宽达512GB/s,核心频率超1800MHz。相比之下,英伟达GTX 1080采用PCIe 3.0 x 16,显存带宽320GB/s。在渲染能力上,JM9271超128 Pixels/s,GTX 1080为111 Pixels/s。值得注意的是,景嘉微GPU底层技术全部自研,已与飞腾、龙芯、统信软件、麒麟软件等国内主要CPU和操作系统厂商完成适配,建立了先发优势。
| 对比项 | 景嘉微 JM9271 | 英伟达 GTX 1080 |
|---|---|---|
| 浮点性能 | 8000 GFLOPS | 8900 GFLOPS |
| 显存带宽 | 512GB/s | 320GB/s |
| 核心频率 | >1800MHz | >1733MHz |
| 主机接口 | PCIe 4.0 x 16 | PCIe 3.0 x 16 |
| 发布时点 | 2021年 | 2016年 |
出口管制催化:国产GPU从信创边缘走向核心
GPU的国产化紧迫性远高于CPU。不同于CPU有X86和ARM等半成品框架可供学习,GPU基本上要完全自研,且国内GPU人才远少于CPU,这使得国产替代难度更大。目前,国内独立GPU领域真正做出实物的仅有景嘉微和中船709所。
2020年是景嘉微市场推广的分水岭。GPU并非信创强制要求,早期景嘉微面临AMD的成熟且便宜产品的竞争,推广艰难。2020年下半年起,受国际因素影响,AMD无法供货,整机厂商只能选用国产GPU,而当时有成熟产品的只有景嘉微,其订单因此高速增加,基本占据了信创市场。在高端GPU芯片受到出口管制的背景下,GPU强制国产化成为大势所趋,具备先发优势的国产厂商有望成为信创2.0时代的重要受益方。
常见问题
GPU和CPU在架构上最本质的区别是什么?
CPU基于低延时设计,单核性能强,大部分晶体管用于控制电路和Cache,适合串行运算;GPU基于大吞吐量设计,控制相对简单,大部分晶体管用于各类专用电路和流水线,拥有更多小核,适合大规模并行计算。这决定了GPU在挖矿、AI训练等场景中的核心地位。
国产GPU与英伟达的差距有多大?
以景嘉微2021年发布的JM9271为例,其浮点性能为8000 GFLOPS,可对标英伟达2016年GTX 1080的8900 GFLOPS水平,技术代差在缩小,产品足够满足信创要求。但GPU需完全自研且人才储备薄弱,整体生态建设仍需时间积累。
为什么GPU国产化比CPU更紧迫?
高端GPU芯片已受到出口管制,且GPU不像CPU有X86、ARM等半成品框架可供国内企业学习,基本需要完全自研。目前国内独立GPU领域真正做出实物产品的仅有景嘉微和中船709所,成熟度较高的国产产品稀缺,这使得GPU的自主可控需求更为迫切。