GPU浮点算力是AI训练的核心支撑,但比算力本身更深的壁垒,是英伟达CUDA构建的软件生态。国产GPU要实现自主可控,硬件自研与软件生态建设必须双线并行——硬件上需完全自研架构,软件上则要完成与国产CPU、操作系统的深度适配,才能进入信创整机采购体系,真正绕开CUDA的路径依赖。
硬件自研:没有“半成品框架”的硬仗
国产GPU的自主可控难度高于CPU。CPU领域尚有X86、ARM等成熟指令集架构可供参考或授权,而GPU基本上需要完全自研,加上国内GPU人才储备远少于CPU,这使得国产化进程更具挑战。
目前国内独立GPU领域真正做出实物产品的厂商屈指可数,景嘉微是其中产品成熟度较高、推出时间较早的代表。以景嘉微JM9271为例,其浮点性能官方标注为8000 GFLOPS(8 TFLOPS),已接近英伟达GTX 1080的8900 GFLOPS(8.9 TFLOPS)水平,产品性能足以满足信创应用要求。在底层技术全部自研的前提下,这一代际差距的缩小意味着国产GPU已具备基本的可用性。
生态适配:进入信创市场的“入场券”
GPU要进入信创整机采购目录,单靠硬件参数远远不够,软件生态的适配广度直接决定了产品的市场落地能力。景嘉微已与国内六大CPU厂商(飞腾、龙芯、中科海光、兆芯、申威、鲲鹏)及两大操作系统厂商(统信软件、麒麟软件)完成适配工作,建立了先发优势。
这一适配的意义在于:整机厂商在组装国产电脑时,需要GPU能与CPU、操作系统协同工作。早期国产GPU曾面临与AMD产品的直接竞争,后者产品成熟且价格低廉;而随着国际供应格局变化,整机厂商转向国产GPU时,已完成生态适配的景嘉微成为主要选择。这也印证了国产GPU绕开CUDA的关键路径——在OpenGL、OpenCL等开放标准上构建属于自己的软硬件协同体系,而非复制英伟达的封闭生态。
常见问题
国产GPU为什么不直接兼容CUDA?
CUDA是英伟达的专有封闭生态,兼容CUDA需要获得授权且面临法律与技术双重障碍。国产GPU选择在OpenGL、OpenCL等开放标准上构建生态,虽然短期内开发者迁移需要成本,但这是实现真正自主可控的唯一路径。
国产GPU与英伟达的性能差距有多大?
以景嘉微JM9271为例,其浮点性能为8 TFLOPS,对标英伟达2016年发布的GTX 1080(8.9 TFLOPS),技术代差约在数年水平。对于信创场景下的图形处理与基础计算需求,这一性能已足够满足;但在AI训练等高端计算领域,差距仍然存在,需后续产品迭代与第三方实测验证。
软件生态适配为什么比硬件参数更重要?
没有生态适配的GPU如同“裸机”——无法被整机厂商集成,也无法运行国产操作系统上的应用。景嘉微与六大CPU、两大OS的适配,意味着其产品已进入信创采购的“候选名单”,这是硬件参数之外决定市场存亡的关键一步。