整车厂自建智算中心的核心壁垒,不在于算力数字的堆砌,而在于从芯片架构、互联通信到训练框架的全栈自研能力,以及将算力转化为自动驾驶迭代效率的工程体系。 以特斯拉Dojo的68.75FLOPS和小鹏扶摇的600PFLOPS为样本,两者分别代表了自研芯片(D1)与深度定制化算力集群两条主流路线,其间的技术分水岭集中在底层硬件设计与上层软件适配的耦合深度上。

技术路线的根本分野:自研芯片 vs 定制集群

特斯拉Dojo的路线是彻底的自研,其D1芯片从指令集到片上网络均为自主设计,目标是构建一个为神经网络训练而生的专用计算阵列。这种路线的优势在于软硬件的极致协同——训练框架可以直接针对D1的硬件特性进行底层优化,消除通用芯片的冗余开销。

小鹏扶摇则代表了另一种务实路线:基于成熟的高性能计算芯片构建大规模集群,但将自研重心放在集群的互联拓扑、液冷散热系统以及AI训练框架的深度适配层。扶摇的600PFLOPS算力并非单纯采购GPU堆叠,而是通过自研的通信调度与存储架构,让通用硬件在特定自动驾驶场景下发挥出接近定制的效率。

壁垒在哪里:不止于“造”与“买”

自建智算中心的壁垒,在硬件层面体现为芯片架构设计大规模集群互联。特斯拉要解决D1芯片在良率、功耗墙下的计算密度问题;小鹏则要攻克万卡级集群中通信延迟、数据吞吐的瓶颈——这涉及高速互联拓扑的设计与网络协议栈的调优,是典型的“硬骨头”。

在软件层面,壁垒则集中在训练框架的适配与数据管线的构建。自动驾驶训练涉及海量视频数据的预处理、标注与回放,通用深度学习框架难以直接高效运行。无论是Dojo还是扶摇,都需要自研或深度改造分布式训练框架,让数据在存储、计算、通信之间高效流转。此外,液冷散热等基础设施的工程化能力,直接决定了集群的稳定运行上限,同样是不可忽视的隐性门槛。

常见问题

特斯拉Dojo和小鹏扶摇的算力差距为什么这么大?

两者的算力口径并不完全可比。特斯拉Dojo的68.75FLOPS是其自研D1芯片阵列的特定算力指标,小鹏扶摇的600PFLOPS则是整个智算中心的综合算力规模。更重要的是,特斯拉的路线是专用芯片追求极致能效比,而小鹏的路线是用成熟芯片构建大规模集群,两者的技术哲学不同,单纯比较数字意义有限。

整车厂不自己造芯片,只采购GPU建智算中心可行吗?

可行,但会失去软硬件协同优化的空间。采购通用芯片的路线(如小鹏扶摇)虽然能快速获得算力,但需要在互联架构、训练框架等上层软件投入大量自研精力来弥补硬件通用性带来的效率损失。而自研芯片(如特斯拉D1)虽然前期投入巨大、风险高,但一旦跑通,在特定任务上的效率优势会形成长期壁垒。

自建智算中心对普通消费者有什么实际影响?

最直接的影响是自动驾驶功能的迭代速度和体验提升。拥有自建智算中心的车企,可以更高效地利用海量真实驾驶数据训练算法,从而更频繁地推送自动驾驶功能的更新。这意味着车主能更快体验到更流畅的辅助驾驶、更精准的自动泊车等本土化功能,这也是小鹏在自动倒车等场景功能上形成差异化竞争力的底层支撑。