国产大模型追赶GPT-3.5涌现能力,核心卡点既在算法原创性,也在高端算力受限,两者是并行的双重挑战,而非单一瓶颈。一方面,国内在模型参数量上并不落后——百度文心大模型参数量达2600亿,超过GPT-3.5的1750亿;另一方面,中国原创模型匮乏、对算法见解有待提升,同时2022年8月后美国限制部分高端GPU出口,也在一定程度上影响模型训练速度。因此,算法创新与算力自主是国产大模型必须同时攻克的两道关卡

参数规模已不落后,差距在原创算法

大模型的涌现能力,是指当模型规模达到某个阈值时,模型对某些问题的处理性能突然呈现快速增长。GPT-3.5正是基于这种能力,才催生了ChatGPT这一现象级应用。从参数规模看,国内企业已具备相当实力——百度文心大模型参数量2600亿,甚至超过了GPT-3.5的1750亿。然而,参数量并非决定能力的唯一因素。

真正的差距在于原创模型的匮乏。国内大模型在架构设计、训练方法等底层算法层面,仍以跟随和追赶为主,对算法的独到见解有待提升。这解释了为何在2020年OpenAI发布GPT-3.0之后,中美在大模型技术上的差距有所拉大。

算力受限:高端GPU出口限制的影响

算力是大模型训练的物理基础。2022年8月之后,美国限制了部分高端GPU出口中国,这在一定程度上影响了国内大模型的训练速度。不过,这一约束正在被逐步化解——部分算力约束可以通过国产GPU或ASIC替代方案来缓解。

维度现状
参数规模百度文心大模型2600亿,超过GPT-3.5的1750亿
算法原创性原创模型匮乏,处于跟随追赶态势
算力供给高端GPU出口受限,国产GPU/ASIC替代推进中

差距在缩小,但追赶仍需时间

尽管存在上述挑战,国产大模型与美国的整体差距已明显缩小。从发布时间看,同等参数量级的模型,美国仅比国内领先1-2年;在全球超千亿参数大模型中,中国企业或机构贡献了1/3,美国贡献了1/2。具体到大模型技术本身,美国优势更大一些,大概领先国内公司2-3年。

未来,随着中国公司在AI算法上持续投入、巨头积极布局,底层技术正处于跟随和追赶的态势。国产大模型的突破路径,将是算法架构创新与算力自主替代双轮驱动,依托大模型的应用落地与产业升级,释放增长潜力。

常见问题

国产大模型与GPT-3.5的差距有多大?

整体差距约1-3年,具体到大模型技术方面,美国优势更大一些,大概领先国内公司2-3年。差距主要体现在原创算法层面,而非参数规模——百度文心大模型参数量2600亿,已超过GPT-3.5的1750亿。

算力受限对国产大模型影响有多大?

2022年8月之后,美国限制部分高端GPU出口中国,在一定程度上影响了模型训练速度。但部分算力约束可通过国产GPU或ASIC替代方案缓解,并非不可逾越的壁垒。

国产大模型的突破方向是什么?

一方面在算法层面持续投入、提升原创能力;另一方面通过国产GPU和ASIC替代化解算力约束。底层技术正处于跟随和追赶的态势,未来有望依托大模型的应用落地和产业升级实现突破。

延伸阅读