计算机视觉(CV)大模型正面临有效训练数据稀缺、学习方法待突破、通用模型未建立以及图像尺寸大导致计算量高昂四大瓶颈,短期内难以出现爆发式增长。在这一背景下,中国在视觉大模型领域与全球前沿存在明显差距,但国内厂商的布局正在加速,整体处于追赶态势

全球前沿与国内格局

从全球范围看,微软的 Swin Transformer 系列、谷歌的 ViT 系列,以及 Meta 发布的 SAM 模型(可识别图像和视频中物体,完成 CV 底层技术突破)代表了当前视觉大模型的全球前沿水平。国内方面,商汤科技发布的日日新大模型是代表性成果之一,但整体而言,多数国内企业的产品仍以小模型为主,主要为特定细分领域提供智能解决方案。

在国产大模型整体布局上,百度、腾讯和华为三家技术储备丰富、进展靠前。其中,百度文心一言在国内进展最快,已开放网页公测;腾讯混元大模型在 NLP 和 CV 子分类中被认为具备发展潜力;华为盘古大模型则在工业制造、能源交通等行业领域应用较深。此外,腾讯和百度对 NLP、CV 和多模态均有布局,华为还额外拥有科学计算大模型。

瓶颈所在:数据、算法与算力

与 NLP 大模型相比,CV 大模型的发展挑战更为突出。官方资料明确指出四大瓶颈:一是可用于训练的有效数据比 NLP 领域有不少差距;二是 CV 领域的学习方法仍需突破;三是不同的视觉应用仍依赖不同模型,通用视觉模型尚未建立;四是供训练的图像尺寸越来越大,较小的模型也可能产生很大的计算量

从算力角度看,图像数据的高维特性决定了训练过程中的计算消耗巨大。尽管国内在安防、城市治理等场景积累了丰富的视觉数据,但这些数据的有效利用程度、以及算力芯片受限带来的制约,仍是影响追赶速度的关键变量。综合来看,CV 大模型短期还很难出现大的爆发,追赶全球前沿需要持续的技术积累与突破。

常见问题

中国在视觉大模型领域与全球领先水平的差距有多大?

国内大模型整体落后全球领先水平约 1-3 年,CV 大模型作为相对不成熟的细分方向,差距同样存在。不过,百度、腾讯、华为等厂商的技术储备和布局正在加速,商汤日日新等代表性模型也在持续推出。

CV 大模型的四大瓶颈具体指什么?

四大瓶颈包括:有效训练数据不足、学习方法待突破、通用视觉模型未建立、图像尺寸大导致计算量高。这些瓶颈共同制约了 CV 大模型短期内的爆发式发展,也是中国厂商追赶过程中需要逐一攻克的难题。

国内哪些厂商在 CV 大模型领域布局较为领先?

百度、腾讯和华为是国产大模型领域技术储备丰富、进展靠前的三家厂商。商汤科技发布的日日新大模型也是国内 CV 领域的代表性成果。各家在生态上各有侧重:百度和腾讯拥有 To C 端数据入口优势,华为则对行业理解更深,更多聚焦 To B 应用。

延伸阅读