CV大模型正面临有效训练数据偏少、学习方法待突破、通用视觉模型尚未建立、图像尺寸增大带来计算量膨胀四大挑战,行业短期内难以出现爆发式增长。在此背景下,竞争格局的演变将主要围绕数据积累能力与算力资源展开,具备To C数据入口或深厚行业积累的厂商更可能占据有利卡位。目前国内进展靠前的代表厂商包括百度(文心一言)、腾讯(混元)、华为(盘古),商汤科技也发布了日日新大模型;海外则以微软Swin Transformer系列、谷歌ViT系列及Meta的SAM模型为代表。
四大挑战如何重塑竞争壁垒
CV大模型的核心难点在于:其一,可用于训练的有效视觉数据规模与NLP领域存在差距;其二,学习方法本身仍需突破;其三,不同视觉应用依赖不同模型,通用视觉模型仍是未知数;其四,训练图像尺寸越来越大,即便较小模型也可能产生巨大计算量。这四项约束决定了CV大模型的门槛不仅在于算法,更在于数据储备与算力基础设施。缺乏这两项支撑的厂商,在模型迭代速度与效果上将面临明显瓶颈。
数据与生态:决定位次的关键变量
在国内主要玩家中,百度和腾讯作为互联网厂商,拥有To C端业务,在数据入口的样本收集方面具备一定优势。华为的优势则在于对行业的理解更深,盘古大模型在工业制造、能源交通等To B领域落地较深,更多依赖行业数据做深做透。从未来两三年趋势看,腾讯可能在NLP和CV大模型的子分类中发展更优,百度在多模态领域具备潜力(多模态依赖搜索业务覆盖的多样场景),华为则发展较为均衡、在细分行业深耕。这一分化本质上是数据来源结构的映射——谁掌握更适配场景的数据管道,谁就更有机会在特定赛道建立领先。
算力与合作的隐性约束
算力是CV大模型训练的基础约束条件,图像尺寸增大带来的计算量膨胀,使得算力资源直接决定模型迭代的可行性与速度。对于不具备自建超大规模算力集群的厂商,与上游AI算力厂商的合作关系将成为竞争格局中的隐性变量。投资视角下,与领先大模型厂商存在合作关系的AI上游厂商,同样值得纳入观察范围。
常见问题
大模型分哪几类?CV大模型处于什么阶段?
大模型主要分为NLP(自然语言处理)、CV(计算机视觉)和多模态三大类。目前NLP是主要发展方向,CV和多模态受数据与算法限制,短期还很难出现大的爆发,多数厂商仍处于技术储备阶段。
国内哪些厂商在CV大模型领域进展靠前?
百度、腾讯、华为三家技术储备丰富、进展较靠前,商汤科技也发布了日日新大模型。腾讯在NLP和CV子分类中被认为可能发展更好,百度在多模态领域有望突破,华为则各方向均衡、在行业应用上做深。
数据优势和算力哪个对竞争格局影响更大?
两者构成双重门槛。数据决定了模型能力的上限来源,算力决定了迭代速度与可行性。互联网厂商在C端数据入口上有优势,行业厂商在垂直数据理解上更深;而算力资源则对所有玩家构成硬性约束,与上游算力厂商的合作关系可能影响竞争位次。