从技术路线看,NLP大模型成熟度最高、落地最快,而CV大模型受数据和算法限制短期难爆发,多模态模型则依赖更强的算力与数据融合能力。国产厂商中,百度文心一言、腾讯混元、华为盘古被业内视为技术储备最靠前的三家,但各自壁垒侧重不同:百度强在多模态与搜索数据入口,腾讯在NLP和CV细分上积累较深,华为则在行业理解与B端落地生态上更具优势。

三类大模型的技术壁垒差异

AI大模型主要分为NLP(自然语言处理)、CV(计算机视觉)和多模态三类,技术成熟度和壁垒来源各不相同。

NLP大模型是目前的主要发展方向。 自BERT和GPT路线出现后,模型通过自监督学习和海量语料预训练,逐步掌握上下文语境与语言生成能力。这条路线技术相对成熟,ChatGPT背后的GPT-3就属于NLP大模型,国产厂商也主要在此发力。

CV大模型的壁垒反而更高。 官方资料指出,CV领域可用于训练的有效数据比NLP少,学习方法仍需突破,且不同视觉应用依赖不同模型,难以建立通用视觉模型,加上图像尺寸增大带来的计算量问题,CV大模型短期还很难出现大的爆发

多模态模型是当前热门方向。 以GPT-4为代表,支持图像和文本输入并生成文本输出,能理解包含文本和照片的文档、图表或屏幕截图。这类模型的技术壁垒在于跨模态的数据对齐与融合能力。

国产大模型三强的路径分野

从整体格局看,国内多数AI企业仍以小模型为主,为细分领域提供智能解决方案,商业模式已较成熟。而在大模型层面,百度文心一言、腾讯混元、华为盘古是进展靠前的三家。

厂商布局特点生态优势
百度文心一言NLP、CV、多模态均有布局To C数据入口,多模态数据覆盖场景更多
腾讯混元NLP、CV、多模态均有布局To C数据入口,在NLP和CV子分类中预期发展更好
华为盘古三类大模型外还有科学计算大模型行业理解深,盘古大模型已在多个行业落地应用

百度的文心一言在国内进展最快,已开放网页公测。 从实际使用体验看,其水平大致相当于GPT-2.5,关键看后续能否像GPT一样实现快速迭代。腾讯混元大模型立项较早,已获得自营业务支持,但对外发布较少。华为盘古大模型在行业落地场景较多,NLP已应用于智慧文旅和金融领域,CV应用于交通巡检和电力设备缺陷识别等场景。

数据入口决定迭代速度

三家的落地思路相近,区别主要在生态。百度和腾讯作为互联网厂商,拥有To C端业务,在数据入口的样本收集方面比华为更有优势,尤其多模态模型主要依赖搜索业务提供的数据,覆盖场景更广。而华为的优势在于对行业的理解比百度和腾讯深,盘古大模型更多面向B端,在工业制造、能源交通等行业做深。

常见问题

为什么CV大模型比NLP大模型更难突破?

CV大模型面临四重限制:有效训练数据少于NLP、学习方法仍需突破、难以建立通用视觉模型、图像尺寸增大带来的计算量问题。因此官方资料判断,CV大模型短期很难出现大的爆发。

百度文心一言目前处于什么水平?

从实际使用感受来看,文心一言大致相当于GPT-2.5的水平,落后OpenAI三年多。不过百度在大模型领域进展国内最快,已开放网页公测,未来重点在于能否实现快速迭代。

腾讯和华为在大模型上的路线有何不同?

腾讯混元大模型依托To C数据入口,预计在NLP和CV的子分类中发展更好;华为盘古大模型则更依赖行业数据,在工业、能源、交通等领域做深,整体发展比较均衡。