GPT-4 与国内大模型在多模态能力上的差距,核心结论是:GPT-4 已支持图像与文本的多模态输入并输出文本,而国内进展靠前的百度文心一言、腾讯混元、华为盘古虽已布局,但整体技术水平大致相当于 GPT-2.5 阶段,落后约三年多。这一差距主要体现在多模态数据的积累、算法成熟度以及模型泛化能力上,而非单纯的参数规模竞争。

GPT-4 的多模态能力为何领先

GPT-4 是 OpenAI 发布的多模态大模型,它能接受图像和文本输入,并生成文本输出。在包含文本和照片的文档、图表或屏幕截图等输入上,GPT-4 均表现出较强的理解能力。例如,它能识别图片中一个过时的大连接器插入小型现代智能手机充电口的荒谬之处,也能直接解答包含复杂公式的物理考试题目。

这种能力的核心在于,多模态大模型需要同时处理文本与视觉两类信息,并理解二者之间的语义关联。相比纯 NLP 模型,多模态模型对训练数据的规模、质量以及跨模态对齐算法提出了更高要求,而 GPT-4 在这些方面建立了显著的技术壁垒。

国产大模型的追赶现状

国内大模型领域,技术储备丰富且进展靠前的厂商主要是百度、腾讯和华为。百度文心一言已开放网页公测,是国内进展最快的产品,但实际使用效果大致相当于 GPT-2.5 的水平。腾讯混元大模型在 2021 年已获得自营业务支持,但对外发布较少,公开信息有限。华为盘古大模型则更侧重行业应用,已在智慧文旅、金融、交通巡检、电力巡检等 To B 场景落地。

从布局来看,腾讯和百度对 NLP、CV 和多模态均有覆盖,华为除三类大模型外还有科学计算大模型。三家的落地思路相似,区别主要在生态:百度和腾讯拥有 To C 数据入口,在数据样本收集上有优势;华为则凭借对行业的深入理解,在 To B 领域走得更深。

差距背后的关键因素

多模态大模型的发展受制于两个核心瓶颈:一是可用于训练的有效视觉数据比 NLP 领域有明显差距,二是跨模态的学习方法仍需突破。此外,不同视觉应用依赖不同模型,建立通用视觉模型的路径尚不清晰,图像尺寸增大也带来更高的计算成本。

这些约束意味着,国产大模型与 GPT-4 的差距不仅是工程实现问题,更涉及底层算法创新和数据生态建设。百度在多模态领域被看好,因其搜索业务收集的数据覆盖场景更多;腾讯则在 NLP 和 CV 子分类中更具优势;华为则可能在特定行业领域做深做透。

常见问题

国产大模型与 GPT-4 的差距有多大?

目前国内进展最快的百度文心一言,实际效果约相当于 GPT-2.5 的水平,整体落后 OpenAI 约三年多。腾讯混元和华为盘古的公开信息较少,但均处于追赶阶段。

多模态大模型短期会爆发吗?

短期内较难出现大的爆发。CV 领域有效训练数据不足、学习方法待突破、通用视觉模型尚未建立,加上图像数据带来的高计算量,都制约着多模态模型的快速成熟。

投资角度应关注哪些方向?

可重点关注与百度、腾讯、华为三家大模型厂商有合作的 AI 上游厂商。三家未来预计会各自选择优势行业场景深耕,模型的样本数量会缩小,但精度和质量会持续提升。