GPT-4多模态能力发布后,大模型竞争格局将呈现头部加速分化、追赶者多线并进、开源阵营逐步逼近的演变态势。OpenAI 凭借 GPT-4 率先落地多模态能力,在同期竞品中占据先发优势;谷歌、Anthropic 等头部厂商正加速追赶,而百度、腾讯、华为等国产厂商则依托各自生态在细分赛道寻求突破。
多模态能力成为分水岭
GPT-4 于 3 月 15 日发布,相比 ChatGPT 支持多模态,能接受图像和文本输入并生成文本输出,在一系列包含文本和照片的文档、图表或屏幕截图的输入上均有优秀表现。这一能力使其在同期竞品(如谷歌 Bard 等)中建立了显著的体验代差,也标志着大模型竞争从单一文本维度升级到多模态综合能力维度。
大模型主要分为 NLP、CV 和多模态三大类。现阶段大模型主要面向 NLP 领域,CV 因有效训练数据不足、学习方法待突破等问题,短期很难出现大的爆发;多模态当前主要聚焦文本-图像模型,是各厂商积极加大技术储备的方向。
追赶者路径与国产厂商布局
追赶者的路径主要有两条:自研多模态模型或通过合作整合视觉能力。国产厂商中,百度文心一言进展最快,已开放网页公测,其水平大致相当于 GPT-2.5,落后 OpenAI 三年左右;腾讯混元大模型已获得自营业务支持;华为盘古大模型在多个行业已有落地应用。三家的落地思路类似,区别主要在生态:百度和腾讯拥有 To C 端业务,在数据样本收集方面有优势;华为对行业理解更深,更多面向 To B 端。
开源阵营与应用层竞争
开源多模态模型(如 LLaVA 等)正在缩小与闭源模型的差距,但综合能力仍有代差。应用层方面,基于 GPT-4 API 的创业公司与自研大模型的科技巨头将形成差异化竞争——前者聚焦场景创新与交付效率,后者依托数据、算力与生态壁垒构建护城河。
常见问题
国产大模型与 GPT-4 的差距有多大?
国内大多数企业产品以小模型为主,大模型领域基本没有能达到 GPT-3 效果的厂商。百度文心一言目前大约相当于 GPT-2.5 水平,落后 OpenAI 三年多,未来重点看能否实现快速迭代。
未来 6-12 个月应关注哪些关键指标?
重点观察头部厂商多模态能力的落地进度、国产大模型的公测与迭代速度、开源模型的综合能力提升幅度,以及各厂商在垂直行业的商业化落地情况。
腾讯、百度、华为各自的优势方向是什么?
腾讯在 NLP 和 CV 大模型子分类中更具优势,百度在多模态领域有望突破(多模态主要由搜索业务提供数据,覆盖场景更多),华为则比较均衡,更多在工业制造、能源交通等行业领域做深。