GPT-4的多模态能力已在实测中展现显著领先优势,它能够识别图像中的幽默元素(如将VGA接口插入现代手机充电口的荒谬场景),也能解答复杂的物理考题。当前全球AI大模型竞争格局中,OpenAI凭借GPT-4的多模态能力处于先发位置,而谷歌、Meta等海外巨头以及国内的百度、腾讯、华为正在加速追赶。
GPT-4多模态实测表现
GPT-4支持图像和文本输入并生成文本输出。在公开实测中,它成功识别出一张图片中给手机充电的是VGA连接器,并理解其中的幽默——将过时的大连接器插入小型现代智能手机充电口的荒谬。此外,GPT-4还能解答包含图表和公式的物理考试题目,展现其在文档、图表、屏幕截图等多领域输入上的优秀能力。
全球大模型竞争格局
海外主要玩家
- OpenAI:GPT-4是目前多模态领域的标杆产品,支持文本-图像的多模态融合。
- 谷歌:拥有ViT系列CV大模型和T5 NLP大模型,在多模态领域也有布局。
- Meta:发布了SAM模型,可识别图像和视频中的物体,完成计算机视觉底层技术突破。
国产大模型进展
国内在大模型领域技术储备丰富、进展靠前的厂商主要包括百度文心一言、腾讯混元和华为盘古。其中,百度文心一言在国内进展最快,已开放公测网页,其水平大致相当于GPT-2.5,落后OpenAI约三年多。腾讯混元大模型于2019年底立项,21年已得到自营业务支持。华为盘古大模型已在智慧文旅、金融、交通、电力等行业实现落地应用。
常见问题
GPT-4的多模态能力具体指什么?
GPT-4能够接受图像和文本输入,并生成文本输出。它可以处理包含文本和照片的文档、图表、屏幕截图等多种输入形式,并在这些领域都有优秀表现。
国产大模型与GPT-4的差距有多大?
目前国内大模型整体落后OpenAI约1-3年。以百度文心一言为例,官方口径将其水平描述为约相当于GPT-2.5。未来重点在于能否像GPT系列一样实现快速迭代。
哪些国产厂商在大模型领域进展较快?
百度(文心一言)、腾讯(混元)和华为(盘古)是技术储备丰富、进展靠前的三家厂商。腾讯在NLP和CV大模型方面优势明显,百度有望在多模态领域突破,华为则在行业应用领域做得较深。