GPT-4在图像识别、考试推理等任务上的表现,代表了当前多模态大模型的领先水平。国产多模态大模型在性能上仍存在明显差距,但以百度文心一言、阿里通义等为代表的厂商正在加速追赶,自主替代的路径正在逐步清晰。
GPT-4的多模态能力基准
GPT-4支持图像和文本的混合输入,并生成文本输出。例如,它能识别出图片中一个过时的VGA接口被插在小型智能手机上的荒谬之处,也能解答物理考试中的热力学计算题。这体现了其在图像理解、逻辑推理和跨模态融合上的综合能力。
多模态模型的核心在于处理、理解和融合文本、图像、视频、音频等多种信息类型。目前文本-图像模型是热门方向,GPT-4在该领域具有标杆地位。
国产多模态大模型的进展与差距
国内在大模型领域布局的企业较多,但大多数仍以小模型为主。在大模型方面,技术储备丰富、进展靠前的厂商主要包括百度(文心一言)、腾讯(混元大模型)和华为(盘古大模型)。
- 百度文心一言:在国内进展最快,已开放网页公测。其当前水平大约相当于GPT-2.5,落后OpenAI三年多。未来重点在于能否像GPT系列一样实现快速迭代。
- 腾讯混元大模型:2019年立项,2021年已支持自营业务,但对外公开信息较少。
- 华为盘古大模型:在NLP、CV和科学计算领域均有布局,落地应用场景较多,如智慧文旅、金融、交通巡检等。
国产模型在图像理解、考试推理等维度上与GPT-4仍有差距,但百度在多模态领域有望率先突破,因其搜索业务能覆盖更多场景的数据。
常见问题
国产多模态大模型与GPT-4的差距有多大?
根据官方资料,百度文心一言当前水平大约相当于GPT-2.5,落后约三年。其他厂商如阿里通义等尚未开放公测,具体性能对比需以后续实测为准。
国产大模型在自主可控方面有哪些支撑?
国内厂商在AI芯片、框架和云服务方面均有布局。例如,百度拥有AI芯片和百度飞桨平台,华为拥有AI芯片和华为云,这些基础设施为国产大模型的自主替代提供了底层支撑。
未来哪些厂商可能在多模态领域取得突破?
官方资料指出,百度在多模态领域发展前景较好,因其搜索业务能收集更多场景数据。腾讯在NLP和CV领域优势较大,华为则更侧重行业深度应用。