GPT-4于3月15日发布,支持图像和文本输入并生成文本输出,将AI应用从纯文本交互拓展至图文混合任务,由此撬动企业级与消费级两大增量市场。其多模态能力带来的市场增量空间,核心体现在企业级文档处理、票据识别、报表分析等场景从人工走向AI,以及拍照问答、多模态搜索等C端新交互方式的落地,但具体市场规模数值官方尚未公布,需结合后续行业渗透数据验证。

多模态能力如何打开应用边界

GPT-4相比ChatGPT的核心跃迁在于支持多模态。官方资料显示,GPT-4能接受图像和文本输入,并生成文本输出,在一系列领域(包括包含文本和照片的文档、图表或屏幕截图)的输入上都有优秀表现。例如,它可以识别图片中给手机充电的是VGA接口并解释其中的幽默,也能直接解答包含图表、公式的考试题目。

这意味着AI应用从纯文本对话走向“看图理解+逻辑推理”的复合任务,应用边界大幅拓展。在技术分类上,目前大模型主要包括NLP、CV和多模态三类,NLP是当前主要发展方向,而多模态模型当前热门研究方向正是文本-图像模型及应用。

企业级场景:图文混合任务的AI替代

多模态能力最直接的增量来自企业服务场景。合同审阅、票据识别、报表分析等任务天然包含图片、表格与文本的混合信息,此前依赖人工处理,GPT-4的多模态能力使这类任务可以直接交给AI完成。官方资料指出,GPT-4在包含文本和照片的文档、图表或屏幕截图等输入上均有优秀表现,这为企业级应用提供了技术基础。

从增长节奏看,企业级场景的落地通常遵循“先标准化、后规模化”的路径。具备高重复度、高规则性的票据识别、表单录入等场景预计率先商业化,而涉及复杂推理的合同审阅、报表分析则需要更长的验证周期。整体而言,多模态为企业级AI应用提供了从“单点工具”走向“流程替代”的可能。

消费级场景:新交互方式打开C端市场

消费级市场方面,多模态带来了拍照问答、多模态搜索等新交互方式。用户可以直接拍摄实物、截图或文档进行提问,降低了AI使用的认知门槛,有望吸引更广泛的非专业用户群体。这类新交互方式对C端市场的渗透,将取决于产品体验的流畅度与场景覆盖的丰富度。

需要注意的是,官方资料指出,CV和多模态大模型受数据、算法限制,短期还很难出现大的爆发。这意味着消费级多模态应用的规模化落地仍需时间,早期增长可能集中在特定高频场景。

常见问题

GPT-4多模态能力对哪些行业影响最大?

企业级文档处理、教育、医疗等涉及图文混合信息的行业预计受益最直接。官方资料显示GPT-4能处理包含文本和照片的文档、图表或屏幕截图,这类能力可应用于合同审阅、票据识别、试题解答等具体场景。

多模态AI应用的市场增量何时能体现?

官方资料显示,CV和多模态大模型受数据、算法限制,短期还很难出现大的爆发。预计企业级标准化场景会先行落地,消费级应用则需要更长的培育周期,具体节奏需以行业实际渗透数据为准。

国内厂商在多模态领域的布局如何?

官方资料显示,国内大模型技术储备丰富、进展靠前的厂商主要是百度文心一言、腾讯混元和华为盘古。其中百度在多模态领域有望突破,因其搜索业务收集的数据覆盖场景更多;华为则更侧重在工业制造、能源交通等行业领域做深应用。