GPT-4多模态能力实测能识别图片中的幽默细节、解答含图表的物理试题,这种跨模态理解能力正在重塑大模型的技术边界,也让各国监管者面临新的治理课题。对普通投资者而言,看懂监管风向的关键,不在于追逐单一模型的技术参数,而在于理解多模态能力带来的风险维度扩展,以及合规要求如何重新划定AI应用的价值坐标。
多模态能力为何成为监管新焦点
大模型按技术路线分为NLP(自然语言处理)、CV(计算机视觉)和多模态三大类。GPT-4属于多模态模型,能接受图像和文本输入并生成文本输出,在包含文本和照片的文档、图表或屏幕截图上表现优秀。例如,它能识别出图片中给手机充电的接口是VGA,从而理解画面中的幽默;也能直接解答包含热辐射测温计原理图(bolomètre)的物理试题,并给出完整的推导过程。
这种能力意味着AI的感知与理解边界从纯文本扩展到了视觉世界,随之而来的监管挑战也相应增加:虚假信息不再局限于文字,可能以深度伪造的图片或视频形式传播;隐私边界从用户输入的文本扩展到图像中的个人信息;内容审核的难度从语义判断升级为跨模态的意图识别。监管者需要应对的,是模型在更丰富信息维度上的行为规范问题。
投资者应关注的政策信号与风险点
从产业格局看,国内大模型领域技术储备较为领先的主要是百度(文心一言)、腾讯(混元)和华为(盘古)。其中百度在多模态方向被认为具备发展潜力,这与搜索业务积累的图文数据有关;腾讯在NLP和CV子分类预期发展更好;华为则在行业应用领域布局较深。监管政策对不同应用场景的影响并不均等,投资者可从以下维度梳理风险与机会:
| 关注维度 | 可能受限的场景 | 可能受益的方向 |
|---|---|---|
| 内容安全 | 无审核机制的UGC图文生成工具 | 具备内容风控能力的B端解决方案提供商 |
| 数据合规 | 未经授权使用个人图像数据的训练方式 | 数据合规与隐私计算服务商 |
| 行业准入 | 金融、医疗等强监管行业的通用大模型 | 深耕垂直场景、满足行业标准的专用模型 |
对普通投资者而言,最需要警惕的是将“技术能力”直接等同于“商业价值”的线性思维。多模态能力强的模型,在合规成本上也更高;而能在特定行业满足监管要求、建立数据壁垒的厂商,反而可能因合规而获得更可持续的商业模式。关注政策对训练数据来源、生成内容标识、应用场景准入的具体规定,比追逐单一模型的演示效果更具参考意义。
常见问题
多模态大模型的技术成熟度如何?
相比NLP大模型,CV和多模态大模型在有效训练数据、学习方法、通用模型构建等方面仍面临挑战,短期还很难出现大的爆发。GPT-4展示了较强的图文理解能力,但整体产业仍处于早期阶段。
国产大模型在多模态领域进展如何?
国内厂商中,百度、腾讯对NLP、CV和多模态均有布局,华为还额外布局了科学计算大模型。从竞争趋势看,百度在多模态领域被认为有较大发展潜力,主要得益于搜索业务积累的多样化数据场景。
监管政策对AI投资最核心的影响是什么?
核心影响在于合规成本与准入门槛的重塑。监管趋严会提高大模型开发与运营的成本,但也可能为具备合规能力、深耕垂直行业的企业创造竞争壁垒。投资者应关注政策对具体应用场景的定义,而非泛泛的行业利好判断。