NLP大模型通过自监督学习在海量无标注语料上完成预训练,显著降低了对人工标注数据的依赖,这直接重塑了AI产业链的成本结构——数据标注环节的成本占比下降,而掌握数据入口与模型能力的厂商在上游议价中占据更主动的位置。这一技术变革的核心结果是:AI价值链的重心从“人工标注”转向“数据入口与算力底座”,大模型厂商对产业链上游的掌控力明显增强。

自监督学习如何改变成本结构

传统监督学习依赖大量人工标注数据,标注环节在AI项目成本中占相当比重。而以BERT和GPT为代表的NLP大模型,通过“遮住文本片段、让模型自行填写”的自监督学习方式,在海量语料库中预训练并掌握上下文语境,大幅减少了对人工标注的依赖。这一机制上的变化,使AI产业链上游的数据服务环节从“劳动密集”向“资源密集”转变——关键在于能否获取大规模、高质量的原始语料,而非标注人力。

议价能力向谁转移

随着参数量爆炸的大模型不断涌现,模型训练对数据量的需求持续攀升,但训练数据仍以公开语料为主。这意味着,拥有数据入口的互联网厂商在数据获取上具备天然优势

以国产大模型为例,百度、腾讯作为互联网厂商,拥有To C端业务,在数据入口的数据样本收集方面比华为更有优势;华为则在行业理解深度上占优,其盘古大模型更多面向To B端行业应用。这种生态差异直接影响了各家在产业链中的议价位置——数据入口的掌控者,在上游数据获取环节拥有更强的话语权。

与此同时,以垂直行业解决方案为主的中小AI企业(如旷视、云从等),其商业模式仍以小模型和细分领域方案为主,在大模型浪潮中,它们对数据入口的掌控力相对有限,议价地位面临重新评估。

常见问题

数据标注公司会被完全淘汰吗?

不会完全淘汰,但角色会转变。自监督学习降低了对通用标注数据的需求,但垂直行业(如金融、医疗、工业)的高质量标注数据仍有价值,尤其是华为盘古等深耕行业的模型,更依赖行业数据的积累与治理。

大模型厂商的议价权增强主要体现在哪里?

主要体现在数据获取和生态构建两个层面。拥有To C入口的厂商能低成本获取多样化语料,同时通过开放平台(如百度文心一言的公测)构建生态,吸引开发者与合作伙伴,进一步巩固其产业链核心位置。

投资者应关注哪些方向?

可重点关注与领先大模型厂商(百度、腾讯、华为)有合作的AI上游厂商,以及具备独特行业数据资源的企业——在大模型从通用走向垂直的过程中,行业数据的稀缺性将决定下一阶段的价值分配。