从BERT到GPT,人工智能自监督学习的演进主线,可以概括为从“填空式理解”到“生成式涌现”的范式转移:以BERT为代表的掩码预训练确立了“自监督学习+微调”的范式,而以GPT系列为代表的生成式模型则将规模法则(Scaling Law)推向极致,最终催生了ChatGPT这一现象级应用。关键拐点在于:Transformer架构解决了并行计算与长距离依赖问题,使自监督学习能够在海量语料上高效扩展,从而完成了从技术验证到产业爆发的跨越。
范式确立:从Word2Vec到Transformer的奠基
自监督学习的早期里程碑是词向量技术,它首次让模型能够从无标注文本中学习语义特征。然而,真正引发质变的是Transformer架构的提出,它解决了传统序列模型难以并行计算、难以捕捉长距离依赖的两大痛点,为大模型的规模化训练提供了算法基础。这一阶段的核心突破在于:将“人工标注特征”转变为“从数据中自动学习特征”,奠定了大模型“预训练+微调”的基本范式。
拐点时刻:BERT与GPT的分野
2018年以来,以BERT和GPT为代表的语言大模型,弥补了自然语言处理标注数据的缺点,促进了NLP技术的发展。这些大模型的训练,透过事先遮住一些文本片段,让AI模型通过自监督学习,通过海量语料库的预训练,逐步掌握上下文语境,把这些被遮住的片段,尽可能合乎逻辑的方式填上去。
两者虽同源于自监督学习,却走向了不同路径:
- BERT路线:强调双向上下文理解,擅长分类、判别等任务;
- GPT路线:强调单向生成与续写,通过不断扩大参数量和数据规模,展现出更强的通用能力。
从2019年的谷歌T5到OpenAI GPT系列,参数量爆炸的大模型不断涌现。GPT系列将“规模法则”确立为核心驱动力——当模型参数与数据量跨越某个临界规模后,模型会涌现出指令跟随、推理等此前小模型不具备的能力。 2022年11月底ChatGPT的出现,更是将这一技术积累转化为全民可感知的产品,引起了社会各界的广泛关注。
产业临界点:从技术验证到商业落地
自监督学习范式的成熟,也带动了国内厂商的加速布局。在国产大模型方面,技术储备丰富、进展靠前的厂商主要是百度文心一言、腾讯混元和华为盘古。这些模型的落地思路相似,区别主要在于生态:百度和腾讯拥有To C端业务,在数据入口的样本收集方面有一定优势;华为则在行业理解上更深,盘古大模型在NLP(如智慧文旅、金融)和CV(如交通巡检、电力巡检)等领域已有较多应用场景。这标志着自监督学习已从学术界的算法竞赛,演进为产业界的工程与生态竞争。
常见问题
为什么说GPT的生成式路线最终胜出?
因为生成式预训练能更充分地利用海量无标注文本数据,且随着模型规模扩大,会涌现出理解、推理等通用能力。相比之下,判别式模型在任务泛化上存在天花板。但需注意,两种路线各有适用场景,最终效果需以实际任务表现为准。
BERT和GPT的核心技术区别是什么?
BERT采用掩码语言建模,随机遮住文本片段让模型预测,擅长理解类任务;GPT采用自回归生成,逐字预测下一个词,擅长生成类任务。两者都基于自监督学习,但训练目标和模型结构不同,导致能力侧重各异。
自监督学习的产业化临界点是什么?
临界点在于“规模法则”的验证——当模型参数、训练数据与算力投入达到一定规模后,模型能力出现跃升式增长。ChatGPT的问世是这一临界点的标志性事件,它将技术能力转化为可被大众直接使用的产品,从而推动了大模型的商业化浪潮。