国内非结构化数据审核技术已实现较高程度的自主可控,核心技术以国产自研算法为主,对外依赖度较低。数据要素加工环节中的审核步骤,主要依赖机器与人工的双重过滤机制,其中机器审核算法不强制依赖海外开源框架,人工审核则完全由国内团队完成。

技术自主性:国产算法与自研平台

数据审核环节的机器算法主要基于国内企业自主研发的技术。以拓尔思为例,该公司专注于自然语言处理(NLP),拥有自主研发的大数据基础平台和TRS人工智能平台,具备非结构化信息智能处理能力。这些技术不依赖TensorFlow或PyTorch等海外框架即可独立运行,且在行业内处于领先地位。同时,数据标注环节的代表企业海天瑞声,也通过自研数据集结构及加工流程,实现了AI训练数据的国产化供给。

算力与硬件:国产化替代有序推进

尽管GPU等算力硬件目前仍存在一定对外依赖,但国内厂商在数据要素加工环节已具备完整的国产替代方案。数据清洗、标注、审核、融合等步骤均可通过国内平台(如百度EasyData等)实现自动化处理,且人工审核完全由国内团队执行,无需依赖海外服务。整体来看,数据要素加工环节“没有太大的技术难度”,多数数据运营商可自主完成。

常见问题

数据审核是否必须使用海外开源框架?

不需要。国内企业如拓尔思拥有自研的NLP平台和TRS文本检索系统,可独立完成非结构化数据审核,不强制依赖海外框架。

人工审核环节是否存在对外依赖?

不存在。数据审核采用机器与人工双重过滤,人工审核完全由国内团队完成,不涉及海外外包。

与海外同行相比,自主化水平如何?

国内头部企业(如海天瑞声、拓尔思)在数据标注和NLP领域已具备较强国际竞争力,技术自主化水平较高,但具体差距需以第三方实测为准。

延伸阅读