多源异构数据融合技术在全球快速普及,中国在数据要素市场中已占据全球第二的规模地位,但在数据开放程度、核心技术(如数据库、融合算法)和生态成熟度方面仍存在差距。中国的优势在于数据量大、应用场景丰富,且多源异构数据融合技术已在众多数据管理平台中集成,为数据价值释放提供了基础。
数据加工与融合:中国技术现状
数据加工是数据资源化的第一步,包括数据清洗、标注、审核和融合等步骤。其中,多源异构数据融合是将多源、多模态的数据互相融合,形成可挖掘分析数据集的关键技术。目前,不同的数据管理平台已开始集成多源异构数据融合和多模态数据挖掘的功能,使企业数据可以被分析和利用,充分释放数据价值。整体来看,这些数据加工环节在中国已较为成熟,许多数据运营商可以自主进行。
中国数据要素市场的代表企业
在数据加工环节,海天瑞声是AI数据标注领域的引领者,经过多年发展,已成为具有较强国际竞争力的国内头部企业,其训练数据涵盖智能语音、计算机视觉、自然语言等多个核心领域。在数据分析环节,拓尔思是A股第一家上市的大数据技术公司,专注于自然语言处理(NLP)技术,在业内处于领先地位,拥有大数据基础平台和TRS人工智能平台,具备全面的数据挖掘能力。
常见问题
中国数据要素市场在全球的规模排名如何?
中国数据要素市场规模位列全球第二,仅次于美国,优势在于数据体量大、应用场景丰富。
中国在多源异构数据融合技术上有哪些不足?
主要差距体现在核心技术(如数据库、融合算法)和生态成熟度方面,数据开放程度也相对较低。
哪些中国公司在数据加工和分析领域具有代表性?
海天瑞声在AI数据标注领域具有较强国际竞争力;拓尔思专注NLP技术,在数据分析环节处于业内领先地位。