多模态数据挖掘功能下沉到数据平台后,数据要素在金融风控、智能制造、智慧医疗等数据密集型行业率先释放价值,核心路径是通过多源异构数据的融合与挖掘,将原始数据转化为可被分析和利用的数据集,从而支撑具体业务场景的决策与优化。这一过程对应数据要素产业链中“数据加工”与“数据分析”两大核心环节,前者负责提升数据可用性,后者负责将数据资源价值化。
数据加工:多源异构融合是价值释放的前提
数据要素价值的释放始于数据加工阶段,这是数据资源化的第一步。加工过程包括数据清洗、数据标注、数据审核和数据融合四个步骤。其中,数据融合是将多源、多模态数据互相融合,形成可被挖掘分析数据集的关键技术过程。目前,不同的数据管理平台已开始在平台中集成多源异构数据融合和多模态数据挖掘功能,使企业数据可以被分析和利用,充分释放数据价值。
在数据标注环节,由于人工智能技术的崛起,专门为AI训练模型提供训练数据的标注产业快速发展,这一环节具备一定技术门槛,许多数据运营商会选择外包给第三方服务商。例如,海天瑞声作为AI数据标注领域的引领者,为AI产业链提供算法模型训练所需的专业数据集,其训练数据涵盖智能语音、计算机视觉、自然语言等多个核心领域,服务于人机交互、智能家居、智能驾驶等多种创新应用场景。
数据分析:从海量数据中挖掘决策依据
数据分析是释放数据要素潜力、将数据资源价值化的过程,核心是利用工具和方法从海量和异构数据中发现规律,揭示数据背后的真相,为决策提供依据。在数据密集型行业中,这一环节直接决定了数据要素能否转化为业务价值。
以拓尔思为例,该公司专注于自然语言处理(NLP)技术,拥有自主研发的大数据基础平台和TRS人工智能平台,具备数据获取、数据检索、数据分析等全面的数据挖掘能力。经过多年行业积累,公司形成了可运营的大数据资源和海量数据资产,并具备日均亿级数据获取能力,这些数据资源在为政府、媒体、金融、公安、商业等多行业主体赋能。
常见问题
多源异构数据融合在数据加工中处于什么位置?
数据融合是数据加工的最后一步,主要功能是将多源、多模态的数据互相融合,形成可以被挖掘分析的数据集。它建立在数据清洗、标注和审核的基础上,是连接数据加工与数据分析的桥梁。
不同下游场景对数据融合的需求有何差异?
不同行业对多模态数据类型和融合深度的需求存在差异。例如,智能语音和计算机视觉数据更多服务于人机交互、智能驾驶等场景,而自然语言处理技术则更多应用于政府、媒体、金融等需要文本挖掘的行业。具体融合深度取决于业务场景对数据维度和精准度的要求。
数据标注产业为何在数据要素市场中增速较快?
数据标注是人工智能训练模型的基础环节,随着AI技术在各行业的渗透,对高质量训练数据的需求持续增长。该环节具备一定技术门槛,催生了专业第三方服务商,成为数据加工链条中增长较快的细分领域。