结构化与非结构化数据类型

Michael Chen | 内容策略师 | 2022 年 4 月 1 日

了解结构化与非结构化数据类型的区别

结构化与非结构化数据的区别是什么,以及为什么您应了解这一点?对于许多企业和组织来说,他们可能认为只有负责处理大数据的 IT 部门才需要明白这种区别。

虽然这有一定道理,但理解其中的区别对每个人来说都有价值,因为一旦掌握了结构化数据和非结构化数据的定义(包括数据存储位置以及数据处理方式),您就能了解应如何利用这些知识来改进各种数据驱动的流程。

销售、营销、运营、人力资源,所有这些部门都会产生数据。即使是最小的小型企业,比如一家拥有实体库存和本地客户群的实体店,也会通过电子邮件、信用卡交易、库存采购和社交媒体等渠道产生结构化和非结构化数据。要充分利用您的业务产生的数据,关键在于理解两者的区别以及它们如何协同工作。

什么是结构化数据?

结构化数据是指采用预定义的预期格式的数据。这些数据可以来自许多不同来源,但共同点是字段固定,存储方式同样固定(因此称为“结构化”)。这种预定义的数据模型便于数据的录入、查询和分析。

例如,试想一下在线订单的交易数据。在这类数据中,每条记录都包含时间戳、购买金额、关联账户信息(或访客账户)、所购商品、支付信息和确认编号。由于每个字段都有明确的用途,因此可以轻松地手动查询这些数据(相当于在 Excel 电子表格中按 CTRL+F)。机器学习算法也可以很容易地识别相应模式,而且在许多情况下,能够识别出这些模式之外的异常。

结构化数据可以深入查看既定且预期的要素。时间戳将采用定义的格式;时间戳不会(也无法)以文字描述的方式传输,因为这超出了相应结构的范围。预定义格式可以简化扩展和处理,即使最终是在人工层面进行处理。

只要数据来源定义了结构,结构化数据就可以用于任何用途。业务中最常见的用途包括 CRM 表单、在线交易、股票数据、企业网络监控数据和网站表单。

什么是非结构化数据?

正如结构化数据天生具有定义一样,非结构化数据则缺乏定义。非结构化数据没有预设格式的预定义字段,而是以各种形式和大小存在。虽然通常为文本形式(如表单中的自由文本字段),但非结构化数据可以以多种形式作为对象存储:图像、音频、视频、文档文件和其他文件格式。所有非结构化数据的共同点是缺乏定义。

非结构化数据更为普遍(详见下文),并且字段可能没有类似于结构化数据的字符或空间限制。考虑到构成非结构化数据的格式范围之广,这种类型的数据通常约占组织数据的 80%,也就不足为奇了。

媒体文件是一种非结构化数据。像播客这样的内容,其内容没有结构。默认情况下,搜索播客的 MP3 文件并不容易;文件名、时间戳和手动分配的标签等元数据可能有助于搜索,但音频文件本身在未经进一步分析或建立关系之前缺乏上下文信息。

视频文件也是如此。如今,视频资源无处不在,从社交媒体上的短视频片段到展示完整网络研讨会或讨论的大文件。与播客 MP3 文件一样,此类数据除元数据外,内容本身缺乏具体细节。我们根本无法根据数据库中视频文件的实际内容来搜索特定的视频文件。

结构化与非结构化数据如何协同工作?

在当今数据驱动的商业环境中,同时使用结构化和非结构化数据是获取洞察的理想途径。让我们回到某企业社交媒体帖子的例子,特别是那些带有某种媒体附件的帖子。组织该如何深入了解营销互动?

首先,使用结构化数据按最高互动量对社交媒体帖子进行排序,然后过滤掉与营销无关的话题标签(例如,移除带有客户服务相关话题标签的高互动帖子)。接下来,可以研究相关的非结构化数据,即实际的社交媒体帖子内容,查看消息传送、媒体类型、语气以及其他可能揭示帖子为何产生互动的元素。

这听起来可能涉及大量手动操作,几年前确实如此。然而,机器学习人工智能的进步正在推动各个级别的自动化。例如,在通过自然语言处理音频文件,生成语音转文字输出后,可以对文本进行关键词模式或正面/负面信息分析。借助尖端工具,这些洞察可以更快地获得,而由于大数据不断增长且其中大部分为非结构化数据,这些工具正变得越来越重要。

数据的来源与去向

如今,数据是在许多不同的来源生成的。让我们来了解一家拥有标准电子商务设置的中型公司。在这个例子中,数据可能来自以下领域:

  • 交易数据
  • 客户账户数据
  • 库存采购
  • 物流跟踪
  • 社交媒体互动
  • 内部人力资源数据
  • 搜索引擎关键字抓取

数据的来源还可以更多。事实上,如今任何公司采集的数据量都是十分惊人的。即便不是大企业,也难以从这场大数据革命种脱身。但如何处理这些数据才是能否利用它们的关键。在许多情况下,最佳解决方案是数据湖

数据湖是可接收结构化和非结构化数据的存储库。将多个数据输入整合到单一来源的能力,使数据湖成为各种大数据基础设施的重要组成部分。当数据进入数据湖时,所有固有的结构都会被剥离,从而生成易于扩展且高度灵活的原始数据。在读取和处理数据时,再根据需要赋予其结构和模式,从而在数据量和效率之间取得平衡。

探索 Oracle Big Data

Oracle Big Data 基于 Oracle Cloud,可加速原始数据的管理和处理。从块存储到数据湖,Oracle 提供灵活的解决方案,既可处理结构化数据,也可处理非结构化数据。

注:为免疑义,本网页所用以下术语专指以下含义:

  1. 除Oracle隐私政策外,本网站中提及的“Oracle”专指Oracle境外公司而非甲骨文中国。
  2. 相关Cloud或云术语均指代Oracle境外公司提供的云技术或其解决方案。