什么是半监督学习?

Michael Chen | 内容策略师 | 2024 年 10 月 29 日

半监督学习是一种同时涉及标注数据集和未标注数据集的机器学习形式。顾名思义,该方法融合了监督学习和无监督学习的要素。半监督学习采用两步流程。首先,与监督学习一样,项目算法会先使用标注数据集进行初始训练。随后,算法转而使用未标注数据集继续训练。

当项目拥有大量训练数据,但其中大部分或全部均为未标注数据时,半监督学习是理想的选择。对于仅拥有未标注数据的项目,半监督学习可通过先使用人工标注的数据进行初始训练,随后转为仅使用未标注训练数据,从而使项目顺利启动并运行。采用这种方法的项目中,团队在人工标注数据时必须格外谨慎,因为这将成为项目后续工作的基础。

是否采用半监督学习通常取决于可用的数据集。在大数据时代,未标注数据的获取渠道远比标注数据更为广泛,且根据来源不同,获取成本通常更低。

尽管如此,项目有时仍可能不得不仅凭未标注数据推进。此时,团队必须权衡:是利用无监督学习的探索性特点,还是投入时间和资金对部分数据集进行标注以作为算法初始训练的手段,哪种方式更为有益。

什么是半监督学习?

半监督学习是一种介于监督学习非监督学习之间的机器学习技术。它同时利用标注数据和未标注数据来训练算法,其效果可能优于仅使用标注数据的情况。

为了判断半监督学习是否适合某个项目,团队应考虑以下问题:

  • 我们可以为此项目使用哪些数据集?
  • 这些数据集中是否有标注过的数据集?以金融数据集为例,标注可能包括交易数据,其中标签标明该交易是欺诈还是合法。
  • 如果数据集均为未标注数据,团队是否有资源对至少部分数据进行标注?
  • 项目目标通过监督学习还是无监督学习更能实现?此处需要权衡的因素包括实践和技术层面的多种因素,包括计算资源、预算、期限和预期成果。
  • 我们的标注数据集是否足以让模型学会识别(例如)欺诈交易和合法交易的模式与特征?

这些问题的答案将决定项目是否可行。一旦决定采用半监督学习,下一步就是准备两个训练数据集。第一个通常是一个较小的标注数据集,用于为项目的基础训练提供锚定。第二个训练数据集更大——通常要大得多——并且未标注。当系统处理未标注的数据集时,它会利用从标注数据集中学到的知识生成伪标签。然后,此流程会反复迭代以优化算法并提升性能。

最常见的半监督学习类型包括:

  • 自训练:在自训练中,系统首先利用标注数据集训练算法,随后在后续训练中为未标注数据集生成高置信度(概率超过 99%)的伪标签,从而使所有记录都拥有标签。随后,系统在扩展的数据集上进行训练,该数据集由原始标注训练数据与使用伪标签拼接而成的无标注数据集组成,从而能够基于比原始标注数据集更大的数据量进行训练。
  • 协同训练:在协同训练中,该过程选取一个较小的标注数据集,并从两个不同的视角(特征组)进行处理,重点关注互补且独立的信息。每个组训练一个独立的算法,然后对未标注的数据集进行预测,为每个生成的模型分类伪标签。分类器(一种预测标签的算法)生成的每个伪标签都附带一个概率分数,随后,概率分数较高的伪标签会被添加到另一个训练数据集中。

例如,一个天气预报模型可能以包含风速、气压和湿度等记录指标标签的数据集为起点,而另一个模型则使用地理位置、日期/时间以及记录的平均降水量等更广泛的数据。两个模型都会生成伪标签,当指标模型的概率分数高于通用模型时,该伪标签会应用于通用模型,反之亦然。

每种方法都会持续训练,以优化概率较低的结果区域,直至生成一个全面的最终模型。

半监督学习的优缺点

优点 缺点
成本更低。通过利用未标记数据,半监督学习减少了对大量人工数据标注的需求,从而节省时间和成本。 对标注数据质量敏感 标注数据的准确性和相关性会显著影响模型的性能,因此需要投入精力和资金来确保高质量标注。
提升模型性能。在许多情况下,与仅基于标注数据训练的模型相比,半监督学习模型可以实现更高的准确率,尤其是在标注数据稀缺时。 不适合复杂、多样化的数据集。如果底层结构过于复杂,模型可能难以在标注数据和未标注数据之间发现有意义的关联。
适用于非结构化数据 半监督学习特别适合文本、视频或音频分类等任务,因为此类任务中通常存在大量未标注数据。 透明度有限。与监督学习相比,理解半监督学习模型如何得出预测结果并验证其准确性可能更为困难。

半监督机器学习结合了使用监督学习启动项目的结构化方法,以及无监督学习的优势,例如高级异常检测,以及发掘未标注数据中隐藏模式和结构的能力。虽然并非适用于所有情况,但其固有的灵活性使其成为满足广泛项目需求和目标的可行选择。

正在努力制定 AI 战略的企业可能会发现,建立卓越中心能够帮助其迈上实现可持续成功的道路。了解其中原因,并立即获取构建卓越中心的路线图。

半监督学习常见问题解答

半监督学习通常用于哪些情况?

当项目仅拥有或主要拥有未标注数据时,半监督学习的效果最佳。在这种情况下,团队可以手动标注一部分数据,作为第一步的训练数据集,然后让模型对未标注的数据集进行探索。

半监督学习和无监督学习之间有何区别?

无监督学习允许模型探索未标注的数据集,旨在自主发现输入与输出之间的模式和关系。半监督学习采用这种方法,但在开始之前,会先利用一小部分标注数据集对算法进行训练,为项目建立基础方向。

半监督学习有哪些优缺点?

半监督学习的优点包括:

  • 它同时利用标注数据集和未标注数据集。
  • 针对大量文本、视频或音频等非结构化数据提供更强大的功能。
  • 它使用更易获取且成本更低的未标注数据集。
  • 提升模型性能,尤其是在数据有限的情况下。

半监督学习的缺点包括:

  • 手动标注训练数据集可能需要耗费时间和资金。
  • 与使用高质量标注数据集的监督学习相比,准确性和透明度可能较低。
  • 它不适用于某些类型的项目,例如具有严格准则或出于安全考虑要求高准确性标准的项目。
  • 不太适合复杂、多样的数据集。

注:为免疑义,本网页所用以下术语专指以下含义:

  1. 除Oracle隐私政策外,本网站中提及的“Oracle”专指Oracle境外公司而非甲骨文中国。
  2. 相关Cloud或云术语均指代Oracle境外公司提供的云技术或其解决方案。