机器学习中的微调简介

Jeffrey Erickson | 高级作家 | 2025 年 2 月 25 日

随着 AI 对企业的价值日益凸显,尤其是 AI 智能体开始承担更复杂的工作流,AI 微调将成为其中的重要一环。这些 agent 能够回答有关数据的问题,并代表我们执行操作 — 编写代码、管理日程、呈现分析洞察,等等。在此过程中,AI 模型需要协同工作,调查数据和文档存储,收集信息,复核其准确性,触发正确的操作并传达结果。所涉及的先进 AI 模型不仅要精通语言的一般模式,还需要针对具有特定术语、知识库等特征的特定领域进行优化。微调流程如何帮助 AI 模型以及未来的 AI agent 准确把握细微差别和细节?下面我们将探讨 AI 模型微调的各个方面。

什么是微调?

AI 模型微调是数据科学家和机器学习 (ML) 工程师用来调整经过训练的 ML 模型,使其在特定任务中表现更好的过程。例如,微调可用于将通用大型语言模型 (LLM) (如 Cohere 的 Command 或 Meta 的 Llama 2)调整为更擅长医疗保健场景或客户服务角色。

这些通用模型(有时也被称为“基础模型”)是在庞大且通用的数据集上进行训练的,例如几乎涵盖整个开放互联网的数据。这有助于它们学习和理解广泛的特征与模式。有些模型在语言处理方面表现出色;有些则能够识别和处理多模态数据,例如图像、视频、音频以及文本。

微调是指在这些复杂的模型基础上,利用源自特定任务或业务领域的较小数据集继续对其进行训练。这使模型能够了解该领域的分类体系、上下文,甚至专业知识。

此举的核心理念在于保留模型原始训练中积累的庞大知识,同时使其更好地理解该AI模型将要应用的领域中的细微差别和细节。例如,通用型 AI 模型可以经过微调来解读和分析医学影像;也可以对基于 LLM、已更熟悉当地方言的聊天机器人进行微调,以提升其在客户服务中的表现。在广泛领域中构建高能力 AI 智能体的竞争,往往取决于微调后的模型。以下是关于微调的方法和机制的更深入探讨

关键要点

  • AI微调是指对通用AI模型进行训练,使其在特定任务(如情感分析、语言生成、图像检测以及许多其他工作负载)中具备更丰富的上下文和知识。
  • 微调是改进 LLM 输出的几种方法之一,以满足包括 agent 在内的各类应用需求。。
  • 与从头开始训练 AI 模型相比,微调所需的训练数据集要小得多。
  • 经过微调后,AI 模型在特定领域(如医疗、制造或客户服务)中将表现得更加游刃有余且准确。

微调的优势与挑战

团队在进行 AI 微调时面临的主要挑战之一,是能否获得与其用例相关的高质量标注数据——获取或创建此类数据可能成本高昂且耗时。例如,标注数据可能意味着需要花费数小时在图像中标注出 AI 应学习识别的区域,或标注文本段落以突出显示关键信息。尽管如此,微调仍具有令人信服的优势,使其成为现代 AI 开发中的一项关键技术。让我们来看看一些优缺点。

优点

  • 与从头开始训练 AI 模型相比,可节省时间和成本:对基础模型进行微调具有多项优势,包括大幅缩短训练时间并降低计算成本,因为基础模型已经过广泛的一般性训练,适应新任务所需的时间和资源更少。此外,即使使用规模较小且针对特定任务的数据集,微调也能发挥效用,从而减少与数据收集和预处理相关的时间和成本。微调所节省的训练时间和计算需求还能降低能耗,从而减少成本。
  • 在特定任务中表现更佳:对基础模型进行微调可以提高准确率并加快收敛速度,所谓收敛是指机器学习模型的误差率趋于恒定的点,这表明在同一数据集上继续训练不会进一步提高其准确率。基础模型能够快速适应新任务的细微差别,且所需数据和训练迭代次数更少。通用知识与特定任务学习相结合,有助于模型在遇到新数据时表现出色。

缺点

  • 过拟合:在 AI 微调中,当针对新数据的训练轮次过于充分,最终覆盖了有助于模型掌握通用知识的层时,就会发生过拟合。基础模型的这种通用知识和语言灵活性,对于其在处理新数据时表现良好至关重要。发生过拟合时,模型就会开始死记硬背训练数据,而非学习能够使其泛化并处理新示例的潜在模式。
  • 成本:微调 AI 模型所需的计算资源和专业知识可能成本高昂。该过程依赖于高性能 GPU 或 TPU(张量处理单元),无论是购买还是从云服务提供商处租用,成本都可能很高。此外,聘请所需的机器学习和自然语言处理专家也可能花费不菲。
  • 时间:微调过程在多个方面都可能非常耗时。首先是数据准备时间,这可能包括数据收集、清洗、标注和格式化。微调过程启动后,微调可能需要数小时、数天甚至数周,具体取决于任务的大小和复杂性。耗时越长,计算时间成本越高。

微调的工作原理

AI 微调的工作原理是将现有模型作为起点。这些基础模型(例如 Meta 的 Llama 2 或 Cohere 的 Command)通常可从云提供商处获取。许多组织会将其他模型从托管预训练机器学习模型的集中式存储库(如 Hugging Face、TensorFlow Hub 和 PyTorch Hub)引入其数据科学平台

从预训练模型开始

选择非常适合您的任务的模型,无论是文本分类、情感分析、回答问题、撰写文章、生成代码、检测对象,还是需要 AI 或 ML 的任何其他工作。

微调 AI 模型需要三项基本要素:格式规范的数据集、合适的基底模型,以及能够提供深度学习所需神经网络和支撑训练流程的 GPU 的基础设施。这些资源通常整合在数据科学平台中,或者近年来,整合在生成式 AI 云服务中。

与技术发展的一贯规律相似,得益于开源项目和云提供商开发团队提供的新工具和基础设施服务,AI 微调流程随着时间的推移变得更加轻松。这些工具和服务正在帮助实现微调自动化,包括我们将讨论的复杂任务,例如超参数优化、模型选择和数据预处理。这让非专业人士也能更轻松地参与这一流程。

事实上,行业观察人士指出,这些工具在抽象化微调过程中繁琐的数据科学细节方面已非常出色,以至于现在最困难的部分反而是收集和格式化最佳的数据集。此外,还有面向医疗保健和金融等各个领域,以及计算机视觉、情感分析或异常检测等能力的现成数据集库。事实上,一个日益增长的趋势是,针对特定用例,直接选用已通过这些库针对该任务进行过微调的模型。在此基础上,组织可以使用规模较小的数据集进一步微调,并且可能采用检索增强生成(RAG)架构来进一步提升 AI 输出质量。

企业已经找到一种称为强化学习的技术来补充传统微调方法的途径。这使 AI 模型能够通过试错和自我改进进行学习,而不是采用单独的数据集标注和监督式微调流程。

如何通过四个步骤微调 AI 模型

1. 使用预训练模型:第一步是选择适合该任务的基础模型。自然语言处理、计算机视觉、文本生成等领域都有广受欢迎的模型。

2. 添加新数据:接下来,收集并准备特定于任务的数据集。这些数据可能包括已标注的客户评论,或模型所针对领域中的样本问答。

3. 调整:第三步是根据需要调整模型。调整可能包括冻结某些层以保留模型先前学到的知识;调整学习率(这也有助于保留模型现有的知识);以及在需要学习全新任务的地方添加层,例如用于文本分类的分类层或用于预测的回归层。

4. 训练模型:此过程涉及将新数据输入模型,并更新模型的参数。目标是在保留模型初始训练中获得的通用知识的同时,优化模型在特定任务上的性能。

微调的技术与方法

在对模型进行微调时,有多种技术可供选择。首先要决定的是,您需要全面微调还是选择性微调。

全面微调

全面微调是指在训练过程中更新基础模型的所有层和参数的过程。当您拥有庞大且多样化的数据集,能够充分更新模型参数且不存在过拟合风险时,这是一个不错的选择。

选择性微调

选择性微调是指利用较小的数据集,仅更新模型中部分层或参数的过程。这种方法有助于保留基础模型的通用知识,并降低训练周期的时间和计算成本。以下是选择性微调技术的示例。

  • 数据增强:通过应用变换,从现有数据集中生成额外的训练数据。对于图像,变换可能包括旋转、缩放、裁剪或添加噪声。当特定任务的数据集较小时,这可以提升微调性能。
  • 提前停止:此技术用于在验证集上的性能停止提升时监控并停止训练。这有助于提高效率,并有助于防止过拟合。
  • 集成方法:此方法通过组合多个微调模型,试图降低模型输出的方差。
  • 微调特定层:该技术通过仅调整深度神经网络的浅层,同时锁定或冻结深层,从而提高微调效率。
  • 超参数调优:这包括各种用于调整微调过程特征的技术,例如学习率或批量大小。
  • 层冻结:在此过程中,基础模型中负责基本和通用理解的层会被锁定。这有助于防止过拟合,即模型本质上只是记住了训练数据,而不是学习可泛化的模式来正确处理新数据。
  • 学习率调度:较低的学习率可以对基础模型的参数进行更细微、更精确的调整。该过程会随着时间推移逐步降低学习率(即步长),帮助模型在接近最优解时通过采取更小的步长,更有效地学习新内容。
  • 正则化技术:这些技术专门用于防止过拟合。
  • 迁移学习:这涉及在特定于某项任务的较小数据集上进一步训练基础模型。

微调与从头训练

在某些用例中,从头开始设计和训练 AI 模型是合理的。但是,在大多数情况下,组织可以通过微调基础模型来获得期望的结果。

在少数情况下,从头开始训练 AI 模型可能是更好的选择。例如,当您所处的领域要求非常严格时,比如涉及非常具体的图像数据的利基医疗应用。从头开始训练需要您汇集大型数据集,并在 AI 专用基础设施上进行多轮长时间的训练。这可能成本高昂,需要多达数千个 GPU 和数百万美元。这也是一项需要数据科学家和机器学习工程师专业知识的任务。

另一方面,微调 AI 模型是指采用基础模型,并使用规模较小的任务特定数据集对其进行调整,使其适用于特定任务。这一过程通常更快速、更高效,因为模型具备坚实的语言和通用知识基础,只需针对新任务的细微差异进行调整。与从头开始训练相比,这种方法不仅能提升AI模型满足您需求的性能,还能减少数据收集和预处理的工作量,并大幅缩短训练轮次。请在下方查看更多有关微调优势的信息。

微调的常见用例

从初创企业到跨国公司,各行各业的众多企业都在对预训练模型进行微调。事实上,对于任何希望使用 AI 的组织而言,这正逐渐成为一种标准做法,因为它使他们能够部署根据自身特定需求量身定制的系统,而无需投入全面模型训练所需的巨额资金。以下是一些用例示例。

真实示例

从事金融、物流、医疗保健以及众多其他领域的组织,正在将经过微调的生成式 AI 引入其日常运营。这些真实案例将帮助您探索广泛的实际应用场景。以下是三个具体示例:

  • 客户支持:一家工业安全解决方案公司实施了一款基于 AI 的工具,立即改善了其客户支持运营。该团队使用经过微调的 Cohere Command R+ LLM 来处理客户咨询并生成准确回复。
  • 医疗保健:大学研究人员正在利用 AI 更深入地分析患者数据,以帮助设计新的癌症疗法。他们正在使用云基础设施大规模托管、运行和微调大型语言模型。
  • 服务行业:巴西一家应用型 AI 公司对大型语言模型进行微调,以辅助回忆疗法,这是一种经验证的心理治疗方法,可帮助认知能力下降的患者。

微调技术的未来趋势

AI 微调正在迅速发展,尤其是随着越来越多的 AI agent 依赖于经过微调的模型。未来将带来更多自动化、新技术以及更广泛的模型选择,帮助组织根据自身需求调整 AI 模型。

这些创新包括改进的 ML 服务,可自动执行微调,涵盖超参数优化、模型选择和数据预处理。我们预计,上下文感知的数据增强技术将帮助模型更快地学习更多相关特征,而动态学习将使模型能够即时调整其学习率。此外,机器学习和基础模型开发者将持续推出更多功能多样且强大的模型,这些模型不仅能够在不同模态间进行知识迁移,还能通过微调来执行需要理解多种类型数据的任务。关键在于构建数据基础设施,使其具备足够的灵活性,以便在这些新创新到来时充分加以利用。

借助生成式 AI 解决方案增强您的 AI 模型

您是否知道 Oracle Cloud Infrastructure (OCI) 为您提供了微调机器学习和基础模型所需的一切资源?Oracle 以完全托管服务的形式,提供物理基础设施、数据处理基础设施、数据科学平台以及生成式 AI 服务。例如,OCI 的生成式 AI 服务可通过易于使用的服务,与多功能 LLM 实现简单、无缝的集成。您可以利用它对模型进行微调,以适配各种场景,包括写作辅助、文本摘要、数据分析和智能对话。

与此同时,您的数据科学家和机器学习工程师可以利用 Oracle 的数据科学平台进行协作,使用 Python 和开源工具构建、训练和部署机器学习模型。基于 JupyterLab 的环境提供了试验、开发模型以及利用 NVIDIA GPU 和分布式训练扩展模型训练所需的所有资源。借助机器学习运维能力(例如自动化管道、模型部署和模型监控)将模型投入生产环境,确保模型正常运行。

对 AI 模型进行微调只是您利用这项技术在竞争中抢占先机的一种方式。了解企业还能从中获益的更多方式。

微调常见问题解答

微调与其他类型的模型训练有何不同?

AI 模型的微调与从头开始训练 AI 模型不同。它是对成熟的基底模型进行多轮训练的过程,从而在特定任务中产生更符合上下文的输出结果。与从头构建和训练模型相比,微调通常需要更少的数据,耗时更短,成本也更低。

微调是否可用于任何类型的模型?

AI 微调可与基础模型结合使用,适用于广泛的用例,包括图像识别、文本分类、语言生成、音频输出或其他输出。

注:为免疑义,本网页所用以下术语专指以下含义:

  1. 除Oracle隐私政策外,本网站中提及的“Oracle”专指Oracle境外公司而非甲骨文中国。
  2. 相关Cloud或云术语均指代Oracle境外公司提供的云技术或其解决方案。