Jeffrey Erickson | 高级作家 | 2025 年 2 月 25 日
随着 AI 对企业的价值日益凸显,尤其是 AI 智能体开始承担更复杂的工作流,AI 微调将成为其中的重要一环。这些 agent 能够回答有关数据的问题,并代表我们执行操作 — 编写代码、管理日程、呈现分析洞察,等等。在此过程中,AI 模型需要协同工作,调查数据和文档存储,收集信息,复核其准确性,触发正确的操作并传达结果。所涉及的先进 AI 模型不仅要精通语言的一般模式,还需要针对具有特定术语、知识库等特征的特定领域进行优化。微调流程如何帮助 AI 模型以及未来的 AI agent 准确把握细微差别和细节?下面我们将探讨 AI 模型微调的各个方面。
AI 模型微调是数据科学家和机器学习 (ML) 工程师用来调整经过训练的 ML 模型,使其在特定任务中表现更好的过程。例如,微调可用于将通用大型语言模型 (LLM) (如 Cohere 的 Command 或 Meta 的 Llama 2)调整为更擅长医疗保健场景或客户服务角色。
这些通用模型(有时也被称为“基础模型”)是在庞大且通用的数据集上进行训练的,例如几乎涵盖整个开放互联网的数据。这有助于它们学习和理解广泛的特征与模式。有些模型在语言处理方面表现出色;有些则能够识别和处理多模态数据,例如图像、视频、音频以及文本。
微调是指在这些复杂的模型基础上,利用源自特定任务或业务领域的较小数据集继续对其进行训练。这使模型能够了解该领域的分类体系、上下文,甚至专业知识。
此举的核心理念在于保留模型原始训练中积累的庞大知识,同时使其更好地理解该AI模型将要应用的领域中的细微差别和细节。例如,通用型 AI 模型可以经过微调来解读和分析医学影像;也可以对基于 LLM、已更熟悉当地方言的聊天机器人进行微调,以提升其在客户服务中的表现。在广泛领域中构建高能力 AI 智能体的竞争,往往取决于微调后的模型。以下是关于微调的方法和机制的更深入探讨。
关键要点
团队在进行 AI 微调时面临的主要挑战之一,是能否获得与其用例相关的高质量标注数据——获取或创建此类数据可能成本高昂且耗时。例如,标注数据可能意味着需要花费数小时在图像中标注出 AI 应学习识别的区域,或标注文本段落以突出显示关键信息。尽管如此,微调仍具有令人信服的优势,使其成为现代 AI 开发中的一项关键技术。让我们来看看一些优缺点。
AI 微调的工作原理是将现有模型作为起点。这些基础模型(例如 Meta 的 Llama 2 或 Cohere 的 Command)通常可从云提供商处获取。许多组织会将其他模型从托管预训练机器学习模型的集中式存储库(如 Hugging Face、TensorFlow Hub 和 PyTorch Hub)引入其数据科学平台。
从预训练模型开始
选择非常适合您的任务的模型,无论是文本分类、情感分析、回答问题、撰写文章、生成代码、检测对象,还是需要 AI 或 ML 的任何其他工作。
微调 AI 模型需要三项基本要素:格式规范的数据集、合适的基底模型,以及能够提供深度学习所需神经网络和支撑训练流程的 GPU 的基础设施。这些资源通常整合在数据科学平台中,或者近年来,整合在生成式 AI 云服务中。
与技术发展的一贯规律相似,得益于开源项目和云提供商开发团队提供的新工具和基础设施服务,AI 微调流程随着时间的推移变得更加轻松。这些工具和服务正在帮助实现微调自动化,包括我们将讨论的复杂任务,例如超参数优化、模型选择和数据预处理。这让非专业人士也能更轻松地参与这一流程。
事实上,行业观察人士指出,这些工具在抽象化微调过程中繁琐的数据科学细节方面已非常出色,以至于现在最困难的部分反而是收集和格式化最佳的数据集。此外,还有面向医疗保健和金融等各个领域,以及计算机视觉、情感分析或异常检测等能力的现成数据集库。事实上,一个日益增长的趋势是,针对特定用例,直接选用已通过这些库针对该任务进行过微调的模型。在此基础上,组织可以使用规模较小的数据集进一步微调,并且可能采用检索增强生成(RAG)架构来进一步提升 AI 输出质量。
企业已经找到一种称为强化学习的技术来补充传统微调方法的途径。这使 AI 模型能够通过试错和自我改进进行学习,而不是采用单独的数据集标注和监督式微调流程。
如何通过四个步骤微调 AI 模型
1. 使用预训练模型:第一步是选择适合该任务的基础模型。自然语言处理、计算机视觉、文本生成等领域都有广受欢迎的模型。
2. 添加新数据:接下来,收集并准备特定于任务的数据集。这些数据可能包括已标注的客户评论,或模型所针对领域中的样本问答。
3. 调整:第三步是根据需要调整模型。调整可能包括冻结某些层以保留模型先前学到的知识;调整学习率(这也有助于保留模型现有的知识);以及在需要学习全新任务的地方添加层,例如用于文本分类的分类层或用于预测的回归层。
4. 训练模型:此过程涉及将新数据输入模型,并更新模型的参数。目标是在保留模型初始训练中获得的通用知识的同时,优化模型在特定任务上的性能。
在对模型进行微调时,有多种技术可供选择。首先要决定的是,您需要全面微调还是选择性微调。
全面微调是指在训练过程中更新基础模型的所有层和参数的过程。当您拥有庞大且多样化的数据集,能够充分更新模型参数且不存在过拟合风险时,这是一个不错的选择。
选择性微调是指利用较小的数据集,仅更新模型中部分层或参数的过程。这种方法有助于保留基础模型的通用知识,并降低训练周期的时间和计算成本。以下是选择性微调技术的示例。
在某些用例中,从头开始设计和训练 AI 模型是合理的。但是,在大多数情况下,组织可以通过微调基础模型来获得期望的结果。
在少数情况下,从头开始训练 AI 模型可能是更好的选择。例如,当您所处的领域要求非常严格时,比如涉及非常具体的图像数据的利基医疗应用。从头开始训练需要您汇集大型数据集,并在 AI 专用基础设施上进行多轮长时间的训练。这可能成本高昂,需要多达数千个 GPU 和数百万美元。这也是一项需要数据科学家和机器学习工程师专业知识的任务。
另一方面,微调 AI 模型是指采用基础模型,并使用规模较小的任务特定数据集对其进行调整,使其适用于特定任务。这一过程通常更快速、更高效,因为模型具备坚实的语言和通用知识基础,只需针对新任务的细微差异进行调整。与从头开始训练相比,这种方法不仅能提升AI模型满足您需求的性能,还能减少数据收集和预处理的工作量,并大幅缩短训练轮次。请在下方查看更多有关微调优势的信息。
从初创企业到跨国公司,各行各业的众多企业都在对预训练模型进行微调。事实上,对于任何希望使用 AI 的组织而言,这正逐渐成为一种标准做法,因为它使他们能够部署根据自身特定需求量身定制的系统,而无需投入全面模型训练所需的巨额资金。以下是一些用例示例。
从事金融、物流、医疗保健以及众多其他领域的组织,正在将经过微调的生成式 AI 引入其日常运营。这些真实案例将帮助您探索广泛的实际应用场景。以下是三个具体示例:
AI 微调正在迅速发展,尤其是随着越来越多的 AI agent 依赖于经过微调的模型。未来将带来更多自动化、新技术以及更广泛的模型选择,帮助组织根据自身需求调整 AI 模型。
这些创新包括改进的 ML 服务,可自动执行微调,涵盖超参数优化、模型选择和数据预处理。我们预计,上下文感知的数据增强技术将帮助模型更快地学习更多相关特征,而动态学习将使模型能够即时调整其学习率。此外,机器学习和基础模型开发者将持续推出更多功能多样且强大的模型,这些模型不仅能够在不同模态间进行知识迁移,还能通过微调来执行需要理解多种类型数据的任务。关键在于构建数据基础设施,使其具备足够的灵活性,以便在这些新创新到来时充分加以利用。
您是否知道 Oracle Cloud Infrastructure (OCI) 为您提供了微调机器学习和基础模型所需的一切资源?Oracle 以完全托管服务的形式,提供物理基础设施、数据处理基础设施、数据科学平台以及生成式 AI 服务。例如,OCI 的生成式 AI 服务可通过易于使用的服务,与多功能 LLM 实现简单、无缝的集成。您可以利用它对模型进行微调,以适配各种场景,包括写作辅助、文本摘要、数据分析和智能对话。
与此同时,您的数据科学家和机器学习工程师可以利用 Oracle 的数据科学平台进行协作,使用 Python 和开源工具构建、训练和部署机器学习模型。基于 JupyterLab 的环境提供了试验、开发模型以及利用 NVIDIA GPU 和分布式训练扩展模型训练所需的所有资源。借助机器学习运维能力(例如自动化管道、模型部署和模型监控)将模型投入生产环境,确保模型正常运行。
对 AI 模型进行微调只是您利用这项技术在竞争中抢占先机的一种方式。了解企业还能从中获益的更多方式。
微调与其他类型的模型训练有何不同?
AI 模型的微调与从头开始训练 AI 模型不同。它是对成熟的基底模型进行多轮训练的过程,从而在特定任务中产生更符合上下文的输出结果。与从头构建和训练模型相比,微调通常需要更少的数据,耗时更短,成本也更低。
微调是否可用于任何类型的模型?
AI 微调可与基础模型结合使用,适用于广泛的用例,包括图像识别、文本分类、语言生成、音频输出或其他输出。
注:为免疑义,本网页所用以下术语专指以下含义: