top of page

什么是迁移学习?利用 AI 实现新任务的更快学习

迁移学习是一种机器学习方法,其中在某一任务上训练的模型将其学到的模式重用于一个新的相关任务。该方法减少了第二个任务所需的标注数据量和计算时间。如今,许多计算机视觉和语言系统都依赖于这种重用。

使用迁移学习的模型从第一次训练运行中捕获的广泛模式开始。这些模式随后指导第二个任务的性能,而无需从随机权重开始。

关键要点

  • 迁移学习重用在大规模源任务上学到的模式,以提高在较小目标任务上的速度和准确性。

  • 当源任务和目标任务共享相似的低级特征时,该方法效果最佳,例如图像中的边缘或文本中的语法。

  • 团队可以仅微调最终层或适应整个网络,具体取决于数据大小和计算预算。

  • 当任务差异太大或源数据包含会延续的偏差时,就会出现局限性。

  • 准备好看看这种方法如何适应知识工具了吗?请查看下载页面以获取本地优先选项。

迁移学习定义

迁移学习采用在大规模源数据集上训练的模型,并将其内部表示适应于新的目标数据集。源数据集通常是公开且规模庞大的,而目标数据集则较小且特定于任务。其核心假设是源领域中发现的有用特征在目标领域中仍然相关。

该实践由三个属性定义。首先,源任务和目标任务必须共享某种结构;否则重用会增加噪声而非信号。其次,训练分两个阶段进行:先在源任务上预训练,然后在目标任务上进行适应。第三,适应的范围可以从冻结早期层到更新每个权重,具体由可用的目标数据量控制。

迁移学习的工作原理

该过程遵循清晰的阶段序列。每个阶段都建立在前一个阶段的输出之上。

阶段 1:在大规模源领域上进行预训练

模型在广泛的数据集上训练多个周期。在视觉任务中,数据集可能包含数百万张标注照片。在语言任务中,数据集可能包含来自网络文本的数十亿个词元。早期层学习通用特征,例如边缘、纹理或常见的词语共现。这些特征成为可重用的构建块。

阶段 2:在目标领域上进行特征提取或微调

预训练权重加载到新的训练运行中。有两种常见选择。特征提取会冻结除最终分类器之外的所有层,并仅在目标数据上训练该头部。微调则以较小的学习率更新部分或全部层,以便模型调整表示而不覆盖有用的源知识。

阶段 3:评估与迭代

在留出的目标验证集上的性能决定成功与否。如果准确率停滞,实践者可能会添加更多目标示例、调整哪些层保持冻结,或更改学习率计划。该循环重复进行,直到结果达到项目阈值。

真实世界应用

计算机视觉团队将迁移学习应用于医学成像。在日常照片上预训练的模型只需看到几百张标注扫描即可检测 X 光中的肿瘤。源特征中的边缘和形状可直接迁移到医学领域。

自然语言团队对文档分类使用相同模式。在一般网络文本上预训练的模型在接触几千个标注协议后即可在法律合同审查上达到高准确率。预训练期间学到的语法和语义模式减少了对数百万法律示例的需求。

机器人研究人员将模拟中训练的运动策略迁移到物理机器人。源任务使用物理引擎进行无限次试验。目标任务使用几小时的真实世界传感器数据将策略适应硬件噪声。

迁移学习的实践 - remio 如何应用相关思想

在知识工具中,remio 采取了不同的方法,将所有捕获的上下文保留在用户设备上。当新信息到达时,系统将其与现有记忆混合,而不是从头重新训练共享模型。这种本地混合体现了重用原则,而无需将数据发送到外部训练运行。

https://www.remio.ai/knowledge-blending

关于迁移学习的常见问题

Q: 迁移学习是否要求源任务和目标任务完全相同?

A: 不。任务只需共享有用的低级特征。当重叠较小时,性能增益会缩小或消失。

Q: 通常需要多少目标数据?

A: 当源模型较强时,数百到几千个标注示例通常就足够了。确切数量取决于任务相似度和模型大小。

Q: 源数据集中的偏差会影响目标结果吗?

A: 是的。预训练期间存在的偏差可能会出现在下游预测中。检查源数据组成并监控目标指标以发现差异影响仍然是必要的。

Q: 迁移学习仅限于深度神经网络吗?

A: 该术语最常描述神经网络,但重用先前知识的基本思想也出现在其他方法中,例如经典机器学习中的领域自适应。

Q: 当源分布和目标分布差异很大时会发生什么?

A: 可能发生负迁移。目标任务的准确率会低于从头训练的模型。及早检测分布偏移有助于避免这种情况。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page