什么是迁移学习?AI 如何跨领域重用知识
迁移学习是一种机器学习方法,它采用已在大型数据集上训练好的模型,并将其适应到新的但相关任务中,只需少量数据。该技术重用模型先前学习的模式,而不是从随机权重开始。
这种方法如今很重要,因为从头训练大型模型已变得昂贵。研究人员和工程师寻求重用现有成果的方式,而迁移学习提供了一条直接途径。MIT Technology Review 的研究表明,在许多领域中,适应预训练模型可同时减少计算时间和标注数据需求。
关键要点
迁移学习重用源任务的知识,以提升目标任务的性能。
ImageNet 预训练为计算机视觉模型提供了强大的初始特征,后续任务可在此基础上构建。
BERT 将同一理念应用于语言,先在海量文本上训练一次,然后微调以完成许多下游任务。
基础模型将这一模式扩展到文本、图像、音频和代码。
当新任务差异较大时,领域不匹配和灾难性遗忘仍是限制。
准备好探索个人工具如何应用这些理念了吗?访问 remio。
迁移学习定义
迁移学习在一个任务上训练模型,存储学习到的参数,然后将这些参数用作第二个任务的起点。源任务通常拥有丰富数据。目标任务往往数据少得多。
三个核心属性将迁移学习与标准训练区分开来。首先,源任务和目标任务共享某些结构,例如视觉特征或语言模式。其次,模型保留大部分早期参数而非重置它们。第三,由于模型已掌握有用表示,该过程在目标领域需要的标注示例更少。
迁移学习的工作原理
该过程遵循四个主要阶段。每个阶段都建立在前一阶段之上,将知识从源领域转移到目标领域。
阶段 1:源任务预训练
大型模型在广泛数据集(如视觉领域的 ImageNet 或语言领域的文本语料库)上训练。目标是学习在许多示例中出现的通用特征。此阶段消耗最多计算资源。
阶段 2:特征提取
预训练后,模型拥有可检测边缘、纹理或词语关系的层。这些层会被固定或轻微更新。提取的特征用作目标任务的输入。
阶段 3:微调
较小的头部或少数顶层在目标数据集上接收更新。学习率保持较低,以避免破坏有用的源知识。该过程通常比从头训练收敛快得多。
阶段 4:评估与调整
适应后的模型在留出的目标数据上运行。如果性能滞后,工程师可能会解冻更多层或添加领域特定数据。2019 年发表在 Nature Machine Intelligence 上的一篇论文表明,当任务差异过大时,仔细选择层可防止负迁移。
真实应用
计算机视觉团队使用迁移学习,在 ImageNet 权重基础上标注医学图像。预训练模型已能识别形状和纹理,因此医学数据集只需数百个示例,而非数万个。
自然语言处理团队在法律或金融文本上微调 BERT。该模型从原始训练中携带通用语言理解,然后用少量额外数据学习领域词汇。
语音识别系统将训练于英语播客的模型适应新口音或语言。早期习得的声学特征减少了新场景所需的转录音频时长。
机器人研究人员跨不同机器人本体转移视觉导航技能。感知层保持相似,而控制层适应新硬件。
迁移学习的实践应用 - remio 如何应用它
在个人知识工具中,remio 对迁移学习采取务实立场。该系统将用户数据本地存储,并在回答新查询时重用跨会议、文件和浏览历史观察到的模式。这种重用与视觉模型在 ImageNet 上训练后识别新物体的原理相同。
remio 将存储的表示保留在设备上,而非发送到中央服务器。当用户提出后续问题时,模型会适应早期上下文而非重新开始。该方法同时降低了延迟和重复标注个人事件的需求。
有关 remio 如何管理存储上下文的更多信息,请参阅主页。
关于 transfer learning AI explained 的常见问题
Q: 迁移学习与微调相同吗?
A: 迁移学习描述重用预训练模型的整体策略。微调是该策略中模型在目标任务上接收更新的特定步骤。
Q: 迁移学习是否总能改善结果?
A: 不是。当源任务和目标任务差异很大时,性能可能下降。这种负迁移出现在在自然照片上学习的视觉特征损害显微图像准确性时。
Q: 目标任务仍需要多少数据?
A: 数量因情况而异,但大多数报告案例成功时,标注数据比从头训练少 10 到 100 倍。确切数字取决于任务相似度和模型大小。
Q: 迁移学习能否与小型模型一起工作?
A: 可以。在 ImageNet 或类似数据集上预训练的较小模型仍能提供有用特征。增益小于大型模型,但该方法在边缘设备上仍实用。
Q: 当新领域随时间漂移时会发生什么?
A: 模型可能遭受灾难性遗忘。定期重放旧示例或逐步解冻层有助于在融入新模式的同时保持早期性能。



