top of page

什么是 AI 中的知识蒸馏?训练小模型像大模型一样思考

知识蒸馏 AI 训练一个紧凑模型来复制更大模型的行为。大模型充当教师。小模型成为学生。这种方法在保持准确性的同时减少了计算需求。

公司采用它在手机、笔记本电脑和边缘设备上运行强大的模型。该方法在不从头重新训练的情况下减少了大小和延迟。

关键要点

  • 知识蒸馏通过输出匹配将知识从大型教师模型转移到较小的学生模型。

  • 该过程在保持大部分原始准确性的同时提高了设备上任务的效率。

  • 企业使用它来降低推理成本,并通过避免持续的云往返来实现隐私目标。

  • 学生模型在训练完成后可以在本地运行。

准备好探索较小模型如何提供强大结果了吗?继续阅读。

什么是知识蒸馏 AI?

知识蒸馏 AI 是一种训练方法,其中大型教师模型指导较小的学生模型。学生学习匹配教师的输出分布,而不仅仅是硬标签。

教师产生包含更丰富类别关系信息的软概率。学生最小化自身输出与这些软目标之间的差异。这种转移通常比单独训练学生产生更好的泛化效果。

该方法定义了三个主要属性。首先,它依赖于一个已经表现良好的预训练教师。其次,它使用温度参数在训练期间软化概率输出。第三,最终的学生模型在蒸馏完成后独立运行。

知识蒸馏如何工作

知识蒸馏遵循清晰的步骤序列。每一步都构建从教师到学生的能力转移。

步骤 1:教师模型准备

教师模型已在目标任务上完成训练。它在蒸馏期间保持固定。其参数不发生变化。

步骤 2:软目标生成

教师处理相同的训练数据,但温度值高于 1。更高的温度产生更软的概率分布。这些软目标揭示了教师如何对错误类别进行排序。

步骤 3:结合损失的学生训练

学生最小化结合两项的损失。一项匹配教师的软输出。另一项匹配真实硬标签。两项之间的平衡由加权超参数设定。

学生最终更小更快。它保留了大部分准确性,因为软目标携带了硬标签所缺乏的额外信息。

比较蒸馏方法

Logit matching,由 Hinton et al. 的基础工作(Distilling the Knowledge in a Neural Network)引入,直接对齐教师和学生之间软化的输出概率。基于提示的方法增加了来自隐藏层的中间特征对齐,改进了视觉任务的转移。Transformer 蒸馏,详见 Google AI 和 OpenAI 的论文,通过注意力图匹配和渐进层映射扩展了这一方法,在语言模型上实现了更好的保留。

实际应用

移动语音助手使用蒸馏模型在不将音频发送到服务器的情况下识别语音。银行在安全环境中部署蒸馏欺诈检测模型。制造商在工厂摄像头上运行蒸馏视觉模型进行质量检查。

每种情况都受益于更低的延迟和减少的数据传输。较小的模型可以放入原始教师永远无法占用的内存中。

知识蒸馏 AI 的实践

知识蒸馏支持向本地优先 AI 系统的更广泛转变。remio 在设备上存储和处理个人数据。蒸馏模型有助于在数据保持私密的同时保持检索和摘要的快速。

用户获得的响应仅来自他们自己捕获的笔记和会议。学生模型到位后无需外部模型调用。

关于知识蒸馏 AI 的常见问题

Q: 知识蒸馏在推理时是否需要原始教师模型?

A: 不需要。训练完成后仅学生模型运行。教师仅在蒸馏阶段使用。

Q: 与教师相比,学生模型会损失多少准确性?

A: 损失因任务和模型对而异。在 Hugging Face 的一项 DistilBERT 实验中(经 Google AI Blog 报道),学生保留了教师 97% 的准确性,同时实现了 40% 的大小缩减。

Q: 知识蒸馏能否跨不同模型架构工作?

A: 可以。学生无需共享教师的架构。仅输出空间必须对齐以进行损失计算。

Q: 知识蒸馏是否仅对分类任务有用?

A: 不是。当使用适当的损失函数时,相同原理适用于回归、生成和嵌入任务。

Q: 哪些硬件从蒸馏模型中受益最大?

A: 手机、平板电脑和嵌入式控制器看到最大收益,因为这些设备上的内存和功耗预算紧张。

温度参数 \(T > 1\) 在训练期间展平教师的 softmax 分布,增加软目标的熵并揭示类间相似性;在推理时,\(T=1\) 恢复原始尖锐分布。实践者通过在留出验证集上进行网格搜索来调整 \(T\),同时联合优化蒸馏损失与硬标签损失之间的加权因子 \(\alpha\)。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page