作者已在ReadPaper上回答好了论文十问,讲解PPT已上传至ReadPaper(在论文的提问区),若对论文有任何疑惑也欢迎前往提问。
Decoupled Knowledge Distillation
论文阅读和十问地址(PPT在提问区):
https://readpaper.com/paper/664394439832129536?channel=bili_kscvpr2022
知识蒸馏是一种广泛应用的模型压缩方法,但主流方法都是 feature-based的,KD 这样的 logit-based 方法被忽视了。本文提出了一种新的视角来分析 KD。我们将 KD 的损失函数解耦为两个部分:TCKD 和 NCKD,并通过实验发现:TCKD 在传递“样本难度”相关的知识,而 NCKD 是蒸馏涨点的主要原因。更重要的是,本文发现 KD 的“耦合性”限制了1)NCKD 的有效性和2)平衡两部分损失的灵活性。为解决这两个问题我们提出了解耦知识蒸馏(DKD),相比 feature-based 的复杂方法,DKD 可以达到相同甚至更优的性能,并且拥有更高的训练效率。