2016 年,在哈佛读博士的 Yoon Kim 和导师 Sasha Rush 提出了序列级知识蒸馏,把最初用在图像识别上的这种方法用到了翻译这一语言任务上。序列级蒸馏不再学习模型每一步输出的概率分布,而是让教师模型先生成高质量译文,再让学生模型学习完整的 “原文-译文” 序列对。提出这个技术,本来是为了压缩庞大的翻译模型,提高解码速度,但它也带来一个效果:就是让蒸馏不再需要知道教师模型逐步输出的概率分布,可以只看 “最终答案” 就实现蒸馏。这就是 “硬蒸馏”,它可以黑盒进行,也就是通过调用 API,直接获得教师模型的回答即可。