上一条:Improved Knowledge Distillation for Pre-trained Language Models via Knowledge Selection. EMNLP (Findings) 2022.
下一条:Learning Light-Weight Translation Models from Deep Transformer