Knowledge Distillation in Wide Neural Networks: Risk Bound, Data Efficiency and Imperfect Teacher
cs.LG, cs.AI, stat.ML
Submitted: 2020-10-20
Updated: 2020-10-20
Journal ref: Advances in Neural Information Processing Systems 33 (2020), pp. 20823-20833
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Extracting Information Overlap in Simultaneous OH-PLIF and PIV Fields with Neural Networks
- Generalization Error Bounds of Gradient Descent for Learning Over-parameterized Deep ReLU Networks
- Distillation $\approx$ Early Stopping? Harvesting Dark Knowledge Utilizing Anisotropic Information Retrieval For Overparameterized Neural Network
- Distilling the Knowledge in a Neural Network
- Like What You Like: Knowledge Distill via Neuron Selectivity Transfer
- Graph-based Knowledge Distillation by Multi-head Attention Network
- Self-Distillation Amplifies Regularization in Hilbert Space
- Understanding and Improving Knowledge Distillation
- Training Shallow and Thin Networks for Acceleration via Knowledge Distillation with Conditional Adversarial Networks
- Frequency Principle: Fourier Analysis Sheds Light on Deep Neural Networks
- Understanding deep learning requires rethinking generalization
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks