When Bias Meets Trainability: Connecting Theories of Initialization
cs.LG, cs.AI, stat.ML
Submitted: 2025-05-17
Updated: 2026-02-28
Code: https://github.com/abassi98/igb_and_trainability
Terminology
Sources
- An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
- Where You Place the Norm Matters: From Prejudiced to Neutral Initializations
- Dynamical Isometry and a Mean Field Theory of LSTMs and GRUs
- Adam: A Method for Stochastic Optimization
- Deep Information Propagation
- Tensor Programs II: Neural Tangent Kernel for Any Architecture
- Dynamical Mean-Field Theory of Self-Attention Neural Networks
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks