Procedural Core: A Compact Recurrent Initialization for Vision Transformers
cs.LG, cs.CV
Submitted: 2026-09-29
Updated: 2026-09-29
Terminology
Sources
- Seeing to Generalize: How Visual Data Corrects Binding Shortcuts
- An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
- Large Language Model for Lossless Image Compression with Visual Prompts
- IBiT: Utilizing Inductive Biases to Create a More Data Efficient Attention Mechanism
- Better Together: Leveraging Unpaired Multimodal Data for Stronger Unimodal Models
- Learning to See Before Seeing: Demystifying LLM Visual Priors from Language Pre-training
- Training Compute-Optimal Large Language Models
- Procedural Pretraining: Warming Up Language Models with Abstract Data
- Modeling rapid language learning by distilling Bayesian priors into artificial neural networks
- Teaching Pretrained Language Models to Think Deeper with Retrofitted Recurrence
- Efficient Stagewise Pretraining via Progressive Subnetworks
- Injecting structural hints: Using language models to study inductive biases in language learning
- Random Initialization Can't Catch Up: The Advantage of Language Model Transfer for Time Series Forecasting
- Scaling Smart: Accelerating Large Language Model Pre-training with Small Model Initialization
- On the Inductive Bias of Stacking Towards Improving Reasoning
- Reasoning with Latent Thoughts: On the Power of Looped Transformers
- Layer by Layer: Uncovering Hidden Representations in Language Models
- Mimetic Initialization of Self-Attention Layers
- Initializing Models with Larger Ones
- Intelligence at the Edge of Chaos
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks