Continual Learning via Self-Probe Gradients
cs.LG, cs.AI
Submitted: 2026-09-26
Updated: 2026-09-26
Code: https://github.com/umamicode/cplus-continual
Terminology
Sources
- Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone
- Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection
- Language Models are Few-Shot Learners
- Rebalancing Batch Normalization for Exemplar-based Class-Incremental Learning
- Efficient Lifelong Learning with A-GEM
- Forget Forgetting: Continual Learning in a World of Abundant Memory
- Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge
- Orthogonal Gradient Descent for Continual Learning
- Measuring Massive Multitask Language Understanding
- Distilling the Knowledge in a Neural Network
- Mitigating Catastrophic Forgetting in Large Language Models with Self-Synthesized Rehearsal
- What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams
- Continual Learning on Noisy Data Streams via Self-Purified Replay
- Overcoming catastrophic forgetting in neural networks
- Optimal Continual Learning has Perfect Memory and is NP-hard
- Replaying pre-training data improves fine-tuning
- Continual evaluation for lifelong learning: Identifying the stability gap
- Forgetting in Language Models: Capacity, Optimization, and Self-Generated Replay
- iCaRL: Incremental Classifier and Representation Learning
- Self-generated Replay Memories for Continual Neural Machine Translation
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks