Exposing Blind Spots in Deep Imbalanced Regression Evaluation
cs.LG, cs.AI
Submitted: 2026-09-21
Updated: 2026-09-21
Code: https://github.com/noah-puetz/muvis-dir
License: http://creativecommons.org/licenses/by/4.0/
The gist: Deep Imbalanced Regression (DIR) addresses a common failure mode of regression models: target distributions are highly non-uniform, causing models to perform best in densely populated target regions
Terminology
Abstract
Deep Imbalanced Regression (DIR) addresses a common failure mode of regression models: target distributions are highly non-uniform, causing models to perform best in densely populated target regions even when reliable performance is required across the full target range. Despite rapid methodological progress, DIR evaluation remains constrained by three blind spots: it is dominated by image-based benchmarks, its standard many-/medium-/few-shot protocol is diagnostic but not decision-complete, and tail-region stability across random seeds has not been systematically evaluated. We revisit DIR evaluation along these three axes. First, we broaden the data domain by evaluating DIR on a multimodal virtual sensing benchmark (MuViS) with nine time-series extrinsic regression tasks across six physical domains, where rare target values often correspond to operationally meaningful regimes. Second, we adopt balanced MAE (bMAE) and introduce balanced Mean Absolute Scaled Error (bMASE), a scale-normalized metric for decision-complete comparison across methods and datasets. Third, through a repeated reevaluation of six representative DIR methods across multiple random seeds, we show that the tail regions targeted by DIR exhibit particularly high sensitivity to seed-level variability. Our results show that standard virtual-sensing models exhibit substantial tail degradation hidden by global MAE, that existing DIR methods can improve balanced performance but transfer unevenly to multimodal time-series data, and that tail-region instability remains a largely hidden failure mode under current DIR evaluation practice. Together, these findings and our publicly available code provide a reproducible basis for future DIR research toward regression systems that capture rare target regimes as reliably as common ones.
Sources
- Delving into Deep Imbalanced Regression
- Large-Scale Long-Tailed Recognition in an Open World
- Accounting for Variance in Machine Learning Benchmarks
- MuViS: Multimodal Virtual Sensing Benchmark
- Variational Imbalanced Regression: Fair Uncertainty Quantification via Probabilistic Smoothing
- Dist Loss: Enhancing Regression in Few-Shot Region through Distribution Distance Constraint
- RankSim: Ranking Similarity Regularization for Deep Imbalanced Regression
- Improving Deep Regression with Ordinal Entropy
- ConR: Contrastive Regularizer for Deep Imbalanced Regression
- Rank-N-Contrast: Learning Continuous Representations for Regression
- Improve Representation for Imbalanced Regression through Geometric Constraints
- Uncertainty Voting Ensemble for Imbalanced Deep Regression
- IM-Context: In-Context Learning for Imbalanced Regression Tasks
- MAESTRO : Adaptive Sparse Attention and Robust Learning for Multimodal Dynamic Time Series
- Monash University, UEA, UCR Time Series Extrinsic Regression Archive
- How Many Random Seeds? Statistical Power Analysis in Deep Reinforcement Learning Experiments
- Focal Loss for Dense Object Detection
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks