MicroQonv: Reshaping Convolution Tensors for Efficient Microscaling in Training and Inference
cs.AR, cs.AI
Submitted: 2026-09-23
Updated: 2026-09-23
Code: https://github.com/ultralytics/ultralytics
Terminology
Sources
- A White Paper on Neural Network Quantization
- Microscaling Data Formats for Deep Learning
- FP4 All the Way: Fully Quantized Training of LLMs
- Pretraining Large Language Models with NVFP4
- Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models
- RT-DETRv4: Painlessly Furthering Real-Time Object Detection with Vision Foundation Models
- Probing Image Compression For Class-Incremental Learning
Related papers
- WitCert: Sound Runtime Risk Observability and Gating for KV-Cache Quantization
- Golden Ruler: A Numeric Format Catalog with Bit-Exact Conformance Vectors for FP8, BF16, MXFP4, and Microscaling Formats
- PoisonCap: Efficient Hierarchical Temporal Safety for CHERI
- Provisioning to Runtime Optimization of a 100 MW-Scale AI Cluster
- Bit-Accurate Modeling of GPU Matrix Multiply-Accumulate Units: Demystifying Numerical Discrepancy and Accuracy
- Optimizing Polynomial Multiplication and Fixed-Weight Sampling for HQC on ARM Cortex-M4