Not All Tasks Quantize Equally: Fisher-Guided Quantization for Visual Geometry Transformer
cs.CV
Submitted: 2026-05-15
Updated: 2026-09-27
Code: https://github.com/ypzhng/FGQ
Terminology
Sources
- Quantized Visual Geometry Grounded Transformer
- GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers
- G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
- VGD: Visual Geometry Gaussian Splatting for Feed-Forward Surround-view Driving Reconstruction
- SpinQuant: LLM quantization with learned rotations
- DINOv2: Learning Robust Visual Features without Supervision
- Tail-Aware Post-Training Quantization for 3D Geometry Models
- FastVGGT: Training-Free Acceleration of Visual Geometry Transformer
- LiteVGGT: Boosting Vanilla VGGT via Geometry-aware Cached Token Merging
- AVGGT: Rethinking Global Attention for Accelerating VGGT
- $\pi^3$: Permutation-Equivariant Visual Geometry Learning
- FlashVGGT: Efficient and Scalable Visual Geometry Transformers with Compressed Descriptor Attention
- Fisher-aware Quantization for DETR Detectors with Critical-category Objectives
- Robo3R: Enhancing Robotic Manipulation with Accurate Feed-Forward 3D Reconstruction
- VersaQ-3D: Architecture Support for Visual Geometry Grounded Transformers via Versatile Quantization
- Stereo Magnification: Learning View Synthesis using Multiplane Images
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models