What Visual Generators Need from Teachers: Rethinking Representation Alignment
cs.CV
Submitted: 2026-09-28
Updated: 2026-09-28
Terminology
Sources
- Demystifying MMD GANs
- Quantifying Knowledge Distillation Using Partial Information Decomposition
- How Compositional Generalization and Creativity Improve as Diffusion Models are Trained
- Image Generators are Generalist Vision Learners
- SPARE: Structural Parameter-Free Affinity Regularization for Flow Matching
- Attention Deficits in Language Models: Causal Explanations for Procedural Hallucinations
- DiverseDiT++: Quantifying, Analyzing, and Promoting Representation Diversity in Diffusion Transformers
- Flow Matching for Generative Modeling
- Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow
- AHPA: Adaptive Hierarchical Prior Alignment for Diffusion Transformers
- Spectrum Matching: a Unified Perspective for Superior Diffusability in Latent Diffusion
- DINOv2: Learning Robust Visual Features without Supervision
- REGLUE Your Latents with Global and Local Semantics for Entangled Diffusion
- Improved Baselines with Representation Autoencoders
- Conditioning Residuals for Diffusion Models via Representation Feedback
- Beyond Point-Wise Matching: Structural Representation Alignment for Accelerating Diffusion Transformers
- A Theory of Usable Information Under Computational Constraints
- Representation Fr'echet Loss for Visual Generation
- Hidden Error Awareness in Chain-of-Thought Reasoning: The Signal Is Diagnostic, Not Causal
- Dyna-DINO: Efficient ViT Distillation Via Adaptive Representation Anchoring
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models