V-Co: A Closer Look at Visual Representation Alignment via Co-Denoising
cs.CV, cs.AI
Submitted: 2026-03-17
Updated: 2026-08-31
Comments: Accepted by ECCV 2026. code: https://github.com/HL-hanlin/V-Co
Code: https://github.com/HL-hanlin/V-Co
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Latent Forcing: Reordering the Diffusion Trajectory for Pixel-Space Image Generation
- Motus: A Unified Latent Action World Model
- Hyperspherical Autoencoder for High-Fidelity Image Reconstruction and Generation
- PixelFlow: Pixel-Space Generative Models with Flow
- UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation
- Adam: A Method for Stochastic Optimization
- Auto-Encoding Variational Bayes
- Back to Basics: Let Denoising Generative Models Denoise
- Fractal Generative Models
- One-step Latent-free Image Generation with Pixel Mean Flows
- DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
- PixelGen: Improving Pixel Diffusion with Perceptual Supervision
- DINOv2: Learning Robust Visual Features without Supervision
- DiP: Taming Diffusion Models in Pixel Space
- SyncMV4D: Synchronized Multi-view Joint Diffusion of Appearance and Motion for Hand-Object Interaction Synthesis
- Generative Modeling via Drifting
- TV2TV: A Unified Framework for Interleaved Language and Video Generation
- MeanFlow Transformers with Representation Autoencoders
- PixelDiT: Pixel Diffusion Transformers for Image Generation
- VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models