AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation
cs.CV, cs.SD
Submitted: 2026-09-24
Updated: 2026-09-28
Terminology
Sources
- DPOK: Reinforcement Learning for Fine-tuning Text-to-Image Diffusion Models
- LTX-2: Efficient Joint Audio-Visual Foundation Model
- GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
- Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- LongCat-Flash-Omni Technical Report
- MOVA: Towards Scalable and Synchronized Video-Audio Generation
- Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound
- UniVerse-1: Unified Audio-Video Generation via Stitching of Experts
- DanceGRPO: Unleashing GRPO on Visual Generation
- OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models