VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation
cs.CV
Submitted: 2026-08-19
Updated: 2026-09-26
Code: https://github.com/ShareLab-SII/VA-Judger
Terminology
Sources
- LTX-2: Efficient Joint Audio-Visual Foundation Model
- VABench: A Comprehensive Benchmark for Audio-Video Generation
- Kling-Omni Technical Report
- Preference Score Distillation: Leveraging 2D Rewards to Align Text-to-3D Generation with Human Preference
- Flow-GRPO: Training Flow Matching Models via Online RL
- JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization
- JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
- Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
- OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning
- Video Diffusion Alignment via Reward Gradients
- SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness
- Qwen3.5-Omni Technical Report
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Speed by Simplicity: A Single-Stream Architecture for Fast Audio-Video Generative Foundation Model
- MOVA: Towards Scalable and Synchronized Video-Audio Generation
- Seedance 2.0: Advancing Video Generation for World Complexity
- Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound
- MotionFollower: Editing Video Motion via Lightweight Score-Guided Diffusion
- StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation
- StableAnimator++: Overcoming Pose Misalignment and Face Distortion for Human Image Animation
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models