Hear the World in Stereo: Learning Dynamic Spatial Correspondence for Immersive Joint Video-Audio Generation
cs.CV
Submitted: 2026-09-30
Updated: 2026-10-08
Project page: https://vivocameraresearch.github.io/Stereo-Bind-Project
Terminology
Sources
- AVControl: Efficient Framework for Training Audio-Visual Controls
- DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation
- LTX-2: Efficient Joint Audio-Visual Foundation Model
- SonoWorld: From One Image to a 3D Audio-Visual Scene
- Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation
- FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips
- Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
- Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks
- Seedance 2.0: Advancing Video Generation for World Complexity
- MOVA: Towards Scalable and Synchronized Video-Audio Generation
- Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound
- AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
- Qwen3-Omni Technical Report
- Qwen3 Technical Report
- BAT: Learning to Reason about Spatial Sounds with Large Language Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models