The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation
cs.MM, cs.CV
Submitted: 2026-09-02
Updated: 2026-09-18
Code: https://github.com/DAGroup-PKU/Temporal-Context-Routing
Terminology
Sources
- WhisperX: Time-Accurate Speech Transcription of Long-Form Audio
- Prompt Relay: Inference-Time Temporal Control for Multi-Event Video Generation
- LTX-2: Efficient Joint Audio-Visual Foundation Model
- Native Audio-Visual Alignment for Generation
- ShotAdapter: Text-to-Multi-Shot Video Generation with Diffusion Models
- Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation
- MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation
- Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
- Improving Joint Audio-Video Generation with Cross-Modal Context Learning
- TIE: Time Interval Encoding for Video Generation over Events
- RoFormer: Enhanced Transformer with Rotary Position Embedding
- Wan: Open and Advanced Large-Scale Video Generative Models
- Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding
- Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
- RationalRewards: Reasoning Rewards Scale Visual Generation Both Training and Test Time
- MultiShotMaster: A Controllable Multi-Shot Video Generation Framework
- KeyVID: Keyframe-Aware Video Diffusion for Audio-Synchronized Visual Animation
- Does Hearing Help Seeing? Investigating Audio-Video Joint Denoising for Video Generation
- Long Video Diffusion Generation with Segmented Cross-Attention and Content-Rich Video Data Curation
- ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
Related papers
- ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
- Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
- Mitigating GenAI-powered Evidence Pollution for Out-of-Context Multimodal Misinformation Detection
- A Rate-Distortion-Classification Approach for Lossy Image Compression