Align Then Reason: A Multimodal Lip-Sync Judge for Dubbing
cs.CV
Submitted: 2026-09-30
Updated: 2026-09-30
Terminology
Sources
- MuAViC: A Multilingual Audio-Visual Corpus for Robust Speech Recognition and Robust Speech-to-Text Translation
- Qwen3-VL Technical Report
- Small RL Controller, Large Language Model: RL-Guided Adaptive Sampling for Test-Time Scaling
- The Llama 3 Herd of Models
- Mistral 7B
- Self-Rewarding Vision-Language Model via Reasoning Decomposition
- Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning
- DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification
- Reinforcing Multimodal Reasoning Against Visual Degradation
- Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction
- Parallel-Probe: Towards Efficient Parallel Thinking via 2D Probing
- LLMs Improving LLMs: Agentic Discovery for Test-Time Scaling
- Dream-RSI: Recursive Self-Improvement through Evolving Worlds
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models