Personalizing Causal Audio-Driven Facial Motion via Dynamic Multi-modal Retrieval
cs.GR, cs.CV
Submitted: 2026-04-26
Updated: 2026-09-18
Terminology
Sources
- Seamless Interaction: Dyadic Audiovisual Motion Modeling and Large-Scale Dataset
- GaussianSpeech: Audio-Driven Gaussian Avatars
- GSTalker: Real-time Audio-Driven Talking Face Generation via Deformable Gaussian Splatting
- Moshi: a speech-text foundation model for real-time dialogue
- Classifier-Free Diffusion Guidance
- Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction
- DFA-NeRF: Personalized Talking Head Generation via Disentangled Face Attributes Neural Rendering
- GeneFace++: Generalized and Stable Real-Time Audio-Driven 3D Talking Face Generation
- GeneFace: Generalized and High-Fidelity Audio-Driven 3D Talking Face Synthesis
- Image and Video Tokenization with Binary Spherical Quantization
Related papers
- SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-Based Humanoid Control
- CADReasoner: Iterative Program Editing for CAD Reverse Engineering
- QuadLink: Autoregressive Quad-Dominant Mesh Generation via Point-Relation Learning
- DrawVideo: Grounded and Faithful Multi-Shot Video Generation from Storyboard Keyframe Sketches
- MotionPersona: Real-Time Locomotion Control across Personas, Bodies, and Styles
- MeshSplatBench: A Unified Benchmark for Triangle- and Mesh-Based Neural Rendering