Binding Multiple Modalities via Multimodal Wasserstein Barycenter
cs.LG
Submitted: 2026-09-27
Updated: 2026-09-27
Terminology
Sources
- A TRIANGLE Enables Multimodal Alignment Beyond Cosine Similarity
- Estimating Barycenters of Distributions with Neural Optimal Transport
- UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation
- Decoupling Semantics from Distortions: Multi-Scale Two-Stream Vision-Language Alignment for AI-Generated Image Quality Assessment
- ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation
- OmniDrive: An LLM-Choreographed Multi-Agent World Model with Unified Latent Co-Compression for Multi-View Driving Video Generation
- Representation Learning with Contrastive Predictive Coding
- EVA-CLIP: Improved Training Techniques for CLIP at Scale
- BaryIR: Learning Multi-Source Unified Representation in Continuous Barycenter Space for Generalizable All-in-One Image Restoration
- InternVideo: General Video Foundation Models via Generative and Discriminative Learning
- InternVideo2: Scaling Foundation Models for Multimodal Video Understanding
- Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks