Syn-Omni: Structured Specialization and Progressive Collaboration for Omnimodal Embeddings
cs.CV, cs.AI, cs.IR
Submitted: 2026-10-08
Updated: 2026-10-08
Code: https://github.com/sony/syn-omni
Terminology
Sources
- MusicLM: Generating Music From Text
- Qwen2.5-VL Technical Report
- A Short Note on the Kinetics-700 Human Action Dataset
- Towards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculum
- E5-V: Universal Embeddings with Multimodal Large Language Models
- MoELoRA: Contrastive Learning Guided Mixture of Experts on Parameter-Efficient Fine-Tuning for Large Language Models
- UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild
- MCA: Modality Composition Awareness for Robust Composed Multimodal Retrieval
- Scaling Audio-Text Retrieval with Multimodal Large Language Models
- Qwen2.5-Omni Technical Report
- Omni-Embed-Nemotron: A Unified Multimodal Retrieval Model for Text, Image, Audio, and Video
- MAGMaR Shared Task System Description: Video Retrieval with OmniEmbed
- Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models