Advancing Video-Text Pretraining with Multi-View Captions
cs.CV
Submitted: 2026-09-28
Updated: 2026-09-28
Project page: https://rvandeghen.github.io/mvc
Terminology
Sources
- Qwen3-VL Technical Report
- VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling
- SynthCLIP: Are We Ready for a Fully Synthetic CLIP Training?
- Shot2Story: A New Benchmark for Comprehensive Understanding of Multi-shot Videos
- The Kinetics Human Action Video Dataset
- Tarsier: Recipes for Training and Evaluating Large Video Description Models
- InternVideo: General Video Foundation Models via Generative and Discriminative Learning
- CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval
- CLIP-ViP: Adapting Pre-trained Image-Text Model to Video-Language Representation Alignment
- VideoCoCa: Video-Text Modeling with Zero-Shot Transfer from Contrastive Captioners
- Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding
- Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models