VIVAS: Vitalizing Visual Perception in VLM Pre-training via Vision-language Unified Autoregressive Supervision
cs.CV
Submitted: 2026-08-25
Updated: 2026-08-25
Terminology
Sources
- Qwen3-VL Technical Report
- Qwen2.5-VL Technical Report
- Are We on the Right Way for Evaluating Large Vision-Language Models?
- Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks
- DeepSeek-V3 Technical Report
- OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning
- BLINK: Multimodal Large Language Models Can See but Not Perceive
- HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
- Seed1.5-VL Technical Report
- TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs
- CATCH: Complementary Adaptive Token-level Contrastive Decoding to Mitigate Hallucinations in LVLMs
- A Diagram Is Worth A Dozen Images
- SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension
- Spatial Forcing: Implicit Spatial Representation Alignment for Vision-language-action Model
- Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models
- ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use
- VISTA: Enhancing Vision-Text Alignment in MLLMs via Cross-Modal Mutual Information Maximization
- Visual Instruction Tuning
- MMBench: Is Your Multi-modal Model an All-around Player?
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models