Hierarchical Compression of Vision-Language Model Benchmarks
cs.LG, cs.AI, cs.CL, cs.CV
Submitted: 2026-09-29
Updated: 2026-09-29
Terminology
Sources
- LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training
- LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
- Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- Qwen3-VL Technical Report
- Qwen2.5-VL Technical Report
- Microsoft COCO Captions: Data Collection and Evaluation Server
- Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- The Llama 3 Herd of Models
- GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning
- DatBench: Discriminative, Faithful, and Efficient VLM Evaluations
- SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension
- Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking
- Holistic Evaluation of Language Models
- SmolVLM: Redefining small and efficient multimodal models
- Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini
- Gemini Robotics: Bringing AI into the Physical World
- Gemma 3 Technical Report
- Gemma 4 Technical Report
- Kimi-VL Technical Report
- HyperCLOVA X 8B Omni
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks