A Strong Baseline for Evaluating Vision Encoders in Multimodal Large Language Models

arXiv:2610.05413 · cs.CV, cs.AI · Submitted 2026-10-04 · Read on arXiv

cs.CV, cs.AI

Submitted: 2026-10-04

Updated: 2026-10-04

Related papers