Looks the Same, Answers Differently: Flip-Direction Steering for Robust Vision-Language Reasoning
cs.CV
Submitted: 2026-09-23
Updated: 2026-09-23
Code: https://github.com/meta-llama/llama-models
Terminology
Sources
- Qwen3-VL Technical Report
- Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets
- GMAI-MMBench: A Comprehensive Multimodal Evaluation Benchmark Towards General Medical AI
- MedMNIST-C: Comprehensive benchmark and improved classifier robustness by simulating realistic image corruptions
- Gemma 3 Technical Report
- Questioning the Stability of Visual Question Answering
- Benchmarking Large Multimodal Models against Common Corruptions
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models