Can VLMs Reliably Assess Sidewalk Accessibility Attributes from Pedestrian-Level Imagery?
cs.CV, cs.CY, cs.LG
Submitted: 2026-09-15
Updated: 2026-09-15
Comments: 29 pages, 4 figures, 9 tables
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Do VLMs See What Sensors Feel? A Scalable Expert-Guided Design for Wheelchair Accessibility Assessment from Street View
- Towards Human-AI Accessibility Mapping in India: VLM-Guided Annotations and POI-Centric Analysis in Chandigarh
- VL-Uncertainty: Detecting Hallucination in Large Vision-Language Model via Uncertainty Estimation
- UrbanVGGT: Scalable Sidewalk Width Estimation from Street View Images
- Non-Determinism of "Deterministic" LLM Settings
- Uncertainty-Aware Evaluation for Vision-Language Models
- Language Models with Conformal Factuality Guarantees
- Data-Driven Calibration of Prediction Sets in Large Vision-Language Models Based on Inductive Conformal Prediction
- CONRep: Uncertainty-Aware Vision-Language Report Drafting Using Conformal Prediction
- Learning Conformal Abstention Policies for Adaptive Risk Management in Large Language and Vision-Language Models
- Conformal Sets in Multiple-Choice Question Answering under Black-Box Settings with Provable Coverage Guarantees
- Empirical Bayes Conformal Prediction for Vision and Language Models
- LLMs are Overconfident: Evaluating Confidence Interval Calibration with FermiEval
- Qwen3-VL Technical Report
- InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency
- OASIS: Automated Assessment of Urban Pedestrian Paths at Scale
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models