VisionPsy-Nano: Improving Accuracy, Efficiency, and Reliability in On-Device Vision-Language Models
cs.CV
Submitted: 2026-09-23
Updated: 2026-09-23
Code: https://github.com/huggingface/nanoVLM
Terminology
Sources
- MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices
- Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improvement
- OpenRT: An Open-Source Red Teaming Framework for Multimodal LLMs
- LFM2 Technical Report
- SmolVLM: Redefining small and efficient multimodal models
- InfoSFT: Learn More and Forget Less with Information-Aware Token Weighting
- Vero: An Open RL Recipe for General Visual Reasoning
- Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models
- Gemma 3 Technical Report
- SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features
- Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
- FineVision: Open Data Is All You Need
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models