SketchVLM: Vision language models can annotate images to explain thoughts and guide users
cs.CV, cs.AI
Submitted: 2026-04-23
Updated: 2026-08-31
Code: https://github.com/allenai/molmo
Project page: https://sketchvlm.github.io
Terminology
Sources
- Qwen2.5-VL Technical Report
- PHYRE: A New Benchmark for Physical Reasoning
- PaliGemma: A versatile 3B VLM for transfer
- SAM 3: Segment Anything with Concepts
- Emerging Properties in Unified Multimodal Pretraining
- ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
- Visual Structures Helps Visual Reasoning: Addressing the Binding Problem in VLMs
- SketchMind: A Multi-Agent Cognitive Framework for Assessing Student-Drawn Scientific Sketches
- Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
- GUI-GenBench: Evaluating Image Generation Models as Interactive GUI Environments
- HoT: Highlighted Chain of Thought for Referencing Supporting Facts from Inputs
- OpenAI GPT-5 System Card
- Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning
- Teaching CLIP to Count to Ten
- OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning
- Understanding Generative AI Capabilities in Everyday Image Editing Tasks
- Chameleon: Mixed-Modal Early-Fusion Foundation Models
- Gemini: A Family of Highly Capable Multimodal Models
- Kimi K2.5: Visual Agentic Intelligence
- Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models