Multimodal Thinking with Renderable Programs
cs.CV, cs.CL
Submitted: 2026-09-24
Updated: 2026-09-24
Terminology
Sources
- Exploring Visual Prompts for Adapting Large-Scale Models
- Qwen3-VL Technical Report
- Qwen2.5-VL Technical Report
- Emerging Properties in Unified Multimodal Pretraining
- CodePlot-CoT: Mathematical Visual Reasoning by Thinking with Code-Driven Images
- Visually Prompted Benchmarks Are Surprisingly Fragile
- Inner Monologue: Embodied Reasoning through Planning with Language Models
- Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models
- Evaluating Object Hallucination in Large Vision-Language Models
- VRPTEST: Evaluating Visual Referring Prompting in Large Multimodal Models
- More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models
- V-Thinker: Interactive Thinking with Images
- RECODE: Reasoning Through Code Generation for Visual Question Answering
- MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
- OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning
- ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models
- Gemini: A Family of Highly Capable Multimodal Models
- Contrastive Region Guidance: Improving Grounding in Vision-Language Models without Training
- Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
- Monet: Reasoning in Latent Visual Space Beyond Images and Language
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models