VISTA: Internalizing Collective Visual Experience via On-Policy Distillation for Active Multimodal Agents
cs.CV
Submitted: 2026-09-29
Updated: 2026-09-29
Code: https://github.com/jiangz20/VISTA
Terminology
Sources
- On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes
- Qwen3-VL Technical Report
- Thinking Without Images: Internalizing Visual Manipulation with On-Policy Self-Distillation
- Are We on the Right Way for Evaluating Large Vision-Language Models?
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- DeepEyesV2: Toward Agentic Multimodal Model
- Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models
- Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search
- Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning
- Visual Contrastive Self-Distillation
- Visual-Advantage On-Policy Distillation for Vision-Language Models
- Visual Agentic Reinforcement Fine-Tuning
- MiMo-VL Technical Report
- Privileged Information Distillation for Language Models
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration
- V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning
- Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning
- Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception
- VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models