Revisit to Segment: Working Memory Distillation for Reasoning Segmentation
cs.CV
Submitted: 2026-09-28
Updated: 2026-10-03
Code: https://github.com/yancilin/SWiM
Terminology
Sources
- Qwen3-VL Technical Report
- Reason Twice: Segmentation via Candidate Discovery and Comparative Reasoning
- DR$^2$Seg: Decomposed Two-Stage Rollouts for Efficient Reasoning Segmentation in Multimodal Large Language Models
- LoRA: Low-Rank Adaptation of Large Language Models
- Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
- Seg-ReSearch: Segmentation with Interleaved Reasoning and External Search
- Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement
- From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding
- Decoupled Weight Decay Regularization
- SegCompass: Exploring Interpretable Alignment with Sparse Autoencoders for Enhanced Reasoning Segmentation
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- A Survey of On-Policy Distillation for Large Language Models
- Gemini: A Family of Highly Capable Multimodal Models
- Kimi K3: Open Frontier Intelligence
- Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents
- SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
- Discriminative Perception via Anchored Description for Reasoning Segmentation
- Don't Guess, Just Ask: Resolving Ambiguity in Referring Segmentation via Multi-turn Clarification
- Multi-Rollout On-Policy Distillation via Peer Successes and Failures
- StAR: Segment Anything Reasoner
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models