Two Clocks in Diffusion MLLMs: When Answers Stabilize Before Rationales Unfold
cs.CV, cs.AI
Submitted: 2026-10-01
Updated: 2026-10-01
Terminology
Sources
- Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
- Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting
- Measuring Faithfulness in Chain-of-Thought Reasoning
- Simple and Effective Masked Diffusion Language Models
- Diffusion Language Models Know the Answer Before Decoding
- Answer First, Reason Later: When Commitment Order Costs Accuracy in Diffusion Language Models
- Multi-Modal Hallucination Control by Visual Information Grounding
- Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models
- ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding
- LaViDa: A Large Diffusion Language Model for Multimodal Understanding
- Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding
- DiffusionGemma Technical Report
- V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs
- Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models