Visual Information-Guided Parallel Decoding for Diffusion Multimodal Large Language Models
cs.CV, cs.CL
Submitted: 2026-08-27
Updated: 2026-08-27
Terminology
Sources
- Learning to Parallel: Accelerating Diffusion Large Language Models via Learnable Parallel Decoding
- Benchmarking and Improving Detail Image Caption
- From Bits to Rounds: Parallel Decoding with Exploration for Diffusion Language Models
- Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models
- Empirical Analysis of Decoding Biases in Masked Diffusion Models
- Learning Unmasking Policies for Diffusion Language Models
- Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models
- Lookahead Unmasking Elicits Accurate Decoding in Diffusion Language Models
- A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models
- Diffusion Language Models Know the Answer Before Decoding
- Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation
- Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models
- DocVQA: A Dataset for VQA on Document Images
- Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model
- Accelerating Diffusion Large Language Models with SlowFast Sampling: The Three Golden Principles
- Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding
- RedVTP: Training-Free Acceleration of Diffusion Vision-Language Models Inference via Masked Token-Guided Visual Token Pruning
- Improving Sampling for Masked Diffusion Models via Information Gain
- Dream 7B: Diffusion Large Language Models
- Dimple: Discrete Diffusion Multimodal Large Language Model with Parallel Decoding
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models