SSD: Spatially Speculative Decoding Accelerates Autoregressive Image Generation
cs.CV
Submitted: 2026-06-18
Updated: 2026-09-27
Project page: https://shilongxiang.github.io/SSD/Abstract
Terminology
Sources
- Accelerating Large Language Model Decoding with Speculative Sampling
- Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling
- Distilling the Knowledge in a Neural Network
- Classifier-Free Diffusion Guidance
- ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment
- GPT-4o System Card
- Annealed Relaxation of Speculative Decoding for Faster Autoregressive Image Generation
- EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test
- DeepSeek-V3 Technical Report
- Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining
- L-MTP: Leap Multi-Token Prediction Beyond Adjacent Context for Large Language Models
- Multi-Scale Local Speculative Decoding for Image Generation
- Searching for Activation Functions
- GLU Variants Improve Transformer
- Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation
- Chameleon: Mixed-Modal Early-Fusion Foundation Models
- Emu3: Next-Token Prediction is All You Need
- Scaling Autoregressive Models for Content-Rich Text-to-Image Generation
- Locality-aware Parallel Decoding for Efficient Autoregressive Image Generation
- FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models