FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation
cs.CV
Submitted: 2026-05-10
Updated: 2026-09-16
Terminology
Sources
- Block Diffusion: Interpolating Between Autoregressive and Diffusion Language Models
- Qwen Technical Report
- ShareGPT-4o-Image: Aligning Multimodal Models with GPT-4o-Level Image Generation
- OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing
- Emu3.5: Native Multimodal Models are World Learners
- Uniform Discrete Diffusion with Metric Path for Video Generation
- Flex Attention: A Programming Model for Generating Optimized Attention Kernels
- LiveWorld: Simulating Out-of-Sight Dynamics in Generative Video World Models
- X-Omni: Reinforcement Learning Makes Discrete Autoregressive Image Generative Models Great Again
- Classifier-Free Diffusion Guidance
- ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment
- T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation
- LANTERN: Accelerating Visual Autoregressive Models with Relaxed Speculative Decoding
- Pick-a-Pic: An Open Dataset of User Preferences for Text-to-Image Generation
- Autoregressive Image Generation with Randomized Parallel Decoding
- Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining
- Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model
- Layer by Layer: Uncovering Hidden Representations in Language Models
- Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation
- HART: Efficient Visual Generation with Hybrid Autoregressive Transformer
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models