Salt++: Context-Aligned Post-Training for Few-Step Streaming Multimodal Generation
cs.CV, cs.AI, eess.IV
Submitted: 2026-09-29
Updated: 2026-09-29
Project page: https://xingtongge.github.io/Saltpp
Terminology
Sources
- Context-Matched Distillation: Teacher Causality for Autoregressive Video Distillation
- Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis
- Speed by Simplicity: A Single-Stream Architecture for Fast Audio-Video Generative Foundation Model
- Seedance 1.0: Exploring the Boundaries of Video Generation Models
- Salt: Self-Consistent Distribution Matching with Cache-Aware Training for Fast Video Generation
- LTX-2: Efficient Joint Audio-Visual Foundation Model
- Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- Autoregressive Adversarial Post-Training for Real-Time Interactive Video Generation
- JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization
- Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow
- Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
- Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference
- Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model
- Seedance 2.0: Advancing Video Generation for World Complexity
- OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
- Kling-Omni Technical Report
- MOVA: Towards Scalable and Synchronized Video-Audio Generation
- MAGI-1: Autoregressive Video Generation at Scale
- Wan: Open and Advanced Large-Scale Video Generative Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models