WhiFlash: Accelerating Speculative Decoding with Token-Level Cross-Paradigm Routing

arXiv:2606.07710 · cs.LG, cs.AI · Submitted 2026-06-05 · Read on arXiv

cs.LG, cs.AI

Submitted: 2026-06-05

Updated: 2026-09-01

Code: https://github.com/tatsu-lab/stanford_alpaca

Terminology

Sources

Related papers