Mixture-of-Top-k Attention: Efficient Attention via Scalable Fast Weights

arXiv:2602.01219 · cs.LG, cs.CV · Submitted 2026-02-01 · Read on arXiv

cs.LG, cs.CV

Submitted: 2026-02-01

Updated: 2026-09-27

Code: https://github.com/QishuaiWen/MiTA

Terminology

Sources

Related papers