Empowering Hybrid Attention Models on NPUs
cs.DC, cs.AI
Submitted: 2026-09-26
Updated: 2026-09-26
Code: https://github.com/yinyuanzhang/HA-NPU
Project page: https://intel.github.io/intel-npu-accelerationlibrary/npu.html
Terminology
Sources
- Accelerating Mobile Language Model via Speculative Decoding and NPU-Coordinated Execution
- Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention
- Kimi Linear: An Expressive, Efficient Attention Architecture
- Kimi K3: Open Frontier Intelligence
- On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability
- Retentive Network: A Successor to Transformer for Large Language Models
- T-MAN: Enabling End-to-End Low-Bit LLM Inference on NPUs via Unified Table Lookup
- Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC
- PowerInfer-2: Fast Large Language Model Inference on a Smartphone
- Parallelizing Linear Transformers with the Delta Rule over Sequence Length
Related papers
- iScheduler: Reinforcement Learning-Driven Continual Optimization for Large-Scale Resource Investment Problems
- SAMM: Sharded Automated Market Maker
- InferScale: GPU-Native KV Injection for Personalized LLM Serving
- Vigil: Accountable Liveness against Selective Silence
- Steelhead: Interleaving Partially Synchronous and Asynchronous Commit Rules on a Shared DAG
- Pushing CPU Speech Synthesis to the Wall: Extreme Inference Tuning under Serverless Architecture and Billing