More GPUs or a Smaller Cache? Tensor Parallelism versus KV Compression for Memory-Bound LLM Serving

arXiv:2608.23962 · cs.AI · Submitted 2026-08-25 · Read on arXiv

cs.AI

Submitted: 2026-08-25

Updated: 2026-08-25

Terminology

Sources

Related papers