End-to-End Latency-Minimizing and Load-Balanced Request Scheduling for Edge LLM Inference in Agentic AI Services

arXiv:2609.17193 · cs.AI · Submitted 2026-09-15 · Read on arXiv

cs.AI

Submitted: 2026-09-15

Updated: 2026-09-15

License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/

Terminology

Sources

Related papers