TreeGraft: Adaptive Multi-Drafter Grafting for Tree-Based Speculative Decoding
cs.CL
Submitted: 2026-05-28
Updated: 2026-08-28
Terminology
Sources
- GPT-4 Technical Report
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- LLaMA: Open and Efficient Foundation Language Models
- Accelerating Large Language Model Decoding with Speculative Sampling
- TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding
- Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads
- Hydra: Sequentially-Dependent Draft Heads for Medusa Decoding
- EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty
- EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test
- The Llama 3 Herd of Models
- Qwen3 Technical Report
- Training Verifiers to Solve Math Word Problems
- Evaluating Large Language Models Trained on Code
- Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering