BudgetMem: Training-Free Selective Memory for Cost-Efficient Long-Context Processing in Language Models
cs.CL, cs.AI
Submitted: 2025-11-07
Updated: 2026-09-20
Comments: 11 pages, 3 figures, 5 tables. Evaluated on 700 QA pairs across multiple document lengths
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- Longformer: The Long-Document Transformer
- GPT-4 Technical Report
- The Llama 3 Herd of Models
- Generating Long Sequences with Sparse Transformers
- Compressive Transformers for Long-Range Sequence Modelling
- RoFormer: Enhanced Transformer with Rotary Position Embedding
- LLaMA: Open and Efficient Foundation Language Models
- Extending Context Window of Large Language Models via Positional Interpolation
- REPLUG: Retrieval-Augmented Black-Box Language Models
- Adapting Language Models to Compress Contexts
- Atlas: Few-shot Learning with Retrieval Augmented Language Models
- LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models
- LongLLMLingua: Accelerating and Enhancing LLMs in Long Context Scenarios via Prompt Compression
- MemoRAG: Boosting Long Context Processing with Global Memory-Enhanced Retrieval Augmentation
- MemLong: Memory-Augmented Retrieval for Long Text Modeling
- InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory
- Memory Networks
- Neural Turing Machines
- Compressing Context to Enhance Inference Efficiency of Large Language Models
- RECOMP: Improving Retrieval-Augmented LMs with Compression and Selective Augmentation
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering