LLMs Can't Play Hangman: On the Necessity of a Private Working Memory for Language Agents
cs.CL
Submitted: 2026-01-11
Updated: 2026-09-02
Code: https://github.com/chandar-lab/Hangman
Terminology
Sources
- GPT-4 Technical Report
- gpt-oss-120b & gpt-oss-20b Model Card
- Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory
- Eliciting Reasoning in Language Models with Cognitive Tools
- LightMem: Lightweight and Efficient Memory-Augmented Generation
- HiAgent: Hierarchical Working Memory Management for Solving Long-Horizon Agent Tasks with Large Language Model
- Unified Mind Model: Reimagining Autonomous Agents in the LLM Era
- Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
- Deep Research Agents: A Systematic Examination And Roadmap
- Why Language Models Hallucinate
- Memory OS of AI Agent
- Unlocking Structured Thinking in Language Models with Cognitive Prompting
- MemOS: An Operating System for Memory-Augmented Generation (MAG) in Large Language Models
- Evaluating Very Long-Term Conversational Memory of LLM Agents
- LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt Compression
- StateAct: Enhancing LLM Base Agents via Self-prompting and State-tracking
- AI Agents vs. Agentic AI: A Conceptual Taxonomy, Applications and Challenges
- On the Brittle Foundations of ReAct Prompting for Agentic Large Language Models
- Voyager: An Open-Ended Embodied Agent with Large Language Models
- RAG+: Enhancing Retrieval-Augmented Generation with Application-Aware Reasoning
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering