Auditing Long-Term Memory Evaluation: Repeated Judging, Reader Variation, and Negative Controls
cs.CL, cs.AI, cs.IR
Submitted: 2026-09-29
Updated: 2026-10-02
Code: https://github.com/JordanMcCann/agentmemory
Terminology
Sources
- Chronos: Temporal-Aware Conversational Agents with Structured Event Retrieval for Long-Term Memory
- Agent Zero Memory: Provenance-Aware Long-Term Memory for LLM Agents
- LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory
- MemGPT: Towards LLMs as Operating Systems
- Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory
- Zep: A Temporal Knowledge Graph Architecture for Agent Memory
- Evaluating Very Long-Term Conversational Memory of LLM Agents
- Passage Re-ranking with BERT
- M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering