CordisBench: Can Language Models Reason About Component Lifecycles in Dynamic Agent Harnesses?
cs.CL, cs.AI
Submitted: 2026-09-01
Updated: 2026-09-01
Terminology
Sources
- Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
- (How) Do Large Language Models Understand High-Level Message Sequence Charts?
- ScratchLens: Lens-Parametric Behavioral Equivalence for Scratch Programs
- Evaluating Program Semantics Reasoning with Type Inference in System F
- TempoBench: Reasoning Execution Without Causal Attribution Is Just Simulation
- CONCUR: Benchmarking LLMs for Concurrent Code Generation
- Evo-Bench: Can Language Models Improve Agent Harness?
- Assessing Large Language Models in Comprehending and Verifying Concurrent Programs across Memory Models
- An Axiomatic Theory for Reversible Computation
- LLMs Lean on Priors, Not Programming Language Semantics
- Rethinking the Evaluation of Harness Evolution for Agents
- Self-Harness: Harnesses That Improve Themselves
- Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering