Opera: A Verbal Critic Framework for Long-horizon Coding Agents
cs.CL
Submitted: 2026-09-27
Updated: 2026-10-08
Code: https://github.com/datacurve-ai/pier
Terminology
Sources
- SWE-Search: Enhancing Software Agents with Monte Carlo Tree Search and Iterative Refinement
- RepairAgent: An Autonomous, LLM-Based Agent for Program Repair
- Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting
- SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?
- SWE-Shepherd: Advancing PRMs for Reinforcing Code Agents
- When Agents go Astray: Course-Correcting SWE Agents with PRMs
- CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing
- Code Generation by Differential Test Time Scaling
- DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks
- Scaling Test-Time Compute for Agentic Coding
- LLM-as-a-Verifier: A General-Purpose Verification Framework
- S*: Test Time Scaling for Code Generation
- Self-Refine: Iterative Refinement with Self-Feedback
- Can LLM-as-a-Judge Reliably Verify Rubrics in Agentic Scenarios?
- ATLAS: Agentic Test-time Learning-to-Allocate Scaling
- Agentic Rubrics as Contextual Verifiers for SWE Agents
- Reflexion: Language Agents with Verbal Reinforcement Learning
- How Coding Agents Fail Their Users: A Large-Scale Analysis of Developer-Agent Misalignment in 20,574 Real-World Sessions
- Accurate Failure Prediction in Agents Does Not Imply Effective Failure Prevention
- OpenHands: An Open Platform for AI Software Developers as Generalist Agents
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering