MAS-ProVe: Understanding the Process Verification of Multi-Agent Systems
cs.AI, cs.CL, cs.MA
Submitted: 2026-02-03
Updated: 2026-08-31
Code: https://github.com/Wang-ML-Lab/MAS-ProVe
Terminology
Sources
- Two Heads are Better Than One: Test-time Scaling of Multi-agent Collaborative Reasoning
- A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems
- gpt-oss-120b & gpt-oss-20b Model Card
- Large Language Monkeys: Scaling Inference Compute with Repeated Sampling
- No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding
- Why Do Multi-Agent LLM Systems Fail?
- AgentVerse: Facilitating Multi-Agent Collaboration and Exploring Emergent Behaviors
- Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate
- Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy
- Do LLM Evaluators Prefer Themselves for a Reason?
- Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling
- Improving Factuality and Reasoning in Language Models through Multiagent Debate
- A Dynamic LLM-Powered Agent Network for Task-Oriented Agent Collaboration
- Multi-Agent Design: Optimizing Agents with Better Prompts and Topologies
- LLM Evaluators Recognize and Favor Their Own Generations
- Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators
- DeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoning
- Reflexion: Language Agents with Verbal Reinforcement Learning
- A Survey on Large Language Models for Mathematical Reasoning
- Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection