It Takes Workflows to Evolve Better Workflows
cs.CL, cs.AI
Submitted: 2026-10-01
Updated: 2026-10-01
Project page: https://xhguo7.github.io/FloWright
Terminology
Sources
- Agent S2: A Compositional Generalist-Specialist Framework for Computer Use Agents
- Seeing the Whole Elephant: A Benchmark for Failure Attribution in LLM-based Multi-Agent Systems
- Beyond Trajectory-Level Attribution: Graph-Based Credit Assignment for Agentic Reinforcement Learning
- Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models?
- Multi-Agent Collaboration via Evolving Orchestration
- Group-in-Group Policy Optimization for LLM Agent Training
- Recursive Agent Optimization
- Anagent For Enhancing Scientific Table & Figure Analysis
- MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework
- OWL: Optimized Workforce Learning for General Multi-Agent Assistance in Real-World Task Automation
- Automated Design of Agentic Systems
- R-Zero: Self-Evolving Reasoning LLM from Zero Data
- MAS-Orchestra: Understanding and Improving Multi-Agent Reasoning Through Holistic Orchestration and Controlled Benchmarks
- DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation
- Agentic Reinforcement Learning with Implicit Step Rewards
- DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems
- MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations
- MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention
- MALT: Improving Reasoning with Multi-Agent LLM Training
- Weak-for-Strong: Training Weak Meta-Agent to Harness Strong Executors
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering