MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement
cs.CL
Submitted: 2026-10-08
Updated: 2026-10-08
Code: https://github.com/datacurve-ai/deep-swe
Terminology
Sources
- SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale
- DFlash: Block Diffusion for Flash Speculative Decoding
- MiMo-V2-Flash Technical Report
- SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?
- AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training
- Semantic Head Specialization Guides Hybrid ViT Attention for Multimodal LLMs
- DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks
- SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?
- ExploitBench: A Capability Ladder Benchmark for LLM Cybersecurity Agents
- The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution
- JobBench: Aligning Agent Work With Human Will
- Multi-Turn On-Policy Distillation with Prefix Replay
- Muown: Row-Norm Control for Muon Optimization
- DeepSeek-V3 Technical Report
- Muon is Scalable for LLM Training
- Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers
- MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training
- Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces
- OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning
- GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering