Not Just Reason, Not Just Scan: Reinforcement Learning for Proactive Scientific Error Verification over Academic Paper
cs.CL
Submitted: 2026-08-27
Updated: 2026-08-27
Code: https://github.com/Staudinger0325/VERA-RL
Terminology
Sources
- Qwen3-VL Technical Report
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- PaSa: An LLM Agent for Comprehensive Academic Paper Search
- QwenLong-L1: Towards Long-Context Large Reasoning Models with Reinforcement Learning
- OpenAI o1 System Card
- Direct Preference Optimization: Your Language Model is Secretly a Reward Model
- Proximal Policy Optimization Algorithms
- PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review
- VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning
- LoongRL: Reinforcement Learning for Advanced Reasoning over Long Contexts
- CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs
- DeepSeek-OCR: Contexts Optical Compression
- FLAWS: A Benchmark for Error Identification and Localization in Scientific Papers
- MMCR: Advancing Visual Language Model in Multimodal Multi-Turn Contextual Reasoning
- DAPO: An Open-Source LLM Reinforcement Learning System at Scale
- VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering