Momentum-Coupled Rubric Adaptation for Detailed Image Captioning
cs.CL
Submitted: 2026-09-29
Updated: 2026-09-29
Code: https://github.com/a23wen/MoCo-Rubric
Terminology
Sources
- SPICE: Semantic Propositional Image Caption Evaluation
- Qwen3-VL Technical Report
- DecisionFlow: Advancing Large Language Model as Principled Decision Maker
- CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era
- Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models
- Benchmarking and Improving Detail Image Caption
- BLINK: Multimodal Large Language Models Can See but Not Perceive
- EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation
- Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains
- RubiCap: Rubric-Guided Reinforcement Learning for Dense Image Captioning
- Reinforcement Learning with Rubric Anchors
- Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric
- BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception
- OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment
- Decoupled Weight Decay Regularization
- OmniCaptioner: One Captioner to Rule Them All
- DocVQA: A Dataset for VQA on Document Images
- DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
- CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering