AffectOmni: RL-Verifiable People-Centric Grounded Affective Reasoning for Social and Art-Related Scenes
cs.AI
Submitted: 2026-08-24
Updated: 2026-08-24
Comments: 12 pages, 5 figures
Code: https://github.com/eliot127825-rgb/AffectOmni_nobody
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- GPT-4 Technical Report
- Gemini: A Family of Highly Capable Multimodal Models
- Qwen2.5-Omni Technical Report
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models
- VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning
- Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning
- HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
- Recent Advances in Multimodal Affective Computing: An NLP Perspective
- Explainable Multimodal Emotion Recognition
- Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
- Application of Multiple Chain-of-Thought in Contrastive Reasoning for Implicit Sentiment Analysis
- VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning
- Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration
- ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning
- EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning
- SightSound-R1: Cross-Modal Reasoning Distillation from Vision to Audio Language Models
- Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
- R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
- Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning
Related papers
- MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction
- Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models
- The Clinician's Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing
- MindHelper: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention
- Incumbent Advantage: Brand Bias and Cognitive Manipulation Dynamics in LLM Recommendation Systems
- VSAL: A Vision Solver with Adaptive Layouts for Graph Property Detection