Cog-VADU: A Training-Free Cognitive Reasoning Framework for Video Anomaly Detection and Understanding
cs.CV, cs.AI
Submitted: 2026-10-01
Updated: 2026-10-01
Code: https://github.com/MohdUbaidwani/Cog-VADU
Terminology
Sources
- VANE-Bench: Video Anomaly Evaluation Benchmark for Conversational LMMs
- MGFN: Magnitude-Contrastive Glance-and-Focus Network for Weakly-Supervised Video Anomaly Detection
- InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- Video-R1: Reinforcing Video Reasoning in MLLMs
- STEAD: Spatio-Temporal Efficient Anomaly Detection for Time and Compute Sensitive Applications
- Memorizing Normality to Detect Anomaly: Memory-augmented Deep Autoencoder for Unsupervised Anomaly Detection
- Learning Temporal Regularity in Video Sequences
- Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought
- Attention-based Deep Multiple Instance Learning
- LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models
- Video-LLaVA: Learning United Visual Representation by Alignment Before Projection
- Improved Baselines with Visual Instruction Tuning
- Future Frame Prediction for Anomaly Detection -- A New Baseline
- Video Anomaly Detection and Explanation via Large Language Models
- Sherlock: Towards Multi-scene Video Abnormal Event Extraction and Localization via a Global-local Spatial-sensitive LLM
- Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models
- Learning Prompt-Enhanced Context Features for Weakly-Supervised Video Anomaly Detection
- TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
- MovieChat: From Dense Token to Sparse Memory for Long Video Understanding
- Real-world Anomaly Detection in Surveillance Videos
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models