HEIR: Learning Human-Entity Interactions with Functional Roles
cs.CV
Submitted: 2026-09-28
Updated: 2026-09-28
Code: https://github.com/Kratos-Wen/HEIR
Terminology
Sources
- Layer Normalization
- OpenMarcie: Dataset for Multimodal Action Recognition in Industrial Environments
- Learning to Detect Human-Object Interactions
- The Llama 3 Herd of Models
- Learning Human-Object Interaction as Groups
- An Image-like Diffusion Method for Human-Object Interaction Detection
- DETRs with Hybrid Matching
- DINOv2 Meets Text: A Unified Framework for Image- and Pixel-Level Vision-Language Alignment
- Rethinking Video Human-Object Interaction: Set Prediction over Time for Unified Detection and Anticipation
- ENIGMA-360: An Ego-Exo Dataset for Human Behavior Understanding in Industrial Scenarios
- Mining Instance-Centric Vision-Language Contexts for Human-Object Interaction Detection
- MVOR: A Multi-view RGB-D Operating Room Dataset for 2D and 3D Human Pose Estimation
- Fast Exact Inference for Recursive Cardinality Models
- RoHOI: Robustness Benchmark for Human-Object Interaction Detection
- IMPACT: A Dataset for Multi-Granularity Human Procedural Action Understanding in Industrial Assembly
- RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics
- HOI-M3:Capture Multiple Humans and Objects Interaction within Contextual Environment
- Diagnosing Human-object Interaction Detectors
- Deformable DETR: Deformable Transformers for End-to-End Object Detection
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models