OmniSmartHome: A Multimodal Reasoning Benchmark for Smart-Home Agents
cs.CV
Submitted: 2026-09-26
Updated: 2026-09-26
Project page: https://omni-smart-home.github.io
Terminology
Sources
- HumanOmni-Speaker: Identifying Who said What and When
- PersonalHomeBench: Evaluating Agents in Personalized Smart Homes
- MIST: Multimodal Interactive Speech-based Tool-calling Conversational Assistants for Smart Homes
- VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction
- Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence
- RTMW: Real-Time Multi-Person 2D and 3D Whole-body Pose Estimation
- SMH-Bench: Benchmarking LLM Agents for Environment-Grounded Reasoning and Action in Smart Homes
- MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models
- Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI
- VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models
- OpenAI GPT-5 System Card
- video-SALMONN 2: Caption-Enhanced Audio-Visual Large Language Models
- Gemma 4 Technical Report
- MIRIX: Multi-Agent Memory System for LLM-Based Agents
- Qwen2.5-Omni Technical Report
- Qwen3-Omni Technical Report
- Agentic Active Omni-Modal Perception for Multi-Hop Audio-Visual Reasoning
- MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models