FloorSAV: Elucidating Spatial Audio-Visual Context with 2D Floormap for AV-LLMs
cs.CV, cs.LG
Submitted: 2026-10-08
Updated: 2026-10-08
Project page: https://byulharang.github.io/FloorSAV
Terminology
Sources
- ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth
- OWL: Geometry-Aware Spatial Reasoning for Audio Large Language Models
- FloorPlan-VLN: A New Paradigm for Floor Plan Guided Vision-Language Navigation
- Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic
- VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
- Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs
- ConceptFusion: Open-set Multimodal 3D Mapping
- JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments
- Aria Everyday Activities Dataset
- EgoAVU: Egocentric Audio-Visual Understanding
- Spatial Audio Motion Understanding and Reasoning
- EFM3D: A Benchmark for Measuring Progress Towards 3D Egocentric Foundation Models
- N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models
- Qwen3-Omni Technical Report
- OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM
- The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models
- Multimodal Spatial Reasoning in the Large Model Era: A Survey and Benchmarks
- EgoSound: Benchmarking Sound Understanding in Egocentric Videos
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models