Error-Driven Scene Editing for 3D Grounding in Large Language Models
cs.CV, cs.AI, cs.CL
Submitted: 2025-11-18
Updated: 2026-08-31
Code: https://github.com/zhangyuejoslin/Deer-3D
Terminology
Sources
- Learning From Mistakes Makes LLM Better Reasoner
- D3Net: A Unified Speaker-Listener Architecture for 3D Dense Captioning and Visual Grounding
- Grounded 3D-LLM with Referent Tokens
- AHA: A Vision-Language-Model for Detecting and Reasoning Over Failures in Robotic Manipulation
- Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning
- Evaluating Models' Local Decision Boundaries via Contrast Sets
- 3DLLM-Mem: Long-Term Spatial-Temporal Memory for Embodied 3D Large Language Model
- An Embodied Generalist Agent in 3D World
- 3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding
- Learning the Difference that Makes a Difference with Counterfactually-Augmented Data
- DataEnvGym: Data Generation Agents in Teacher Environments with Student Feedback
- SQA3D: Situated Question Answering in 3D Scenes
- When LLMs step into the 3D World: A Survey and Meta-Analysis of 3D Tasks via Multi-modal Large Language Models
- It's All in the Name: Mitigating Gender Bias with Name-Based Counterfactual Data Substitution
- Counterfactual Generative Networks
- SC-NeRF: Self-Correcting Neural Radiance Field with Sparse Views
- Learning from Mistakes via Cooperative Study Assistant for Large Language Models
- Targeted Augmentation for Low-Resource Event Extraction
- Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes
- 3DSceneEditor: Controllable 3D Scene Editing with Gaussian Splatting
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models