LEGO-Anything: Coding Agents for 3D Scene Reconstruction
cs.CV
Submitted: 2026-09-28
Updated: 2026-09-28
Code: https://github.com/ahujasid/blender-mcp
Project page: https://lego-anything.com
Terminology
Sources
- Gen3DSR: Generalizable 3D Scene Reconstruction via Divide and Conquer from a Single View
- PhysX-Anything: Simulation-Ready Physical 3D Assets from Single Image
- Collaborative Multi-Modal Coding for High-Quality 3D Generation
- SAM 3: Segment Anything with Concepts
- Sandboxed Coding Agents are Competitive Omni-modal Task Solvers
- BlenderFusion: 3D-Grounded Visual Editing and Generative Compositing
- Panoptic 3D Scene Reconstruction From a Single RGB Image
- ProcTHOR: Large-Scale Embodied AI Using Procedural Generation
- CityCraft: A Real Crafter for 3D City Generation
- CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation
- 3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code
- Mesh R-CNN
- LVIS: A Dataset for Large Vocabulary Instance Segmentation
- Thinking in Blender: Staged Executable Inverse Graphics with Vision-Language Models
- SceneCraft: An LLM Agent for Synthesizing 3D Scene as Blender Code
- LiteReality: Graphics-Ready 3D Scene Reconstruction from RGB-D Scans
- Ditto: Building Digital Twins of Articulated Objects from Interaction
- SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
- SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning
- SceneConductor: 3D Scene Generation from a Single Image with Multi-Agent Orchestration
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models