PartLLM: A Unified Multimodal Foundation for 3D Part Segmentation
cs.CV, cs.GR
Submitted: 2026-09-22
Updated: 2026-09-22
Project page: https://czvvd.github.io/PartLLMPage
Terminology
Sources
- Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- Qwen3-VL Technical Report
- Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic
- PatchAlign3D: Local Feature Alignment for Dense 3D Shape Understanding
- Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
- HY3D-Bench: Generation of 3D Assets
- GPT-4o System Card
- Detect Anything via Next Point Prediction
- CoSMo3D: Open-World Promptable 3D Semantic Part Segmentation through LLM-Guided Canonical Spatial Modeling
- Hunyuan3D 2.5: Towards High-Fidelity 3D Assets Generation with Ultimate Details
- P3-SAM: Native 3D Part Segmentation
- Find Any Part in 3D
- S2AM3D: Scale-controllable Part Segmentation of 3D Point Clouds
- Segment Any Mesh
- Native and Compact Structured Latents for 3D Generation
- SAMPart3D: Segment Any Part in 3D Objects
- Utonia: Toward One Encoder for All Point Clouds
- PartSLIP++: Enhancing Low-Shot 3D Part Segmentation via Multi-View Instance Segmentation and Maximum Likelihood Estimation
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models