AntiGrounding: Executable Robot Trajectories as Visual Prompts for VLM-Guided Manipulation
cs.RO, cs.AI
Submitted: 2025-06-14
Updated: 2026-09-18
Comments: 8 pages, 7 figures, 3 tables. Submitted to ICRA 2027
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Sources
- PaLM-E: An Embodied Multimodal Language Model
- Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- GPT-4 Technical Report
- Do As I Can, Not As I Say: Grounding Language in Robotic Affordances
- Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language
- VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models
- PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs
- ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation
- RoboDexVLM: Visual Language Model-Enabled Task Planning and Motion Control for Dexterous Robot Manipulation
- RoboGround: Robotic Manipulation with Grounded Vision-Language Priors
- SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors
- SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models
- CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting
- Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models
- How to Enable LLM with 3D Capacity? A Survey of Spatial Reasoning in LLM
- Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces
- LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness
- Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning
- INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model
- G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving