Cue the Flow: Steering Flow-Matching Policies for Open-World Delivery Manipulation
cs.RO
Submitted: 2026-09-30
Updated: 2026-09-30
Project page: https://hatchetproject.github.io/delivery_steer
Terminology
Sources
- OpenVLA: An Open-Source Vision-Language-Action Model
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy
- THE COLOSSEUM: A Benchmark for Evaluating Generalization for Robotic Manipulation
- MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting
- RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics
- Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V
- kPAM: KeyPoint Affordances for Category-Level Robotic Manipulation
- TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies
- $\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- VCA: Vision-Click-Action Framework for Precise Manipulation of Segmented Objects in Target Ambiguous Environments
- SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model
- Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos
- Much Ado About Noising: Dispelling the Myths of Generative Robotic Control
- Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models
- PointVLA: Injecting the 3D World into Vision-Language-Action Models
- Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance
- OmniGuide: Universal Guidance Fields for Enhancing Generalist Robot Policies
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving