SAKI: Skill Assembly and Kinematic Imitation from Human Videos for Long-Horizon Mobile Manipulation
cs.RO
Submitted: 2026-09-28
Updated: 2026-09-28
Project page: https://aus.bot/research/saki/Abstract
Terminology
Sources
- Vision-based Manipulation from Single Human Video with Open-World Object Graphs
- DynaMem: Online Dynamic Spatio-Semantic Memory for Open World Mobile Manipulation
- BUMBLE: Unifying Reasoning and Acting with Vision-Language Models for Building-wide Mobile Manipulation
- SPOT: SE(3) Pose Trajectory Diffusion for Object-Centric Manipulation
- ScrewMimic: Bimanual Imitation from Human Videos with Screw Space Projection
- Neural Descriptor Fields: SE(3)-Equivariant Object Representations for Manipulation
- SE(3)-Equivariant Relational Rearrangement with Neural Descriptor Fields
- VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models
- ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation
- Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation
- HoMMI: Learning Whole-Body Mobile Manipulation from Human Demonstrations
- HRT1: One-Shot Human-to-Robot Trajectory Transfer for Mobile Manipulation
- Inner Monologue: Embodied Reasoning through Planning with Language Models
- MimicGen: A Data Generation System for Scalable Robot Learning using Human Demonstrations
- DemoGen: Synthetic Demonstration Generation for Data-Efficient Visuomotor Policy Learning
- Tri-Manual Visuomotor Imitation Learning of Robot Policies
- Worlds in One Demo: A Synthetic Data Engine for Learning Open-World Mobile Manipulation
- Dream2Flow: Bridging Video Generation and Open-World Manipulation with 3D Object Flow
- RoboReact: Agentic Skill Distillation from Generated Egocentric Videos for Generalizable Whole-Body Manipulation
- Do As I Can, Not As I Say: Grounding Language in Robotic Affordances
Related papers
- FMT x: An Efficient and Asymptotically Optimal Extension of the Fast Marching Tree for Dynamic Replanning
- MPCFormer: A physics-informed data-driven approach for explainable socially-aware autonomous driving
- RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
- HRDexDB: A 4D Dexterous Grasping Dataset Across Human and Multiple Robot Embodiments
- APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies
- Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving