From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation
cs.CV
Submitted: 2026-05-09
Updated: 2026-09-25
Comments: NeurIPS 2026: https://arlo0o.github.io/KVLR-project/
Journal ref: NeurIPS 2026
Code: https://github.com/facebookresearch/slowfast
License: http://creativecommons.org/licenses/by/4.0/
The gist: Action-conditioned surgical video generation is a critical yet highly challenging problem for robotic surgery.
Terminology
Abstract
Action-conditioned surgical video generation is a critical yet highly challenging problem for robotic surgery. The core difficulty is that low-dimensional control vectors must precisely govern complex image-space evolution. In this work, we propose a kinematic-to-visual lifting paradigm that converts articulated kinematics into a unified set of five image-aligned control modalities. Building on this representation, we introduce a hierarchically routed visual control framework that selectively activates the most relevant control modalities and motion scales. Instead of uniformly applying all control signals, our model performs hierarchical routing to dynamically allocate conditioning capacity. We further design kinematic-prior-guided routing loss functions to ensure physically meaningful, temporally stable, and efficient expert utilization. To improve efficiency, we propose a budgeted training and inference scheme that leverages routing-induced sparsity. By selectively discarding low-significance control pathways during training and execution, our approach enables adaptive computation that is complementary to standard distillation. We additionally construct a new benchmark with curated articulated annotations, obtained through human-in-the-loop semantic labeling and differentiable pose tracking, providing realistic supervision for action-conditioned surgical video generation. Extensive experiments demonstrate that our method consistently improves action faithfulness, visual fidelity, and cross-domain generalization over diverse baselines. Moreover, our efficient variant achieves substantial reductions in latency while maintaining strong control accuracy.
Sources
- Cosmos-Transfer1: Conditional World Generation with Adaptive Multimodal Control
- Medical Video Generation for Disease Progression Simulation
- UniMLVG: Unified Framework for Multi-view Long Video Generation with Comprehensive Control Capabilities for Autonomous Driving
- How Far Are Surgeons from Surgical World Models? A Pilot Study on Zero-shot Surgical Video Generation with Expert Assessment
- SurGen: Text-Guided Diffusion Model for Surgical Video Generation
- Scaling Diffusion Transformers to 16 Billion Parameters
- DepthPilot: From Controllability to Interpretability in Colonoscopy Video Generation
- PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generation
- Unraveling the Effects of Synthetic Data on End-to-End Autonomous Driving
- Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI
- DiST-4D: Disentangled Spatiotemporal Diffusion with Metric Depth for 4D Driving Scene Generation
- Cosmos-H-Surgical: Learning Surgical Robot Policies from Videos via World Modeling
- Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future
- LVSM: A Large View Synthesis Model with Minimal 3D Inductive Bias
- Surgical-LLaVA: Toward Surgical Scenario Understanding via Large Language and Vision Models
- Disturbance-Free Surgical Video Generation from Multi-Camera Shadowless Lamps for Open Surgery
- 3D and 4D World Modeling: A Survey
- HunyuanVideo: A Systematic Framework For Large Video Generative Models
- Scaling Up Occupancy-centric Driving Scene Generation: Dataset and Method
- OmniNWM: Omniscient Driving Navigation World Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models