Learning Transformation-Isomorphic Latent Space for Accurate Hand Pose Estimation
cs.CV
Submitted: 2025-02-18
Updated: 2025-02-18
Code: https://github.com/openmmlab/mmpose
Terminology
Sources
- Masked Autoencoders Are Scalable Vision Learners
- Masked Modeling for Self-supervised Representation Learning on Vision and Beyond
- Pre-Training for 3D Hand Pose Estimation with Contrastive Learning on Large-Scale Hand Images in the Wild
- MediaPipe: A Framework for Building Perception Pipelines
- Bringing Inputs to Shared Domains for 3D Interacting Hands Recovery in the Wild
- PeCLR: Self-Supervised 3D Hand Pose Estimation from monocular RGB via Equivariant Contrastive Learning
- RI-MAE: Rotation-Invariant Masked AutoEncoders for Self-Supervised Point Cloud Representation Learning
- ViTPose++: Vision Transformer for Generic Body Pose Estimation
- iBOT: Image BERT Pre-Training with Online Tokenizer
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models