Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Xinshun, Li, Peiming, Wang, Ziyi, Fang, Zhongbin, Deng, Zhichao, Wu, Songtao, Li, Jason, Liu, Mengyuan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Skeleton-in-Context: Unified Skeleton Sequence Modeling with In-Context Learning
par: Wang, Xinshun, et autres
Publié: (2023)
par: Wang, Xinshun, et autres
Publié: (2023)
Human-in-Context: Unified Cross-Domain 3D Human Motion Modeling via In-Context Learning
par: Liu, Mengyuan, et autres
Publié: (2025)
par: Liu, Mengyuan, et autres
Publié: (2025)
Universal Skeleton Understanding via Differentiable Rendering and MLLMs
par: Wang, Ziyi, et autres
Publié: (2026)
par: Wang, Ziyi, et autres
Publié: (2026)
UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation
par: Wang, Ziyi, et autres
Publié: (2026)
par: Wang, Ziyi, et autres
Publié: (2026)
Recognizing Actions from Robotic View for Natural Human-Robot Interaction
par: Wang, Ziyi, et autres
Publié: (2025)
par: Wang, Ziyi, et autres
Publié: (2025)
ClickDiff: Click to Induce Semantic Contact Map for Controllable Grasp Generation with Diffusion Models
par: Li, Peiming, et autres
Publié: (2024)
par: Li, Peiming, et autres
Publié: (2024)
Lens Privacy Sealing: A New Benchmark and Method for Physical Privacy-Preserving Action Recognition
par: Liu, Mengyuan, et autres
Publié: (2026)
par: Liu, Mengyuan, et autres
Publié: (2026)
UST-SSM: Unified Spatio-Temporal State Space Models for Point Cloud Video Modeling
par: Li, Peiming, et autres
Publié: (2025)
par: Li, Peiming, et autres
Publié: (2025)
CHASE: Learning Convex Hull Adaptive Shift for Skeleton-based Multi-Entity Action Recognition
par: Wen, Yuhang, et autres
Publié: (2024)
par: Wen, Yuhang, et autres
Publié: (2024)
MoPO: Incorporating Motion Prior for Occluded Human Mesh Recovery
par: Tang, Tao, et autres
Publié: (2026)
par: Tang, Tao, et autres
Publié: (2026)
ModelNet-O: A Large-Scale Synthetic Dataset for Occlusion-Aware Point Cloud Classification
par: Fang, Zhongbin, et autres
Publié: (2024)
par: Fang, Zhongbin, et autres
Publié: (2024)
HyLiFormer: Hyperbolic Linear Attention for Skeleton-based Human Action Recognition
par: Li, Yue, et autres
Publié: (2025)
par: Li, Yue, et autres
Publié: (2025)
Language-Guided Transformer Tokenizer for Human Motion Generation
par: Yan, Sheng, et autres
Publié: (2026)
par: Yan, Sheng, et autres
Publié: (2026)
Active Generation Network of Human Skeleton for Action Recognition
par: Liu, Long, et autres
Publié: (2024)
par: Liu, Long, et autres
Publié: (2024)
Learning Mutual Excitation for Hand-to-Hand and Human-to-Human Interaction Recognition
par: Liu, Mengyuan, et autres
Publié: (2024)
par: Liu, Mengyuan, et autres
Publié: (2024)
Aligning Human Motion Generation with Human Perceptions
par: Wang, Haoru, et autres
Publié: (2024)
par: Wang, Haoru, et autres
Publié: (2024)
Motion Matters: Motion-guided Modulation Network for Skeleton-based Micro-Action Recognition
par: Gu, Jihao, et autres
Publié: (2025)
par: Gu, Jihao, et autres
Publié: (2025)
EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer
par: Yang, Yuxiao, et autres
Publié: (2025)
par: Yang, Yuxiao, et autres
Publié: (2025)
Eye Motion Matters for 3D Face Reconstruction
par: Wang, Xuan, et autres
Publié: (2024)
par: Wang, Xuan, et autres
Publié: (2024)
Controllable Complex Human Motion Video Generation via Text-to-Skeleton Cascades
par: Taghipour, Ashkan, et autres
Publié: (2026)
par: Taghipour, Ashkan, et autres
Publié: (2026)
VG4D: Vision-Language Model Goes 4D Video Recognition
par: Deng, Zhichao, et autres
Publié: (2024)
par: Deng, Zhichao, et autres
Publié: (2024)
Language-Assisted Human Part Motion Learning for Skeleton-Based Temporal Action Segmentation
par: Chen, Bowen, et autres
Publié: (2024)
par: Chen, Bowen, et autres
Publié: (2024)
Multi-Modality Co-Learning for Efficient Skeleton-based Action Recognition
par: Liu, Jinfu, et autres
Publié: (2024)
par: Liu, Jinfu, et autres
Publié: (2024)
MoSa: Motion Generation with Scalable Autoregressive Modeling
par: Liu, Mengyuan, et autres
Publié: (2025)
par: Liu, Mengyuan, et autres
Publié: (2025)
Marrying Text-to-Motion Generation with Skeleton-Based Action Recognition
par: Kuang, Jidong, et autres
Publié: (2026)
par: Kuang, Jidong, et autres
Publié: (2026)
Expressive Forecasting of 3D Whole-body Human Motions
par: Ding, Pengxiang, et autres
Publié: (2023)
par: Ding, Pengxiang, et autres
Publié: (2023)
MotionRFT: Unified Reinforcement Fine-Tuning for Text-to-Motion Generation
par: Tan, Xiaofeng, et autres
Publié: (2026)
par: Tan, Xiaofeng, et autres
Publié: (2026)
Point-In-Context: Understanding Point Cloud via In-Context Learning
par: Liu, Mengyuan, et autres
Publié: (2024)
par: Liu, Mengyuan, et autres
Publié: (2024)
MEgoHand: Multimodal Egocentric Hand-Object Interaction Motion Generation
par: Zhou, Bohan, et autres
Publié: (2025)
par: Zhou, Bohan, et autres
Publié: (2025)
Foundation Model for Skeleton-Based Human Action Understanding
par: Wang, Hongsong, et autres
Publié: (2025)
par: Wang, Hongsong, et autres
Publié: (2025)
MoCapAnything: Unified 3D Motion Capture for Arbitrary Skeletons from Monocular Videos
par: Gong, Kehong, et autres
Publié: (2025)
par: Gong, Kehong, et autres
Publié: (2025)
PUMPS: Skeleton-Agnostic Point-based Universal Motion Pre-Training for Synthesis in Human Motion Tasks
par: Mo, Clinton Ansun, et autres
Publié: (2025)
par: Mo, Clinton Ansun, et autres
Publié: (2025)
X-MoGen: Unified Motion Generation across Humans and Animals
par: Wang, Xuan, et autres
Publié: (2025)
par: Wang, Xuan, et autres
Publié: (2025)
SemGeoMo: Dynamic Contextual Human Motion Generation with Semantic and Geometric Guidance
par: Cong, Peishan, et autres
Publié: (2025)
par: Cong, Peishan, et autres
Publié: (2025)
Breaking the Passive Learning Trap: An Active Perception Strategy for Human Motion Prediction
par: Hu, Juncheng, et autres
Publié: (2025)
par: Hu, Juncheng, et autres
Publié: (2025)
MLP: Motion Label Prior for Temporal Sentence Localization in Untrimmed 3D Human Motions
par: Yan, Sheng, et autres
Publié: (2024)
par: Yan, Sheng, et autres
Publié: (2024)
A Survey on 3D Skeleton-Based Action Recognition Using Learning Method
par: Ren, Bin, et autres
Publié: (2020)
par: Ren, Bin, et autres
Publié: (2020)
The Language of Motion: Unifying Verbal and Non-verbal Language of 3D Human Motion
par: Chen, Changan, et autres
Publié: (2024)
par: Chen, Changan, et autres
Publié: (2024)
Motion Avatar: Generate Human and Animal Avatars with Arbitrary Motion
par: Zhang, Zeyu, et autres
Publié: (2024)
par: Zhang, Zeyu, et autres
Publié: (2024)
Progressive Human Motion Generation Based on Text and Few Motion Frames
par: Zeng, Ling-An, et autres
Publié: (2025)
par: Zeng, Ling-An, et autres
Publié: (2025)
Documents similaires
-
Skeleton-in-Context: Unified Skeleton Sequence Modeling with In-Context Learning
par: Wang, Xinshun, et autres
Publié: (2023) -
Human-in-Context: Unified Cross-Domain 3D Human Motion Modeling via In-Context Learning
par: Liu, Mengyuan, et autres
Publié: (2025) -
Universal Skeleton Understanding via Differentiable Rendering and MLLMs
par: Wang, Ziyi, et autres
Publié: (2026) -
UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation
par: Wang, Ziyi, et autres
Publié: (2026) -
Recognizing Actions from Robotic View for Natural Human-Robot Interaction
par: Wang, Ziyi, et autres
Publié: (2025)