MotionVerse: A Unified Multimodal Framework for Motion Comprehension, Generation and Editing
Fuente:
arXiv
Salvato in:
| Autori principali: | Hou, Ruibing, Luo, Mingshuang, Pan, Hongyu, Chang, Hong, Shan, Shiguang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
M$^3$GPT: An Advanced Multimodal, Multitask Framework for Motion Comprehension and Generation
di: Luo, Mingshuang, et al.
Pubblicazione: (2024)
di: Luo, Mingshuang, et al.
Pubblicazione: (2024)
UniPose: A Unified Multimodal Framework for Human Pose Comprehension, Generation and Editing
di: Li, Yiheng, et al.
Pubblicazione: (2024)
di: Li, Yiheng, et al.
Pubblicazione: (2024)
EgoMotion: Hierarchical Reasoning and Diffusion for Egocentric Vision-Language Motion Generation
di: Hou, Ruibing, et al.
Pubblicazione: (2026)
di: Hou, Ruibing, et al.
Pubblicazione: (2026)
Morph: A Motion-free Physics Optimization Framework for Human Motion Generation
di: Li, Zhuo, et al.
Pubblicazione: (2024)
di: Li, Zhuo, et al.
Pubblicazione: (2024)
CLIP-Guided Adaptable Self-Supervised Learning for Human-Centric Visual Tasks
di: Luo, Mingshuang, et al.
Pubblicazione: (2026)
di: Luo, Mingshuang, et al.
Pubblicazione: (2026)
RefHCM: A Unified Model for Referring Perceptions in Human-Centric Scenarios
di: Huang, Jie, et al.
Pubblicazione: (2024)
di: Huang, Jie, et al.
Pubblicazione: (2024)
AnyMo: Scaling Any-Modality Conditional Motion Generation with Masked Modeling
di: Li, Yiheng, et al.
Pubblicazione: (2026)
di: Li, Yiheng, et al.
Pubblicazione: (2026)
HIS-GPT: Towards 3D Human-In-Scene Multimodal Understanding
di: Zhao, Jiahe, et al.
Pubblicazione: (2025)
di: Zhao, Jiahe, et al.
Pubblicazione: (2025)
Component-Based Out-of-Distribution Detection
di: Liu, Wenrui, et al.
Pubblicazione: (2026)
di: Liu, Wenrui, et al.
Pubblicazione: (2026)
DIVE: Inverting Conditional Diffusion Models for Discriminative Tasks
di: Li, Yinqi, et al.
Pubblicazione: (2025)
di: Li, Yinqi, et al.
Pubblicazione: (2025)
Generalized Semi-Supervised Learning via Self-Supervised Feature Adaptation
di: Liang, Jiachen, et al.
Pubblicazione: (2024)
di: Liang, Jiachen, et al.
Pubblicazione: (2024)
un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP
di: Li, Yinqi, et al.
Pubblicazione: (2025)
di: Li, Yinqi, et al.
Pubblicazione: (2025)
Revisiting Logit Distributions for Reliable Out-of-Distribution Detection
di: Liang, Jiachen, et al.
Pubblicazione: (2025)
di: Liang, Jiachen, et al.
Pubblicazione: (2025)
UMFC: Unsupervised Multi-Domain Feature Calibration for Vision-Language Models
di: Liang, Jiachen, et al.
Pubblicazione: (2024)
di: Liang, Jiachen, et al.
Pubblicazione: (2024)
HERM: Benchmarking and Enhancing Multimodal LLMs for Human-Centric Understanding
di: Li, Keliang, et al.
Pubblicazione: (2024)
di: Li, Keliang, et al.
Pubblicazione: (2024)
VersatileMotion: A Unified Framework for Motion Synthesis and Comprehension
di: Ling, Zeyu, et al.
Pubblicazione: (2024)
di: Ling, Zeyu, et al.
Pubblicazione: (2024)
MotionLab: Unified Human Motion Generation and Editing via the Motion-Condition-Motion Paradigm
di: Guo, Ziyan, et al.
Pubblicazione: (2025)
di: Guo, Ziyan, et al.
Pubblicazione: (2025)
Clothes-Changing Person Re-Identification with Feasibility-Aware Intermediary Matching
di: Zhao, Jiahe, et al.
Pubblicazione: (2024)
di: Zhao, Jiahe, et al.
Pubblicazione: (2024)
MG-MotionLLM: A Unified Framework for Motion Comprehension and Generation across Multiple Granularities
di: Wu, Bizhu, et al.
Pubblicazione: (2025)
di: Wu, Bizhu, et al.
Pubblicazione: (2025)
EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning
di: Ju, Xuan, et al.
Pubblicazione: (2025)
di: Ju, Xuan, et al.
Pubblicazione: (2025)
MechVerse: Evaluating Physical Motion Consistency in Video Generation Models
di: Jain, Rahul, et al.
Pubblicazione: (2026)
di: Jain, Rahul, et al.
Pubblicazione: (2026)
MotionMERGE: A Multi-granular Framework for Human Motion Editing, Reasoning, Generation, and Explanation
di: Wu, Bizhu, et al.
Pubblicazione: (2026)
di: Wu, Bizhu, et al.
Pubblicazione: (2026)
OmniMotion: Multimodal Motion Generation with Continuous Masked Autoregression
di: Li, Zhe, et al.
Pubblicazione: (2025)
di: Li, Zhe, et al.
Pubblicazione: (2025)
Fully Unified Motion Planning for End-to-End Autonomous Driving
di: Liu, Lin, et al.
Pubblicazione: (2025)
di: Liu, Lin, et al.
Pubblicazione: (2025)
UniEdit: A Unified Tuning-Free Framework for Video Motion and Appearance Editing
di: Bai, Jianhong, et al.
Pubblicazione: (2024)
di: Bai, Jianhong, et al.
Pubblicazione: (2024)
Large Motion Model for Unified Multi-Modal Motion Generation
di: Zhang, Mingyuan, et al.
Pubblicazione: (2024)
di: Zhang, Mingyuan, et al.
Pubblicazione: (2024)
ComprehendEdit: A Comprehensive Dataset and Evaluation Framework for Multimodal Knowledge Editing
di: Ma, Yaohui, et al.
Pubblicazione: (2024)
di: Ma, Yaohui, et al.
Pubblicazione: (2024)
FacEDiT: Unified Talking Face Editing and Generation via Facial Motion Infilling
di: Sung-Bin, Kim, et al.
Pubblicazione: (2025)
di: Sung-Bin, Kim, et al.
Pubblicazione: (2025)
EfficientMT: Efficient Temporal Adaptation for Motion Transfer in Text-to-Video Diffusion Models
di: Cai, Yufei, et al.
Pubblicazione: (2025)
di: Cai, Yufei, et al.
Pubblicazione: (2025)
DreamActor-M2: Universal Character Image Animation via Spatiotemporal In-Context Learning
di: Luo, Mingshuang, et al.
Pubblicazione: (2026)
di: Luo, Mingshuang, et al.
Pubblicazione: (2026)
MotionCtrl: A Unified and Flexible Motion Controller for Video Generation
di: Wang, Zhouxia, et al.
Pubblicazione: (2023)
di: Wang, Zhouxia, et al.
Pubblicazione: (2023)
Dynamic Motion Blending for Versatile Motion Editing
di: Jiang, Nan, et al.
Pubblicazione: (2025)
di: Jiang, Nan, et al.
Pubblicazione: (2025)
UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation
di: Wang, Ziyi, et al.
Pubblicazione: (2026)
di: Wang, Ziyi, et al.
Pubblicazione: (2026)
FreeMotion: A Unified Framework for Number-free Text-to-Motion Synthesis
di: Fan, Ke, et al.
Pubblicazione: (2024)
di: Fan, Ke, et al.
Pubblicazione: (2024)
Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing
di: Liu, Jialun, et al.
Pubblicazione: (2026)
di: Liu, Jialun, et al.
Pubblicazione: (2026)
DynamicVerse: A Physically-Aware Multimodal Framework for 4D World Modeling
di: Wen, Kairun, et al.
Pubblicazione: (2025)
di: Wen, Kairun, et al.
Pubblicazione: (2025)
Revisiting Multimodal Positional Encoding in Vision-Language Models
di: Huang, Jie, et al.
Pubblicazione: (2025)
di: Huang, Jie, et al.
Pubblicazione: (2025)
MotionRFT: Unified Reinforcement Fine-Tuning for Text-to-Motion Generation
di: Tan, Xiaofeng, et al.
Pubblicazione: (2026)
di: Tan, Xiaofeng, et al.
Pubblicazione: (2026)
SimMotionEdit: Text-Based Human Motion Editing with Motion Similarity Prediction
di: Li, Zhengyuan, et al.
Pubblicazione: (2025)
di: Li, Zhengyuan, et al.
Pubblicazione: (2025)
UniEgoMotion: A Unified Model for Egocentric Motion Reconstruction, Forecasting, and Generation
di: Patel, Chaitanya, et al.
Pubblicazione: (2025)
di: Patel, Chaitanya, et al.
Pubblicazione: (2025)
Documenti analoghi
-
M$^3$GPT: An Advanced Multimodal, Multitask Framework for Motion Comprehension and Generation
di: Luo, Mingshuang, et al.
Pubblicazione: (2024) -
UniPose: A Unified Multimodal Framework for Human Pose Comprehension, Generation and Editing
di: Li, Yiheng, et al.
Pubblicazione: (2024) -
EgoMotion: Hierarchical Reasoning and Diffusion for Egocentric Vision-Language Motion Generation
di: Hou, Ruibing, et al.
Pubblicazione: (2026) -
Morph: A Motion-free Physics Optimization Framework for Human Motion Generation
di: Li, Zhuo, et al.
Pubblicazione: (2024) -
CLIP-Guided Adaptable Self-Supervised Learning for Human-Centric Visual Tasks
di: Luo, Mingshuang, et al.
Pubblicazione: (2026)