MMGT: Motion Mask Guided Two-Stage Network for Co-Speech Gesture Video Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Siyuan, Liu, Jiawei, Wang, Wei, Jin, Yeying, Du, Jinsong, Han, Zhi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MDT-A2G: Exploring Masked Diffusion Transformers for Co-Speech Gesture Generation
por: Mao, Xiaofeng, et al.
Publicado: (2024)
por: Mao, Xiaofeng, et al.
Publicado: (2024)
PersonaGest: Personalized Co-Speech Gesture Generation with Semantic-Guided Hierarchical Motion Representation
por: Zhao, Junchuan, et al.
Publicado: (2026)
por: Zhao, Junchuan, et al.
Publicado: (2026)
LiveGesture Streamable Co-Speech Gesture Generation Model
por: Saleem, Muhammad Usama, et al.
Publicado: (2026)
por: Saleem, Muhammad Usama, et al.
Publicado: (2026)
EMAGE: Towards Unified Holistic Co-Speech Gesture Generation via Expressive Masked Audio Gesture Modeling
por: Liu, Haiyang, et al.
Publicado: (2023)
por: Liu, Haiyang, et al.
Publicado: (2023)
Co-Speech Gesture Video Generation via Motion-Decoupled Diffusion Model
por: He, Xu, et al.
Publicado: (2024)
por: He, Xu, et al.
Publicado: (2024)
Contextual Gesture: Co-Speech Gesture Video Generation through Context-aware Gesture Representation
por: Liu, Pinxin, et al.
Publicado: (2025)
por: Liu, Pinxin, et al.
Publicado: (2025)
TANGO: Co-Speech Gesture Video Reenactment with Hierarchical Audio Motion Embedding and Diffusion Interpolation
por: Liu, Haiyang, et al.
Publicado: (2024)
por: Liu, Haiyang, et al.
Publicado: (2024)
Co-speech Gesture Video Generation via Motion-Based Graph Retrieval
por: Song, Yafei, et al.
Publicado: (2025)
por: Song, Yafei, et al.
Publicado: (2025)
Democratizing High-Fidelity Co-Speech Gesture Video Generation
por: Yang, Xu, et al.
Publicado: (2025)
por: Yang, Xu, et al.
Publicado: (2025)
EchoMask: Speech-Queried Attention-based Mask Modeling for Holistic Co-Speech Motion Generation
por: Zhang, Xiangyue, et al.
Publicado: (2025)
por: Zhang, Xiangyue, et al.
Publicado: (2025)
SpeechAct: Towards Generating Whole-body Motion from Speech
por: Zhang, Jinsong, et al.
Publicado: (2023)
por: Zhang, Jinsong, et al.
Publicado: (2023)
Recognizing Co-Speech Gestures in-the-Wild
por: Hegde, Sindhu B, et al.
Publicado: (2026)
por: Hegde, Sindhu B, et al.
Publicado: (2026)
CoordSpeaker: Exploiting Gesture Captioning for Coordinated Caption-Empowered Co-Speech Gesture Generation
por: Fang, Fengyi, et al.
Publicado: (2025)
por: Fang, Fengyi, et al.
Publicado: (2025)
Generation then Reconstruction: Accelerating Masked Autoregressive Models via Two-Stage Sampling
por: Yan, Feihong, et al.
Publicado: (2025)
por: Yan, Feihong, et al.
Publicado: (2025)
CoCoGesture: Toward Coherent Co-speech 3D Gesture Generation in the Wild
por: Qi, Xingqun, et al.
Publicado: (2024)
por: Qi, Xingqun, et al.
Publicado: (2024)
Cosh-DiT: Co-Speech Gesture Video Synthesis via Hybrid Audio-Visual Diffusion Transformers
por: Sun, Yasheng, et al.
Publicado: (2025)
por: Sun, Yasheng, et al.
Publicado: (2025)
HOP: Heterogeneous Topology-based Multimodal Entanglement for Co-Speech Gesture Generation
por: Cheng, Hongye, et al.
Publicado: (2025)
por: Cheng, Hongye, et al.
Publicado: (2025)
PersonaGesture: Single-Reference Co-Speech Gesture Personalization for Unseen Speakers
por: Zhang, Xiangyue, et al.
Publicado: (2026)
por: Zhang, Xiangyue, et al.
Publicado: (2026)
GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling
por: Liu, Pinxin, et al.
Publicado: (2025)
por: Liu, Pinxin, et al.
Publicado: (2025)
DuoGesture: Neuro-Inspired and Biomechanically Informed Dual-Stream Co-Speech Gesture Generation
por: Paar, Ferdinand, et al.
Publicado: (2026)
por: Paar, Ferdinand, et al.
Publicado: (2026)
Prompt-Guided Mask Proposal for Two-Stage Open-Vocabulary Segmentation
por: Li, Yu-Jhe, et al.
Publicado: (2024)
por: Li, Yu-Jhe, et al.
Publicado: (2024)
Co$^{3}$Gesture: Towards Coherent Concurrent Co-speech 3D Gesture Generation with Interactive Diffusion
por: Qi, Xingqun, et al.
Publicado: (2025)
por: Qi, Xingqun, et al.
Publicado: (2025)
Conveying Meaning through Gestures: An Investigation into Semantic Co-Speech Gesture Generation
por: Voss, Hendric, et al.
Publicado: (2025)
por: Voss, Hendric, et al.
Publicado: (2025)
ExGes: Expressive Human Motion Retrieval and Modulation for Audio-Driven Gesture Synthesis
por: Zhou, Xukun, et al.
Publicado: (2025)
por: Zhou, Xukun, et al.
Publicado: (2025)
MAG: Multi-Modal Aligned Autoregressive Co-Speech Gesture Generation without Vector Quantization
por: Liu, Binjie, et al.
Publicado: (2025)
por: Liu, Binjie, et al.
Publicado: (2025)
Text-Guided Video Masked Autoencoder
por: Fan, David, et al.
Publicado: (2024)
por: Fan, David, et al.
Publicado: (2024)
Motion-example-controlled Co-speech Gesture Generation Leveraging Large Language Models
por: Chen, Bohong, et al.
Publicado: (2025)
por: Chen, Bohong, et al.
Publicado: (2025)
ReMoMask: Retrieval-Augmented Masked Motion Generation
por: Li, Zhengdao, et al.
Publicado: (2025)
por: Li, Zhengdao, et al.
Publicado: (2025)
InteracTalker: Prompt-Based Human-Object Interaction with Co-Speech Gesture Generation
por: Rajan, Sreehari, et al.
Publicado: (2025)
por: Rajan, Sreehari, et al.
Publicado: (2025)
Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters
por: Hogue, Steven, et al.
Publicado: (2024)
por: Hogue, Steven, et al.
Publicado: (2024)
Edit as You See: Image-guided Video Editing via Masked Motion Modeling
por: Huang, Zhi-Lin, et al.
Publicado: (2025)
por: Huang, Zhi-Lin, et al.
Publicado: (2025)
mmEgoHand: Egocentric Hand Pose Estimation and Gesture Recognition with Head-mounted Millimeter-wave Radar and IMU
por: Lv, Yizhe, et al.
Publicado: (2025)
por: Lv, Yizhe, et al.
Publicado: (2025)
MaskSem: Semantic-Guided Masking for Learning 3D Hybrid High-Order Motion Representation
por: Wei, Wei, et al.
Publicado: (2025)
por: Wei, Wei, et al.
Publicado: (2025)
EmotionGesture: Audio-Driven Diverse Emotional Co-Speech 3D Gesture Generation
por: Qi, Xingqun, et al.
Publicado: (2023)
por: Qi, Xingqun, et al.
Publicado: (2023)
LumosFlow: Motion-Guided Long Video Generation
por: Chen, Jiahao, et al.
Publicado: (2025)
por: Chen, Jiahao, et al.
Publicado: (2025)
Motion Guided Token Compression for Efficient Masked Video Modeling
por: Feng, Yukun, et al.
Publicado: (2024)
por: Feng, Yukun, et al.
Publicado: (2024)
HoloGest: Decoupled Diffusion and Motion Priors for Generating Holisticly Expressive Co-speech Gestures
por: Cheng, Yongkang, et al.
Publicado: (2025)
por: Cheng, Yongkang, et al.
Publicado: (2025)
Prompt-to-Gesture: Measuring the Capabilities of Image-to-Video Deictic Gesture Generation
por: Ali, Hassan, et al.
Publicado: (2026)
por: Ali, Hassan, et al.
Publicado: (2026)
A Two-Stage Masked Autoencoder Based Network for Indoor Depth Completion
por: Sun, Kailai, et al.
Publicado: (2024)
por: Sun, Kailai, et al.
Publicado: (2024)
Emphasizing Semantic Consistency of Salient Posture for Speech-Driven Gesture Generation
por: Liu, Fengqi, et al.
Publicado: (2024)
por: Liu, Fengqi, et al.
Publicado: (2024)
Ejemplares similares
-
MDT-A2G: Exploring Masked Diffusion Transformers for Co-Speech Gesture Generation
por: Mao, Xiaofeng, et al.
Publicado: (2024) -
PersonaGest: Personalized Co-Speech Gesture Generation with Semantic-Guided Hierarchical Motion Representation
por: Zhao, Junchuan, et al.
Publicado: (2026) -
LiveGesture Streamable Co-Speech Gesture Generation Model
por: Saleem, Muhammad Usama, et al.
Publicado: (2026) -
EMAGE: Towards Unified Holistic Co-Speech Gesture Generation via Expressive Masked Audio Gesture Modeling
por: Liu, Haiyang, et al.
Publicado: (2023) -
Co-Speech Gesture Video Generation via Motion-Decoupled Diffusion Model
por: He, Xu, et al.
Publicado: (2024)