MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yucheng, Xu, Dan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MoDiTalker: Motion-Disentangled Diffusion Model for High-Fidelity Talking Head Generation
par: Kim, Seyeon, et autres
Publié: (2024)
par: Kim, Seyeon, et autres
Publié: (2024)
ConsistTalk: Intensity Controllable Temporally Consistent Talking Head Generation with Diffusion Noise Search
par: Liu, Zhenjie, et autres
Publié: (2025)
par: Liu, Zhenjie, et autres
Publié: (2025)
Learning Online Scale Transformation for Talking Head Video Generation
par: Hong, Fa-Ting, et autres
Publié: (2024)
par: Hong, Fa-Ting, et autres
Publié: (2024)
DiMo: Discrete Diffusion Modeling for Motion Generation and Understanding
par: Zhang, Ning, et autres
Publié: (2026)
par: Zhang, Ning, et autres
Publié: (2026)
MoDA: Multi-modal Diffusion Architecture for Talking Head Generation
par: Li, Xinyang, et autres
Publié: (2025)
par: Li, Xinyang, et autres
Publié: (2025)
MoCoTalk: Multi-Conditional Diffusion with Adaptive Router for Controllable Talking Head Generation
par: Ye, Xinyan, et autres
Publié: (2026)
par: Ye, Xinyan, et autres
Publié: (2026)
Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation
par: Zhao, Shuling, et autres
Publié: (2024)
par: Zhao, Shuling, et autres
Publié: (2024)
ConsistentAvatar: Learning to Diffuse Fully Consistent Talking Head Avatar with Temporal Guidance
par: Yang, Haijie, et autres
Publié: (2024)
par: Yang, Haijie, et autres
Publié: (2024)
IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation
par: Yang, Sejong, et autres
Publié: (2024)
par: Yang, Sejong, et autres
Publié: (2024)
JambaTalk: Speech-Driven 3D Talking Head Generation Based on Hybrid Transformer-Mamba Model
par: Jafari, Farzaneh, et autres
Publié: (2024)
par: Jafari, Farzaneh, et autres
Publié: (2024)
EmoTalk3D: High-Fidelity Free-View Synthesis of Emotional 3D Talking Head
par: He, Qianyun, et autres
Publié: (2024)
par: He, Qianyun, et autres
Publié: (2024)
DreamTalk: When Emotional Talking Head Generation Meets Diffusion Probabilistic Models
par: Ma, Yifeng, et autres
Publié: (2023)
par: Ma, Yifeng, et autres
Publié: (2023)
EmoDiffTalk:Emotion-aware Diffusion for Editable 3D Gaussian Talking Head
par: Liu, Chang, et autres
Publié: (2025)
par: Liu, Chang, et autres
Publié: (2025)
Audio-visual Controlled Video Diffusion with Masked Selective State Spaces Modeling for Natural Talking Head Generation
par: Hong, Fa-Ting, et autres
Publié: (2025)
par: Hong, Fa-Ting, et autres
Publié: (2025)
Dimitra: Audio-driven Diffusion model for Expressive Talking Head Generation
par: Chopin, Baptiste, et autres
Publié: (2025)
par: Chopin, Baptiste, et autres
Publié: (2025)
HM-Talker: Hybrid Motion Modeling for High-Fidelity Talking Head Synthesis
par: Liu, Shiyu, et autres
Publié: (2025)
par: Liu, Shiyu, et autres
Publié: (2025)
FreeTalk: Emotional Topology-Free 3D Talking Heads
par: Nocentini, Federico, et autres
Publié: (2026)
par: Nocentini, Federico, et autres
Publié: (2026)
ScanTalk: 3D Talking Heads from Unregistered Scans
par: Nocentini, Federico, et autres
Publié: (2024)
par: Nocentini, Federico, et autres
Publié: (2024)
OT-Talk: Animating 3D Talking Head with Optimal Transportation
par: Wang, Xinmu, et autres
Publié: (2025)
par: Wang, Xinmu, et autres
Publié: (2025)
GaussianHeadTalk: Wobble-Free 3D Talking Heads with Audio Driven Gaussian Splatting
par: Agarwal, Madhav, et autres
Publié: (2025)
par: Agarwal, Madhav, et autres
Publié: (2025)
Beyond Talking -- Generating Holistic 3D Human Dyadic Motion for Communication
par: Sun, Mingze, et autres
Publié: (2024)
par: Sun, Mingze, et autres
Publié: (2024)
MiM-DiT: MoE in MoE with Diffusion Transformers for All-in-One Image Restoration
par: Kong, Lingshun, et autres
Publié: (2026)
par: Kong, Lingshun, et autres
Publié: (2026)
Learning Dynamic Tetrahedra for High-Quality Talking Head Synthesis
par: Zhang, Zicheng, et autres
Publié: (2024)
par: Zhang, Zicheng, et autres
Publié: (2024)
FD2Talk: Towards Generalized Talking Head Generation with Facial Decoupled Diffusion Model
par: Yao, Ziyu, et autres
Publié: (2024)
par: Yao, Ziyu, et autres
Publié: (2024)
IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos
par: Li, Yuan, et autres
Publié: (2025)
par: Li, Yuan, et autres
Publié: (2025)
HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation
par: Gan, Qijun, et autres
Publié: (2025)
par: Gan, Qijun, et autres
Publié: (2025)
EMOdiffhead: Continuously Emotional Control in Talking Head Generation via Diffusion
par: Zhang, Jian, et autres
Publié: (2024)
par: Zhang, Jian, et autres
Publié: (2024)
FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis
par: Wang, Mengchao, et autres
Publié: (2025)
par: Wang, Mengchao, et autres
Publié: (2025)
Toward Fine-Grained Facial Control in 3D Talking Head Generation
par: Xie, Shaoyang, et autres
Publié: (2026)
par: Xie, Shaoyang, et autres
Publié: (2026)
SVP: Style-Enhanced Vivid Portrait Talking Head Diffusion Model
par: Tan, Weipeng, et autres
Publié: (2024)
par: Tan, Weipeng, et autres
Publié: (2024)
MotionAura: Generating High-Quality and Motion Consistent Videos using Discrete Diffusion
par: Susladkar, Onkar, et autres
Publié: (2024)
par: Susladkar, Onkar, et autres
Publié: (2024)
FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases
par: Tan, Shuai, et autres
Publié: (2025)
par: Tan, Shuai, et autres
Publié: (2025)
Consistent and Controllable Image Animation with Motion Linear Diffusion Transformers
par: Ma, Xin, et autres
Publié: (2025)
par: Ma, Xin, et autres
Publié: (2025)
eMoE-Tracker: Environmental MoE-based Transformer for Robust Event-guided Object Tracking
par: Chen, Yucheng, et autres
Publié: (2024)
par: Chen, Yucheng, et autres
Publié: (2024)
LaMoD: Latent Motion Diffusion Model For Myocardial Strain Generation
par: Xing, Jiarui, et autres
Publié: (2024)
par: Xing, Jiarui, et autres
Publié: (2024)
MultiTalk: Enhancing 3D Talking Head Generation Across Languages with Multilingual Video Dataset
par: Sung-Bin, Kim, et autres
Publié: (2024)
par: Sung-Bin, Kim, et autres
Publié: (2024)
From Blurry to Believable: Enhancing Low-quality Talking Heads with 3D Generative Priors
par: Huang, Ding-Jiun, et autres
Publié: (2026)
par: Huang, Ding-Jiun, et autres
Publié: (2026)
TalkCLIP: Talking Head Generation with Text-Guided Expressive Speaking Styles
par: Ma, Yifeng, et autres
Publié: (2023)
par: Ma, Yifeng, et autres
Publié: (2023)
TalkingGaussian: Structure-Persistent 3D Talking Head Synthesis via Gaussian Splatting
par: Li, Jiahe, et autres
Publié: (2024)
par: Li, Jiahe, et autres
Publié: (2024)
TopoDiT-3D: Topology-Aware Diffusion Transformer with Bottleneck Structure for 3D Point Cloud Generation
par: Guan, Zechao, et autres
Publié: (2025)
par: Guan, Zechao, et autres
Publié: (2025)
Documents similaires
-
MoDiTalker: Motion-Disentangled Diffusion Model for High-Fidelity Talking Head Generation
par: Kim, Seyeon, et autres
Publié: (2024) -
ConsistTalk: Intensity Controllable Temporally Consistent Talking Head Generation with Diffusion Noise Search
par: Liu, Zhenjie, et autres
Publié: (2025) -
Learning Online Scale Transformation for Talking Head Video Generation
par: Hong, Fa-Ting, et autres
Publié: (2024) -
DiMo: Discrete Diffusion Modeling for Motion Generation and Understanding
par: Zhang, Ning, et autres
Publié: (2026) -
MoDA: Multi-modal Diffusion Architecture for Talking Head Generation
par: Li, Xinyang, et autres
Publié: (2025)