FD2Talk: Towards Generalized Talking Head Generation with Facial Decoupled Diffusion Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Yao, Ziyu, Cheng, Xuxin, Huang, Zhiqi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Talking Head Generation Driven by Speech-Related Facial Action Units and Audio- Based on Multimodal Representation Fusion
por: Chen, Sen, et al.
Publicado: (2022)
por: Chen, Sen, et al.
Publicado: (2022)
PoseTalk: Text-and-Audio-based Pose Control and Motion Refinement for One-Shot Talking Head Generation
por: Ling, Jun, et al.
Publicado: (2024)
por: Ling, Jun, et al.
Publicado: (2024)
GAIA: Zero-shot Talking Avatar Generation
por: He, Tianyu, et al.
Publicado: (2023)
por: He, Tianyu, et al.
Publicado: (2023)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
por: Li, Hebeizi, et al.
Publicado: (2026)
por: Li, Hebeizi, et al.
Publicado: (2026)
EditYourself: Audio-Driven Generation and Manipulation of Talking Head Videos with Diffusion Transformers
por: Flynn, John, et al.
Publicado: (2026)
por: Flynn, John, et al.
Publicado: (2026)
DAE-Talker: High Fidelity Speech-Driven Talking Face Generation with Diffusion Autoencoder
por: Du, Chenpeng, et al.
Publicado: (2023)
por: Du, Chenpeng, et al.
Publicado: (2023)
TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation
por: Liu, Xiangyu, et al.
Publicado: (2026)
por: Liu, Xiangyu, et al.
Publicado: (2026)
SegTalker: Segmentation-based Talking Face Generation with Mask-guided Local Editing
por: Xiong, Lingyu, et al.
Publicado: (2024)
por: Xiong, Lingyu, et al.
Publicado: (2024)
Memories are One-to-Many Mapping Alleviators in Talking Face Generation
por: Tang, Anni, et al.
Publicado: (2022)
por: Tang, Anni, et al.
Publicado: (2022)
Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation
por: Zhang, Zhicheng, et al.
Publicado: (2026)
por: Zhang, Zhicheng, et al.
Publicado: (2026)
G4G:A Generic Framework for High Fidelity Talking Face Generation with Fine-grained Intra-modal Alignment
por: Zhang, Juan, et al.
Publicado: (2024)
por: Zhang, Juan, et al.
Publicado: (2024)
EditEmoTalk: Controllable Speech-Driven 3D Facial Animation with Continuous Expression Editing
por: Jiang, Diqiong, et al.
Publicado: (2026)
por: Jiang, Diqiong, et al.
Publicado: (2026)
GaussianTalker: Speaker-specific Talking Head Synthesis via 3D Gaussian Splatting
por: Yu, Hongyun, et al.
Publicado: (2024)
por: Yu, Hongyun, et al.
Publicado: (2024)
OpFlowTalker: Realistic and Natural Talking Face Generation via Optical Flow Guidance
por: Ge, Shuheng, et al.
Publicado: (2024)
por: Ge, Shuheng, et al.
Publicado: (2024)
GaussianTalker: Real-Time High-Fidelity Talking Head Synthesis with Audio-Driven 3D Gaussian Splatting
por: Cho, Kyusun, et al.
Publicado: (2024)
por: Cho, Kyusun, et al.
Publicado: (2024)
ReactDiff: Latent Diffusion for Facial Reaction Generation
por: Li, Jiaming, et al.
Publicado: (2025)
por: Li, Jiaming, et al.
Publicado: (2025)
Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling
por: Ye, Zhen, et al.
Publicado: (2026)
por: Ye, Zhen, et al.
Publicado: (2026)
AdaMesh: Personalized Facial Expressions and Head Poses for Adaptive Speech-Driven 3D Facial Animation
por: Chen, Liyang, et al.
Publicado: (2023)
por: Chen, Liyang, et al.
Publicado: (2023)
High-fidelity and Lip-synced Talking Face Synthesis via Landmark-based Diffusion Model
por: Zhong, Weizhi, et al.
Publicado: (2024)
por: Zhong, Weizhi, et al.
Publicado: (2024)
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
por: Wang, Zhenzhi, et al.
Publicado: (2025)
por: Wang, Zhenzhi, et al.
Publicado: (2025)
A Near-Raw Talking-Head Video Dataset for Various Computer Vision Tasks
por: Naderi, Babak, et al.
Publicado: (2026)
por: Naderi, Babak, et al.
Publicado: (2026)
Enhancing Self-Supervised Talking Head Forgery Detection via a Training-Free Dual-System Framework
por: Liu, Ke, et al.
Publicado: (2026)
por: Liu, Ke, et al.
Publicado: (2026)
ProFD: Prompt-Guided Feature Disentangling for Occluded Person Re-Identification
por: Cui, Can, et al.
Publicado: (2024)
por: Cui, Can, et al.
Publicado: (2024)
NeRF-AD: Neural Radiance Field with Attention-based Disentanglement for Talking Face Synthesis
por: Bi, Chongke, et al.
Publicado: (2024)
por: Bi, Chongke, et al.
Publicado: (2024)
EARTalking: End-to-end GPT-style Autoregressive Talking Head Synthesis with Frame-wise Control
por: Weng, Yuzhe, et al.
Publicado: (2026)
por: Weng, Yuzhe, et al.
Publicado: (2026)
Co-Speech Gesture Video Generation via Motion-Decoupled Diffusion Model
por: He, Xu, et al.
Publicado: (2024)
por: He, Xu, et al.
Publicado: (2024)
Is It Really You? Exploring Biometric Verification Scenarios in Photorealistic Talking-Head Avatar Videos
por: Pedrouzo-Rodriguez, Laura, et al.
Publicado: (2025)
por: Pedrouzo-Rodriguez, Laura, et al.
Publicado: (2025)
CountLLM: Towards Generalizable Repetitive Action Counting via Large Language Model
por: Yao, Ziyu, et al.
Publicado: (2025)
por: Yao, Ziyu, et al.
Publicado: (2025)
Advancing Talking Head Generation: A Comprehensive Survey of Multi-Modal Methodologies, Datasets, Evaluation Metrics, and Loss Functions
por: Rakesh, Vineet Kumar, et al.
Publicado: (2025)
por: Rakesh, Vineet Kumar, et al.
Publicado: (2025)
StableMoFusion: Towards Robust and Efficient Diffusion-based Motion Generation Framework
por: Huang, Yiheng, et al.
Publicado: (2024)
por: Huang, Yiheng, et al.
Publicado: (2024)
SEED: A Benchmark Dataset for Sequential Facial Attribute Editing with Diffusion Models
por: Zhu, Yule, et al.
Publicado: (2025)
por: Zhu, Yule, et al.
Publicado: (2025)
Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation
por: Kang, Fang, et al.
Publicado: (2025)
por: Kang, Fang, et al.
Publicado: (2025)
KAN-Based Fusion of Dual-Domain for Audio-Driven Facial Landmarks Generation
por: Vo-Thanh, Hoang-Son, et al.
Publicado: (2024)
por: Vo-Thanh, Hoang-Son, et al.
Publicado: (2024)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
por: Chow, Wei, et al.
Publicado: (2024)
por: Chow, Wei, et al.
Publicado: (2024)
ExpLLM: Towards Chain of Thought for Facial Expression Recognition
por: Lan, Xing, et al.
Publicado: (2024)
por: Lan, Xing, et al.
Publicado: (2024)
Hi3D: Pursuing High-Resolution Image-to-3D Generation with Video Diffusion Models
por: Yang, Haibo, et al.
Publicado: (2024)
por: Yang, Haibo, et al.
Publicado: (2024)
ReactDiff: Fundamental Multiple Appropriate Facial Reaction Diffusion Model
por: Cheng, Luo, et al.
Publicado: (2025)
por: Cheng, Luo, et al.
Publicado: (2025)
Toward Fine-Grained Facial Control in 3D Talking Head Generation
por: Xie, Shaoyang, et al.
Publicado: (2026)
por: Xie, Shaoyang, et al.
Publicado: (2026)
GAOT: Generating Articulated Objects Through Text-Guided Diffusion Models
por: Sun, Hao, et al.
Publicado: (2025)
por: Sun, Hao, et al.
Publicado: (2025)
EmotiveTalk: Expressive Talking Head Generation through Audio Information Decoupling and Emotional Video Diffusion
por: Wang, Haotian, et al.
Publicado: (2024)
por: Wang, Haotian, et al.
Publicado: (2024)
Ejemplares similares
-
Talking Head Generation Driven by Speech-Related Facial Action Units and Audio- Based on Multimodal Representation Fusion
por: Chen, Sen, et al.
Publicado: (2022) -
PoseTalk: Text-and-Audio-based Pose Control and Motion Refinement for One-Shot Talking Head Generation
por: Ling, Jun, et al.
Publicado: (2024) -
GAIA: Zero-shot Talking Avatar Generation
por: He, Tianyu, et al.
Publicado: (2023) -
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
por: Li, Hebeizi, et al.
Publicado: (2026) -
EditYourself: Audio-Driven Generation and Manipulation of Talking Head Videos with Diffusion Transformers
por: Flynn, John, et al.
Publicado: (2026)