Make Your Actor Talk: Generalizable and High-Fidelity Lip Sync with Motion and Appearance Disentanglement
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Runyi, He, Tianyu, Zhang, Ailing, Wang, Yuchi, Guo, Junliang, Tan, Xu, Liu, Chang, Chen, Jie, Bian, Jiang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
InstructAvatar: Text-Guided Emotion and Motion Control for Avatar Generation
par: Wang, Yuchi, et autres
Publié: (2024)
par: Wang, Yuchi, et autres
Publié: (2024)
UniEdit: A Unified Tuning-Free Framework for Video Motion and Appearance Editing
par: Bai, Jianhong, et autres
Publié: (2024)
par: Bai, Jianhong, et autres
Publié: (2024)
UniSync: Towards Generalizable and High-Fidelity Lip Synchronization for Challenging Scenarios
par: Fan, Ruidi, et autres
Publié: (2026)
par: Fan, Ruidi, et autres
Publié: (2026)
GAIA: Zero-shot Talking Avatar Generation
par: He, Tianyu, et autres
Publié: (2023)
par: He, Tianyu, et autres
Publié: (2023)
VidTwin: Video VAE with Decoupled Structure and Dynamics
par: Wang, Yuchi, et autres
Publié: (2024)
par: Wang, Yuchi, et autres
Publié: (2024)
BioLip: Language-Generalizable Lip-Sync Deepfake Detection via Biomechanical Constraint Violation Modeling
par: Chen, Hao, et autres
Publié: (2026)
par: Chen, Hao, et autres
Publié: (2026)
DAE-Talker: High Fidelity Speech-Driven Talking Face Generation with Diffusion Autoencoder
par: Du, Chenpeng, et autres
Publié: (2023)
par: Du, Chenpeng, et autres
Publié: (2023)
Text2Lip: Progressive Lip-Synced Talking Face Generation from Text via Viseme-Guided Rendering
par: Wang, Xu, et autres
Publié: (2025)
par: Wang, Xu, et autres
Publié: (2025)
SyncAnyone: Implicit Disentanglement via Progressive Self-Correction for Lip-Syncing in the wild
par: Zhang, Xindi, et autres
Publié: (2025)
par: Zhang, Xindi, et autres
Publié: (2025)
SyncTalk++: High-Fidelity and Efficient Synchronized Talking Heads Synthesis Using Gaussian Splatting
par: Peng, Ziqiao, et autres
Publié: (2025)
par: Peng, Ziqiao, et autres
Publié: (2025)
Exploring Phonetic Context-Aware Lip-Sync For Talking Face Generation
par: Park, Se Jin, et autres
Publié: (2023)
par: Park, Se Jin, et autres
Publié: (2023)
SyncLipMAE: Contrastive Masked Pretraining for Audio-Visual Talking-Face Representation
par: Ling, Zeyu, et autres
Publié: (2025)
par: Ling, Zeyu, et autres
Publié: (2025)
PASE: Phoneme-Aware Speech Encoder to Improve Lip Sync Accuracy for Talking Head Synthesis
par: Huang, Yihuan, et autres
Publié: (2025)
par: Huang, Yihuan, et autres
Publié: (2025)
LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision
par: Li, Chunyu, et autres
Publié: (2024)
par: Li, Chunyu, et autres
Publié: (2024)
MoDiTalker: Motion-Disentangled Diffusion Model for High-Fidelity Talking Head Generation
par: Kim, Seyeon, et autres
Publié: (2024)
par: Kim, Seyeon, et autres
Publié: (2024)
GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting
par: Agarwal, Anushka, et autres
Publié: (2025)
par: Agarwal, Anushka, et autres
Publié: (2025)
JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync
par: Park, Sungjoon, et autres
Publié: (2025)
par: Park, Sungjoon, et autres
Publié: (2025)
Playing with Transformer at 30+ FPS via Next-Frame Diffusion
par: Cheng, Xinle, et autres
Publié: (2025)
par: Cheng, Xinle, et autres
Publié: (2025)
SyncTalk: The Devil is in the Synchronization for Talking Head Synthesis
par: Peng, Ziqiao, et autres
Publié: (2023)
par: Peng, Ziqiao, et autres
Publié: (2023)
3DXTalker: Unifying Identity, Lip Sync, Emotion, and Spatial Dynamics in Expressive 3D Talking Avatars
par: Wang, Zhongju, et autres
Publié: (2026)
par: Wang, Zhongju, et autres
Publié: (2026)
StyleLipSync: Style-based Personalized Lip-sync Video Generation
par: Ki, Taekyung, et autres
Publié: (2023)
par: Ki, Taekyung, et autres
Publié: (2023)
HighSync: High-Quality Lip Synchronization via Latent Diffusion Models
par: Daghigh, Saeed Firouzi, et autres
Publié: (2026)
par: Daghigh, Saeed Firouzi, et autres
Publié: (2026)
HM-Talker: Hybrid Motion Modeling for High-Fidelity Talking Head Synthesis
par: Liu, Shiyu, et autres
Publié: (2025)
par: Liu, Shiyu, et autres
Publié: (2025)
Video In-context Learning: Autoregressive Transformers are Zero-Shot Video Imitators
par: Zhang, Wentao, et autres
Publié: (2024)
par: Zhang, Wentao, et autres
Publié: (2024)
OmniSync: Towards Universal Lip Synchronization via Diffusion Transformers
par: Peng, Ziqiao, et autres
Publié: (2025)
par: Peng, Ziqiao, et autres
Publié: (2025)
Lips Are Lying: Spotting the Temporal Inconsistency between Audio and Visual in Lip-Syncing DeepFakes
par: Liu, Weifeng, et autres
Publié: (2024)
par: Liu, Weifeng, et autres
Publié: (2024)
Removing Averaging: Personalized Lip-Sync Driven Characters Based on Identity Adapter
par: Zhu, Yanyu, et autres
Publié: (2025)
par: Zhu, Yanyu, et autres
Publié: (2025)
KeySync: A Robust Approach for Leakage-free Lip Synchronization in High Resolution
par: Bigata, Antoni, et autres
Publié: (2025)
par: Bigata, Antoni, et autres
Publié: (2025)
Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation
par: Zhao, Shuling, et autres
Publié: (2024)
par: Zhao, Shuling, et autres
Publié: (2024)
VidTok: A Versatile and Open-Source Video Tokenizer
par: Tang, Anni, et autres
Publié: (2024)
par: Tang, Anni, et autres
Publié: (2024)
Compositional 3D-aware Video Generation with LLM Director
par: Zhu, Hanxin, et autres
Publié: (2024)
par: Zhu, Hanxin, et autres
Publié: (2024)
AR4D: Autoregressive 4D Generation from Monocular Videos
par: Zhu, Hanxin, et autres
Publié: (2025)
par: Zhu, Hanxin, et autres
Publié: (2025)
Motion Consistency Model: Accelerating Video Diffusion with Disentangled Motion-Appearance Distillation
par: Zhai, Yuanhao, et autres
Publié: (2024)
par: Zhai, Yuanhao, et autres
Publié: (2024)
DAM-VSR: Disentanglement of Appearance and Motion for Video Super-Resolution
par: Kong, Zhe, et autres
Publié: (2025)
par: Kong, Zhe, et autres
Publié: (2025)
FlashLips: 100-FPS Mask-Free Latent Lip-Sync using Reconstruction Instead of Diffusion or GANs
par: Zinonos, Andreas, et autres
Publié: (2025)
par: Zinonos, Andreas, et autres
Publié: (2025)
Style-Preserving Lip Sync via Audio-Aware Style Reference
par: Zhong, Weizhi, et autres
Publié: (2024)
par: Zhong, Weizhi, et autres
Publié: (2024)
MineWorld: a Real-Time and Open-Source Interactive World Model on Minecraft
par: Guo, Junliang, et autres
Publié: (2025)
par: Guo, Junliang, et autres
Publié: (2025)
SyncAnimation: A Real-Time End-to-End Framework for Audio-Driven Human Pose and Talking Head Animation
par: Liu, Yujian, et autres
Publié: (2025)
par: Liu, Yujian, et autres
Publié: (2025)
FaceChain-ImagineID: Freely Crafting High-Fidelity Diverse Talking Faces from Disentangled Audio
par: Xu, Chao, et autres
Publié: (2024)
par: Xu, Chao, et autres
Publié: (2024)
VideoSPatS: Video SPatiotemporal Splines for Disentangled Occlusion, Appearance and Motion Modeling and Editing
par: Bello, Juan Luis Gonzalez, et autres
Publié: (2025)
par: Bello, Juan Luis Gonzalez, et autres
Publié: (2025)
Documents similaires
-
InstructAvatar: Text-Guided Emotion and Motion Control for Avatar Generation
par: Wang, Yuchi, et autres
Publié: (2024) -
UniEdit: A Unified Tuning-Free Framework for Video Motion and Appearance Editing
par: Bai, Jianhong, et autres
Publié: (2024) -
UniSync: Towards Generalizable and High-Fidelity Lip Synchronization for Challenging Scenarios
par: Fan, Ruidi, et autres
Publié: (2026) -
GAIA: Zero-shot Talking Avatar Generation
par: He, Tianyu, et autres
Publié: (2023) -
VidTwin: Video VAE with Decoupled Structure and Dynamics
par: Wang, Yuchi, et autres
Publié: (2024)