Audio2Face-3D: Audio-driven Realistic Facial Animation For Digital Avatars
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | NVIDIA, :, Chung, Chaeyeon, Fedorov, Ilya, Huang, Michael, Karmanov, Aleksey, Korobchenko, Dmitry, Ribera, Roger, Seol, Yeongho |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Content and Style Aware Audio-Driven Facial Animation
par: Liu, Qingju, et autres
Publié: (2024)
par: Liu, Qingju, et autres
Publié: (2024)
Meta-Learning Empowered Meta-Face: Personalized Speaking Style Adaptation for Audio-Driven 3D Talking Face Animation
par: Zhou, Xukun, et autres
Publié: (2024)
par: Zhou, Xukun, et autres
Publié: (2024)
Text-driven Talking Face Synthesis by Reprogramming Audio-driven Models
par: Choi, Jeongsoo, et autres
Publié: (2023)
par: Choi, Jeongsoo, et autres
Publié: (2023)
RAP: Real-time Audio-driven Portrait Animation with Video Diffusion Transformer
par: Du, Fangyu, et autres
Publié: (2025)
par: Du, Fangyu, et autres
Publié: (2025)
Human Feedback Driven Dynamic Speech Emotion Recognition
par: Fedorov, Ilya, et autres
Publié: (2025)
par: Fedorov, Ilya, et autres
Publié: (2025)
ELGAR: Expressive Cello Performance Motion Generation for Audio Rendition
par: Qiu, Zhiping, et autres
Publié: (2025)
par: Qiu, Zhiping, et autres
Publié: (2025)
Sonic: Shifting Focus to Global Audio Perception in Portrait Animation
par: Ji, Xiaozhong, et autres
Publié: (2024)
par: Ji, Xiaozhong, et autres
Publié: (2024)
GaussianSpeech: Audio-Driven Gaussian Avatars
par: Aneja, Shivangi, et autres
Publié: (2024)
par: Aneja, Shivangi, et autres
Publié: (2024)
Audio is all in one: speech-driven gesture synthetics using WavLM pre-trained model
par: Zhang, Fan, et autres
Publié: (2023)
par: Zhang, Fan, et autres
Publié: (2023)
READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation
par: Wang, Haotian, et autres
Publié: (2025)
par: Wang, Haotian, et autres
Publié: (2025)
Audio-Plane: Audio Factorization Plane Gaussian Splatting for Real-Time Talking Head Synthesis
par: Shen, Shuai, et autres
Publié: (2025)
par: Shen, Shuai, et autres
Publié: (2025)
LAV: Audio-Driven Dynamic Visual Generation with Neural Compression and StyleGAN2
par: Jung, Jongmin, et autres
Publié: (2025)
par: Jung, Jongmin, et autres
Publié: (2025)
FaceTalk: Audio-Driven Motion Diffusion for Neural Parametric Head Models
par: Aneja, Shivangi, et autres
Publié: (2023)
par: Aneja, Shivangi, et autres
Publié: (2023)
ASPED: An Audio Dataset for Detecting Pedestrians
par: Seshadri, Pavan, et autres
Publié: (2023)
par: Seshadri, Pavan, et autres
Publié: (2023)
PointTalk: Audio-Driven Dynamic Lip Point Cloud for 3D Gaussian-based Talking Head Synthesis
par: Xie, Yifan, et autres
Publié: (2024)
par: Xie, Yifan, et autres
Publié: (2024)
Seeing Sound: Assembling Sounds from Visuals for Audio-to-Image Generation
par: Petermann, Darius, et autres
Publié: (2025)
par: Petermann, Darius, et autres
Publié: (2025)
MACS: Multi-source Audio-to-image Generation with Contextual Significance and Semantic Alignment
par: Zhou, Hao, et autres
Publié: (2025)
par: Zhou, Hao, et autres
Publié: (2025)
Text-Driven Voice Conversion via Latent State-Space Modeling
par: Li, Wen, et autres
Publié: (2025)
par: Li, Wen, et autres
Publié: (2025)
Listen and Move: Improving GANs Coherency in Agnostic Sound-to-Video Generation
par: Redondo, Rafael
Publié: (2024)
par: Redondo, Rafael
Publié: (2024)
DGFM: Full Body Dance Generation Driven by Music Foundation Models
par: Liu, Xinran, et autres
Publié: (2025)
par: Liu, Xinran, et autres
Publié: (2025)
NAT: Neural Acoustic Transfer for Interactive Scenes in Real Time
par: Jin, Xutong, et autres
Publié: (2025)
par: Jin, Xutong, et autres
Publié: (2025)
EnchantDance: Unveiling the Potential of Music-Driven Dance Movement
par: Han, Bo, et autres
Publié: (2023)
par: Han, Bo, et autres
Publié: (2023)
SyncViolinist: Music-Oriented Violin Motion Generation Based on Bowing and Fingering
par: Nishizawa, Hiroki, et autres
Publié: (2024)
par: Nishizawa, Hiroki, et autres
Publié: (2024)
Beat-It: Beat-Synchronized Multi-Condition 3D Dance Generation
par: Huang, Zikai, et autres
Publié: (2024)
par: Huang, Zikai, et autres
Publié: (2024)
Audio Avatar Fingerprinting: An Approach for Authorized Use of Voice Cloning in the Era of Synthetic Audio
par: Gerstner, Candice R.
Publié: (2026)
par: Gerstner, Candice R.
Publié: (2026)
AsynFusion: Towards Asynchronous Latent Consistency Models for Decoupled Whole-Body Audio-Driven Avatars
par: Zhang, Tianbao, et autres
Publié: (2025)
par: Zhang, Tianbao, et autres
Publié: (2025)
AudioGAN: A Compact and Efficient Framework for Real-Time High-Fidelity Text-to-Audio Generation
par: Chung, HaeChun
Publié: (2025)
par: Chung, HaeChun
Publié: (2025)
DanceAnyWay: Synthesizing Beat-Guided 3D Dances with Randomized Temporal Contrastive Learning
par: Bhattacharya, Aneesh, et autres
Publié: (2023)
par: Bhattacharya, Aneesh, et autres
Publié: (2023)
MATHDance: Mamba-Transformer Architecture with Uniform Tokenization for High-Quality 3D Dance Generation
par: Yang, Kaixing, et autres
Publié: (2025)
par: Yang, Kaixing, et autres
Publié: (2025)
Combining Genre Classification and Harmonic-Percussive Features with Diffusion Models for Music-Video Generation
par: Pina, Leonardo, et autres
Publié: (2024)
par: Pina, Leonardo, et autres
Publié: (2024)
MusicScore: A Dataset for Music Score Modeling and Generation
par: Lin, Yuheng, et autres
Publié: (2024)
par: Lin, Yuheng, et autres
Publié: (2024)
Hindi audio-video-Deepfake (HAV-DF): A Hindi language-based Audio-video Deepfake Dataset
par: Kaur, Sukhandeep, et autres
Publié: (2024)
par: Kaur, Sukhandeep, et autres
Publié: (2024)
SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation
par: Pham, Kien T., et autres
Publié: (2025)
par: Pham, Kien T., et autres
Publié: (2025)
Enhancing Neural Audio Fingerprint Robustness to Audio Degradation for Music Identification
par: Araz, R. Oguz, et autres
Publié: (2025)
par: Araz, R. Oguz, et autres
Publié: (2025)
UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner
par: Yang, Dongchao, et autres
Publié: (2024)
par: Yang, Dongchao, et autres
Publié: (2024)
NeRF-3DTalker: Neural Radiance Field with 3D Prior Aided Audio Disentanglement for Talking Head Synthesis
par: Liu, Xiaoxing, et autres
Publié: (2025)
par: Liu, Xiaoxing, et autres
Publié: (2025)
Conditional GAN for Enhancing Diffusion Models in Efficient and Authentic Global Gesture Generation from Audios
par: Cheng, Yongkang, et autres
Publié: (2024)
par: Cheng, Yongkang, et autres
Publié: (2024)
Silence is Golden: Leveraging Adversarial Examples to Nullify Audio Control in LDM-based Talking-Head Generation
par: Gan, Yuan, et autres
Publié: (2025)
par: Gan, Yuan, et autres
Publié: (2025)
Leveraging Mamba with Full-Face Vision for Audio-Visual Speech Enhancement
par: Chao, Rong, et autres
Publié: (2025)
par: Chao, Rong, et autres
Publié: (2025)
UniAudio: An Audio Foundation Model Toward Universal Audio Generation
par: Yang, Dongchao, et autres
Publié: (2023)
par: Yang, Dongchao, et autres
Publié: (2023)
Documents similaires
-
Content and Style Aware Audio-Driven Facial Animation
par: Liu, Qingju, et autres
Publié: (2024) -
Meta-Learning Empowered Meta-Face: Personalized Speaking Style Adaptation for Audio-Driven 3D Talking Face Animation
par: Zhou, Xukun, et autres
Publié: (2024) -
Text-driven Talking Face Synthesis by Reprogramming Audio-driven Models
par: Choi, Jeongsoo, et autres
Publié: (2023) -
RAP: Real-time Audio-driven Portrait Animation with Video Diffusion Transformer
par: Du, Fangyu, et autres
Publié: (2025) -
Human Feedback Driven Dynamic Speech Emotion Recognition
par: Fedorov, Ilya, et autres
Publié: (2025)