VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Sicheng, Chen, Guojun, Guo, Yu-Xiao, Yang, Jiaolong, Li, Chong, Zang, Zhenyu, Zhang, Yizhong, Tong, Xin, Guo, Baining |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VASA-3D: Lifelike Audio-Driven Gaussian Head Avatars from a Single Image
di: Xu, Sicheng, et al.
Pubblicazione: (2025)
di: Xu, Sicheng, et al.
Pubblicazione: (2025)
Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs
di: Xu, Sicheng, et al.
Pubblicazione: (2026)
di: Xu, Sicheng, et al.
Pubblicazione: (2026)
ESGaussianFace: Emotional and Stylized Audio-Driven Facial Animation via 3D Gaussian Splatting
di: Ma, Chuhang, et al.
Pubblicazione: (2026)
di: Ma, Chuhang, et al.
Pubblicazione: (2026)
UniAvatar: Taming Lifelike Audio-Driven Talking Head Generation with Comprehensive Motion and Lighting Control
di: Sun, Wenzhang, et al.
Pubblicazione: (2024)
di: Sun, Wenzhang, et al.
Pubblicazione: (2024)
Gaussian Variation Field Diffusion for High-fidelity Video-to-4D Synthesis
di: Zhang, Bowen, et al.
Pubblicazione: (2025)
di: Zhang, Bowen, et al.
Pubblicazione: (2025)
ALIVE: Animate Your World with Lifelike Audio-Video Generation
di: Guo, Ying, et al.
Pubblicazione: (2026)
di: Guo, Ying, et al.
Pubblicazione: (2026)
PC-Talk: Precise Facial Animation Control for Audio-Driven Talking Face Generation
di: Wang, Baiqin, et al.
Pubblicazione: (2025)
di: Wang, Baiqin, et al.
Pubblicazione: (2025)
RealTalk: Realistic Emotion-Aware Lifelike Talking-Head Synthesis
di: Wang, Wenqing, et al.
Pubblicazione: (2025)
di: Wang, Wenqing, et al.
Pubblicazione: (2025)
JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation
di: Cao, Xuyang, et al.
Pubblicazione: (2024)
di: Cao, Xuyang, et al.
Pubblicazione: (2024)
Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning
di: Xie, Yifan, et al.
Pubblicazione: (2025)
di: Xie, Yifan, et al.
Pubblicazione: (2025)
GSTalker: Real-time Audio-Driven Talking Face Generation via Deformable Gaussian Splatting
di: Chen, Bo, et al.
Pubblicazione: (2024)
di: Chen, Bo, et al.
Pubblicazione: (2024)
Language-Guided Face Animation by Recurrent StyleGAN-based Generator
di: Hang, Tiankai, et al.
Pubblicazione: (2022)
di: Hang, Tiankai, et al.
Pubblicazione: (2022)
SyncBreaker:Stage-Aware Multimodal Adversarial Attacks on Audio-Driven Talking Head Generation
di: Zhang, Wenli, et al.
Pubblicazione: (2026)
di: Zhang, Wenli, et al.
Pubblicazione: (2026)
MAGIC-Talk: Motion-aware Audio-Driven Talking Face Generation with Customizable Identity Control
di: Nazarieh, Fatemeh, et al.
Pubblicazione: (2025)
di: Nazarieh, Fatemeh, et al.
Pubblicazione: (2025)
Audio-Driven Talking Face Generation with Blink Embedding and Hash Grid Landmarks Encoding
di: Zhang, Yuhui, et al.
Pubblicazione: (2026)
di: Zhang, Yuhui, et al.
Pubblicazione: (2026)
SwapTalk: Audio-Driven Talking Face Generation with One-Shot Customization in Latent Space
di: Zhang, Zeren, et al.
Pubblicazione: (2024)
di: Zhang, Zeren, et al.
Pubblicazione: (2024)
SyncAnimation: A Real-Time End-to-End Framework for Audio-Driven Human Pose and Talking Head Animation
di: Liu, Yujian, et al.
Pubblicazione: (2025)
di: Liu, Yujian, et al.
Pubblicazione: (2025)
TaoAvatar: Real-Time Lifelike Full-Body Talking Avatars for Augmented Reality via 3D Gaussian Splatting
di: Chen, Jianchuan, et al.
Pubblicazione: (2025)
di: Chen, Jianchuan, et al.
Pubblicazione: (2025)
EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions
di: Chen, Zhiyuan, et al.
Pubblicazione: (2024)
di: Chen, Zhiyuan, et al.
Pubblicazione: (2024)
MoGe: Unlocking Accurate Monocular Geometry Estimation for Open-Domain Images with Optimal Training Supervision
di: Wang, Ruicheng, et al.
Pubblicazione: (2024)
di: Wang, Ruicheng, et al.
Pubblicazione: (2024)
Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos
di: Li, Qixiu, et al.
Pubblicazione: (2025)
di: Li, Qixiu, et al.
Pubblicazione: (2025)
Context-aware Talking Face Video Generation
di: Xuanyuan, Meidai, et al.
Pubblicazione: (2024)
di: Xuanyuan, Meidai, et al.
Pubblicazione: (2024)
GaussianCube: A Structured and Explicit Radiance Representation for 3D Generative Modeling
di: Zhang, Bowen, et al.
Pubblicazione: (2024)
di: Zhang, Bowen, et al.
Pubblicazione: (2024)
Structured 3D Latents for Scalable and Versatile 3D Generation
di: Xiang, Jianfeng, et al.
Pubblicazione: (2024)
di: Xiang, Jianfeng, et al.
Pubblicazione: (2024)
Audio-driven Talking Face Generation with Stabilized Synchronization Loss
di: Yaman, Dogucan, et al.
Pubblicazione: (2023)
di: Yaman, Dogucan, et al.
Pubblicazione: (2023)
JoyGen: Audio-Driven 3D Depth-Aware Talking-Face Video Editing
di: Wang, Qili, et al.
Pubblicazione: (2025)
di: Wang, Qili, et al.
Pubblicazione: (2025)
PortraitTalk: Towards Customizable One-Shot Audio-to-Talking Face Generation
di: Nazarieh, Fatemeh, et al.
Pubblicazione: (2024)
di: Nazarieh, Fatemeh, et al.
Pubblicazione: (2024)
VideoVLA: Video Generators Can Be Generalizable Robot Manipulators
di: Shen, Yichao, et al.
Pubblicazione: (2025)
di: Shen, Yichao, et al.
Pubblicazione: (2025)
AVI-Talking: Learning Audio-Visual Instructions for Expressive 3D Talking Face Generation
di: Sun, Yasheng, et al.
Pubblicazione: (2024)
di: Sun, Yasheng, et al.
Pubblicazione: (2024)
Text-Driven Emotionally Continuous Talking Face Generation
di: Yang, Hao, et al.
Pubblicazione: (2026)
di: Yang, Hao, et al.
Pubblicazione: (2026)
Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation
di: Zhang, Zhicheng, et al.
Pubblicazione: (2026)
di: Zhang, Zhicheng, et al.
Pubblicazione: (2026)
RodinHD: High-Fidelity 3D Avatar Generation with Diffusion Models
di: Zhang, Bowen, et al.
Pubblicazione: (2024)
di: Zhang, Bowen, et al.
Pubblicazione: (2024)
RealTalk: Real-time and Realistic Audio-driven Face Generation with 3D Facial Prior-guided Identity Alignment Network
di: Ji, Xiaozhong, et al.
Pubblicazione: (2024)
di: Ji, Xiaozhong, et al.
Pubblicazione: (2024)
Waver: Wave Your Way to Lifelike Video Generation
di: Zhang, Yifu, et al.
Pubblicazione: (2025)
di: Zhang, Yifu, et al.
Pubblicazione: (2025)
DisentTalk: Cross-lingual Talking Face Generation via Semantic Disentangled Diffusion Model
di: Liu, Kangwei, et al.
Pubblicazione: (2025)
di: Liu, Kangwei, et al.
Pubblicazione: (2025)
DAE-Talker: High Fidelity Speech-Driven Talking Face Generation with Diffusion Autoencoder
di: Du, Chenpeng, et al.
Pubblicazione: (2023)
di: Du, Chenpeng, et al.
Pubblicazione: (2023)
FaceTalk: Audio-Driven Motion Diffusion for Neural Parametric Head Models
di: Aneja, Shivangi, et al.
Pubblicazione: (2023)
di: Aneja, Shivangi, et al.
Pubblicazione: (2023)
SoulX-FlashTalk: Real-Time Infinite Streaming of Audio-Driven Avatars via Self-Correcting Bidirectional Distillation
di: Shen, Le, et al.
Pubblicazione: (2025)
di: Shen, Le, et al.
Pubblicazione: (2025)
MoGe-2: Accurate Monocular Geometry with Metric Scale and Sharp Details
di: Wang, Ruicheng, et al.
Pubblicazione: (2025)
di: Wang, Ruicheng, et al.
Pubblicazione: (2025)
OmniTalker: One-shot Real-time Text-Driven Talking Audio-Video Generation With Multimodal Style Mimicking
di: Wang, Zhongjian, et al.
Pubblicazione: (2025)
di: Wang, Zhongjian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
VASA-3D: Lifelike Audio-Driven Gaussian Head Avatars from a Single Image
di: Xu, Sicheng, et al.
Pubblicazione: (2025) -
Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs
di: Xu, Sicheng, et al.
Pubblicazione: (2026) -
ESGaussianFace: Emotional and Stylized Audio-Driven Facial Animation via 3D Gaussian Splatting
di: Ma, Chuhang, et al.
Pubblicazione: (2026) -
UniAvatar: Taming Lifelike Audio-Driven Talking Head Generation with Comprehensive Motion and Lighting Control
di: Sun, Wenzhang, et al.
Pubblicazione: (2024) -
Gaussian Variation Field Diffusion for High-fidelity Video-to-4D Synthesis
di: Zhang, Bowen, et al.
Pubblicazione: (2025)