TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Low, Chetwin, Wang, Weimin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Meta-Learning Empowered Meta-Face: Personalized Speaking Style Adaptation for Audio-Driven 3D Talking Face Animation
di: Zhou, Xukun, et al.
Pubblicazione: (2024)
di: Zhou, Xukun, et al.
Pubblicazione: (2024)
FaceTalk: Audio-Driven Motion Diffusion for Neural Parametric Head Models
di: Aneja, Shivangi, et al.
Pubblicazione: (2023)
di: Aneja, Shivangi, et al.
Pubblicazione: (2023)
PointTalk: Audio-Driven Dynamic Lip Point Cloud for 3D Gaussian-based Talking Head Synthesis
di: Xie, Yifan, et al.
Pubblicazione: (2024)
di: Xie, Yifan, et al.
Pubblicazione: (2024)
LAV: Audio-Driven Dynamic Visual Generation with Neural Compression and StyleGAN2
di: Jung, Jongmin, et al.
Pubblicazione: (2025)
di: Jung, Jongmin, et al.
Pubblicazione: (2025)
Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
di: Low, Chetwin, et al.
Pubblicazione: (2025)
di: Low, Chetwin, et al.
Pubblicazione: (2025)
ChoreoMuse: Robust Music-to-Dance Video Generation with Style Transfer and Beat-Adherent Motion
di: Wang, Xuanchen, et al.
Pubblicazione: (2025)
di: Wang, Xuanchen, et al.
Pubblicazione: (2025)
Content and Style Aware Audio-Driven Facial Animation
di: Liu, Qingju, et al.
Pubblicazione: (2024)
di: Liu, Qingju, et al.
Pubblicazione: (2024)
Audio-Plane: Audio Factorization Plane Gaussian Splatting for Real-Time Talking Head Synthesis
di: Shen, Shuai, et al.
Pubblicazione: (2025)
di: Shen, Shuai, et al.
Pubblicazione: (2025)
DiffSHEG: A Diffusion-Based Approach for Real-Time Speech-driven Holistic 3D Expression and Gesture Generation
di: Chen, Junming, et al.
Pubblicazione: (2024)
di: Chen, Junming, et al.
Pubblicazione: (2024)
Audio Driven Real-Time Facial Animation for Social Telepresence
di: Lee, Jiye, et al.
Pubblicazione: (2025)
di: Lee, Jiye, et al.
Pubblicazione: (2025)
GaussianSpeech: Audio-Driven Gaussian Avatars
di: Aneja, Shivangi, et al.
Pubblicazione: (2024)
di: Aneja, Shivangi, et al.
Pubblicazione: (2024)
EGSTalker: Real-Time Audio-Driven Talking Head Generation with Efficient Gaussian Deformation
di: Zhu, Tianheng, et al.
Pubblicazione: (2025)
di: Zhu, Tianheng, et al.
Pubblicazione: (2025)
Audio is all in one: speech-driven gesture synthetics using WavLM pre-trained model
di: Zhang, Fan, et al.
Pubblicazione: (2023)
di: Zhang, Fan, et al.
Pubblicazione: (2023)
Text-driven Talking Face Synthesis by Reprogramming Audio-driven Models
di: Choi, Jeongsoo, et al.
Pubblicazione: (2023)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2023)
DiM-Gesture: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2 framework
di: Zhang, Fan, et al.
Pubblicazione: (2024)
di: Zhang, Fan, et al.
Pubblicazione: (2024)
Conditional GAN for Enhancing Diffusion Models in Efficient and Authentic Global Gesture Generation from Audios
di: Cheng, Yongkang, et al.
Pubblicazione: (2024)
di: Cheng, Yongkang, et al.
Pubblicazione: (2024)
Not Like Transformers: Drop the Beat Representation for Dance Generation with Mamba-Based Diffusion Model
di: Park, Sangjune, et al.
Pubblicazione: (2026)
di: Park, Sangjune, et al.
Pubblicazione: (2026)
READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation
di: Wang, Haotian, et al.
Pubblicazione: (2025)
di: Wang, Haotian, et al.
Pubblicazione: (2025)
PGSTalker: Real-Time Audio-Driven Talking Head Generation via 3D Gaussian Splatting with Pixel-Aware Density Control
di: Zhu, Tianheng, et al.
Pubblicazione: (2025)
di: Zhu, Tianheng, et al.
Pubblicazione: (2025)
FürElise: Capturing and Physically Synthesizing Hand Motions of Piano Performance
di: Wang, Ruocheng, et al.
Pubblicazione: (2024)
di: Wang, Ruocheng, et al.
Pubblicazione: (2024)
StyleStream: Real-Time Zero-Shot Voice Style Conversion
di: Liu, Yisi, et al.
Pubblicazione: (2026)
di: Liu, Yisi, et al.
Pubblicazione: (2026)
AsynFusion: Towards Asynchronous Latent Consistency Models for Decoupled Whole-Body Audio-Driven Avatars
di: Zhang, Tianbao, et al.
Pubblicazione: (2025)
di: Zhang, Tianbao, et al.
Pubblicazione: (2025)
SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation
di: Pham, Kien T., et al.
Pubblicazione: (2025)
di: Pham, Kien T., et al.
Pubblicazione: (2025)
NAT: Neural Acoustic Transfer for Interactive Scenes in Real Time
di: Jin, Xutong, et al.
Pubblicazione: (2025)
di: Jin, Xutong, et al.
Pubblicazione: (2025)
Hindi audio-video-Deepfake (HAV-DF): A Hindi language-based Audio-video Deepfake Dataset
di: Kaur, Sukhandeep, et al.
Pubblicazione: (2024)
di: Kaur, Sukhandeep, et al.
Pubblicazione: (2024)
RAP: Real-time Audio-driven Portrait Animation with Video Diffusion Transformer
di: Du, Fangyu, et al.
Pubblicazione: (2025)
di: Du, Fangyu, et al.
Pubblicazione: (2025)
ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRA
di: Dahan, Aviad, et al.
Pubblicazione: (2026)
di: Dahan, Aviad, et al.
Pubblicazione: (2026)
Towards Unified Co-Speech Gesture Generation via Hierarchical Implicit Periodicity Learning
di: Guo, Xin, et al.
Pubblicazione: (2025)
di: Guo, Xin, et al.
Pubblicazione: (2025)
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
di: Wang, Zhenzhi, et al.
Pubblicazione: (2025)
di: Wang, Zhenzhi, et al.
Pubblicazione: (2025)
Geometry-Aware Global Feature Aggregation for Real-Time Indirect Illumination
di: Gai, Meng, et al.
Pubblicazione: (2025)
di: Gai, Meng, et al.
Pubblicazione: (2025)
UMo: Unified Sparse Motion Modeling for Real-Time Co-Speech Avatars
di: Zhan, Xiaoyu, et al.
Pubblicazione: (2026)
di: Zhan, Xiaoyu, et al.
Pubblicazione: (2026)
Learning Disentangled Speech- and Expression-Driven Blendshapes for 3D Talking Face Animation
di: Mao, Yuxiang, et al.
Pubblicazione: (2025)
di: Mao, Yuxiang, et al.
Pubblicazione: (2025)
M3G: Multi-Granular Gesture Generator for Audio-Driven Full-Body Human Motion Synthesis
di: Yin, Zhizhuo, et al.
Pubblicazione: (2025)
di: Yin, Zhizhuo, et al.
Pubblicazione: (2025)
Neural Two-Level Monte Carlo Real-Time Rendering
di: Dereviannykh, Mikhail, et al.
Pubblicazione: (2024)
di: Dereviannykh, Mikhail, et al.
Pubblicazione: (2024)
RealWonder: Real-Time Physical Action-Conditioned Video Generation
di: Liu, Wei, et al.
Pubblicazione: (2026)
di: Liu, Wei, et al.
Pubblicazione: (2026)
Music Style Transfer With Diffusion Model
di: Huang, Hong, et al.
Pubblicazione: (2024)
di: Huang, Hong, et al.
Pubblicazione: (2024)
PESTalk: Speech-Driven 3D Facial Animation with Personalized Emotional Styles
di: Han, Tianshun, et al.
Pubblicazione: (2025)
di: Han, Tianshun, et al.
Pubblicazione: (2025)
Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning
di: Xie, Yuankun, et al.
Pubblicazione: (2026)
di: Xie, Yuankun, et al.
Pubblicazione: (2026)
FADA: Fast Diffusion Avatar Synthesis with Mixed-Supervised Multi-CFG Distillation
di: Zhong, Tianyun, et al.
Pubblicazione: (2024)
di: Zhong, Tianyun, et al.
Pubblicazione: (2024)
Inference Time Debiasing Concepts in Diffusion Models
di: Kupssinskü, Lucas S., et al.
Pubblicazione: (2025)
di: Kupssinskü, Lucas S., et al.
Pubblicazione: (2025)
Documenti analoghi
-
Meta-Learning Empowered Meta-Face: Personalized Speaking Style Adaptation for Audio-Driven 3D Talking Face Animation
di: Zhou, Xukun, et al.
Pubblicazione: (2024) -
FaceTalk: Audio-Driven Motion Diffusion for Neural Parametric Head Models
di: Aneja, Shivangi, et al.
Pubblicazione: (2023) -
PointTalk: Audio-Driven Dynamic Lip Point Cloud for 3D Gaussian-based Talking Head Synthesis
di: Xie, Yifan, et al.
Pubblicazione: (2024) -
LAV: Audio-Driven Dynamic Visual Generation with Neural Compression and StyleGAN2
di: Jung, Jongmin, et al.
Pubblicazione: (2025) -
Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation
di: Low, Chetwin, et al.
Pubblicazione: (2025)