TempoSyncDiff: Distilled Temporally-Consistent Diffusion for Low-Latency Audio-Driven Talking Head Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mazumdar, Soumya, Rakesh, Vineet Kumar |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PrivFedTalk: Privacy-Aware Federated Diffusion with Identity-Stable Adapters for Personalized Talking-Head Generation
par: Mazumdar, Soumya, et autres
Publié: (2026)
par: Mazumdar, Soumya, et autres
Publié: (2026)
VineetVC: Adaptive Video Conferencing Under Severe Bandwidth Constraints Using Audio-Driven Talking-Head Reconstruction
par: Rakesh, Vineet Kumar, et autres
Publié: (2026)
par: Rakesh, Vineet Kumar, et autres
Publié: (2026)
DiffusionTalker: Efficient and Compact Speech-Driven 3D Talking Head via Personalizer-Guided Distillation
par: Chen, Peng, et autres
Publié: (2025)
par: Chen, Peng, et autres
Publié: (2025)
FaceTalk: Audio-Driven Motion Diffusion for Neural Parametric Head Models
par: Aneja, Shivangi, et autres
Publié: (2023)
par: Aneja, Shivangi, et autres
Publié: (2023)
TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation
par: Liu, Xiangyu, et autres
Publié: (2026)
par: Liu, Xiangyu, et autres
Publié: (2026)
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
par: Wang, Zhenzhi, et autres
Publié: (2025)
par: Wang, Zhenzhi, et autres
Publié: (2025)
VedicTHG: Symbolic Vedic Computation for Low-Resource Talking-Head Generation in Educational Avatars
par: Rakesh, Vineet Kumar, et autres
Publié: (2026)
par: Rakesh, Vineet Kumar, et autres
Publié: (2026)
Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation
par: Kang, Fang, et autres
Publié: (2025)
par: Kang, Fang, et autres
Publié: (2025)
Advancing Talking Head Generation: A Comprehensive Survey of Multi-Modal Methodologies, Datasets, Evaluation Metrics, and Loss Functions
par: Rakesh, Vineet Kumar, et autres
Publié: (2025)
par: Rakesh, Vineet Kumar, et autres
Publié: (2025)
REST: Diffusion-based Real-time End-to-end Streaming Talking Head Generation via ID-Context Caching and Asynchronous Streaming Distillation
par: Wang, Haotian, et autres
Publié: (2025)
par: Wang, Haotian, et autres
Publié: (2025)
Dual Audio-Centric Modality Coupling for Talking Head Generation
par: Fu, Ao, et autres
Publié: (2025)
par: Fu, Ao, et autres
Publié: (2025)
READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation
par: Wang, Haotian, et autres
Publié: (2025)
par: Wang, Haotian, et autres
Publié: (2025)
Exploring Phonetic Context-Aware Lip-Sync For Talking Face Generation
par: Park, Se Jin, et autres
Publié: (2023)
par: Park, Se Jin, et autres
Publié: (2023)
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
par: Li, Hebeizi, et autres
Publié: (2026)
par: Li, Hebeizi, et autres
Publié: (2026)
Diffusion Models for Joint Audio-Video Generation
par: La Torre, Alejandro Paredes
Publié: (2026)
par: La Torre, Alejandro Paredes
Publié: (2026)
BayesFusion-SDF: Probabilistic Signed Distance Fusion with View Planning on CPU
par: Mazumdar, Soumya, et autres
Publié: (2026)
par: Mazumdar, Soumya, et autres
Publié: (2026)
EARTalking: End-to-end GPT-style Autoregressive Talking Head Synthesis with Frame-wise Control
par: Weng, Yuzhe, et autres
Publié: (2026)
par: Weng, Yuzhe, et autres
Publié: (2026)
FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation
par: Tan, Weiting, et autres
Publié: (2026)
par: Tan, Weiting, et autres
Publié: (2026)
ATL-Diff: Audio-Driven Talking Head Generation with Early Landmarks-Guide Noise Diffusion
par: Vo, Hoang-Son, et autres
Publié: (2025)
par: Vo, Hoang-Son, et autres
Publié: (2025)
SyncBreaker:Stage-Aware Multimodal Adversarial Attacks on Audio-Driven Talking Head Generation
par: Zhang, Wenli, et autres
Publié: (2026)
par: Zhang, Wenli, et autres
Publié: (2026)
Audio-Plane: Audio Factorization Plane Gaussian Splatting for Real-Time Talking Head Synthesis
par: Shen, Shuai, et autres
Publié: (2025)
par: Shen, Shuai, et autres
Publié: (2025)
Analysis of Hyperparameter Optimization Effects on Lightweight Deep Models for Real-Time Image Classification
par: Rakesh, Vineet Kumar, et autres
Publié: (2025)
par: Rakesh, Vineet Kumar, et autres
Publié: (2025)
CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing
par: Cong, Gaoxiang, et autres
Publié: (2026)
par: Cong, Gaoxiang, et autres
Publié: (2026)
UniSync: A Unified Framework for Audio-Visual Synchronization
par: Feng, Tao, et autres
Publié: (2025)
par: Feng, Tao, et autres
Publié: (2025)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
par: Tian, Zeyue, et autres
Publié: (2026)
par: Tian, Zeyue, et autres
Publié: (2026)
JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization
par: Liu, Kai, et autres
Publié: (2025)
par: Liu, Kai, et autres
Publié: (2025)
DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression
par: Li, Bingzhou, et autres
Publié: (2026)
par: Li, Bingzhou, et autres
Publié: (2026)
ConsistTalk: Intensity Controllable Temporally Consistent Talking Head Generation with Diffusion Noise Search
par: Liu, Zhenjie, et autres
Publié: (2025)
par: Liu, Zhenjie, et autres
Publié: (2025)
DualTalk: Dual-Speaker Interaction for 3D Talking Head Conversations
par: Peng, Ziqiao, et autres
Publié: (2025)
par: Peng, Ziqiao, et autres
Publié: (2025)
FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts
par: Li, You, et autres
Publié: (2026)
par: Li, You, et autres
Publié: (2026)
Audio-Sync Video Generation with Multi-Stream Temporal Control
par: Weng, Shuchen, et autres
Publié: (2025)
par: Weng, Shuchen, et autres
Publié: (2025)
StereoSync: Spatially-Aware Stereo Audio Generation from Video
par: Marinoni, Christian, et autres
Publié: (2025)
par: Marinoni, Christian, et autres
Publié: (2025)
EmotiveTalk: Expressive Talking Head Generation through Audio Information Decoupling and Emotional Video Diffusion
par: Wang, Haotian, et autres
Publié: (2024)
par: Wang, Haotian, et autres
Publié: (2024)
Apollo: Unified Multi-Task Audio-Video Joint Generation
par: Wang, Jun, et autres
Publié: (2026)
par: Wang, Jun, et autres
Publié: (2026)
Do Joint Audio-Video Generation Models Understand Physics?
par: Cui, Zijun, et autres
Publié: (2026)
par: Cui, Zijun, et autres
Publié: (2026)
Silence is Golden: Leveraging Adversarial Examples to Nullify Audio Control in LDM-based Talking-Head Generation
par: Gan, Yuan, et autres
Publié: (2025)
par: Gan, Yuan, et autres
Publié: (2025)
Audio-Guided Visual Perception for Audio-Visual Navigation
par: Wang, Yi, et autres
Publié: (2025)
par: Wang, Yi, et autres
Publié: (2025)
Ditto: Motion-Space Diffusion for Controllable Realtime Talking Head Synthesis
par: Li, Tianqi, et autres
Publié: (2024)
par: Li, Tianqi, et autres
Publié: (2024)
AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
par: Yang, Jialiang, et autres
Publié: (2026)
par: Yang, Jialiang, et autres
Publié: (2026)
Tempo as the Stable Cue: Hierarchical Mixture of Tempo and Beat Experts for Music to 3D Dance Generation
par: Lyu, Guangtao, et autres
Publié: (2025)
par: Lyu, Guangtao, et autres
Publié: (2025)
Documents similaires
-
PrivFedTalk: Privacy-Aware Federated Diffusion with Identity-Stable Adapters for Personalized Talking-Head Generation
par: Mazumdar, Soumya, et autres
Publié: (2026) -
VineetVC: Adaptive Video Conferencing Under Severe Bandwidth Constraints Using Audio-Driven Talking-Head Reconstruction
par: Rakesh, Vineet Kumar, et autres
Publié: (2026) -
DiffusionTalker: Efficient and Compact Speech-Driven 3D Talking Head via Personalizer-Guided Distillation
par: Chen, Peng, et autres
Publié: (2025) -
FaceTalk: Audio-Driven Motion Diffusion for Neural Parametric Head Models
par: Aneja, Shivangi, et autres
Publié: (2023) -
TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation
par: Liu, Xiangyu, et autres
Publié: (2026)