PGSTalker: Real-Time Audio-Driven Talking Head Generation via 3D Gaussian Splatting with Pixel-Aware Density Control
Fuente:
arXiv
Saved in:
| Main Authors: | Zhu, Tianheng, Yu, Yinfeng, Wang, Liejun, Sun, Fuchun, Zheng, Wendong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
EGSTalker: Real-Time Audio-Driven Talking Head Generation with Efficient Gaussian Deformation
by: Zhu, Tianheng, et al.
Published: (2025)
by: Zhu, Tianheng, et al.
Published: (2025)
Audio-Guided Dynamic Modality Fusion with Stereo-Aware Attention for Audio-Visual Navigation
by: Li, Jia, et al.
Published: (2025)
by: Li, Jia, et al.
Published: (2025)
EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal Coherence
by: Li, Yahui, et al.
Published: (2026)
by: Li, Yahui, et al.
Published: (2026)
Audio-Guided Visual Perception for Audio-Visual Navigation
by: Wang, Yi, et al.
Published: (2025)
by: Wang, Yi, et al.
Published: (2025)
Iterative Residual Cross-Attention Mechanism: An Integrated Approach for Audio-Visual Navigation Tasks
by: Zhang, Hailong, et al.
Published: (2025)
by: Zhang, Hailong, et al.
Published: (2025)
ECTSpeech: Enhancing Efficient Speech Synthesis via Easy Consistency Tuning
by: Zhu, Tao, et al.
Published: (2025)
by: Zhu, Tao, et al.
Published: (2025)
UNQA: Unified No-Reference Quality Assessment for Audio, Image, Video, and Audio-Visual Content
by: Cao, Yuqin, et al.
Published: (2024)
by: Cao, Yuqin, et al.
Published: (2024)
Physics-Based iOCT Sonification for Real-time Interaction Awareness in Subretinal Injection
by: Vargas, Luis D. Reyes, et al.
Published: (2026)
by: Vargas, Luis D. Reyes, et al.
Published: (2026)
Efficient Face Detection with Audio-Based Region Proposals for Human-Robot Interactions
by: Aris, William, et al.
Published: (2023)
by: Aris, William, et al.
Published: (2023)
Audio-Visual Driven Compression for Low-Bitrate Talking Head Videos
by: Takahashi, Riku, et al.
Published: (2025)
by: Takahashi, Riku, et al.
Published: (2025)
Audio-Visual Speaker Diarization: Current Databases, Approaches and Challenges
by: Mingote, Victoria, et al.
Published: (2024)
by: Mingote, Victoria, et al.
Published: (2024)
Beyond Textual Knowledge-Leveraging Multimodal Knowledge Bases for Enhancing Vision-and-Language Navigation
by: Yang, Dongsheng, et al.
Published: (2026)
by: Yang, Dongsheng, et al.
Published: (2026)
Generalizable 3D Gaussian Splatting enabled Semantic Coding for Real-Time Immersive Video Communications
by: Yang, Dingxi, et al.
Published: (2026)
by: Yang, Dingxi, et al.
Published: (2026)
Robust Multi-modal Task-oriented Communications with Redundancy-aware Representations
by: Fu, Jingwen, et al.
Published: (2025)
by: Fu, Jingwen, et al.
Published: (2025)
CoAVT: A Cognition-Inspired Unified Audio-Visual-Text Pre-Training Model for Multimodal Processing
by: Yue, Xianghu, et al.
Published: (2024)
by: Yue, Xianghu, et al.
Published: (2024)
Exploring Phonetic Context-Aware Lip-Sync For Talking Face Generation
by: Park, Se Jin, et al.
Published: (2023)
by: Park, Se Jin, et al.
Published: (2023)
PrismAudio: Decomposed Chain-of-Thoughts and Multi-dimensional Rewards for Video-to-Audio Generation
by: Liu, Huadai, et al.
Published: (2025)
by: Liu, Huadai, et al.
Published: (2025)
Audio-Plane: Audio Factorization Plane Gaussian Splatting for Real-Time Talking Head Synthesis
by: Shen, Shuai, et al.
Published: (2025)
by: Shen, Shuai, et al.
Published: (2025)
A Wavefield Correlation Approach to Improve Sound Speed Estimation in Ultrasound Autofocusing
by: Zhuang, Louise, et al.
Published: (2026)
by: Zhuang, Louise, et al.
Published: (2026)
Learning to reconstruct from saturated data: audio declipping and high-dynamic range imaging
by: Sechaud, Victor, et al.
Published: (2026)
by: Sechaud, Victor, et al.
Published: (2026)
A 129FPS Full HD Real-Time Accelerator for 3D Gaussian Splatting
by: Chang, Fang-Chi, et al.
Published: (2026)
by: Chang, Fang-Chi, et al.
Published: (2026)
Faces that Speak: Jointly Synthesising Talking Face and Speech from Text
by: Jang, Youngjoon, et al.
Published: (2024)
by: Jang, Youngjoon, et al.
Published: (2024)
GS-LIVM: Real-Time Photo-Realistic LiDAR-Inertial-Visual Mapping with Gaussian Splatting
by: Xie, Yusen, et al.
Published: (2024)
by: Xie, Yusen, et al.
Published: (2024)
Localizing Audio-Visual Deepfakes via Hierarchical Boundary Modeling
by: Chen, Xuanjun, et al.
Published: (2025)
by: Chen, Xuanjun, et al.
Published: (2025)
Cross Attentional Audio-Visual Fusion for Dimensional Emotion Recognition
by: Praveen, R. Gnana, et al.
Published: (2021)
by: Praveen, R. Gnana, et al.
Published: (2021)
Towards Language-Independent Face-Voice Association with Multimodal Foundation Models
by: Farhadipour, Aref, et al.
Published: (2025)
by: Farhadipour, Aref, et al.
Published: (2025)
KunquDB: An Attempt for Speaker Verification in the Chinese Opera Scenario
by: Zhou, Huali, et al.
Published: (2024)
by: Zhou, Huali, et al.
Published: (2024)
Interpretable Modeling of Articulatory Temporal Dynamics from real-time MRI for Phoneme Recognition
by: Park, Jay, et al.
Published: (2025)
by: Park, Jay, et al.
Published: (2025)
Improvement Of Audiovisual Quality Estimation Using A Nonlinear Autoregressive Exogenous Neural Network And Bitstream Parameters
by: Kossi, Koffi, et al.
Published: (2024)
by: Kossi, Koffi, et al.
Published: (2024)
The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models
by: Wang, Yi, et al.
Published: (2025)
by: Wang, Yi, et al.
Published: (2025)
Advancing Audio-Visual Navigation Through Multi-Agent Collaboration in 3D Environments
by: Zhang, Hailong, et al.
Published: (2025)
by: Zhang, Hailong, et al.
Published: (2025)
Lightweight Gradient-Aware Upscaling of 3D Gaussian Splatting Images
by: Niedermayr, Simon, et al.
Published: (2025)
by: Niedermayr, Simon, et al.
Published: (2025)
Beyond Correlation: Evaluating Multimedia Quality Models with the Constrained Concordance Index
by: Ragano, Alessandro, et al.
Published: (2024)
by: Ragano, Alessandro, et al.
Published: (2024)
Streaming Real-Time Rendered Scenes as 3D Gaussians
by: Siekkinen, Matti, et al.
Published: (2026)
by: Siekkinen, Matti, et al.
Published: (2026)
Out-Of-Distribution Detection for Audio-visual Generalized Zero-Shot Learning: A General Framework
by: Wen, Liuyuan
Published: (2024)
by: Wen, Liuyuan
Published: (2024)
Multimodal Confidence Modeling in Audio-Visual Quality Assessment
by: Mithila, Mayesha Maliha R., et al.
Published: (2026)
by: Mithila, Mayesha Maliha R., et al.
Published: (2026)
Region-Adaptive Learned Hierarchical Encoding for 3D Gaussian Splatting Data
by: Sridhara, Shashank N., et al.
Published: (2025)
by: Sridhara, Shashank N., et al.
Published: (2025)
Cross-modal Cognitive Consensus guided Audio-Visual Segmentation
by: Shi, Zhaofeng, et al.
Published: (2023)
by: Shi, Zhaofeng, et al.
Published: (2023)
Asymmetric Mask Scheme for Self-Supervised Real Image Denoising
by: Liao, Xiangyu, et al.
Published: (2024)
by: Liao, Xiangyu, et al.
Published: (2024)
Splats in Splats: Robust and Effective 3D Steganography towards Gaussian Splatting
by: Guo, Yijia, et al.
Published: (2024)
by: Guo, Yijia, et al.
Published: (2024)
Similar Items
-
EGSTalker: Real-Time Audio-Driven Talking Head Generation with Efficient Gaussian Deformation
by: Zhu, Tianheng, et al.
Published: (2025) -
Audio-Guided Dynamic Modality Fusion with Stereo-Aware Attention for Audio-Visual Navigation
by: Li, Jia, et al.
Published: (2025) -
EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal Coherence
by: Li, Yahui, et al.
Published: (2026) -
Audio-Guided Visual Perception for Audio-Visual Navigation
by: Wang, Yi, et al.
Published: (2025) -
Iterative Residual Cross-Attention Mechanism: An Integrated Approach for Audio-Visual Navigation Tasks
by: Zhang, Hailong, et al.
Published: (2025)