PASE: Phoneme-Aware Speech Encoder to Improve Lip Sync Accuracy for Talking Head Synthesis
Fuente:
arXiv
Salvato in:
| Autori principali: | Huang, Yihuan, Liu, Jiajun, Ren, Yanzhen, Xue, Jun, Liu, Wuyang, Sun, Zongkun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DiffPoseTalk: Speech-Driven Stylistic 3D Facial Animation and Head Pose Generation via Diffusion Models
di: Sun, Zhiyao, et al.
Pubblicazione: (2023)
di: Sun, Zhiyao, et al.
Pubblicazione: (2023)
Supervising 3D Talking Head Avatars with Analysis-by-Audio-Synthesis
di: Daněček, Radek, et al.
Pubblicazione: (2025)
di: Daněček, Radek, et al.
Pubblicazione: (2025)
OT-Talk: Animating 3D Talking Head with Optimal Transportation
di: Wang, Xinmu, et al.
Pubblicazione: (2025)
di: Wang, Xinmu, et al.
Pubblicazione: (2025)
Perceptually Accurate 3D Talking Head Generation: New Definitions, Speech-Mesh Representation, and Evaluation Metrics
di: Chae-Yeon, Lee, et al.
Pubblicazione: (2025)
di: Chae-Yeon, Lee, et al.
Pubblicazione: (2025)
MultiTalk: Enhancing 3D Talking Head Generation Across Languages with Multilingual Video Dataset
di: Sung-Bin, Kim, et al.
Pubblicazione: (2024)
di: Sung-Bin, Kim, et al.
Pubblicazione: (2024)
PointTalk: Audio-Driven Dynamic Lip Point Cloud for 3D Gaussian-based Talking Head Synthesis
di: Xie, Yifan, et al.
Pubblicazione: (2024)
di: Xie, Yifan, et al.
Pubblicazione: (2024)
StyGazeTalk: Learning Stylized Generation of Gaze and Head Dynamics
di: Shi, Chengwei, et al.
Pubblicazione: (2025)
di: Shi, Chengwei, et al.
Pubblicazione: (2025)
MoDA: Multi-modal Diffusion Architecture for Talking Head Generation
di: Li, Xinyang, et al.
Pubblicazione: (2025)
di: Li, Xinyang, et al.
Pubblicazione: (2025)
Enhancing Speech-Driven 3D Facial Animation with Audio-Visual Guidance from Lip Reading Expert
di: EunGi, Han, et al.
Pubblicazione: (2024)
di: EunGi, Han, et al.
Pubblicazione: (2024)
READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation
di: Wang, Haotian, et al.
Pubblicazione: (2025)
di: Wang, Haotian, et al.
Pubblicazione: (2025)
NeRF-3DTalker: Neural Radiance Field with 3D Prior Aided Audio Disentanglement for Talking Head Synthesis
di: Liu, Xiaoxing, et al.
Pubblicazione: (2025)
di: Liu, Xiaoxing, et al.
Pubblicazione: (2025)
Lightning Fast Caching-based Parallel Denoising Prediction for Accelerating Talking Head Generation
di: Long, Jianzhi, et al.
Pubblicazione: (2025)
di: Long, Jianzhi, et al.
Pubblicazione: (2025)
SyncTalk: The Devil is in the Synchronization for Talking Head Synthesis
di: Peng, Ziqiao, et al.
Pubblicazione: (2023)
di: Peng, Ziqiao, et al.
Pubblicazione: (2023)
SyncLight: Single-Edit Multi-View Relighting
di: Serrano-Lozano, David, et al.
Pubblicazione: (2026)
di: Serrano-Lozano, David, et al.
Pubblicazione: (2026)
Learning Disentangled Speech- and Expression-Driven Blendshapes for 3D Talking Face Animation
di: Mao, Yuxiang, et al.
Pubblicazione: (2025)
di: Mao, Yuxiang, et al.
Pubblicazione: (2025)
One Shot, One Talk: Whole-body Talking Avatar from a Single Image
di: Xiang, Jun, et al.
Pubblicazione: (2024)
di: Xiang, Jun, et al.
Pubblicazione: (2024)
A Comprehensive Multi-scale Approach for Speech and Dynamics Synchrony in Talking Head Generation
di: Airale, Louis, et al.
Pubblicazione: (2023)
di: Airale, Louis, et al.
Pubblicazione: (2023)
VoxDet: Rethinking 3D Semantic Occupancy Prediction as Dense Object Detection
di: Li, Wuyang, et al.
Pubblicazione: (2025)
di: Li, Wuyang, et al.
Pubblicazione: (2025)
Audio-Plane: Audio Factorization Plane Gaussian Splatting for Real-Time Talking Head Synthesis
di: Shen, Shuai, et al.
Pubblicazione: (2025)
di: Shen, Shuai, et al.
Pubblicazione: (2025)
SyncDreamer: Generating Multiview-consistent Images from a Single-view Image
di: Liu, Yuan, et al.
Pubblicazione: (2023)
di: Liu, Yuan, et al.
Pubblicazione: (2023)
ReSyncer: Rewiring Style-based Generator for Unified Audio-Visually Synced Facial Performer
di: Guan, Jiazhi, et al.
Pubblicazione: (2024)
di: Guan, Jiazhi, et al.
Pubblicazione: (2024)
Semantic Gesticulator: Semantics-Aware Co-Speech Gesture Synthesis
di: Zhang, Zeyi, et al.
Pubblicazione: (2024)
di: Zhang, Zeyi, et al.
Pubblicazione: (2024)
Learn2Talk: 3D Talking Face Learns from 2D Talking Face
di: Zhuang, Yixiang, et al.
Pubblicazione: (2024)
di: Zhuang, Yixiang, et al.
Pubblicazione: (2024)
PanoHair: Detailed Hair Strand Synthesis on Volumetric Heads
di: Verma, Shashikant, et al.
Pubblicazione: (2025)
di: Verma, Shashikant, et al.
Pubblicazione: (2025)
SyncSDE: A Probabilistic Framework for Diffusion Synchronization
di: Lee, Hyunjun, et al.
Pubblicazione: (2025)
di: Lee, Hyunjun, et al.
Pubblicazione: (2025)
In-Context Sync-LoRA for Portrait Video Editing
di: Polaczek, Sagi, et al.
Pubblicazione: (2025)
di: Polaczek, Sagi, et al.
Pubblicazione: (2025)
GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling
di: Liu, Pinxin, et al.
Pubblicazione: (2025)
di: Liu, Pinxin, et al.
Pubblicazione: (2025)
Tolerance-Aware Deep Optics
di: Dai, Jun, et al.
Pubblicazione: (2025)
di: Dai, Jun, et al.
Pubblicazione: (2025)
Joker: Conditional 3D Head Synthesis with Extreme Facial Expressions
di: Prinzler, Malte, et al.
Pubblicazione: (2024)
di: Prinzler, Malte, et al.
Pubblicazione: (2024)
EditYourself: Audio-Driven Generation and Manipulation of Talking Head Videos with Diffusion Transformers
di: Flynn, John, et al.
Pubblicazione: (2026)
di: Flynn, John, et al.
Pubblicazione: (2026)
3D-SSGAN: Lifting 2D Semantics for 3D-Aware Compositional Portrait Synthesis
di: Liu, Ruiqi, et al.
Pubblicazione: (2024)
di: Liu, Ruiqi, et al.
Pubblicazione: (2024)
TextToon: Real-Time Text Toonify Head Avatar from Single Video
di: Song, Luchuan, et al.
Pubblicazione: (2024)
di: Song, Luchuan, et al.
Pubblicazione: (2024)
Geometry-Aware Texture Generation for 3D Head Modeling with Artist-driven Control
di: Fadaeinejad, Amin, et al.
Pubblicazione: (2025)
di: Fadaeinejad, Amin, et al.
Pubblicazione: (2025)
FlashAvatar: High-fidelity Head Avatar with Efficient Gaussian Embedding
di: Xiang, Jun, et al.
Pubblicazione: (2023)
di: Xiang, Jun, et al.
Pubblicazione: (2023)
HHAvatar: Gaussian Head Avatar with Dynamic Hairs
di: Liao, Zhanfeng, et al.
Pubblicazione: (2023)
di: Liao, Zhanfeng, et al.
Pubblicazione: (2023)
Profiling the Voice: Speaker-Specific Phoneme Fingerprinting for Speech Deepfake Detection
di: Xue, Jun, et al.
Pubblicazione: (2026)
di: Xue, Jun, et al.
Pubblicazione: (2026)
LSF-Animation: Label-Free Speech-Driven Facial Animation via Implicit Feature Representation
di: Lu, Xin, et al.
Pubblicazione: (2025)
di: Lu, Xin, et al.
Pubblicazione: (2025)
SEGA: Drivable 3D Gaussian Head Avatar from a Single Image
di: Guo, Chen, et al.
Pubblicazione: (2025)
di: Guo, Chen, et al.
Pubblicazione: (2025)
VRMM: A Volumetric Relightable Morphable Head Model
di: Yang, Haotian, et al.
Pubblicazione: (2024)
di: Yang, Haotian, et al.
Pubblicazione: (2024)
Refined Geometry-guided Head Avatar Reconstruction from Monocular RGB Video
di: Park, Pilseo, et al.
Pubblicazione: (2025)
di: Park, Pilseo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DiffPoseTalk: Speech-Driven Stylistic 3D Facial Animation and Head Pose Generation via Diffusion Models
di: Sun, Zhiyao, et al.
Pubblicazione: (2023) -
Supervising 3D Talking Head Avatars with Analysis-by-Audio-Synthesis
di: Daněček, Radek, et al.
Pubblicazione: (2025) -
OT-Talk: Animating 3D Talking Head with Optimal Transportation
di: Wang, Xinmu, et al.
Pubblicazione: (2025) -
Perceptually Accurate 3D Talking Head Generation: New Definitions, Speech-Mesh Representation, and Evaluation Metrics
di: Chae-Yeon, Lee, et al.
Pubblicazione: (2025) -
MultiTalk: Enhancing 3D Talking Head Generation Across Languages with Multilingual Video Dataset
di: Sung-Bin, Kim, et al.
Pubblicazione: (2024)