LTA-L2S: Lexical Tone-Aware Lip-to-Speech Synthesis for Mandarin with Cross-Lingual Transfer Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Kang, Liang, Yifan, Liu, Fangkun, Xie, Zhenping, Zheng, Chengshi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
NaturalL2S: End-to-End High-quality Multispeaker Lip-to-Speech Synthesis with Differential Digital Signal Processing
di: Liang, Yifan, et al.
Pubblicazione: (2025)
di: Liang, Yifan, et al.
Pubblicazione: (2025)
Towards Accurate Lip-to-Speech Synthesis in-the-Wild
di: Hegde, Sindhu, et al.
Pubblicazione: (2024)
di: Hegde, Sindhu, et al.
Pubblicazione: (2024)
SwinLip: An Efficient Visual Speech Encoder for Lip Reading Using Swin Transformer
di: Park, Young-Hu, et al.
Pubblicazione: (2025)
di: Park, Young-Hu, et al.
Pubblicazione: (2025)
Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention
di: Li, Kai, et al.
Pubblicazione: (2025)
di: Li, Kai, et al.
Pubblicazione: (2025)
SLD-L2S: Hierarchical Subspace Latent Diffusion for High-Fidelity Lip to Speech Synthesis
di: Liang, Yifan, et al.
Pubblicazione: (2026)
di: Liang, Yifan, et al.
Pubblicazione: (2026)
AISHELL6-whisper: A Chinese Mandarin Audio-visual Whisper Speech Dataset with Speech Recognition Baselines
di: Li, Cancan, et al.
Pubblicazione: (2025)
di: Li, Cancan, et al.
Pubblicazione: (2025)
Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation
di: Goncalves, Lucas, et al.
Pubblicazione: (2024)
di: Goncalves, Lucas, et al.
Pubblicazione: (2024)
Contrastive Decoupled Representation Learning and Regularization for Speech-Preserving Facial Expression Manipulation
di: Chen, Tianshui, et al.
Pubblicazione: (2025)
di: Chen, Tianshui, et al.
Pubblicazione: (2025)
LipSody: Lip-to-Speech Synthesis with Enhanced Prosody Consistency
di: Lee, Jaejun, et al.
Pubblicazione: (2026)
di: Lee, Jaejun, et al.
Pubblicazione: (2026)
Learning Separable Hidden Unit Contributions for Speaker-Adaptive Lip-Reading
di: Luo, Songtao, et al.
Pubblicazione: (2023)
di: Luo, Songtao, et al.
Pubblicazione: (2023)
Semantic Gesticulator: Semantics-Aware Co-Speech Gesture Synthesis
di: Zhang, Zeyi, et al.
Pubblicazione: (2024)
di: Zhang, Zeyi, et al.
Pubblicazione: (2024)
Cross-Lingual F5-TTS: Towards Language-Agnostic Voice Cloning and Speech Synthesis
di: Liu, Qingyu, et al.
Pubblicazione: (2025)
di: Liu, Qingyu, et al.
Pubblicazione: (2025)
VoxAging: Continuously Tracking Speaker Aging with a Large-Scale Longitudinal Dataset in English and Mandarin
di: Ai, Zhiqi, et al.
Pubblicazione: (2025)
di: Ai, Zhiqi, et al.
Pubblicazione: (2025)
An Audio-Visual Speech Separation Model Inspired by Cortico-Thalamo-Cortical Circuits
di: Li, Kai, et al.
Pubblicazione: (2022)
di: Li, Kai, et al.
Pubblicazione: (2022)
PAVAS: Physics-Aware Video-to-Audio Synthesis
di: Hyun-Bin, Oh, et al.
Pubblicazione: (2025)
di: Hyun-Bin, Oh, et al.
Pubblicazione: (2025)
Face-StyleSpeech: Enhancing Zero-shot Speech Synthesis from Face Images with Improved Face-to-Speech Mapping
di: Kang, Minki, et al.
Pubblicazione: (2023)
di: Kang, Minki, et al.
Pubblicazione: (2023)
Lip Reading for Low-resource Languages by Learning and Combining General Speech Knowledge and Language-specific Knowledge
di: Kim, Minsu, et al.
Pubblicazione: (2023)
di: Kim, Minsu, et al.
Pubblicazione: (2023)
Towards Unified Co-Speech Gesture Generation via Hierarchical Implicit Periodicity Learning
di: Guo, Xin, et al.
Pubblicazione: (2025)
di: Guo, Xin, et al.
Pubblicazione: (2025)
DiVISe: Direct Visual-Input Speech Synthesis Preserving Speaker Characteristics And Intelligibility
di: Liu, Yifan, et al.
Pubblicazione: (2025)
di: Liu, Yifan, et al.
Pubblicazione: (2025)
XM-ALIGN: Unified Cross-Modal Embedding Alignment for Face-Voice Association
di: Fang, Zhihua, et al.
Pubblicazione: (2025)
di: Fang, Zhihua, et al.
Pubblicazione: (2025)
Exploring Phonetic Context-Aware Lip-Sync For Talking Face Generation
di: Park, Se Jin, et al.
Pubblicazione: (2023)
di: Park, Se Jin, et al.
Pubblicazione: (2023)
Hierarchical Codec Diffusion for Video-to-Speech Generation
di: Ye, Jiaxin, et al.
Pubblicazione: (2026)
di: Ye, Jiaxin, et al.
Pubblicazione: (2026)
Separate in the Speech Chain: Cross-Modal Conditional Audio-Visual Target Speech Extraction
di: Mu, Zhaoxi, et al.
Pubblicazione: (2024)
di: Mu, Zhaoxi, et al.
Pubblicazione: (2024)
Pay Attention to CTC: Fast and Robust Pseudo-Labelling for Unified Speech Recognition
di: Haliassos, Alexandros, et al.
Pubblicazione: (2026)
di: Haliassos, Alexandros, et al.
Pubblicazione: (2026)
EchoMask: Speech-Queried Attention-based Mask Modeling for Holistic Co-Speech Motion Generation
di: Zhang, Xiangyue, et al.
Pubblicazione: (2025)
di: Zhang, Xiangyue, et al.
Pubblicazione: (2025)
IMSE: Efficient U-Net-based Speech Enhancement using Inception Depthwise Convolution and Amplitude-Aware Linear Attention
di: Tang, Xinxin, et al.
Pubblicazione: (2025)
di: Tang, Xinxin, et al.
Pubblicazione: (2025)
Mechanisms of Multimodal Synchronization: Insights from Decoder-Based Video-Text-to-Speech Synthesis
di: Gupta, Akshita, et al.
Pubblicazione: (2024)
di: Gupta, Akshita, et al.
Pubblicazione: (2024)
DuoGesture: Neuro-Inspired and Biomechanically Informed Dual-Stream Co-Speech Gesture Generation
di: Paar, Ferdinand, et al.
Pubblicazione: (2026)
di: Paar, Ferdinand, et al.
Pubblicazione: (2026)
Distillation-based Layer Dropping (DLD): Effective End-to-end Framework for Dynamic Speech Networks
di: Hannan, Abdul, et al.
Pubblicazione: (2026)
di: Hannan, Abdul, et al.
Pubblicazione: (2026)
UMo: Unified Sparse Motion Modeling for Real-Time Co-Speech Avatars
di: Zhan, Xiaoyu, et al.
Pubblicazione: (2026)
di: Zhan, Xiaoyu, et al.
Pubblicazione: (2026)
GOMPSNR: Reflourish the Signal-to-Noise Ratio Metric for Audio Generation Tasks
di: Dai, Lingling, et al.
Pubblicazione: (2026)
di: Dai, Lingling, et al.
Pubblicazione: (2026)
Speech Audio Generation from dynamic MRI via a Knowledge Enhanced Conditional Variational Autoencoder
di: Li, Yaxuan, et al.
Pubblicazione: (2025)
di: Li, Yaxuan, et al.
Pubblicazione: (2025)
MAG: Multi-Modal Aligned Autoregressive Co-Speech Gesture Generation without Vector Quantization
di: Liu, Binjie, et al.
Pubblicazione: (2025)
di: Liu, Binjie, et al.
Pubblicazione: (2025)
TARO: Timestep-Adaptive Representation Alignment with Onset-Aware Conditioning for Synchronized Video-to-Audio Synthesis
di: Ton, Tri, et al.
Pubblicazione: (2025)
di: Ton, Tri, et al.
Pubblicazione: (2025)
Toward Fine-Grained Speech Inpainting Forensics:A Dataset, Method, and Metric for Multi-Region Tampering Localization
di: Vu, Tung, et al.
Pubblicazione: (2026)
di: Vu, Tung, et al.
Pubblicazione: (2026)
UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation
di: Wang, Jinting, et al.
Pubblicazione: (2025)
di: Wang, Jinting, et al.
Pubblicazione: (2025)
Semantics-Aware Human Motion Generation from Audio Instructions
di: Wang, Zi-An, et al.
Pubblicazione: (2025)
di: Wang, Zi-An, et al.
Pubblicazione: (2025)
AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition
di: Liu, Zehua, et al.
Pubblicazione: (2024)
di: Liu, Zehua, et al.
Pubblicazione: (2024)
Discovering "Words" in Music: Unsupervised Learning of Compositional Sparse Code for Symbolic Music
di: Wang, Tianle, et al.
Pubblicazione: (2025)
di: Wang, Tianle, et al.
Pubblicazione: (2025)
Leveraging Large Language Models in Visual Speech Recognition: Model Scaling, Context-Aware Decoding, and Iterative Polishing
di: Liu, Zehua, et al.
Pubblicazione: (2025)
di: Liu, Zehua, et al.
Pubblicazione: (2025)
Documenti analoghi
-
NaturalL2S: End-to-End High-quality Multispeaker Lip-to-Speech Synthesis with Differential Digital Signal Processing
di: Liang, Yifan, et al.
Pubblicazione: (2025) -
Towards Accurate Lip-to-Speech Synthesis in-the-Wild
di: Hegde, Sindhu, et al.
Pubblicazione: (2024) -
SwinLip: An Efficient Visual Speech Encoder for Lip Reading Using Swin Transformer
di: Park, Young-Hu, et al.
Pubblicazione: (2025) -
Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention
di: Li, Kai, et al.
Pubblicazione: (2025) -
SLD-L2S: Hierarchical Subspace Latent Diffusion for High-Fidelity Lip to Speech Synthesis
di: Liang, Yifan, et al.
Pubblicazione: (2026)