SLD-L2S: Hierarchical Subspace Latent Diffusion for High-Fidelity Lip to Speech Synthesis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liang, Yifan, Li, Andong, Yang, Kang, Yu, Guochen, Liu, Fangkun, Dai, Lingling, Li, Xiaodong, Zheng, Chengshi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
NaturalL2S: End-to-End High-quality Multispeaker Lip-to-Speech Synthesis with Differential Digital Signal Processing
par: Liang, Yifan, et autres
Publié: (2025)
par: Liang, Yifan, et autres
Publié: (2025)
Rethinking the joint estimation of magnitude and phase for time-frequency domain neural vocoders
par: Dai, Lingling, et autres
Publié: (2025)
par: Dai, Lingling, et autres
Publié: (2025)
Neural Vocoders as Speech Enhancers
par: Li, Andong, et autres
Publié: (2025)
par: Li, Andong, et autres
Publié: (2025)
LipDiffuser: Lip-to-Speech Generation with Conditional Diffusion Models
par: Richter, Julius, et autres
Publié: (2025)
par: Richter, Julius, et autres
Publié: (2025)
BSDB-Net: Band-Split Dual-Branch Network with Selective State Spaces Mechanism for Monaural Speech Enhancement
par: Fan, Cunhang, et autres
Publié: (2024)
par: Fan, Cunhang, et autres
Publié: (2024)
Fairness of Automatic Speech Recognition in Cleft Lip and Palate Speech
par: Bhattacharjee, Susmita, et autres
Publié: (2025)
par: Bhattacharjee, Susmita, et autres
Publié: (2025)
DiTSE: High-Fidelity Generative Speech Enhancement via Latent Diffusion Transformers
par: Guimarães, Heitor R., et autres
Publié: (2025)
par: Guimarães, Heitor R., et autres
Publié: (2025)
Latent Filling: Latent Space Data Augmentation for Zero-shot Speech Synthesis
par: Bae, Jae-Sung, et autres
Publié: (2023)
par: Bae, Jae-Sung, et autres
Publié: (2023)
From Continuous to Discrete: Cross-Domain Collaborative General Speech Enhancement via Hierarchical Language Models
par: Mu, Zhaoxi, et autres
Publié: (2025)
par: Mu, Zhaoxi, et autres
Publié: (2025)
Speech Synthesis From Continuous Features Using Per-Token Latent Diffusion
par: Turetzky, Arnon, et autres
Publié: (2024)
par: Turetzky, Arnon, et autres
Publié: (2024)
LipVoicer: Generating Speech from Silent Videos Guided by Lip Reading
par: Yemini, Yochai, et autres
Publié: (2023)
par: Yemini, Yochai, et autres
Publié: (2023)
LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
par: Xin, Detai, et autres
Publié: (2026)
par: Xin, Detai, et autres
Publié: (2026)
Hierarchical Control of Emotion Rendering in Speech Synthesis
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
UniTalker: Conversational Speech-Visual Synthesis
par: Hu, Yifan, et autres
Publié: (2025)
par: Hu, Yifan, et autres
Publié: (2025)
The Acoustic Camouflage Phenomenon: Re-evaluating Speech Features for Financial Risk Prediction
par: Dungrani, Dhruvin, et autres
Publié: (2026)
par: Dungrani, Dhruvin, et autres
Publié: (2026)
Hierarchical Emotion Prediction and Control in Text-to-Speech Synthesis
par: Inoue, Sho, et autres
Publié: (2024)
par: Inoue, Sho, et autres
Publié: (2024)
CLEAR: Continuous Latent Autoregressive Modeling for High-quality and Low-latency Speech Synthesis
par: Wu, Chun Yat, et autres
Publié: (2025)
par: Wu, Chun Yat, et autres
Publié: (2025)
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
par: Yang, Yifan, et autres
Publié: (2024)
par: Yang, Yifan, et autres
Publié: (2024)
Investigation of Speech and Noise Latent Representations in Single-channel VAE-based Speech Enhancement
par: Li, Jiatong, et autres
Publié: (2025)
par: Li, Jiatong, et autres
Publié: (2025)
Spatial Reconstructed Local Attention Res2Net with F0 Subband for Fake Speech Detection
par: Fan, Cunhang, et autres
Publié: (2023)
par: Fan, Cunhang, et autres
Publié: (2023)
End-to-end multi-channel speaker extraction and binaural speech synthesis
par: Chi, Cheng, et autres
Publié: (2024)
par: Chi, Cheng, et autres
Publié: (2024)
Semantic-VAE: Semantic-Alignment Latent Representation for Better Speech Synthesis
par: Niu, Zhikang, et autres
Publié: (2025)
par: Niu, Zhikang, et autres
Publié: (2025)
Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling
par: Jiang, Yuepeng, et autres
Publié: (2024)
par: Jiang, Yuepeng, et autres
Publié: (2024)
Multi-Step Prediction and Control of Hierarchical Emotion Distribution in Text-to-Speech Synthesis
par: Inoue, Sho, et autres
Publié: (2025)
par: Inoue, Sho, et autres
Publié: (2025)
AS-Speech: Adaptive Style For Speech Synthesis
par: Li, Zhipeng, et autres
Publié: (2024)
par: Li, Zhipeng, et autres
Publié: (2024)
FNH-TTS: Mixture-of-Experts Duration Modeling for Robust Neural Speech Synthesis
par: Meng, Qingliang, et autres
Publié: (2025)
par: Meng, Qingliang, et autres
Publié: (2025)
SenSE: Semantic-Aware High-Fidelity Universal Speech Enhancement
par: Li, Xingchen, et autres
Publié: (2025)
par: Li, Xingchen, et autres
Publié: (2025)
Towards Accurate Lip-to-Speech Synthesis in-the-Wild
par: Hegde, Sindhu, et autres
Publié: (2024)
par: Hegde, Sindhu, et autres
Publié: (2024)
Beyond Lips: Integrating Gesture and Lip Cues for Robust Audio-visual Speaker Extraction
par: Pan, Zexu, et autres
Publié: (2026)
par: Pan, Zexu, et autres
Publié: (2026)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
par: Liao, Shijia, et autres
Publié: (2024)
par: Liao, Shijia, et autres
Publié: (2024)
Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis
par: Hu, Yifan, et autres
Publié: (2025)
par: Hu, Yifan, et autres
Publié: (2025)
FNSE-SBGAN: Far-field Speech Enhancement with Schrodinger Bridge and Generative Adversarial Networks
par: Lei, Tong, et autres
Publié: (2025)
par: Lei, Tong, et autres
Publié: (2025)
UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations
par: Rong, Xiaobin, et autres
Publié: (2026)
par: Rong, Xiaobin, et autres
Publié: (2026)
PerformSinger: Multimodal Singing Voice Synthesis Leveraging Synchronized Lip Cues from Singing Performance Videos
par: Gu, Ke, et autres
Publié: (2025)
par: Gu, Ke, et autres
Publié: (2025)
SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models
par: Yang, Dongchao, et autres
Publié: (2024)
par: Yang, Dongchao, et autres
Publié: (2024)
VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature
par: Du, Chenpeng, et autres
Publié: (2022)
par: Du, Chenpeng, et autres
Publié: (2022)
SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis
par: Wang, Huimeng, et autres
Publié: (2026)
par: Wang, Huimeng, et autres
Publié: (2026)
UME: Upcycling Mixture-of-Experts for Scalable and Efficient Automatic Speech Recognition
par: Fu, Li, et autres
Publié: (2024)
par: Fu, Li, et autres
Publié: (2024)
DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model
par: Chen, Xueyuan, et autres
Publié: (2025)
par: Chen, Xueyuan, et autres
Publié: (2025)
Impairments are Clustered in Latents of Deep Neural Network-based Speech Quality Models
par: Cumlin, Fredrik, et autres
Publié: (2025)
par: Cumlin, Fredrik, et autres
Publié: (2025)
Documents similaires
-
NaturalL2S: End-to-End High-quality Multispeaker Lip-to-Speech Synthesis with Differential Digital Signal Processing
par: Liang, Yifan, et autres
Publié: (2025) -
Rethinking the joint estimation of magnitude and phase for time-frequency domain neural vocoders
par: Dai, Lingling, et autres
Publié: (2025) -
Neural Vocoders as Speech Enhancers
par: Li, Andong, et autres
Publié: (2025) -
LipDiffuser: Lip-to-Speech Generation with Conditional Diffusion Models
par: Richter, Julius, et autres
Publié: (2025) -
BSDB-Net: Band-Split Dual-Branch Network with Selective State Spaces Mechanism for Monaural Speech Enhancement
par: Fan, Cunhang, et autres
Publié: (2024)