DDSP-QbE++: Improving Speech Quality for Speech Anonymisation for Atypical Speech
Fuente:
arXiv
Salvato in:
| Autori principali: | Ghosh, Suhita, Sinha, Yamini, Stober, Sebastian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Anonymising Elderly and Pathological Speech: Voice Conversion Using DDSP and Query-by-Example
di: Ghosh, Suhita, et al.
Pubblicazione: (2024)
di: Ghosh, Suhita, et al.
Pubblicazione: (2024)
Improving Voice Quality in Speech Anonymization With Just Perception-Informed Losses
di: Ghosh, Suhita, et al.
Pubblicazione: (2024)
di: Ghosh, Suhita, et al.
Pubblicazione: (2024)
StutterCut: Uncertainty-Guided Normalised Cut for Dysfluency Segmentation
di: Ghosh, Suhita, et al.
Pubblicazione: (2025)
di: Ghosh, Suhita, et al.
Pubblicazione: (2025)
SpeechQualityLLM: LLM-Based Multimodal Assessment of Speech Quality
di: Monjur, Mahathir, et al.
Pubblicazione: (2025)
di: Monjur, Mahathir, et al.
Pubblicazione: (2025)
Understanding Frechet Speech Distance for Synthetic Speech Quality Evaluation
di: Kim, June-Woo, et al.
Pubblicazione: (2026)
di: Kim, June-Woo, et al.
Pubblicazione: (2026)
GSRM: Generative Speech Reward Model for Speech RLHF
di: Shen, Maohao, et al.
Pubblicazione: (2026)
di: Shen, Maohao, et al.
Pubblicazione: (2026)
SLM-SS: Speech Language Model for Generative Speech Separation
di: Li, Tianhua, et al.
Pubblicazione: (2026)
di: Li, Tianhua, et al.
Pubblicazione: (2026)
Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction
di: Li, Xiang, et al.
Pubblicazione: (2026)
di: Li, Xiang, et al.
Pubblicazione: (2026)
Fake Speech Wild: Detecting Deepfake Speech on Social Media Platform
di: Xie, Yuankun, et al.
Pubblicazione: (2025)
di: Xie, Yuankun, et al.
Pubblicazione: (2025)
SlimSpeech: Lightweight and Efficient Text-to-Speech with Slim Rectified Flow
di: Wang, Kaidi, et al.
Pubblicazione: (2025)
di: Wang, Kaidi, et al.
Pubblicazione: (2025)
UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice
di: Cheng, Sitong, et al.
Pubblicazione: (2025)
di: Cheng, Sitong, et al.
Pubblicazione: (2025)
Enabling Automatic Disordered Speech Recognition: An Impaired Speech Dataset in the Akan Language
di: Wiafe, Isaac, et al.
Pubblicazione: (2026)
di: Wiafe, Isaac, et al.
Pubblicazione: (2026)
SyncSpeech: Efficient and Low-Latency Text-to-Speech based on Temporal Masked Transformer
di: Sheng, Zhengyan, et al.
Pubblicazione: (2025)
di: Sheng, Zhengyan, et al.
Pubblicazione: (2025)
MF-Speech: Achieving Fine-Grained and Compositional Control in Speech Generation via Factor Disentanglement
di: Yu, Xinyue, et al.
Pubblicazione: (2025)
di: Yu, Xinyue, et al.
Pubblicazione: (2025)
Towards Improving NAM-to-Speech Synthesis Intelligibility using Self-Supervised Speech Models
di: Shah, Neil, et al.
Pubblicazione: (2024)
di: Shah, Neil, et al.
Pubblicazione: (2024)
Improving Robustness of LLM-based Speech Synthesis by Learning Monotonic Alignment
di: Neekhara, Paarth, et al.
Pubblicazione: (2024)
di: Neekhara, Paarth, et al.
Pubblicazione: (2024)
CleanMel: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR
di: Shao, Nian, et al.
Pubblicazione: (2025)
di: Shao, Nian, et al.
Pubblicazione: (2025)
SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline
di: Wang, Helin, et al.
Pubblicazione: (2025)
di: Wang, Helin, et al.
Pubblicazione: (2025)
QAMO: Quality-aware Multi-centroid One-class Learning For Speech Deepfake Detection
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2025)
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2025)
SpeechJudge: Towards Human-Level Judgment for Speech Naturalness
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech
di: Fu, Szu-Wei, et al.
Pubblicazione: (2024)
di: Fu, Szu-Wei, et al.
Pubblicazione: (2024)
Explicit Tonal Tension Conditioning via Dual-Level Beam Search for Symbolic Music Generation
di: Ebrahimzadeh, Maral, et al.
Pubblicazione: (2025)
di: Ebrahimzadeh, Maral, et al.
Pubblicazione: (2025)
Speech Separation for Hearing-Impaired Children in the Classroom
di: Olalere, Feyisayo, et al.
Pubblicazione: (2025)
di: Olalere, Feyisayo, et al.
Pubblicazione: (2025)
Large Speech Model Enabled Semantic Communication
di: Tian, Yun, et al.
Pubblicazione: (2025)
di: Tian, Yun, et al.
Pubblicazione: (2025)
QualiSpeech: A Speech Quality Assessment Dataset with Natural Language Reasoning and Descriptions
di: Wang, Siyin, et al.
Pubblicazione: (2025)
di: Wang, Siyin, et al.
Pubblicazione: (2025)
SpeechParaling-Bench: A Comprehensive Benchmark for Paralinguistic-Aware Speech Generation
di: Liu, Ruohan, et al.
Pubblicazione: (2026)
di: Liu, Ruohan, et al.
Pubblicazione: (2026)
Speaker Anonymisation for Speech-based Suicide Risk Detection
di: Cui, Ziyun, et al.
Pubblicazione: (2025)
di: Cui, Ziyun, et al.
Pubblicazione: (2025)
EMO-TTA: Improving Test-Time Adaptation of Audio-Language Models for Speech Emotion Recognition
di: Shi, Jiacheng, et al.
Pubblicazione: (2025)
di: Shi, Jiacheng, et al.
Pubblicazione: (2025)
Clustering and Mining Accented Speech for Inclusive and Fair Speech Recognition
di: Kim, Jaeyoung, et al.
Pubblicazione: (2024)
di: Kim, Jaeyoung, et al.
Pubblicazione: (2024)
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
di: Lin, Zijian, et al.
Pubblicazione: (2025)
di: Lin, Zijian, et al.
Pubblicazione: (2025)
Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer
di: Wang, Yongqi, et al.
Pubblicazione: (2023)
di: Wang, Yongqi, et al.
Pubblicazione: (2023)
StreamSpeech: Simultaneous Speech-to-Speech Translation with Multi-task Learning
di: Zhang, Shaolei, et al.
Pubblicazione: (2024)
di: Zhang, Shaolei, et al.
Pubblicazione: (2024)
Leveraging Mixture of Experts for Improved Speech Deepfake Detection
di: Negroni, Viola, et al.
Pubblicazione: (2024)
di: Negroni, Viola, et al.
Pubblicazione: (2024)
Speaker Verification with Speech-Aware LLMs: Evaluation and Augmentation
di: Thebaud, Thomas, et al.
Pubblicazione: (2026)
di: Thebaud, Thomas, et al.
Pubblicazione: (2026)
Residual Tokens Enhance Masked Autoencoders for Speech Modeling
di: Sadok, Samir, et al.
Pubblicazione: (2026)
di: Sadok, Samir, et al.
Pubblicazione: (2026)
Provable Speech Attributes Conversion via Latent Independence
di: Svirsky, Jonathan, et al.
Pubblicazione: (2025)
di: Svirsky, Jonathan, et al.
Pubblicazione: (2025)
Dynamic Fusion Multimodal Network for SpeechWellness Detection
di: Sun, Wenqiang, et al.
Pubblicazione: (2025)
di: Sun, Wenqiang, et al.
Pubblicazione: (2025)
Enhancing Speech Quality through the Integration of BGRU and Transformer Architectures
di: Alghnam, Souliman, et al.
Pubblicazione: (2025)
di: Alghnam, Souliman, et al.
Pubblicazione: (2025)
CapSpeech: Enabling Downstream Applications in Style-Captioned Text-to-Speech
di: Wang, Helin, et al.
Pubblicazione: (2025)
di: Wang, Helin, et al.
Pubblicazione: (2025)
Neural Speech Embeddings for Speech Synthesis Based on Deep Generative Networks
di: Lee, Seo-Hyun, et al.
Pubblicazione: (2023)
di: Lee, Seo-Hyun, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Anonymising Elderly and Pathological Speech: Voice Conversion Using DDSP and Query-by-Example
di: Ghosh, Suhita, et al.
Pubblicazione: (2024) -
Improving Voice Quality in Speech Anonymization With Just Perception-Informed Losses
di: Ghosh, Suhita, et al.
Pubblicazione: (2024) -
StutterCut: Uncertainty-Guided Normalised Cut for Dysfluency Segmentation
di: Ghosh, Suhita, et al.
Pubblicazione: (2025) -
SpeechQualityLLM: LLM-Based Multimodal Assessment of Speech Quality
di: Monjur, Mahathir, et al.
Pubblicazione: (2025) -
Understanding Frechet Speech Distance for Synthetic Speech Quality Evaluation
di: Kim, June-Woo, et al.
Pubblicazione: (2026)