Towards Improving NAM-to-Speech Synthesis Intelligibility using Self-Supervised Speech Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Shah, Neil, Karande, Shirish, Gandhi, Vineet |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Advancing NAM-to-Speech Conversion with Novel Methods and the MultiNAM Dataset
di: Shah, Neil, et al.
Pubblicazione: (2024)
di: Shah, Neil, et al.
Pubblicazione: (2024)
MRI2Speech: Speech Synthesis from Articulatory Movements Recorded by Real-time MRI
di: Shah, Neil, et al.
Pubblicazione: (2024)
di: Shah, Neil, et al.
Pubblicazione: (2024)
Improved Intelligibility of Dysarthric Speech using Conditional Flow Matching
di: Das, Shoutrik, et al.
Pubblicazione: (2025)
di: Das, Shoutrik, et al.
Pubblicazione: (2025)
Improving Speech Inversion Through Self-Supervised Embeddings and Enhanced Tract Variables
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2023)
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2023)
Self-Supervised Models for Phoneme Recognition: Applications in Children's Speech for Reading Learning
di: Medin, Lucas Block, et al.
Pubblicazione: (2025)
di: Medin, Lucas Block, et al.
Pubblicazione: (2025)
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
di: Lin, Zijian, et al.
Pubblicazione: (2025)
di: Lin, Zijian, et al.
Pubblicazione: (2025)
Improving Robustness of LLM-based Speech Synthesis by Learning Monotonic Alignment
di: Neekhara, Paarth, et al.
Pubblicazione: (2024)
di: Neekhara, Paarth, et al.
Pubblicazione: (2024)
Unveiling the Best Practices for Applying Speech Foundation Models to Speech Intelligibility Prediction for Hearing-Impaired People
di: Zhou, Haoshuai, et al.
Pubblicazione: (2025)
di: Zhou, Haoshuai, et al.
Pubblicazione: (2025)
Bridging ASR and LLMs for Dysarthric Speech Recognition: Benchmarking Self-Supervised and Generative Approaches
di: Aboeitta, Ahmed, et al.
Pubblicazione: (2025)
di: Aboeitta, Ahmed, et al.
Pubblicazione: (2025)
Neural Speech Embeddings for Speech Synthesis Based on Deep Generative Networks
di: Lee, Seo-Hyun, et al.
Pubblicazione: (2023)
di: Lee, Seo-Hyun, et al.
Pubblicazione: (2023)
Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis
di: Ji, Zhoulin, et al.
Pubblicazione: (2024)
di: Ji, Zhoulin, et al.
Pubblicazione: (2024)
Cross-Corpus Validation of Speech Emotion Recognition in Urdu using Domain-Knowledge Acoustic Features
di: Talpur, Unzela, et al.
Pubblicazione: (2025)
di: Talpur, Unzela, et al.
Pubblicazione: (2025)
DSFlow: Dual Supervision and Step-Aware Architecture for One-Step Flow Matching Speech Synthesis
di: Lin, Bin, et al.
Pubblicazione: (2026)
di: Lin, Bin, et al.
Pubblicazione: (2026)
Enhancing Speech Emotion Recognition through Segmental Average Pooling of Self-Supervised Learning Features
di: Hyeon, Jonghwan, et al.
Pubblicazione: (2024)
di: Hyeon, Jonghwan, et al.
Pubblicazione: (2024)
Adaptive Knowledge Distillation for Device-Directed Speech Detection
di: Chi, Hyung Gun, et al.
Pubblicazione: (2025)
di: Chi, Hyung Gun, et al.
Pubblicazione: (2025)
Voice Cloning for Dysarthric Speech Synthesis: Addressing Data Scarcity in Speech-Language Pathology
di: Moell, Birger, et al.
Pubblicazione: (2025)
di: Moell, Birger, et al.
Pubblicazione: (2025)
Towards Automatic Assessment of Self-Supervised Speech Models using Rank
di: Aldeneh, Zakaria, et al.
Pubblicazione: (2024)
di: Aldeneh, Zakaria, et al.
Pubblicazione: (2024)
AMNet: An Acoustic Model Network for Enhanced Mandarin Speech Synthesis
di: Cao, Yubing, et al.
Pubblicazione: (2025)
di: Cao, Yubing, et al.
Pubblicazione: (2025)
SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline
di: Wang, Helin, et al.
Pubblicazione: (2025)
di: Wang, Helin, et al.
Pubblicazione: (2025)
Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech
di: Fu, Szu-Wei, et al.
Pubblicazione: (2024)
di: Fu, Szu-Wei, et al.
Pubblicazione: (2024)
Decoding Order Matters in Autoregressive Speech Synthesis
di: Zhao, Minghui, et al.
Pubblicazione: (2026)
di: Zhao, Minghui, et al.
Pubblicazione: (2026)
DiffCSS: Diverse and Expressive Conversational Speech Synthesis with Diffusion Models
di: wu, Weihao, et al.
Pubblicazione: (2025)
di: wu, Weihao, et al.
Pubblicazione: (2025)
A Hybrid Model for Weakly-Supervised Speech Dereverberation
di: Bahrman, Louis, et al.
Pubblicazione: (2025)
di: Bahrman, Louis, et al.
Pubblicazione: (2025)
Jointly Fine-Tuning "BERT-like" Self Supervised Models to Improve Multimodal Speech Emotion Recognition
di: Siriwardhana, Shamane, et al.
Pubblicazione: (2020)
di: Siriwardhana, Shamane, et al.
Pubblicazione: (2020)
Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition
di: Hu, Shujie, et al.
Pubblicazione: (2024)
di: Hu, Shujie, et al.
Pubblicazione: (2024)
HuBERT-VIC: Improving Noise-Robust Automatic Speech Recognition of Speech Foundation Model via Variance-Invariance-Covariance Regularization
di: Ahn, Hyebin, et al.
Pubblicazione: (2025)
di: Ahn, Hyebin, et al.
Pubblicazione: (2025)
Interpreting Pretrained Speech Models for Automatic Speech Assessment of Voice Disorders
di: Lau, Hok-Shing, et al.
Pubblicazione: (2024)
di: Lau, Hok-Shing, et al.
Pubblicazione: (2024)
Non-Intrusive Speech Intelligibility Prediction for Hearing-Impaired Users using Intermediate ASR Features and Human Memory Models
di: Mogridge, Rhiannon, et al.
Pubblicazione: (2024)
di: Mogridge, Rhiannon, et al.
Pubblicazione: (2024)
Magnitude-Phase Dual-Path Speech Enhancement Network based on Self-Supervised Embedding and Perceptual Contrast Stretch Boosting
di: Mattursun, Alimjan, et al.
Pubblicazione: (2025)
di: Mattursun, Alimjan, et al.
Pubblicazione: (2025)
No Audiogram: Leveraging Existing Scores for Personalized Speech Intelligibility Prediction
di: Zhou, Haoshuai, et al.
Pubblicazione: (2025)
di: Zhou, Haoshuai, et al.
Pubblicazione: (2025)
Lina-Speech: Gated Linear Attention and Initial-State Tuning for Multi-Sample Prompting Text-To-Speech Synthesis
di: Lemerle, Théodor, et al.
Pubblicazione: (2024)
di: Lemerle, Théodor, et al.
Pubblicazione: (2024)
Leveraging Mixture of Experts for Improved Speech Deepfake Detection
di: Negroni, Viola, et al.
Pubblicazione: (2024)
di: Negroni, Viola, et al.
Pubblicazione: (2024)
Unifying Speech Recognition, Synthesis and Conversion with Autoregressive Transformers
di: Cai, Runyuan, et al.
Pubblicazione: (2026)
di: Cai, Runyuan, et al.
Pubblicazione: (2026)
Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2024)
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2024)
MSP-Podcast SER Challenge 2024: L'antenne du Ventoux Multimodal Self-Supervised Learning for Speech Emotion Recognition
di: Duret, Jarod, et al.
Pubblicazione: (2024)
di: Duret, Jarod, et al.
Pubblicazione: (2024)
DiEmo-TTS: Disentangled Emotion Representations via Self-Supervised Distillation for Cross-Speaker Emotion Transfer in Text-to-Speech
di: Cho, Deok-Hyeon, et al.
Pubblicazione: (2025)
di: Cho, Deok-Hyeon, et al.
Pubblicazione: (2025)
Eta-WavLM: Efficient Speaker Identity Removal in Self-Supervised Speech Representations Using a Simple Linear Equation
di: Ruggiero, Giuseppe, et al.
Pubblicazione: (2025)
di: Ruggiero, Giuseppe, et al.
Pubblicazione: (2025)
Meta-Learning Approaches for Improving Detection of Unseen Speech Deepfakes
di: Kukanov, Ivan, et al.
Pubblicazione: (2024)
di: Kukanov, Ivan, et al.
Pubblicazione: (2024)
Joint Semantic Knowledge Distillation and Masked Acoustic Modeling for Full-band Speech Restoration with Improved Intelligibility
di: Liu, Xiaoyu, et al.
Pubblicazione: (2024)
di: Liu, Xiaoyu, et al.
Pubblicazione: (2024)
Audio Codec Augmentation for Robust Collaborative Watermarking of Speech Synthesis
di: Juvela, Lauri, et al.
Pubblicazione: (2024)
di: Juvela, Lauri, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Advancing NAM-to-Speech Conversion with Novel Methods and the MultiNAM Dataset
di: Shah, Neil, et al.
Pubblicazione: (2024) -
MRI2Speech: Speech Synthesis from Articulatory Movements Recorded by Real-time MRI
di: Shah, Neil, et al.
Pubblicazione: (2024) -
Improved Intelligibility of Dysarthric Speech using Conditional Flow Matching
di: Das, Shoutrik, et al.
Pubblicazione: (2025) -
Improving Speech Inversion Through Self-Supervised Embeddings and Enhanced Tract Variables
di: Attia, Ahmed Adel, et al.
Pubblicazione: (2023) -
Self-Supervised Models for Phoneme Recognition: Applications in Children's Speech for Reading Learning
di: Medin, Lucas Block, et al.
Pubblicazione: (2025)