Improving Voice Quality in Speech Anonymization With Just Perception-Informed Losses
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ghosh, Suhita, Thiele, Tim, Lorbeer, Frederic, Dreyer, Frank, Stober, Sebastian |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Anonymising Elderly and Pathological Speech: Voice Conversion Using DDSP and Query-by-Example
par: Ghosh, Suhita, et autres
Publié: (2024)
par: Ghosh, Suhita, et autres
Publié: (2024)
StutterCut: Uncertainty-Guided Normalised Cut for Dysfluency Segmentation
par: Ghosh, Suhita, et autres
Publié: (2025)
par: Ghosh, Suhita, et autres
Publié: (2025)
Interpreting Pretrained Speech Models for Automatic Speech Assessment of Voice Disorders
par: Lau, Hok-Shing, et autres
Publié: (2024)
par: Lau, Hok-Shing, et autres
Publié: (2024)
Asynchronous Voice Anonymization Using Adversarial Perturbation On Speaker Embedding
par: Wang, Rui, et autres
Publié: (2024)
par: Wang, Rui, et autres
Publié: (2024)
VoiceShop: A Unified Speech-to-Speech Framework for Identity-Preserving Zero-Shot Voice Editing
par: Anastassiou, Philip, et autres
Publié: (2024)
par: Anastassiou, Philip, et autres
Publié: (2024)
Anonymizing Speech: Evaluating and Designing Speaker Anonymization Techniques
par: Champion, Pierre
Publié: (2023)
par: Champion, Pierre
Publié: (2023)
Voice Cloning for Dysarthric Speech Synthesis: Addressing Data Scarcity in Speech-Language Pathology
par: Moell, Birger, et autres
Publié: (2025)
par: Moell, Birger, et autres
Publié: (2025)
CleanMel: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR
par: Shao, Nian, et autres
Publié: (2025)
par: Shao, Nian, et autres
Publié: (2025)
Improving Robustness of LLM-based Speech Synthesis by Learning Monotonic Alignment
par: Neekhara, Paarth, et autres
Publié: (2024)
par: Neekhara, Paarth, et autres
Publié: (2024)
Private kNN-VC: Interpretable Anonymization of Converted Speech
par: Franzreb, Carlos, et autres
Publié: (2025)
par: Franzreb, Carlos, et autres
Publié: (2025)
EmoAttack: Utilizing Emotional Voice Conversion for Speech Backdoor Attacks on Deep Speech Classification Models
par: Yao, Wenhan, et autres
Publié: (2024)
par: Yao, Wenhan, et autres
Publié: (2024)
VoiceBridge: General Speech Restoration with One-step Latent Bridge Models
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
Content Leakage in LibriSpeech and Its Impact on the Privacy Evaluation of Speaker Anonymization
par: Franzreb, Carlos, et autres
Publié: (2026)
par: Franzreb, Carlos, et autres
Publié: (2026)
LHQ-SVC: Lightweight and High Quality Singing Voice Conversion Modeling
par: Huang, Yubo, et autres
Publié: (2024)
par: Huang, Yubo, et autres
Publié: (2024)
Do Not Mimic My Voice: Speaker Identity Unlearning for Zero-Shot Text-to-Speech
par: Kim, Taesoo, et autres
Publié: (2025)
par: Kim, Taesoo, et autres
Publié: (2025)
Defense Against Synthetic Speech: Real-Time Detection of RVC Voice Conversion Attacks
par: Chinchmalatpure, Prajwal, et autres
Publié: (2025)
par: Chinchmalatpure, Prajwal, et autres
Publié: (2025)
Unsupervised Rhythm and Voice Conversion to Improve ASR on Dysarthric Speech
par: Hajal, Karl El, et autres
Publié: (2025)
par: Hajal, Karl El, et autres
Publié: (2025)
CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training
par: Du, Zhihao, et autres
Publié: (2025)
par: Du, Zhihao, et autres
Publié: (2025)
DeepASMR: LLM-Based Zero-Shot ASMR Speech Generation for Anyone of Any Voice
par: Zhang, Leying, et autres
Publié: (2026)
par: Zhang, Leying, et autres
Publié: (2026)
CIS-BWE: Chaos-Informed Speech Bandwidth Extension
par: Tamiti, Tarikul Islam, et autres
Publié: (2025)
par: Tamiti, Tarikul Islam, et autres
Publié: (2025)
SoulX-Singer: Towards High-Quality Zero-Shot Singing Voice Synthesis
par: Qian, Jiale, et autres
Publié: (2026)
par: Qian, Jiale, et autres
Publié: (2026)
Selective Attention System (SAS): Device-Addressed Speech Detection for Real-Time On-Device Voice AI
par: Kim, David Joohun, et autres
Publié: (2026)
par: Kim, David Joohun, et autres
Publié: (2026)
Speech Foundation Model Ensembles for the Controlled Singing Voice Deepfake Detection (CtrSVDD) Challenge 2024
par: Guragain, Anmol, et autres
Publié: (2024)
par: Guragain, Anmol, et autres
Publié: (2024)
Frequency-Weighted Training Losses for Phoneme-Level DNN-based Speech Enhancement
par: Monir, Nasser-Eddine, et autres
Publié: (2025)
par: Monir, Nasser-Eddine, et autres
Publié: (2025)
APG-MOS: Auditory Perception Guided-MOS Predictor for Synthetic Speech
par: Lian, Zhicheng, et autres
Publié: (2025)
par: Lian, Zhicheng, et autres
Publié: (2025)
Towards Improving NAM-to-Speech Synthesis Intelligibility using Self-Supervised Speech Models
par: Shah, Neil, et autres
Publié: (2024)
par: Shah, Neil, et autres
Publié: (2024)
Safe Guard: an LLM-agent for Real-time Voice-based Hate Speech Detection in Social Virtual Reality
par: Xu, Yiwen, et autres
Publié: (2024)
par: Xu, Yiwen, et autres
Publié: (2024)
SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline
par: Wang, Helin, et autres
Publié: (2025)
par: Wang, Helin, et autres
Publié: (2025)
BinauralFlow: A Causal and Streamable Approach for High-Quality Binaural Speech Synthesis with Flow Matching Models
par: Liang, Susan, et autres
Publié: (2025)
par: Liang, Susan, et autres
Publié: (2025)
Enhancing Speech Quality through the Integration of BGRU and Transformer Architectures
par: Alghnam, Souliman, et autres
Publié: (2025)
par: Alghnam, Souliman, et autres
Publié: (2025)
Learning Physiology-Informed Vocal Spectrotemporal Representations for Speech Emotion Recognition
par: Zhang, Xu, et autres
Publié: (2026)
par: Zhang, Xu, et autres
Publié: (2026)
Leveraging Mixture of Experts for Improved Speech Deepfake Detection
par: Negroni, Viola, et autres
Publié: (2024)
par: Negroni, Viola, et autres
Publié: (2024)
HQ-SVC: Towards High-Quality Zero-Shot Singing Voice Conversion in Low-Resource Scenarios
par: Bai, Bingsong, et autres
Publié: (2025)
par: Bai, Bingsong, et autres
Publié: (2025)
Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
par: Kim, Nam-Gyu, et autres
Publié: (2025)
par: Kim, Nam-Gyu, et autres
Publié: (2025)
ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech
par: Pan, Yu, et autres
Publié: (2025)
par: Pan, Yu, et autres
Publié: (2025)
Emotion-Aware Speech Generation with Character-Specific Voices for Comics
par: Qian, Zhiwen, et autres
Publié: (2025)
par: Qian, Zhiwen, et autres
Publié: (2025)
Multi-Loss Learning for Speech Emotion Recognition with Energy-Adaptive Mixup and Frame-Level Attention
par: Wang, Cong, et autres
Publié: (2025)
par: Wang, Cong, et autres
Publié: (2025)
Audio-to-Image Encoding for Improved Voice Characteristic Detection Using Deep Convolutional Neural Networks
par: Atif, Youness
Publié: (2025)
par: Atif, Youness
Publié: (2025)
Incremental FastPitch: Chunk-based High Quality Text to Speech
par: Du, Muyang, et autres
Publié: (2024)
par: Du, Muyang, et autres
Publié: (2024)
Speech Prefix-Tuning with RNNT Loss for Improving LLM Predictions
par: Baskar, Murali Karthick, et autres
Publié: (2024)
par: Baskar, Murali Karthick, et autres
Publié: (2024)
Documents similaires
-
Anonymising Elderly and Pathological Speech: Voice Conversion Using DDSP and Query-by-Example
par: Ghosh, Suhita, et autres
Publié: (2024) -
StutterCut: Uncertainty-Guided Normalised Cut for Dysfluency Segmentation
par: Ghosh, Suhita, et autres
Publié: (2025) -
Interpreting Pretrained Speech Models for Automatic Speech Assessment of Voice Disorders
par: Lau, Hok-Shing, et autres
Publié: (2024) -
Asynchronous Voice Anonymization Using Adversarial Perturbation On Speaker Embedding
par: Wang, Rui, et autres
Publié: (2024) -
VoiceShop: A Unified Speech-to-Speech Framework for Identity-Preserving Zero-Shot Voice Editing
par: Anastassiou, Philip, et autres
Publié: (2024)