MUSA: Multi-lingual Speaker Anonymization via Serial Disentanglement
Fuente:
arXiv
Salvato in:
| Autori principali: | Yao, Jixun, Wang, Qing, Guo, Pengcheng, Ning, Ziqian, Yang, Yuguang, Pan, Yu, Xie, Lei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Distinctive and Natural Speaker Anonymization via Singular Value Transformation-assisted Matrix
di: Yao, Jixun, et al.
Pubblicazione: (2024)
di: Yao, Jixun, et al.
Pubblicazione: (2024)
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
di: Yao, Jixun, et al.
Pubblicazione: (2025)
di: Yao, Jixun, et al.
Pubblicazione: (2025)
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
di: Yao, Jixun, et al.
Pubblicazione: (2024)
di: Yao, Jixun, et al.
Pubblicazione: (2024)
Fine-grained Preference Optimization Improves Zero-shot Text-to-Speech
di: Yao, Jixun, et al.
Pubblicazione: (2025)
di: Yao, Jixun, et al.
Pubblicazione: (2025)
DiffAttack: Diffusion-based Timbre-reserved Adversarial Attack in Speaker Identification
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
DualVC 3: Leveraging Language Model Generated Pseudo Context for End-to-end Low Latency Streaming Voice Conversion
di: Ning, Ziqian, et al.
Pubblicazione: (2024)
di: Ning, Ziqian, et al.
Pubblicazione: (2024)
MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
di: Ma, Guobin, et al.
Pubblicazione: (2025)
di: Ma, Guobin, et al.
Pubblicazione: (2025)
NPU-NTU System for Voice Privacy 2024 Challenge
di: Yao, Jixun, et al.
Pubblicazione: (2024)
di: Yao, Jixun, et al.
Pubblicazione: (2024)
DualVC 2: Dynamic Masked Convolution for Unified Streaming and Non-Streaming Voice Conversion
di: Ning, Ziqian, et al.
Pubblicazione: (2023)
di: Ning, Ziqian, et al.
Pubblicazione: (2023)
Zero-Shot Voice Conversion via Content-Aware Timbre Ensemble and Conditional Flow Matching
di: Pan, Yu, et al.
Pubblicazione: (2024)
di: Pan, Yu, et al.
Pubblicazione: (2024)
Drop the beat! Freestyler for Accompaniment Conditioned Rapping Voice Generation
di: Ning, Ziqian, et al.
Pubblicazione: (2024)
di: Ning, Ziqian, et al.
Pubblicazione: (2024)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
di: Pan, Yu, et al.
Pubblicazione: (2025)
di: Pan, Yu, et al.
Pubblicazione: (2025)
DiffRhythm: Blazingly Fast and Embarrassingly Simple End-to-End Full-Length Song Generation with Latent Diffusion
di: Ning, Ziqian, et al.
Pubblicazione: (2025)
di: Ning, Ziqian, et al.
Pubblicazione: (2025)
Adapting General Disentanglement-Based Speaker Anonymization for Enhanced Emotion Preservation
di: Miao, Xiaoxiao, et al.
Pubblicazione: (2024)
di: Miao, Xiaoxiao, et al.
Pubblicazione: (2024)
DiffRhythm 2: Efficient and High Fidelity Song Generation via Block Flow Matching
di: Jiang, Yuepeng, et al.
Pubblicazione: (2025)
di: Jiang, Yuepeng, et al.
Pubblicazione: (2025)
UniFlow: Unifying Speech Front-End Tasks via Continuous Generative Modeling
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
di: Wang, Ziqian, et al.
Pubblicazione: (2025)
SQ-Whisper: Speaker-Querying based Whisper Model for Target-Speaker ASR
di: Guo, Pengcheng, et al.
Pubblicazione: (2024)
di: Guo, Pengcheng, et al.
Pubblicazione: (2024)
Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling
di: Yang, Yuguang, et al.
Pubblicazione: (2024)
di: Yang, Yuguang, et al.
Pubblicazione: (2024)
EvoTSE: Evolving Enrollment for Target Speaker Extraction
di: Liu, Zikai, et al.
Pubblicazione: (2026)
di: Liu, Zikai, et al.
Pubblicazione: (2026)
StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding
di: Guo, Dake, et al.
Pubblicazione: (2025)
di: Guo, Dake, et al.
Pubblicazione: (2025)
Speaker Contrastive Learning for Source Speaker Tracing
di: Wang, Qing, et al.
Pubblicazione: (2024)
di: Wang, Qing, et al.
Pubblicazione: (2024)
Pinhole Effect on Linkability and Dispersion in Speaker Anonymization
di: Lee, Kong Aik, et al.
Pubblicazione: (2025)
di: Lee, Kong Aik, et al.
Pubblicazione: (2025)
MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech
di: Xia, Kangxiang, et al.
Pubblicazione: (2025)
di: Xia, Kangxiang, et al.
Pubblicazione: (2025)
DiffRhythm+: Controllable and Flexible Full-Length Song Generation with Preference Optimization
di: Chen, Huakang, et al.
Pubblicazione: (2025)
di: Chen, Huakang, et al.
Pubblicazione: (2025)
SynthVC: Leveraging Synthetic Data for End-to-End Low Latency Streaming Voice Conversion
di: Guo, Zhao, et al.
Pubblicazione: (2025)
di: Guo, Zhao, et al.
Pubblicazione: (2025)
REF-VC: Robust, Expressive and Fast Zero-Shot Voice Conversion with Diffusion Transformers
di: Jiang, Yuepeng, et al.
Pubblicazione: (2025)
di: Jiang, Yuepeng, et al.
Pubblicazione: (2025)
Whisper-SV: Adapting Whisper for Low-data-resource Speaker Verification
di: Zhang, Li, et al.
Pubblicazione: (2024)
di: Zhang, Li, et al.
Pubblicazione: (2024)
Anonymization, Not Elimination: Utility-Preserved Speech Anonymization
di: Xiao, Yunchong, et al.
Pubblicazione: (2026)
di: Xiao, Yunchong, et al.
Pubblicazione: (2026)
Accent-VITS:accent transfer for end-to-end TTS
di: Ma, Linhan, et al.
Pubblicazione: (2023)
di: Ma, Linhan, et al.
Pubblicazione: (2023)
ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech
di: Pan, Yu, et al.
Pubblicazione: (2025)
di: Pan, Yu, et al.
Pubblicazione: (2025)
Towards Out-of-Distribution Detection in Vocoder Recognition via Latent Feature Reconstruction
di: Du, Renmingyue, et al.
Pubblicazione: (2024)
di: Du, Renmingyue, et al.
Pubblicazione: (2024)
Mitigating Language Mismatch in SSL-Based Speaker Anonymization
di: Zhang, Zhe, et al.
Pubblicazione: (2025)
di: Zhang, Zhe, et al.
Pubblicazione: (2025)
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
di: Zhu, Xinfa, et al.
Pubblicazione: (2023)
di: Zhu, Xinfa, et al.
Pubblicazione: (2023)
Speaker Disentanglement of Speech Pre-trained Model Based on Interpretability
di: Zhu, Xiaoxu, et al.
Pubblicazione: (2025)
di: Zhu, Xiaoxu, et al.
Pubblicazione: (2025)
GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling
di: Yao, Jixun, et al.
Pubblicazione: (2025)
di: Yao, Jixun, et al.
Pubblicazione: (2025)
Attacking Voice Anonymization Systems with Augmented Feature and Speaker Identity Difference
di: Zhang, Yanzhe, et al.
Pubblicazione: (2024)
di: Zhang, Yanzhe, et al.
Pubblicazione: (2024)
SA-SOT: Speaker-Aware Serialized Output Training for Multi-Talker ASR
di: Fan, Zhiyun, et al.
Pubblicazione: (2024)
di: Fan, Zhiyun, et al.
Pubblicazione: (2024)
MLCA-AVSR: Multi-Layer Cross Attention Fusion based Audio-Visual Speech Recognition
di: Wang, He, et al.
Pubblicazione: (2024)
di: Wang, He, et al.
Pubblicazione: (2024)
Mixture of LoRA Experts with Multi-Modal and Multi-Granularity LLM Generative Error Correction for Accented Speech Recognition
di: Mu, Bingshen, et al.
Pubblicazione: (2025)
di: Mu, Bingshen, et al.
Pubblicazione: (2025)
Dual-LoRA: Parameter-Efficient Adversarial Disentanglement for Cross-Lingual Speaker Verification
di: Shangguan, Qituan, et al.
Pubblicazione: (2026)
di: Shangguan, Qituan, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Distinctive and Natural Speaker Anonymization via Singular Value Transformation-assisted Matrix
di: Yao, Jixun, et al.
Pubblicazione: (2024) -
EASY: Emotion-aware Speaker Anonymization via Factorized Distillation
di: Yao, Jixun, et al.
Pubblicazione: (2025) -
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
di: Yao, Jixun, et al.
Pubblicazione: (2024) -
Fine-grained Preference Optimization Improves Zero-shot Text-to-Speech
di: Yao, Jixun, et al.
Pubblicazione: (2025) -
DiffAttack: Diffusion-based Timbre-reserved Adversarial Attack in Speaker Identification
di: Wang, Qing, et al.
Pubblicazione: (2025)