Enregistré dans:
| Auteurs principaux: | Miao, Xiaoxiao, Tao, Ruijie, Zeng, Chang, Wang, Xin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2407.05608 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Third VoicePrivacy Challenge: Preserving Emotional Expressiveness and Linguistic Content in Voice Anonymization
par: Tomashenko, Natalia, et autres
Publié: (2026)
par: Tomashenko, Natalia, et autres
Publié: (2026)
SPGISpeech 2.0: Transcribed multi-speaker financial audio for speaker-tagged transcription
par: Grossman, Raymond, et autres
Publié: (2025)
par: Grossman, Raymond, et autres
Publié: (2025)
Mitigating Language Mismatch in SSL-Based Speaker Anonymization
par: Zhang, Zhe, et autres
Publié: (2025)
par: Zhang, Zhe, et autres
Publié: (2025)
A multi-speaker multi-lingual voice cloning system based on vits2 for limmits 2024 challenge
par: Wang, Xiaopeng, et autres
Publié: (2024)
par: Wang, Xiaopeng, et autres
Publié: (2024)
An approach to optimize inference of the DIART speaker diarization pipeline
par: Aperdannier, Roman, et autres
Publié: (2024)
par: Aperdannier, Roman, et autres
Publié: (2024)
Extending Whisper with prompt tuning to target-speaker ASR
par: Ma, Hao, et autres
Publié: (2023)
par: Ma, Hao, et autres
Publié: (2023)
SEF-MK: Speaker-Embedding-Free Voice Anonymization through Multi-k-means Quantization
par: Tang, Beilong, et autres
Publié: (2025)
par: Tang, Beilong, et autres
Publié: (2025)
VoxHakka: A Dialectally Diverse Multi-speaker Text-to-Speech System for Taiwanese Hakka
par: Chen, Li-Wei, et autres
Publié: (2024)
par: Chen, Li-Wei, et autres
Publié: (2024)
Adapting General Disentanglement-Based Speaker Anonymization for Enhanced Emotion Preservation
par: Miao, Xiaoxiao, et autres
Publié: (2024)
par: Miao, Xiaoxiao, et autres
Publié: (2024)
Probing the Feasibility of Multilingual Speaker Anonymization
par: Meyer, Sarina, et autres
Publié: (2024)
par: Meyer, Sarina, et autres
Publié: (2024)
Spoofing-Aware Speaker Verification Robust Against Domain and Channel Mismatches
par: Zeng, Chang, et autres
Publié: (2024)
par: Zeng, Chang, et autres
Publié: (2024)
You don't understand me!: Comparing ASR results for L1 and L2 speakers of Swedish
par: Cumbal, Ronald, et autres
Publié: (2024)
par: Cumbal, Ronald, et autres
Publié: (2024)
Multi-speaker Text-to-speech Training with Speaker Anonymized Data
par: Huang, Wen-Chin, et autres
Publié: (2024)
par: Huang, Wen-Chin, et autres
Publié: (2024)
Analysis of Speech Temporal Dynamics in the Context of Speaker Verification and Voice Anonymization
par: Tomashenko, Natalia, et autres
Publié: (2024)
par: Tomashenko, Natalia, et autres
Publié: (2024)
On the Impact of Voice Anonymization on Speech Diagnostic Applications: a Case Study on COVID-19 Detection
par: Zhu, Yi, et autres
Publié: (2023)
par: Zhu, Yi, et autres
Publié: (2023)
MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark
par: Wang, Dingdong, et autres
Publié: (2025)
par: Wang, Dingdong, et autres
Publié: (2025)
A Multi-Probe Audit of Clinical-Interview Depression Detection Benchmarks
par: Ishikawa, Takehiro, et autres
Publié: (2026)
par: Ishikawa, Takehiro, et autres
Publié: (2026)
SceneFake: An Initial Dataset and Benchmarks for Scene Fake Audio Detection
par: Yi, Jiangyan, et autres
Publié: (2022)
par: Yi, Jiangyan, et autres
Publié: (2022)
S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models
par: Fang, Yuanbo, et autres
Publié: (2025)
par: Fang, Yuanbo, et autres
Publié: (2025)
WearVox: An Egocentric Multichannel Voice Assistant Benchmark for Wearables
par: Lin, Zhaojiang, et autres
Publié: (2025)
par: Lin, Zhaojiang, et autres
Publié: (2025)
WildScore: Benchmarking MLLMs in-the-Wild Symbolic Music Reasoning
par: Mundada, Gagan, et autres
Publié: (2025)
par: Mundada, Gagan, et autres
Publié: (2025)
InstructSing: High-Fidelity Singing Voice Generation via Instructing Yourself
par: Zeng, Chang, et autres
Publié: (2024)
par: Zeng, Chang, et autres
Publié: (2024)
ContextASR-Bench: A Massive Contextual Speech Recognition Benchmark
par: Wang, He, et autres
Publié: (2025)
par: Wang, He, et autres
Publié: (2025)
ML-SUPERB: Multilingual Speech Universal PERformance Benchmark
par: Shi, Jiatong, et autres
Publié: (2023)
par: Shi, Jiatong, et autres
Publié: (2023)
Text adaptation for speaker verification with speaker-text factorized embeddings
par: Yang, Yexin, et autres
Publié: (2025)
par: Yang, Yexin, et autres
Publié: (2025)
ML-SUPERB 2.0: Benchmarking Multilingual Speech Models Across Modeling Constraints, Languages, and Datasets
par: Shi, Jiatong, et autres
Publié: (2024)
par: Shi, Jiatong, et autres
Publié: (2024)
SD-Eval: A Benchmark Dataset for Spoken Dialogue Understanding Beyond Words
par: Ao, Junyi, et autres
Publié: (2024)
par: Ao, Junyi, et autres
Publié: (2024)
Hierarchical speaker representation for target speaker extraction
par: He, Shulin, et autres
Publié: (2022)
par: He, Shulin, et autres
Publié: (2022)
WaveFM: A High-Fidelity and Efficient Vocoder Based on Flow Matching
par: Luo, Tianze, et autres
Publié: (2025)
par: Luo, Tianze, et autres
Publié: (2025)
Benchmarking Japanese Speech Recognition on ASR-LLM Setups with Multi-Pass Augmented Generative Error Correction
par: Ko, Yuka, et autres
Publié: (2024)
par: Ko, Yuka, et autres
Publié: (2024)
SecureSpeech: Prompt-based Speaker and Content Protection
par: Hui, Belinda Soh Hui, et autres
Publié: (2025)
par: Hui, Belinda Soh Hui, et autres
Publié: (2025)
CMDAR: A Chinese Multi-scene Dynamic Audio Reasoning Benchmark with Diverse Challenges
par: Li, Hui, et autres
Publié: (2025)
par: Li, Hui, et autres
Publié: (2025)
AudioBench: A Universal Benchmark for Audio Large Language Models
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition
par: Zhao, Ruoyu, et autres
Publié: (2025)
par: Zhao, Ruoyu, et autres
Publié: (2025)
ASR-EC Benchmark: Evaluating Large Language Models on Chinese ASR Error Correction
par: Wei, Victor Junqiu, et autres
Publié: (2024)
par: Wei, Victor Junqiu, et autres
Publié: (2024)
Vedavani: A Benchmark Corpus for ASR on Vedic Sanskrit Poetry
par: Kumar, Sujeet, et autres
Publié: (2025)
par: Kumar, Sujeet, et autres
Publié: (2025)
Multilingual Source Tracing of Speech Deepfakes: A First Benchmark
par: Xuan, Xi, et autres
Publié: (2025)
par: Xuan, Xi, et autres
Publié: (2025)
Improving curriculum learning for target speaker extraction with synthetic speakers
par: Liu, Yun, et autres
Publié: (2024)
par: Liu, Yun, et autres
Publié: (2024)
BERSting at the Screams: A Benchmark for Distanced, Emotional and Shouted Speech Recognition
par: Tuttösí, Paige, et autres
Publié: (2025)
par: Tuttösí, Paige, et autres
Publié: (2025)
STAB: Speech Tokenizer Assessment Benchmark
par: Vashishth, Shikhar, et autres
Publié: (2024)
par: Vashishth, Shikhar, et autres
Publié: (2024)
Documents similaires
-
The Third VoicePrivacy Challenge: Preserving Emotional Expressiveness and Linguistic Content in Voice Anonymization
par: Tomashenko, Natalia, et autres
Publié: (2026) -
SPGISpeech 2.0: Transcribed multi-speaker financial audio for speaker-tagged transcription
par: Grossman, Raymond, et autres
Publié: (2025) -
Mitigating Language Mismatch in SSL-Based Speaker Anonymization
par: Zhang, Zhe, et autres
Publié: (2025) -
A multi-speaker multi-lingual voice cloning system based on vits2 for limmits 2024 challenge
par: Wang, Xiaopeng, et autres
Publié: (2024) -
An approach to optimize inference of the DIART speaker diarization pipeline
par: Aperdannier, Roman, et autres
Publié: (2024)