From Dialect Gaps to Identity Maps: Tackling Variability in Speaker Verification
Fuente:
arXiv
Salvato in:
| Autori principali: | Abdullah, Abdulhady Abas, Badawi, Soran, Abdullah, Dana A., Hamad, Dana Rasul |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing Kurdish Text-to-Speech with Native Corpus Training: A High-Quality WaveGlow Vocoder Approach
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2024)
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2024)
End-to-End Transformer-based Automatic Speech Recognition for Northern Kurdish: A Pioneering Approach
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2024)
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2024)
Advanced Clustering Techniques for Speech Signal Enhancement: A Review and Metanalysis of Fuzzy C-Means, K-Means, and Kernel Fuzzy C-Means Methods
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2024)
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2024)
Speaker Diarization for Low-Resource Languages Through Wav2vec Fine-Tuning
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2025)
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2025)
Breaking Walls: Pioneering Automatic Speech Recognition for Central Kurdish: End-to-End Transformer Paradigm
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2024)
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2024)
CryCeleb: A Speaker Verification Dataset Based on Infant Cry Sounds
di: Budaghyan, David, et al.
Pubblicazione: (2023)
di: Budaghyan, David, et al.
Pubblicazione: (2023)
FMSD-TTS: Few-shot Multi-Speaker Multi-Dialect Text-to-Speech Synthesis for Ü-Tsang, Amdo and Kham Speech Dataset Generation
di: Liu, Yutong, et al.
Pubblicazione: (2025)
di: Liu, Yutong, et al.
Pubblicazione: (2025)
PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects
di: Yang, Sicheng, et al.
Pubblicazione: (2026)
di: Yang, Sicheng, et al.
Pubblicazione: (2026)
Dialectal Coverage And Generalization in Arabic Speech Recognition
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2024)
di: Djanibekov, Amirbek, et al.
Pubblicazione: (2024)
Improving Low-Resource Dialect Classification Using Retrieval-based Voice Conversion
di: Fischbach, Lea, et al.
Pubblicazione: (2025)
di: Fischbach, Lea, et al.
Pubblicazione: (2025)
Voice Conversion Improves Cross-Domain Robustness for Spoken Arabic Dialect Identification
di: Abdullah, Badr M., et al.
Pubblicazione: (2025)
di: Abdullah, Badr M., et al.
Pubblicazione: (2025)
Efficient Dialect-Aware Modeling and Conditioning for Low-Resource Taiwanese Hakka Speech Processing
di: Peng, An-Ci, et al.
Pubblicazione: (2026)
di: Peng, An-Ci, et al.
Pubblicazione: (2026)
Closing the Gap Between Text and Speech Understanding in LLMs
di: Cuervo, Santiago, et al.
Pubblicazione: (2025)
di: Cuervo, Santiago, et al.
Pubblicazione: (2025)
VoxHakka: A Dialectally Diverse Multi-speaker Text-to-Speech System for Taiwanese Hakka
di: Chen, Li-Wei, et al.
Pubblicazione: (2024)
di: Chen, Li-Wei, et al.
Pubblicazione: (2024)
Disentangling Age and Identity with a Mutual Information Minimization Approach for Cross-Age Speaker Verification
di: Zhang, Fengrun, et al.
Pubblicazione: (2024)
di: Zhang, Fengrun, et al.
Pubblicazione: (2024)
USAT: A Universal Speaker-Adaptive Text-to-Speech Approach
di: Wang, Wenbin, et al.
Pubblicazione: (2024)
di: Wang, Wenbin, et al.
Pubblicazione: (2024)
Cross-Speaker Encoding Network for Multi-Talker Speech Recognition
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
di: Kang, Jiawen, et al.
Pubblicazione: (2024)
Enhancing Low-Resource ASR through Versatile TTS: Bridging the Data Gap
di: Yang, Guanrou, et al.
Pubblicazione: (2024)
di: Yang, Guanrou, et al.
Pubblicazione: (2024)
ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling
di: Jiang, Yuxuan, et al.
Pubblicazione: (2025)
di: Jiang, Yuxuan, et al.
Pubblicazione: (2025)
Enhancing Dialogue Annotation with Speaker Characteristics Leveraging a Frozen LLM
di: Thebaud, Thomas, et al.
Pubblicazione: (2025)
di: Thebaud, Thomas, et al.
Pubblicazione: (2025)
ArVoice: A Multi-Speaker Dataset for Arabic Speech Synthesis
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2025)
di: Toyin, Hawau Olamide, et al.
Pubblicazione: (2025)
Interpolating Speaker Identities in Embedding Space for Data Expansion
di: Liu, Tianchi, et al.
Pubblicazione: (2025)
di: Liu, Tianchi, et al.
Pubblicazione: (2025)
GOAT-SLM: A Spoken Language Model with Paralinguistic and Speaker Characteristic Awareness
di: Chen, Hongjie, et al.
Pubblicazione: (2025)
di: Chen, Hongjie, et al.
Pubblicazione: (2025)
Iterative LLM-based improvement for French Clinical Interview Transcription and Speaker Diarization
di: Marie, Ambre, et al.
Pubblicazione: (2026)
di: Marie, Ambre, et al.
Pubblicazione: (2026)
Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
di: Wang, Haoyu, et al.
Pubblicazione: (2024)
Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio
di: He, Xinlu, et al.
Pubblicazione: (2025)
di: He, Xinlu, et al.
Pubblicazione: (2025)
Multi-class Decoding of Attended Speaker Direction Using Electroencephalogram and Audio Spatial Spectrum
di: Zhang, Yuanming, et al.
Pubblicazione: (2024)
di: Zhang, Yuanming, et al.
Pubblicazione: (2024)
Investigating Safety Vulnerabilities of Large Audio-Language Models Under Speaker Emotional Variations
di: Feng, Bo-Han, et al.
Pubblicazione: (2025)
di: Feng, Bo-Han, et al.
Pubblicazione: (2025)
Make It Hard to Hear, Easy to Learn: Long-Form Bengali ASR and Speaker Diarization via Extreme Augmentation and Perfect Alignment
di: Hasan, Sanjid, et al.
Pubblicazione: (2026)
di: Hasan, Sanjid, et al.
Pubblicazione: (2026)
Explainable Attribute-Based Speaker Verification
di: Wu, Xiaoliang, et al.
Pubblicazione: (2024)
di: Wu, Xiaoliang, et al.
Pubblicazione: (2024)
Streaming Speaker Change Detection and Gender Classification for Transducer-Based Multi-Talker Speech Translation
di: Wang, Peidong, et al.
Pubblicazione: (2025)
di: Wang, Peidong, et al.
Pubblicazione: (2025)
Exploring Multilingual Unseen Speaker Emotion Recognition: Leveraging Co-Attention Cues in Multitask Learning
di: Goel, Arnav, et al.
Pubblicazione: (2024)
di: Goel, Arnav, et al.
Pubblicazione: (2024)
Memory-Efficient Training for Deep Speaker Embedding Learning in Speaker Verification
di: Liu, Bei, et al.
Pubblicazione: (2024)
di: Liu, Bei, et al.
Pubblicazione: (2024)
DAME: Duration-Aware Matryoshka Embedding for Duration-Robust Speaker Verification
di: Jung, Youngmoon, et al.
Pubblicazione: (2026)
di: Jung, Youngmoon, et al.
Pubblicazione: (2026)
Automatic Pronunciation Error Detection and Correction of the Holy Quran's Learners Using Deep Learning
di: Abdelfattah, Abdullah, et al.
Pubblicazione: (2025)
di: Abdelfattah, Abdullah, et al.
Pubblicazione: (2025)
Toward Responsible ASR for African American English Speakers: A Scoping Review of Bias and Equity in Speech Technology
di: Cunningham, Jay L., et al.
Pubblicazione: (2025)
di: Cunningham, Jay L., et al.
Pubblicazione: (2025)
A Multi-Dialectal Dataset for German Dialect ASR and Dialect-to-Standard Speech Translation
di: Blaschke, Verena, et al.
Pubblicazione: (2025)
di: Blaschke, Verena, et al.
Pubblicazione: (2025)
AG-LSEC: Audio Grounded Lexical Speaker Error Correction
di: Paturi, Rohit, et al.
Pubblicazione: (2024)
di: Paturi, Rohit, et al.
Pubblicazione: (2024)
CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
Dolphin-CN-Dialect: Where Chinese Dialects Matter
di: Meng, Yangyang, et al.
Pubblicazione: (2026)
di: Meng, Yangyang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Enhancing Kurdish Text-to-Speech with Native Corpus Training: A High-Quality WaveGlow Vocoder Approach
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2024) -
End-to-End Transformer-based Automatic Speech Recognition for Northern Kurdish: A Pioneering Approach
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2024) -
Advanced Clustering Techniques for Speech Signal Enhancement: A Review and Metanalysis of Fuzzy C-Means, K-Means, and Kernel Fuzzy C-Means Methods
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2024) -
Speaker Diarization for Low-Resource Languages Through Wav2vec Fine-Tuning
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2025) -
Breaking Walls: Pioneering Automatic Speech Recognition for Central Kurdish: End-to-End Transformer Paradigm
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2024)