Deep Learning for Speaker Identification: Architectural Insights from AB-1 Corpus Analysis and Performance Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Bartolo, Matthias |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Memory-Efficient Training for Deep Speaker Embedding Learning in Speaker Verification
par: Liu, Bei, et autres
Publié: (2024)
par: Liu, Bei, et autres
Publié: (2024)
Evaluating Speaker Identity Coding in Self-supervised Models and Humans
par: Elbanna, Gasser
Publié: (2024)
par: Elbanna, Gasser
Publié: (2024)
Speaker Embeddings to Improve Tracking of Intermittent and Moving Speakers
par: Iatariene, Taous, et autres
Publié: (2025)
par: Iatariene, Taous, et autres
Publié: (2025)
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
par: Kang, Jiawen, et autres
Publié: (2024)
par: Kang, Jiawen, et autres
Publié: (2024)
Developing an Effective Training Dataset to Enhance the Performance of AI-based Speaker Separation Systems
par: Melhem, Rawad, et autres
Publié: (2024)
par: Melhem, Rawad, et autres
Publié: (2024)
Leveraging Speaker Embeddings in End-to-End Neural Diarization for Two-Speaker Scenarios
par: Alvarez-Trejos, Juan Ignacio, et autres
Publié: (2024)
par: Alvarez-Trejos, Juan Ignacio, et autres
Publié: (2024)
Text-dependent Speaker Verification (TdSV) Challenge 2024: Challenge Evaluation Plan
par: Hossein, Zeinali, et autres
Publié: (2024)
par: Hossein, Zeinali, et autres
Publié: (2024)
Explainable Attribute-Based Speaker Verification
par: Wu, Xiaoliang, et autres
Publié: (2024)
par: Wu, Xiaoliang, et autres
Publié: (2024)
From Modular to End-to-End Speaker Diarization
par: Landini, Federico
Publié: (2024)
par: Landini, Federico
Publié: (2024)
Certification of Speaker Recognition Models to Additive Perturbations
par: Korzh, Dmitrii, et autres
Publié: (2024)
par: Korzh, Dmitrii, et autres
Publié: (2024)
Whisper Speaker Identification: Leveraging Pre-Trained Multilingual Transformers for Robust Speaker Embeddings
par: Emon, Jakaria Islam, et autres
Publié: (2025)
par: Emon, Jakaria Islam, et autres
Publié: (2025)
The VoxCeleb Speaker Recognition Challenge: A Retrospective
par: Huh, Jaesung, et autres
Publié: (2024)
par: Huh, Jaesung, et autres
Publié: (2024)
SDBench: A Comprehensive Benchmark Suite for Speaker Diarization
par: Pacheco, Eduardo, et autres
Publié: (2025)
par: Pacheco, Eduardo, et autres
Publié: (2025)
Quranic Audio Dataset: Crowdsourced and Labeled Recitation from Non-Arabic Speakers
par: Salameh, Raghad, et autres
Publié: (2024)
par: Salameh, Raghad, et autres
Publié: (2024)
Removing Speaker Information from Speech Representation using Variable-Length Soft Pooling
par: Hwang, Injune, et autres
Publié: (2024)
par: Hwang, Injune, et autres
Publié: (2024)
End-to-End Supervised Hierarchical Graph Clustering for Speaker Diarization
par: Singh, Prachi, et autres
Publié: (2024)
par: Singh, Prachi, et autres
Publié: (2024)
LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec
par: Guo, Yiwei, et autres
Publié: (2024)
par: Guo, Yiwei, et autres
Publié: (2024)
DART: Disentanglement of Accent and Speaker Representation in Multispeaker Text-to-Speech
par: Melechovsky, Jan, et autres
Publié: (2024)
par: Melechovsky, Jan, et autres
Publié: (2024)
Asynchronous Voice Anonymization Using Adversarial Perturbation On Speaker Embedding
par: Wang, Rui, et autres
Publié: (2024)
par: Wang, Rui, et autres
Publié: (2024)
Unispeaker: A Unified Approach for Multimodality-driven Speaker Generation
par: Sheng, Zhengyan, et autres
Publié: (2025)
par: Sheng, Zhengyan, et autres
Publié: (2025)
Automatic Speech Recognition in the Modern Era: Architectures, Training, and Evaluation
par: Nayeem, Md., et autres
Publié: (2025)
par: Nayeem, Md., et autres
Publié: (2025)
Music Genre Classification: A Comparative Analysis of Classical Machine Learning and Deep Learning Approaches
par: Prajuli, Sachin, et autres
Publié: (2026)
par: Prajuli, Sachin, et autres
Publié: (2026)
NeuroSpex: Neuro-Guided Speaker Extraction with Cross-Modal Attention
par: De Silva, Dashanka, et autres
Publié: (2024)
par: De Silva, Dashanka, et autres
Publié: (2024)
ASoBO: Attentive Beamformer Selection for Distant Speaker Diarization in Meetings
par: Mariotte, Theo, et autres
Publié: (2024)
par: Mariotte, Theo, et autres
Publié: (2024)
ExPO: Explainable Phonetic Trait-Oriented Network for Speaker Verification
par: Ma, Yi, et autres
Publié: (2025)
par: Ma, Yi, et autres
Publié: (2025)
Multi-Speaker Conversational Audio Deepfake: Taxonomy, Dataset and Pilot Study
par: Ahmed, Alabi, et autres
Publié: (2026)
par: Ahmed, Alabi, et autres
Publié: (2026)
Perceiver-Prompt: Flexible Speaker Adaptation in Whisper for Chinese Disordered Speech Recognition
par: Jiang, Yicong, et autres
Publié: (2024)
par: Jiang, Yicong, et autres
Publié: (2024)
ML-SAN: Multi-Level Speaker-Adaptive Network for Emotion Recognition in Conversations
par: Wang, Kexue, et autres
Publié: (2026)
par: Wang, Kexue, et autres
Publié: (2026)
Improving Neural Diarization through Speaker Attribute Attractors and Local Dependency Modeling
par: Palzer, David, et autres
Publié: (2025)
par: Palzer, David, et autres
Publié: (2025)
Target Speaker Extraction through Comparing Noisy Positive and Negative Audio Enrollments
par: Xu, Shitong, et autres
Publié: (2025)
par: Xu, Shitong, et autres
Publié: (2025)
EmoSpeech: A Corpus of Emotionally Rich and Contextually Detailed Speech Annotations
par: Bian, Weizhen, et autres
Publié: (2024)
par: Bian, Weizhen, et autres
Publié: (2024)
Who is Authentic Speaker
par: Huang, Qiang
Publié: (2024)
par: Huang, Qiang
Publié: (2024)
Can We Really Repurpose Multi-Speaker ASR Corpus for Speaker Diarization?
par: Horiguchi, Shota, et autres
Publié: (2025)
par: Horiguchi, Shota, et autres
Publié: (2025)
Towards Low-Latency Tracking of Multiple Speakers With Short-Context Speaker Embeddings
par: Iatariene, Taous, et autres
Publié: (2025)
par: Iatariene, Taous, et autres
Publié: (2025)
Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting
par: Han, Wooseok, et autres
Publié: (2024)
par: Han, Wooseok, et autres
Publié: (2024)
Egocentric Speaker Classification in Child-Adult Dyadic Interactions: From Sensing to Computational Modeling
par: Feng, Tiantian, et autres
Publié: (2024)
par: Feng, Tiantian, et autres
Publié: (2024)
The SVASR System for Text-dependent Speaker Verification (TdSV) AAIC Challenge 2024
par: Molavi, Mohammadreza, et autres
Publié: (2024)
par: Molavi, Mohammadreza, et autres
Publié: (2024)
MultiActor-Audiobook: Zero-Shot Audiobook Generation with Faces and Voices of Multiple Speakers
par: Park, Kyeongman, et autres
Publié: (2025)
par: Park, Kyeongman, et autres
Publié: (2025)
Do Not Mimic My Voice: Speaker Identity Unlearning for Zero-Shot Text-to-Speech
par: Kim, Taesoo, et autres
Publié: (2025)
par: Kim, Taesoo, et autres
Publié: (2025)
Plug-and-Play Co-Occurring Face Attention for Robust Audio-Visual Speaker Extraction
par: Pan, Zexu, et autres
Publié: (2025)
par: Pan, Zexu, et autres
Publié: (2025)
Documents similaires
-
Memory-Efficient Training for Deep Speaker Embedding Learning in Speaker Verification
par: Liu, Bei, et autres
Publié: (2024) -
Evaluating Speaker Identity Coding in Self-supervised Models and Humans
par: Elbanna, Gasser
Publié: (2024) -
Speaker Embeddings to Improve Tracking of Intermittent and Moving Speakers
par: Iatariene, Taous, et autres
Publié: (2025) -
Disentangling Speakers in Multi-Talker Speech Recognition with Speaker-Aware CTC
par: Kang, Jiawen, et autres
Publié: (2024) -
Developing an Effective Training Dataset to Enhance the Performance of AI-based Speaker Separation Systems
par: Melhem, Rawad, et autres
Publié: (2024)