Post-Training Embedding Alignment for Decoupling Enrollment and Runtime Speaker Recognition Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Gao, Chenyang, Desplanques, Brecht, Ju, Chelsea J. -T., Chadha, Aman, Stolcke, Andreas |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Adversarial Reweighting for Speaker Verification Fairness
di: Jin, Minho, et al.
Pubblicazione: (2022)
di: Jin, Minho, et al.
Pubblicazione: (2022)
Improving speaker verification robustness with synthetic emotional utterances
di: Koditala, Nikhil Kumar, et al.
Pubblicazione: (2024)
di: Koditala, Nikhil Kumar, et al.
Pubblicazione: (2024)
Unmixing the Crowd: Learning Mixture-to-Set Speaker Embeddings for Enrollment-Free Target Speech Extraction
di: Sidharth, FNU, et al.
Pubblicazione: (2026)
di: Sidharth, FNU, et al.
Pubblicazione: (2026)
Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement
di: Huang, Ziling, et al.
Pubblicazione: (2025)
di: Huang, Ziling, et al.
Pubblicazione: (2025)
Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion
di: Jin, Zhan, et al.
Pubblicazione: (2025)
di: Jin, Zhan, et al.
Pubblicazione: (2025)
End-to-End Target Speaker Speech Recognition Using Context-Aware Attention Mechanisms for Challenging Enrollment Scenario
di: Ghane, Mohsen, et al.
Pubblicazione: (2025)
di: Ghane, Mohsen, et al.
Pubblicazione: (2025)
Dynamic Recognition of Speakers for Consent Management by Contrastive Embedding Replay
di: Shahmansoori, Arash, et al.
Pubblicazione: (2022)
di: Shahmansoori, Arash, et al.
Pubblicazione: (2022)
Elevating Robust Multi-Talker ASR by Decoupling Speaker Separation and Speech Recognition
di: Yang, Yufeng, et al.
Pubblicazione: (2025)
di: Yang, Yufeng, et al.
Pubblicazione: (2025)
Revealing Emotional Clusters in Speaker Embeddings: A Contrastive Learning Strategy for Speech Emotion Recognition
di: Ulgen, Ismail Rasim, et al.
Pubblicazione: (2024)
di: Ulgen, Ismail Rasim, et al.
Pubblicazione: (2024)
Emotional Styles Hide in Deep Speaker Embeddings: Disentangle Deep Speaker Embeddings for Speaker Clustering
di: Lin, Chaohao, et al.
Pubblicazione: (2025)
di: Lin, Chaohao, et al.
Pubblicazione: (2025)
DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions
di: Xue, Ke, et al.
Pubblicazione: (2025)
di: Xue, Ke, et al.
Pubblicazione: (2025)
Joint Training of Speaker Embedding Extractor, Speech and Overlap Detection for Diarization
di: Pálka, Petr, et al.
Pubblicazione: (2024)
di: Pálka, Petr, et al.
Pubblicazione: (2024)
Guided Speaker Embedding
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)
Reducing Geographic Disparities in Automatic Speech Recognition via Elastic Weight Consolidation
di: Trinh, Viet Anh, et al.
Pubblicazione: (2022)
di: Trinh, Viet Anh, et al.
Pubblicazione: (2022)
DiarizationLM: Speaker Diarization Post-Processing with Large Language Models
di: Wang, Quan, et al.
Pubblicazione: (2024)
di: Wang, Quan, et al.
Pubblicazione: (2024)
Cosine Scoring with Uncertainty for Neural Speaker Embedding
di: Wang, Qiongqiong, et al.
Pubblicazione: (2024)
di: Wang, Qiongqiong, et al.
Pubblicazione: (2024)
A Comprehensive Investigation on Speaker Augmentation for Speaker Recognition
di: Zhou, Zhenyu, et al.
Pubblicazione: (2024)
di: Zhou, Zhenyu, et al.
Pubblicazione: (2024)
Mitigating Non-Target Speaker Bias in Guided Speaker Embedding
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
USEF-TSE: Universal Speaker Embedding Free Target Speaker Extraction
di: Zeng, Bang, et al.
Pubblicazione: (2024)
di: Zeng, Bang, et al.
Pubblicazione: (2024)
Interpreting the Dimensions of Speaker Embedding Space
di: Huckvale, Mark
Pubblicazione: (2025)
di: Huckvale, Mark
Pubblicazione: (2025)
On the Generation and Removal of Speaker Adversarial Perturbation for Voice-Privacy Protection
di: Guo, Chenyang, et al.
Pubblicazione: (2024)
di: Guo, Chenyang, et al.
Pubblicazione: (2024)
Self-Supervised Learning for Speaker Recognition: A study and review
di: Lepage, Theo, et al.
Pubblicazione: (2026)
di: Lepage, Theo, et al.
Pubblicazione: (2026)
CEC: A Noisy Label Detection Method for Speaker Recognition
di: Shen, Yao, et al.
Pubblicazione: (2024)
di: Shen, Yao, et al.
Pubblicazione: (2024)
Recursive Attentive Pooling for Extracting Speaker Embeddings from Multi-Speaker Recordings
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
di: Thienpondt, Jenthe, et al.
Pubblicazione: (2024)
di: Thienpondt, Jenthe, et al.
Pubblicazione: (2024)
Adversarial Speaker Distillation for Countermeasure Model on Automatic Speaker Verification
di: Liao, Yen-Lun, et al.
Pubblicazione: (2022)
di: Liao, Yen-Lun, et al.
Pubblicazione: (2022)
Universal Speaker Embedding Free Target Speaker Extraction and Personal Voice Activity Detection
di: Zeng, Bang, et al.
Pubblicazione: (2025)
di: Zeng, Bang, et al.
Pubblicazione: (2025)
The Reasonable Effectiveness of Speaker Embeddings for Violence Detection
di: Jain, Sarthak, et al.
Pubblicazione: (2024)
di: Jain, Sarthak, et al.
Pubblicazione: (2024)
Explaining Speaker and Spoof Embeddings via Probing
di: Liu, Xuechen, et al.
Pubblicazione: (2024)
di: Liu, Xuechen, et al.
Pubblicazione: (2024)
Xi+: Uncertainty Supervision for Robust Speaker Embedding
di: Li, Junjie, et al.
Pubblicazione: (2025)
di: Li, Junjie, et al.
Pubblicazione: (2025)
Memory-Efficient Training for Deep Speaker Embedding Learning in Speaker Verification
di: Liu, Bei, et al.
Pubblicazione: (2024)
di: Liu, Bei, et al.
Pubblicazione: (2024)
Transcription-Free Fine-Tuning of Speech Separation Models for Noisy and Reverberant Multi-Speaker Automatic Speech Recognition
di: Ravenscroft, William, et al.
Pubblicazione: (2024)
di: Ravenscroft, William, et al.
Pubblicazione: (2024)
Emotion Recognition in Multi-Speaker Conversations through Speaker Identification, Knowledge Distillation, and Hierarchical Fusion
di: Li, Xiao, et al.
Pubblicazione: (2025)
di: Li, Xiao, et al.
Pubblicazione: (2025)
Target Speaker Extraction through Comparing Noisy Positive and Negative Audio Enrollments
di: Xu, Shitong, et al.
Pubblicazione: (2025)
di: Xu, Shitong, et al.
Pubblicazione: (2025)
M-Vec: Matryoshka Speaker Embeddings with Flexible Dimensions
di: Wang, Shuai, et al.
Pubblicazione: (2024)
di: Wang, Shuai, et al.
Pubblicazione: (2024)
Adversarial Training of Denoising Diffusion Model Using Dual Discriminators for High-Fidelity Multi-Speaker TTS
di: Ko, Myeongjin, et al.
Pubblicazione: (2023)
di: Ko, Myeongjin, et al.
Pubblicazione: (2023)
Structured Speaker-Deficiency Adaptation of Foundation Models for Dysarthric and Elderly Speech Recognition
di: Hu, Shujie, et al.
Pubblicazione: (2024)
di: Hu, Shujie, et al.
Pubblicazione: (2024)
Improving Speaker-independent Speech Emotion Recognition Using Dynamic Joint Distribution Adaptation
di: Lu, Cheng, et al.
Pubblicazione: (2024)
di: Lu, Cheng, et al.
Pubblicazione: (2024)
On the application of Visibility Graphs in the Spectral Domain for Speaker Recognition
di: Bocaccio, Hernan, et al.
Pubblicazione: (2025)
di: Bocaccio, Hernan, et al.
Pubblicazione: (2025)
Disentangled Representation Learning for Environment-agnostic Speaker Recognition
di: Nam, KiHyun, et al.
Pubblicazione: (2024)
di: Nam, KiHyun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Adversarial Reweighting for Speaker Verification Fairness
di: Jin, Minho, et al.
Pubblicazione: (2022) -
Improving speaker verification robustness with synthetic emotional utterances
di: Koditala, Nikhil Kumar, et al.
Pubblicazione: (2024) -
Unmixing the Crowd: Learning Mixture-to-Set Speaker Embeddings for Enrollment-Free Target Speech Extraction
di: Sidharth, FNU, et al.
Pubblicazione: (2026) -
Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement
di: Huang, Ziling, et al.
Pubblicazione: (2025) -
Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion
di: Jin, Zhan, et al.
Pubblicazione: (2025)