Xi+: Uncertainty Supervision for Robust Speaker Embedding
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Junjie, Lee, Kong Aik, Truong, Duc-Tuan, Liu, Tianchi, Mak, Man-Wai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On the effectiveness of enrollment speech augmentation for Target Speaker Extraction
di: Li, Junjie, et al.
Pubblicazione: (2024)
di: Li, Junjie, et al.
Pubblicazione: (2024)
Emphasized Non-Target Speaker Knowledge in Knowledge Distillation for Automatic Speaker Verification
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2023)
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2023)
Golden Gemini is All You Need: Finding the Sweet Spots for Speaker Verification
di: Liu, Tianchi, et al.
Pubblicazione: (2023)
di: Liu, Tianchi, et al.
Pubblicazione: (2023)
Cosine Scoring with Uncertainty for Neural Speaker Embedding
di: Wang, Qiongqiong, et al.
Pubblicazione: (2024)
di: Wang, Qiongqiong, et al.
Pubblicazione: (2024)
Nes2Net: A Lightweight Nested Architecture for Foundation Model Driven Speech Anti-spoofing
di: Liu, Tianchi, et al.
Pubblicazione: (2025)
di: Liu, Tianchi, et al.
Pubblicazione: (2025)
VoxGenesis: Unsupervised Discovery of Latent Speaker Manifold for Speech Synthesis
di: Lin, Weiwei, et al.
Pubblicazione: (2024)
di: Lin, Weiwei, et al.
Pubblicazione: (2024)
Room Impulse Responses help attackers to evade Deep Fake Detection
di: Luong, Hieu-Thi, et al.
Pubblicazione: (2024)
di: Luong, Hieu-Thi, et al.
Pubblicazione: (2024)
MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues
di: Li, Junjie, et al.
Pubblicazione: (2024)
di: Li, Junjie, et al.
Pubblicazione: (2024)
Overview of Speaker Modeling and Its Applications: From the Lens of Deep Speaker Representation Learning
di: Wang, Shuai, et al.
Pubblicazione: (2024)
di: Wang, Shuai, et al.
Pubblicazione: (2024)
EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model
di: Yang, Yiqing, et al.
Pubblicazione: (2025)
di: Yang, Yiqing, et al.
Pubblicazione: (2025)
Temporal-Channel Modeling in Multi-head Self-Attention for Synthetic Speech Detection
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2024)
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2024)
Spectral-Aware Low-Rank Adaptation for Speaker Verification
di: Li, Zhe, et al.
Pubblicazione: (2025)
di: Li, Zhe, et al.
Pubblicazione: (2025)
Generalizing Speaker Verification for Spoof Awareness in the Embedding Space
di: Liu, Xuechen, et al.
Pubblicazione: (2024)
di: Liu, Xuechen, et al.
Pubblicazione: (2024)
Revisiting and Improving Scoring Fusion for Spoofing-aware Speaker Verification Using Compositional Data Analysis
di: Wang, Xin, et al.
Pubblicazione: (2024)
di: Wang, Xin, et al.
Pubblicazione: (2024)
PhiNet: Speaker Verification with Phonetic Interpretability
di: Ma, Yi, et al.
Pubblicazione: (2026)
di: Ma, Yi, et al.
Pubblicazione: (2026)
Bayesian Learning for Domain-Invariant Speaker Verification and Anti-Spoofing
di: Li, Jin, et al.
Pubblicazione: (2025)
di: Li, Jin, et al.
Pubblicazione: (2025)
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
di: Thienpondt, Jenthe, et al.
Pubblicazione: (2024)
di: Thienpondt, Jenthe, et al.
Pubblicazione: (2024)
Text-dependent Speaker Verification (TdSV) Challenge 2024: Challenge Evaluation Plan
di: Hossein, Zeinali, et al.
Pubblicazione: (2024)
di: Hossein, Zeinali, et al.
Pubblicazione: (2024)
Robust Localization of Partially Fake Speech: Metrics and Out-of-Domain Evaluation
di: Luong, Hieu-Thi, et al.
Pubblicazione: (2025)
di: Luong, Hieu-Thi, et al.
Pubblicazione: (2025)
UNet-Based Fusion and Exponential Moving Average Adaptation for Noise-Robust Speaker Recognition
di: Gan, Chong-Xin, et al.
Pubblicazione: (2026)
di: Gan, Chong-Xin, et al.
Pubblicazione: (2026)
On the Generation and Removal of Speaker Adversarial Perturbation for Voice-Privacy Protection
di: Guo, Chenyang, et al.
Pubblicazione: (2024)
di: Guo, Chenyang, et al.
Pubblicazione: (2024)
Emotional Styles Hide in Deep Speaker Embeddings: Disentangle Deep Speaker Embeddings for Speaker Clustering
di: Lin, Chaohao, et al.
Pubblicazione: (2025)
di: Lin, Chaohao, et al.
Pubblicazione: (2025)
USEF-TSE: Universal Speaker Embedding Free Target Speaker Extraction
di: Zeng, Bang, et al.
Pubblicazione: (2024)
di: Zeng, Bang, et al.
Pubblicazione: (2024)
Gradient weighting for speaker verification in extremely low Signal-to-Noise Ratio
di: Ma, Yi, et al.
Pubblicazione: (2024)
di: Ma, Yi, et al.
Pubblicazione: (2024)
Guided Speaker Embedding
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)
Multi-Level Speaker Representation for Target Speaker Extraction
di: Zhang, Ke, et al.
Pubblicazione: (2024)
di: Zhang, Ke, et al.
Pubblicazione: (2024)
Improving the Adversarial Robustness for Speaker Verification by Self-Supervised Learning
di: Wu, Haibin, et al.
Pubblicazione: (2021)
di: Wu, Haibin, et al.
Pubblicazione: (2021)
Universal Speaker Embedding Free Target Speaker Extraction and Personal Voice Activity Detection
di: Zeng, Bang, et al.
Pubblicazione: (2025)
di: Zeng, Bang, et al.
Pubblicazione: (2025)
Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
di: Chen, Yafeng, et al.
Pubblicazione: (2024)
di: Chen, Yafeng, et al.
Pubblicazione: (2024)
Self-Distillation Prototypes Network: Learning Robust Speaker Representations without Supervision
di: Chen, Yafeng, et al.
Pubblicazione: (2023)
di: Chen, Yafeng, et al.
Pubblicazione: (2023)
Explaining Speaker and Spoof Embeddings via Probing
di: Liu, Xuechen, et al.
Pubblicazione: (2024)
di: Liu, Xuechen, et al.
Pubblicazione: (2024)
Mitigating Non-Target Speaker Bias in Guided Speaker Embedding
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
ExPO: Explainable Phonetic Trait-Oriented Network for Speaker Verification
di: Ma, Yi, et al.
Pubblicazione: (2025)
di: Ma, Yi, et al.
Pubblicazione: (2025)
LlamaPartialSpoof: An LLM-Driven Fake Speech Dataset Simulating Disinformation Generation
di: Luong, Hieu-Thi, et al.
Pubblicazione: (2024)
di: Luong, Hieu-Thi, et al.
Pubblicazione: (2024)
M-Vec: Matryoshka Speaker Embeddings with Flexible Dimensions
di: Wang, Shuai, et al.
Pubblicazione: (2024)
di: Wang, Shuai, et al.
Pubblicazione: (2024)
Interpreting the Dimensions of Speaker Embedding Space
di: Huckvale, Mark
Pubblicazione: (2025)
di: Huckvale, Mark
Pubblicazione: (2025)
Recursive Attentive Pooling for Extracting Speaker Embeddings from Multi-Speaker Recordings
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)
A Large-Scale Probing Analysis of Speaker-Specific Attributes in Self-Supervised Speech Representations
di: Chiu, Aemon Yat Fei, et al.
Pubblicazione: (2025)
di: Chiu, Aemon Yat Fei, et al.
Pubblicazione: (2025)
SegAug: CTC-Aligned Segmented Augmentation For Robust RNN-Transducer Based Speech Recognition
di: Le, Khanh, et al.
Pubblicazione: (2025)
di: Le, Khanh, et al.
Pubblicazione: (2025)
Leveraging Self-Supervised Learning for Speaker Diarization
di: Han, Jiangyu, et al.
Pubblicazione: (2024)
di: Han, Jiangyu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
On the effectiveness of enrollment speech augmentation for Target Speaker Extraction
di: Li, Junjie, et al.
Pubblicazione: (2024) -
Emphasized Non-Target Speaker Knowledge in Knowledge Distillation for Automatic Speaker Verification
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2023) -
Golden Gemini is All You Need: Finding the Sweet Spots for Speaker Verification
di: Liu, Tianchi, et al.
Pubblicazione: (2023) -
Cosine Scoring with Uncertainty for Neural Speaker Embedding
di: Wang, Qiongqiong, et al.
Pubblicazione: (2024) -
Nes2Net: A Lightweight Nested Architecture for Foundation Model Driven Speech Anti-spoofing
di: Liu, Tianchi, et al.
Pubblicazione: (2025)