UNet-Based Fusion and Exponential Moving Average Adaptation for Noise-Robust Speaker Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gan, Chong-Xin, Bell, Peter, Mak, Man-Wai, Li, Zhe, Jin, Zezhong, Huang, Zilong, Lee, Kong Aik |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Bayesian Learning for Domain-Invariant Speaker Verification and Anti-Spoofing
par: Li, Jin, et autres
Publié: (2025)
par: Li, Jin, et autres
Publié: (2025)
Asymmetric Clean Segments-Guided Self-Supervised Learning for Robust Speaker Verification
par: Gan, Chong-Xin, et autres
Publié: (2023)
par: Gan, Chong-Xin, et autres
Publié: (2023)
Xi+: Uncertainty Supervision for Robust Speaker Embedding
par: Li, Junjie, et autres
Publié: (2025)
par: Li, Junjie, et autres
Publié: (2025)
On the effectiveness of enrollment speech augmentation for Target Speaker Extraction
par: Li, Junjie, et autres
Publié: (2024)
par: Li, Junjie, et autres
Publié: (2024)
Subband Architecture Aided Selective Fixed-Filter Active Noise Control
par: Liang, Hong-Cheng, et autres
Publié: (2025)
par: Liang, Hong-Cheng, et autres
Publié: (2025)
VoxGenesis: Unsupervised Discovery of Latent Speaker Manifold for Speech Synthesis
par: Lin, Weiwei, et autres
Publié: (2024)
par: Lin, Weiwei, et autres
Publié: (2024)
Spectral-Aware Low-Rank Adaptation for Speaker Verification
par: Li, Zhe, et autres
Publié: (2025)
par: Li, Zhe, et autres
Publié: (2025)
EmoQ: Speech Emotion Recognition via Speech-Aware Q-Former and Large Language Model
par: Yang, Yiqing, et autres
Publié: (2025)
par: Yang, Yiqing, et autres
Publié: (2025)
Revisiting and Improving Scoring Fusion for Spoofing-aware Speaker Verification Using Compositional Data Analysis
par: Wang, Xin, et autres
Publié: (2024)
par: Wang, Xin, et autres
Publié: (2024)
MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues
par: Li, Junjie, et autres
Publié: (2024)
par: Li, Junjie, et autres
Publié: (2024)
IDMap: A Pseudo-Speaker Generator Framework Based on Speaker Identity Index to Vector Mapping
par: Liu, Zeyan, et autres
Publié: (2025)
par: Liu, Zeyan, et autres
Publié: (2025)
Pinhole Effect on Linkability and Dispersion in Speaker Anonymization
par: Lee, Kong Aik, et autres
Publié: (2025)
par: Lee, Kong Aik, et autres
Publié: (2025)
Cosine Scoring with Uncertainty for Neural Speaker Embedding
par: Wang, Qiongqiong, et autres
Publié: (2024)
par: Wang, Qiongqiong, et autres
Publié: (2024)
RADAR Challenge 2026: Robust Audio Deepfake Recognition under Media Transformations
par: Luong, Hieu-Thi, et autres
Publié: (2026)
par: Luong, Hieu-Thi, et autres
Publié: (2026)
A Study of the Removability of Speaker-Adversarial Perturbations
par: Chen, Liping, et autres
Publié: (2025)
par: Chen, Liping, et autres
Publié: (2025)
Overview of Speaker Modeling and Its Applications: From the Lens of Deep Speaker Representation Learning
par: Wang, Shuai, et autres
Publié: (2024)
par: Wang, Shuai, et autres
Publié: (2024)
Golden Gemini is All You Need: Finding the Sweet Spots for Speaker Verification
par: Liu, Tianchi, et autres
Publié: (2023)
par: Liu, Tianchi, et autres
Publié: (2023)
Emphasized Non-Target Speaker Knowledge in Knowledge Distillation for Automatic Speaker Verification
par: Truong, Duc-Tuan, et autres
Publié: (2023)
par: Truong, Duc-Tuan, et autres
Publié: (2023)
Speaker Privacy and Security in the Big Data Era: Protection and Defense against Deepfake
par: Chen, Liping, et autres
Publié: (2025)
par: Chen, Liping, et autres
Publié: (2025)
Cross-Modal Bottleneck Fusion For Noise Robust Audio-Visual Speech Recognition
par: Ok, Seaone, et autres
Publié: (2026)
par: Ok, Seaone, et autres
Publié: (2026)
Gradient weighting for speaker verification in extremely low Signal-to-Noise Ratio
par: Ma, Yi, et autres
Publié: (2024)
par: Ma, Yi, et autres
Publié: (2024)
Text-dependent Speaker Verification (TdSV) Challenge 2024: Challenge Evaluation Plan
par: Hossein, Zeinali, et autres
Publié: (2024)
par: Hossein, Zeinali, et autres
Publié: (2024)
Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
par: Zhang, Jing-Xuan, et autres
Publié: (2025)
Stream-Voice-Anon: Enhancing Utility of Real-Time Speaker Anonymization via Neural Audio Codec and Language Models
par: Kuzmin, Nikita, et autres
Publié: (2026)
par: Kuzmin, Nikita, et autres
Publié: (2026)
MOPSA: Mixture of Prompt-Experts Based Speaker Adaptation for Elderly Speech Recognition
par: Deng, Chengxi, et autres
Publié: (2025)
par: Deng, Chengxi, et autres
Publié: (2025)
Array Geometry-Robust Attention-Based Neural Beamformer for Moving Speakers
par: Tammen, Marvin, et autres
Publié: (2024)
par: Tammen, Marvin, et autres
Publié: (2024)
Structured Speaker-Deficiency Adaptation of Foundation Models for Dysarthric and Elderly Speech Recognition
par: Hu, Shujie, et autres
Publié: (2024)
par: Hu, Shujie, et autres
Publié: (2024)
Emotion Recognition in Multi-Speaker Conversations through Speaker Identification, Knowledge Distillation, and Hierarchical Fusion
par: Li, Xiao, et autres
Publié: (2025)
par: Li, Xiao, et autres
Publié: (2025)
StreamVoiceAnon+: Emotion-Preserving Streaming Speaker Anonymization via Frame-Level Acoustic Distillation
par: Kuzmin, Nikita, et autres
Publié: (2026)
par: Kuzmin, Nikita, et autres
Publié: (2026)
Enhancing Dysarthric Speech Recognition for Unseen Speakers via Prototype-Based Adaptation
par: Wang, Shiyao, et autres
Publié: (2024)
par: Wang, Shiyao, et autres
Publié: (2024)
Generalizing Speaker Verification for Spoof Awareness in the Embedding Space
par: Liu, Xuechen, et autres
Publié: (2024)
par: Liu, Xuechen, et autres
Publié: (2024)
Study on Inter and Intra Speaker Variability in Speaker Recognition
par: Okhotnikov, Anton, et autres
Publié: (2024)
par: Okhotnikov, Anton, et autres
Publié: (2024)
SE/BN Adapter: Parametric Efficient Domain Adaptation for Speaker Recognition
par: Wang, Tianhao, et autres
Publié: (2024)
par: Wang, Tianhao, et autres
Publié: (2024)
Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion
par: Jin, Zhan, et autres
Publié: (2025)
par: Jin, Zhan, et autres
Publié: (2025)
FT-Boosted SV: Towards Noise Robust Speaker Verification for English Speaking Classroom Environments
par: Tabatabaee, Saba, et autres
Publié: (2025)
par: Tabatabaee, Saba, et autres
Publié: (2025)
On the Generation and Removal of Speaker Adversarial Perturbation for Voice-Privacy Protection
par: Guo, Chenyang, et autres
Publié: (2024)
par: Guo, Chenyang, et autres
Publié: (2024)
SpeakerRPL v2: Robust Open-set Speaker Identification through Enhanced Few-shot Foundation Tuning and Model Fusion
par: Chen, Zhiyong, et autres
Publié: (2026)
par: Chen, Zhiyong, et autres
Publié: (2026)
Reshape Dimensions Network for Speaker Recognition
par: Yakovlev, Ivan, et autres
Publié: (2024)
par: Yakovlev, Ivan, et autres
Publié: (2024)
A Joint Noise Disentanglement and Adversarial Training Framework for Robust Speaker Verification
par: Xing, Xujiang, et autres
Publié: (2024)
par: Xing, Xujiang, et autres
Publié: (2024)
Noise-Conditioned Mixture-of-Experts Framework for Robust Speaker Verification
par: Gu, Bin, et autres
Publié: (2025)
par: Gu, Bin, et autres
Publié: (2025)
Documents similaires
-
Bayesian Learning for Domain-Invariant Speaker Verification and Anti-Spoofing
par: Li, Jin, et autres
Publié: (2025) -
Asymmetric Clean Segments-Guided Self-Supervised Learning for Robust Speaker Verification
par: Gan, Chong-Xin, et autres
Publié: (2023) -
Xi+: Uncertainty Supervision for Robust Speaker Embedding
par: Li, Junjie, et autres
Publié: (2025) -
On the effectiveness of enrollment speech augmentation for Target Speaker Extraction
par: Li, Junjie, et autres
Publié: (2024) -
Subband Architecture Aided Selective Fixed-Filter Active Noise Control
par: Liang, Hong-Cheng, et autres
Publié: (2025)