Enhancing Open-Set Speaker Identification through Rapid Tuning with Speaker Reciprocal Points and Negative Sample
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Zhiyong, Ai, Zhiqi, Li, Xinnuo, Xu, Shugong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
StyleFusion TTS: Multimodal Style-control and Enhanced Feature Fusion for Zero-shot Text-to-speech Synthesis
di: Chen, Zhiyong, et al.
Pubblicazione: (2024)
di: Chen, Zhiyong, et al.
Pubblicazione: (2024)
Effective User-defined Keyword Spotting with Dual-stage Matching, Multi-modal Enrollment, and Continual Adaptation
di: Ai, Zhiqi, et al.
Pubblicazione: (2026)
di: Ai, Zhiqi, et al.
Pubblicazione: (2026)
MM-KWS: Multi-modal Prompts for Multilingual User-defined Keyword Spotting
di: Ai, Zhiqi, et al.
Pubblicazione: (2024)
di: Ai, Zhiqi, et al.
Pubblicazione: (2024)
Enhancing Zero-Shot Multi-Speaker TTS with Negated Speaker Representations
di: Jeon, Yejin, et al.
Pubblicazione: (2024)
di: Jeon, Yejin, et al.
Pubblicazione: (2024)
Emotion Recognition in Multi-Speaker Conversations through Speaker Identification, Knowledge Distillation, and Hierarchical Fusion
di: Li, Xiao, et al.
Pubblicazione: (2025)
di: Li, Xiao, et al.
Pubblicazione: (2025)
Pretraining Multi-Speaker Identification for Neural Speaker Diarization
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
A Comprehensive Investigation on Speaker Augmentation for Speaker Recognition
di: Zhou, Zhenyu, et al.
Pubblicazione: (2024)
di: Zhou, Zhenyu, et al.
Pubblicazione: (2024)
Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling
di: Wu, Shu, et al.
Pubblicazione: (2025)
di: Wu, Shu, et al.
Pubblicazione: (2025)
Learning Emotion-Invariant Speaker Representations for Speaker Verification
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
di: Tian, Jingguang, et al.
Pubblicazione: (2025)
Emotional Styles Hide in Deep Speaker Embeddings: Disentangle Deep Speaker Embeddings for Speaker Clustering
di: Lin, Chaohao, et al.
Pubblicazione: (2025)
di: Lin, Chaohao, et al.
Pubblicazione: (2025)
Speaker Contrastive Learning for Source Speaker Tracing
di: Wang, Qing, et al.
Pubblicazione: (2024)
di: Wang, Qing, et al.
Pubblicazione: (2024)
Multi-Level Speaker Representation for Target Speaker Extraction
di: Zhang, Ke, et al.
Pubblicazione: (2024)
di: Zhang, Ke, et al.
Pubblicazione: (2024)
An Investigation on Speaker Augmentation for End-to-End Speaker Extraction
di: You, Zhenghai, et al.
Pubblicazione: (2025)
di: You, Zhenghai, et al.
Pubblicazione: (2025)
ASRRL-TTS: Agile Speaker Representation Reinforcement Learning for Text-to-Speech Speaker Adaptation
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
di: Fu, Ruibo, et al.
Pubblicazione: (2024)
USEF-TSE: Universal Speaker Embedding Free Target Speaker Extraction
di: Zeng, Bang, et al.
Pubblicazione: (2024)
di: Zeng, Bang, et al.
Pubblicazione: (2024)
SpeakerRPL v2: Robust Open-set Speaker Identification through Enhanced Few-shot Foundation Tuning and Model Fusion
di: Chen, Zhiyong, et al.
Pubblicazione: (2026)
di: Chen, Zhiyong, et al.
Pubblicazione: (2026)
Multi-Label Training for Text-Independent Speaker Identification
di: Xue, Yuqi
Pubblicazione: (2022)
di: Xue, Yuqi
Pubblicazione: (2022)
Overview of Speaker Modeling and Its Applications: From the Lens of Deep Speaker Representation Learning
di: Wang, Shuai, et al.
Pubblicazione: (2024)
di: Wang, Shuai, et al.
Pubblicazione: (2024)
Speaker-Smoothed kNN Speaker Adaptation for End-to-End ASR
di: Li, Shaojun, et al.
Pubblicazione: (2024)
di: Li, Shaojun, et al.
Pubblicazione: (2024)
Neural Codec-based Adversarial Sample Detection for Speaker Verification
di: Chen, Xuanjun, et al.
Pubblicazione: (2024)
di: Chen, Xuanjun, et al.
Pubblicazione: (2024)
Mitigating Non-Target Speaker Bias in Guided Speaker Embedding
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
Universal Speaker Embedding Free Target Speaker Extraction and Personal Voice Activity Detection
di: Zeng, Bang, et al.
Pubblicazione: (2025)
di: Zeng, Bang, et al.
Pubblicazione: (2025)
Speaker-IPL: Unsupervised Learning of Speaker Characteristics with i-Vector based Pseudo-Labels
di: Aldeneh, Zakaria, et al.
Pubblicazione: (2024)
di: Aldeneh, Zakaria, et al.
Pubblicazione: (2024)
Uncertainty Quantification in Machine Learning for Joint Speaker Diarization and Identification
di: McKnight, Simon W., et al.
Pubblicazione: (2023)
di: McKnight, Simon W., et al.
Pubblicazione: (2023)
In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion
di: Jin, Jiawei, et al.
Pubblicazione: (2025)
di: Jin, Jiawei, et al.
Pubblicazione: (2025)
Target Speaker Extraction through Comparing Noisy Positive and Negative Audio Enrollments
di: Xu, Shitong, et al.
Pubblicazione: (2025)
di: Xu, Shitong, et al.
Pubblicazione: (2025)
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
di: Park, Nohil, et al.
Pubblicazione: (2024)
di: Park, Nohil, et al.
Pubblicazione: (2024)
Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR
di: Wang, Weiqing, et al.
Pubblicazione: (2025)
di: Wang, Weiqing, et al.
Pubblicazione: (2025)
Generating Speakers by Prompting Listener Impressions for Pre-trained Multi-Speaker Text-to-Speech Systems
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
Integrated Multi-Level Knowledge Distillation for Enhanced Speaker Verification
di: Yang, Wenhao, et al.
Pubblicazione: (2024)
di: Yang, Wenhao, et al.
Pubblicazione: (2024)
On Speaker Attribution with SURT
di: Raj, Desh, et al.
Pubblicazione: (2024)
di: Raj, Desh, et al.
Pubblicazione: (2024)
Guided Speaker Embedding
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)
Recursive Attentive Pooling for Extracting Speaker Embeddings from Multi-Speaker Recordings
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)
di: Horiguchi, Shota, et al.
Pubblicazione: (2024)
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
di: Thienpondt, Jenthe, et al.
Pubblicazione: (2024)
di: Thienpondt, Jenthe, et al.
Pubblicazione: (2024)
SQ-Whisper: Speaker-Querying based Whisper Model for Target-Speaker ASR
di: Guo, Pengcheng, et al.
Pubblicazione: (2024)
di: Guo, Pengcheng, et al.
Pubblicazione: (2024)
Can We Really Repurpose Multi-Speaker ASR Corpus for Speaker Diarization?
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
di: Horiguchi, Shota, et al.
Pubblicazione: (2025)
From Independence to Interaction: Speaker-Aware Simulation of Multi-Speaker Conversational Timing
di: Gedeon, Máté, et al.
Pubblicazione: (2025)
di: Gedeon, Máté, et al.
Pubblicazione: (2025)
Emphasized Non-Target Speaker Knowledge in Knowledge Distillation for Automatic Speaker Verification
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2023)
di: Truong, Duc-Tuan, et al.
Pubblicazione: (2023)
Enhancing Age-Related Robustness in Children Speaker Verification
di: Shetty, Vishwas M., et al.
Pubblicazione: (2025)
di: Shetty, Vishwas M., et al.
Pubblicazione: (2025)
Spoofing-Aware Speaker Verification via Wavelet Prompt Tuning and Multi-Model Ensembles
di: Farhadipour, Aref, et al.
Pubblicazione: (2026)
di: Farhadipour, Aref, et al.
Pubblicazione: (2026)
Documenti analoghi
-
StyleFusion TTS: Multimodal Style-control and Enhanced Feature Fusion for Zero-shot Text-to-speech Synthesis
di: Chen, Zhiyong, et al.
Pubblicazione: (2024) -
Effective User-defined Keyword Spotting with Dual-stage Matching, Multi-modal Enrollment, and Continual Adaptation
di: Ai, Zhiqi, et al.
Pubblicazione: (2026) -
MM-KWS: Multi-modal Prompts for Multilingual User-defined Keyword Spotting
di: Ai, Zhiqi, et al.
Pubblicazione: (2024) -
Enhancing Zero-Shot Multi-Speaker TTS with Negated Speaker Representations
di: Jeon, Yejin, et al.
Pubblicazione: (2024) -
Emotion Recognition in Multi-Speaker Conversations through Speaker Identification, Knowledge Distillation, and Hierarchical Fusion
di: Li, Xiao, et al.
Pubblicazione: (2025)