Adaptive Speaker Embedding Self-Augmentation for Personal Voice Activity Detection with Short Enrollment Speech
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Feng, Fuyuan, Zhang, Wenbin, Gao, Yu, Xu, Longting, Mou, Xiaofeng, Xu, Yi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multi-modal Speech Enhancement with Limited Electromyography Channels
par: Feng, Fuyuan, et autres
Publié: (2025)
par: Feng, Fuyuan, et autres
Publié: (2025)
EEND-SAA: Enrollment-Less Main Speaker Voice Activity Detection Using Self-Attention Attractors
par: Wu, Wen-Yung, et autres
Publié: (2025)
par: Wu, Wen-Yung, et autres
Publié: (2025)
Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement
par: Huang, Ziling, et autres
Publié: (2025)
par: Huang, Ziling, et autres
Publié: (2025)
Universal Speaker Embedding Free Target Speaker Extraction and Personal Voice Activity Detection
par: Zeng, Bang, et autres
Publié: (2025)
par: Zeng, Bang, et autres
Publié: (2025)
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
par: Thienpondt, Jenthe, et autres
Publié: (2024)
par: Thienpondt, Jenthe, et autres
Publié: (2024)
Unmixing the Crowd: Learning Mixture-to-Set Speaker Embeddings for Enrollment-Free Target Speech Extraction
par: Sidharth, FNU, et autres
Publié: (2026)
par: Sidharth, FNU, et autres
Publié: (2026)
NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers
par: Park, Nohil, et autres
Publié: (2024)
par: Park, Nohil, et autres
Publié: (2024)
Retrieval-Augmented Self-Taught Reasoning Model with Adaptive Chain-of-Thought for ASR Named Entity Correction
par: An, Junjie, et autres
Publié: (2026)
par: An, Junjie, et autres
Publié: (2026)
End-to-End Direction-Aware Keyword Spotting with Spatial Priors in Noisy Environments
par: Wang, Rui, et autres
Publié: (2026)
par: Wang, Rui, et autres
Publié: (2026)
Device Feature based on Graph Fourier Transformation with Logarithmic Processing For Detection of Replay Speech Attacks
par: He, Mingrui, et autres
Publié: (2024)
par: He, Mingrui, et autres
Publié: (2024)
EvoTSE: Evolving Enrollment for Target Speaker Extraction
par: Liu, Zikai, et autres
Publié: (2026)
par: Liu, Zikai, et autres
Publié: (2026)
Robust Speech Activity Detection in the Presence of Singing Voice
par: Grundhuber, Philipp, et autres
Publié: (2025)
par: Grundhuber, Philipp, et autres
Publié: (2025)
Voice Conversion Augmentation for Speaker Recognition on Defective Datasets
par: Tao, Ruijie, et autres
Publié: (2024)
par: Tao, Ruijie, et autres
Publié: (2024)
Profile-Error-Tolerant Target-Speaker Voice Activity Detection
par: Wang, Dongmei, et autres
Publié: (2023)
par: Wang, Dongmei, et autres
Publié: (2023)
Exploring Speech Foundation Models for Speaker Diarization Across Lifespan
par: Xu, Anfeng, et autres
Publié: (2026)
par: Xu, Anfeng, et autres
Publié: (2026)
Post-Training Embedding Alignment for Decoupling Enrollment and Runtime Speaker Recognition Models
par: Gao, Chenyang, et autres
Publié: (2024)
par: Gao, Chenyang, et autres
Publié: (2024)
Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Speaker Diarization
par: Cheng, Ming, et autres
Publié: (2024)
par: Cheng, Ming, et autres
Publié: (2024)
Adversarial Attacks and Robust Defenses in Speaker Embedding based Zero-Shot Text-to-Speech System
par: Li, Ze, et autres
Publié: (2024)
par: Li, Ze, et autres
Publié: (2024)
GLOBE: A High-quality English Corpus with Global Accents for Zero-shot Speaker Adaptive Text-to-Speech
par: Wang, Wenbin, et autres
Publié: (2024)
par: Wang, Wenbin, et autres
Publié: (2024)
Single-Microphone Speaker Separation and Voice Activity Detection in Noisy and Reverberant Environments
par: Opochinsky, Renana, et autres
Publié: (2024)
par: Opochinsky, Renana, et autres
Publié: (2024)
Joint Training of Speaker Embedding Extractor, Speech and Overlap Detection for Diarization
par: Pálka, Petr, et autres
Publié: (2024)
par: Pálka, Petr, et autres
Publié: (2024)
End-to-End Target Speaker Speech Recognition Using Context-Aware Attention Mechanisms for Challenging Enrollment Scenario
par: Ghane, Mohsen, et autres
Publié: (2025)
par: Ghane, Mohsen, et autres
Publié: (2025)
Emotional Styles Hide in Deep Speaker Embeddings: Disentangle Deep Speaker Embeddings for Speaker Clustering
par: Lin, Chaohao, et autres
Publié: (2025)
par: Lin, Chaohao, et autres
Publié: (2025)
Residual Speaker Representation for One-Shot Voice Conversion
par: Xu, Le, et autres
Publié: (2023)
par: Xu, Le, et autres
Publié: (2023)
Adaptive Data Augmentation with NaturalSpeech3 for Far-field Speaker Verification
par: Zhang, Li, et autres
Publié: (2025)
par: Zhang, Li, et autres
Publié: (2025)
Flow-TSVAD: Target-Speaker Voice Activity Detection via Latent Flow Matching
par: Chen, Zhengyang, et autres
Publié: (2024)
par: Chen, Zhengyang, et autres
Publié: (2024)
VoiceGuider: Enhancing Out-of-Domain Performance in Parameter-Efficient Speaker-Adaptive Text-to-Speech via Autoguidance
par: Yeom, Jiheum, et autres
Publié: (2024)
par: Yeom, Jiheum, et autres
Publié: (2024)
A Comprehensive Investigation on Speaker Augmentation for Speaker Recognition
par: Zhou, Zhenyu, et autres
Publié: (2024)
par: Zhou, Zhenyu, et autres
Publié: (2024)
End-to-End DOA-Guided Speech Extraction in Noisy Multi-Talker Scenarios
par: Jing, Kangqi, et autres
Publié: (2025)
par: Jing, Kangqi, et autres
Publié: (2025)
What Does the Speaker Embedding Encode?
par: Wang, Shuai, et autres
Publié: (2025)
par: Wang, Shuai, et autres
Publié: (2025)
Attacking Voice Anonymization Systems with Augmented Feature and Speaker Identity Difference
par: Zhang, Yanzhe, et autres
Publié: (2024)
par: Zhang, Yanzhe, et autres
Publié: (2024)
Target Speaker Extraction through Comparing Noisy Positive and Negative Audio Enrollments
par: Xu, Shitong, et autres
Publié: (2025)
par: Xu, Shitong, et autres
Publié: (2025)
Creating Personalized Synthetic Voices from Articulation Impaired Speech Using Augmented Reconstruction Loss
par: Tian, Yusheng, et autres
Publié: (2024)
par: Tian, Yusheng, et autres
Publié: (2024)
End-to-End Integration of Speech Emotion Recognition with Voice Activity Detection using Self-Supervised Learning Features
par: Yamashita, Natsuo, et autres
Publié: (2024)
par: Yamashita, Natsuo, et autres
Publié: (2024)
DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions
par: Xue, Ke, et autres
Publié: (2025)
par: Xue, Ke, et autres
Publié: (2025)
AS-Speech: Adaptive Style For Speech Synthesis
par: Li, Zhipeng, et autres
Publié: (2024)
par: Li, Zhipeng, et autres
Publié: (2024)
Spoken Language Corpora Augmentation with Domain-Specific Voice-Cloned Speech
par: Czyżnikiewicz, Mateusz, et autres
Publié: (2024)
par: Czyżnikiewicz, Mateusz, et autres
Publié: (2024)
Channel-Combination Algorithms for Robust Distant Voice Activity and Overlapped Speech Detection
par: Mariotte, Théo, et autres
Publié: (2024)
par: Mariotte, Théo, et autres
Publié: (2024)
Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion
par: Jin, Zhan, et autres
Publié: (2025)
par: Jin, Zhan, et autres
Publié: (2025)
PAS-SE: Personalized Auxiliary-Sensor Speech Enhancement for Voice Pickup in Hearables
par: Ohlenbusch, Mattes, et autres
Publié: (2025)
par: Ohlenbusch, Mattes, et autres
Publié: (2025)
Documents similaires
-
Multi-modal Speech Enhancement with Limited Electromyography Channels
par: Feng, Fuyuan, et autres
Publié: (2025) -
EEND-SAA: Enrollment-Less Main Speaker Voice Activity Detection Using Self-Attention Attractors
par: Wu, Wen-Yung, et autres
Publié: (2025) -
Unified Architecture and Unsupervised Speech Disentanglement for Speaker Embedding-Free Enrollment in Personalized Speech Enhancement
par: Huang, Ziling, et autres
Publié: (2025) -
Universal Speaker Embedding Free Target Speaker Extraction and Personal Voice Activity Detection
par: Zeng, Bang, et autres
Publié: (2025) -
Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization
par: Thienpondt, Jenthe, et autres
Publié: (2024)