Voice Conversion Augmentation for Speaker Recognition on Defective Datasets
Fuente:
arXiv
Guardado en:
| Autores principales: | Tao, Ruijie, Shi, Zhan, Jiang, Yidi, Liu, Tianchi, Li, Haizhou |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multi-Stage Face-Voice Association Learning with Keynote Speaker Diarization
por: Tao, Ruijie, et al.
Publicado: (2024)
por: Tao, Ruijie, et al.
Publicado: (2024)
Interpolating Speaker Identities in Embedding Space for Data Expansion
por: Liu, Tianchi, et al.
Publicado: (2025)
por: Liu, Tianchi, et al.
Publicado: (2025)
Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention
por: Tao, Ruijie, et al.
Publicado: (2024)
por: Tao, Ruijie, et al.
Publicado: (2024)
PhiNet: Speaker Verification with Phonetic Interpretability
por: Ma, Yi, et al.
Publicado: (2026)
por: Ma, Yi, et al.
Publicado: (2026)
Target Speech Diarization with Multimodal Prompts
por: Jiang, Yidi, et al.
Publicado: (2024)
por: Jiang, Yidi, et al.
Publicado: (2024)
Golden Gemini is All You Need: Finding the Sweet Spots for Speaker Verification
por: Liu, Tianchi, et al.
Publicado: (2023)
por: Liu, Tianchi, et al.
Publicado: (2023)
Prompt-driven Target Speech Diarization
por: Jiang, Yidi, et al.
Publicado: (2023)
por: Jiang, Yidi, et al.
Publicado: (2023)
Detect, Attend and Extract: Keyword Guided Target Speaker Extraction
por: Li, Haoyu, et al.
Publicado: (2026)
por: Li, Haoyu, et al.
Publicado: (2026)
ExPO: Explainable Phonetic Trait-Oriented Network for Speaker Verification
por: Ma, Yi, et al.
Publicado: (2025)
por: Ma, Yi, et al.
Publicado: (2025)
Residual Speaker Representation for One-Shot Voice Conversion
por: Xu, Le, et al.
Publicado: (2023)
por: Xu, Le, et al.
Publicado: (2023)
A Comprehensive Investigation on Speaker Augmentation for Speaker Recognition
por: Zhou, Zhenyu, et al.
Publicado: (2024)
por: Zhou, Zhenyu, et al.
Publicado: (2024)
Flow-TSVAD: Target-Speaker Voice Activity Detection via Latent Flow Matching
por: Chen, Zhengyang, et al.
Publicado: (2024)
por: Chen, Zhengyang, et al.
Publicado: (2024)
USED: Universal Speaker Extraction and Diarization
por: Ao, Junyi, et al.
Publicado: (2023)
por: Ao, Junyi, et al.
Publicado: (2023)
Enhancing Real-World Active Speaker Detection with Multi-Modal Extraction Pre-Training
por: Tao, Ruijie, et al.
Publicado: (2024)
por: Tao, Ruijie, et al.
Publicado: (2024)
RefXVC: Cross-Lingual Voice Conversion with Enhanced Reference Leveraging
por: Zhang, Mingyang, et al.
Publicado: (2024)
por: Zhang, Mingyang, et al.
Publicado: (2024)
Generating Novel and Realistic Speakers for Voice Conversion
por: Chen, Meiying Melissa, et al.
Publicado: (2025)
por: Chen, Meiying Melissa, et al.
Publicado: (2025)
How Do Neural Spoofing Countermeasures Detect Partially Spoofed Audio?
por: Liu, Tianchi, et al.
Publicado: (2024)
por: Liu, Tianchi, et al.
Publicado: (2024)
Descriptor:: Extended-Length Audio Dataset for Synthetic Voice Detection and Speaker Recognition (ELAD-SVDSR)
por: Vijaykumar, Rahul, et al.
Publicado: (2025)
por: Vijaykumar, Rahul, et al.
Publicado: (2025)
Unified Audio Event Detection
por: Jiang, Yidi, et al.
Publicado: (2024)
por: Jiang, Yidi, et al.
Publicado: (2024)
JoyVoice: Long-Context Conditioning for Anthropomorphic Multi-Speaker Conversational Synthesis
por: Yu, Fan, et al.
Publicado: (2025)
por: Yu, Fan, et al.
Publicado: (2025)
Towards Naturalistic Voice Conversion: NaturalVoices Dataset with an Automatic Processing Pipeline
por: Salman, Ali N., et al.
Publicado: (2024)
por: Salman, Ali N., et al.
Publicado: (2024)
Emotion Recognition in Multi-Speaker Conversations through Speaker Identification, Knowledge Distillation, and Hierarchical Fusion
por: Li, Xiao, et al.
Publicado: (2025)
por: Li, Xiao, et al.
Publicado: (2025)
Language-Invariant Multilingual Speaker Verification for the TidyVoice 2026 Challenge
por: Li, Ze, et al.
Publicado: (2026)
por: Li, Ze, et al.
Publicado: (2026)
M-Vec: Matryoshka Speaker Embeddings with Flexible Dimensions
por: Wang, Shuai, et al.
Publicado: (2024)
por: Wang, Shuai, et al.
Publicado: (2024)
TidyVoice: A Curated Multilingual Dataset for Speaker Verification Derived from Common Voice
por: Farhadipour, Aref, et al.
Publicado: (2026)
por: Farhadipour, Aref, et al.
Publicado: (2026)
Adaptive Speaker Embedding Self-Augmentation for Personal Voice Activity Detection with Short Enrollment Speech
por: Feng, Fuyuan, et al.
Publicado: (2026)
por: Feng, Fuyuan, et al.
Publicado: (2026)
Attacking Voice Anonymization Systems with Augmented Feature and Speaker Identity Difference
por: Zhang, Yanzhe, et al.
Publicado: (2024)
por: Zhang, Yanzhe, et al.
Publicado: (2024)
Multi-Level Speaker Representation for Target Speaker Extraction
por: Zhang, Ke, et al.
Publicado: (2024)
por: Zhang, Ke, et al.
Publicado: (2024)
Xi+: Uncertainty Supervision for Robust Speaker Embedding
por: Li, Junjie, et al.
Publicado: (2025)
por: Li, Junjie, et al.
Publicado: (2025)
Multi-level Temporal-channel Speaker Retrieval for Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2023)
por: Wang, Zhichao, et al.
Publicado: (2023)
Overview of Speaker Modeling and Its Applications: From the Lens of Deep Speaker Representation Learning
por: Wang, Shuai, et al.
Publicado: (2024)
por: Wang, Shuai, et al.
Publicado: (2024)
SA-WavLM: Speaker-Aware Self-Supervised Pre-training for Mixture Speech
por: Lin, Jingru, et al.
Publicado: (2024)
por: Lin, Jingru, et al.
Publicado: (2024)
UniTalker: Conversational Speech-Visual Synthesis
por: Hu, Yifan, et al.
Publicado: (2025)
por: Hu, Yifan, et al.
Publicado: (2025)
Quantifying Source Speaker Leakage in One-to-One Voice Conversion
por: Wellington, Scott, et al.
Publicado: (2025)
por: Wellington, Scott, et al.
Publicado: (2025)
Emphasized Non-Target Speaker Knowledge in Knowledge Distillation for Automatic Speaker Verification
por: Truong, Duc-Tuan, et al.
Publicado: (2023)
por: Truong, Duc-Tuan, et al.
Publicado: (2023)
Study on Inter and Intra Speaker Variability in Speaker Recognition
por: Okhotnikov, Anton, et al.
Publicado: (2024)
por: Okhotnikov, Anton, et al.
Publicado: (2024)
ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization
por: Ren, Pengyu, et al.
Publicado: (2025)
por: Ren, Pengyu, et al.
Publicado: (2025)
Leveraging Language Information for Target Language Extraction
por: Yıldırım, Mehmet Sinan, et al.
Publicado: (2025)
por: Yıldırım, Mehmet Sinan, et al.
Publicado: (2025)
VoiceVector: Multimodal Enrolment Vectors for Speaker Separation
por: Rahimi, Akam, et al.
Publicado: (2025)
por: Rahimi, Akam, et al.
Publicado: (2025)
DreamVoice: Text-Guided Voice Conversion
por: Hai, Jiarui, et al.
Publicado: (2024)
por: Hai, Jiarui, et al.
Publicado: (2024)
Ejemplares similares
-
Multi-Stage Face-Voice Association Learning with Keynote Speaker Diarization
por: Tao, Ruijie, et al.
Publicado: (2024) -
Interpolating Speaker Identities in Embedding Space for Data Expansion
por: Liu, Tianchi, et al.
Publicado: (2025) -
Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention
por: Tao, Ruijie, et al.
Publicado: (2024) -
PhiNet: Speaker Verification with Phonetic Interpretability
por: Ma, Yi, et al.
Publicado: (2026) -
Target Speech Diarization with Multimodal Prompts
por: Jiang, Yidi, et al.
Publicado: (2024)