Training-Free Multi-Step Inference for Target Speaker Extraction
Fuente:
arXiv
Guardado en:
| Autores principales: | You, Zhenghai, Shi, Ying, Li, Lantian, Wang, Dong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
An Investigation on Speaker Augmentation for End-to-End Speaker Extraction
por: You, Zhenghai, et al.
Publicado: (2025)
por: You, Zhenghai, et al.
Publicado: (2025)
A Comprehensive Investigation on Speaker Augmentation for Speaker Recognition
por: Zhou, Zhenyu, et al.
Publicado: (2024)
por: Zhou, Zhenyu, et al.
Publicado: (2024)
Multi-Level Speaker Representation for Target Speaker Extraction
por: Zhang, Ke, et al.
Publicado: (2024)
por: Zhang, Ke, et al.
Publicado: (2024)
SE/BN Adapter: Parametric Efficient Domain Adaptation for Speaker Recognition
por: Wang, Tianhao, et al.
Publicado: (2024)
por: Wang, Tianhao, et al.
Publicado: (2024)
MT-HuBERT: Self-Supervised Mix-Training for Few-Shot Keyword Spotting in Mixed Speech
por: Yuan, Junming, et al.
Publicado: (2025)
por: Yuan, Junming, et al.
Publicado: (2025)
Training Dynamics-Aware Multi-Factor Curriculum Learning for Target Speaker Extraction
por: Liu, Yun, et al.
Publicado: (2026)
por: Liu, Yun, et al.
Publicado: (2026)
USEF-TSE: Universal Speaker Embedding Free Target Speaker Extraction
por: Zeng, Bang, et al.
Publicado: (2024)
por: Zeng, Bang, et al.
Publicado: (2024)
Serialized Output Training by Learned Dominance
por: Shi, Ying, et al.
Publicado: (2024)
por: Shi, Ying, et al.
Publicado: (2024)
Universal Speaker Embedding Free Target Speaker Extraction and Personal Voice Activity Detection
por: Zeng, Bang, et al.
Publicado: (2025)
por: Zeng, Bang, et al.
Publicado: (2025)
AlphaFlowTSE: One-Step Generative Target Speaker Extraction via Conditional AlphaFlow
por: Li, Duojia, et al.
Publicado: (2026)
por: Li, Duojia, et al.
Publicado: (2026)
Adversarial Data Augmentation for Robust Speaker Verification
por: Zhou, Zhenyu, et al.
Publicado: (2024)
por: Zhou, Zhenyu, et al.
Publicado: (2024)
Unmixing the Crowd: Learning Mixture-to-Set Speaker Embeddings for Enrollment-Free Target Speech Extraction
por: Sidharth, FNU, et al.
Publicado: (2026)
por: Sidharth, FNU, et al.
Publicado: (2026)
Brainprint-Modulated Target Speaker Extraction
por: Han, Qiushi, et al.
Publicado: (2025)
por: Han, Qiushi, et al.
Publicado: (2025)
On the effectiveness of enrollment speech augmentation for Target Speaker Extraction
por: Li, Junjie, et al.
Publicado: (2024)
por: Li, Junjie, et al.
Publicado: (2024)
Neural Scoring: A Refreshed End-to-End Approach for Speaker Recognition in Complex Conditions
por: Lin, Wan, et al.
Publicado: (2024)
por: Lin, Wan, et al.
Publicado: (2024)
Target Speaker Extraction with Curriculum Learning
por: Liu, Yun, et al.
Publicado: (2024)
por: Liu, Yun, et al.
Publicado: (2024)
Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling
por: Wu, Shu, et al.
Publicado: (2025)
por: Wu, Shu, et al.
Publicado: (2025)
Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention
por: Tao, Ruijie, et al.
Publicado: (2024)
por: Tao, Ruijie, et al.
Publicado: (2024)
Discriminative-Generative Target Speaker Extraction with Decoder-Only Language Models
por: Zeng, Bang, et al.
Publicado: (2026)
por: Zeng, Bang, et al.
Publicado: (2026)
M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction
por: Fan, Cunhang, et al.
Publicado: (2025)
por: Fan, Cunhang, et al.
Publicado: (2025)
Listen to Extract: Onset-Prompted Target Speaker Extraction
por: Shen, Pengjie, et al.
Publicado: (2025)
por: Shen, Pengjie, et al.
Publicado: (2025)
Improved Feature Extraction Network for Neuro-Oriented Target Speaker Extraction
por: Fan, Cunhang, et al.
Publicado: (2025)
por: Fan, Cunhang, et al.
Publicado: (2025)
Beyond Speaker Identity: Text Guided Target Speech Extraction
por: Huo, Mingyue, et al.
Publicado: (2025)
por: Huo, Mingyue, et al.
Publicado: (2025)
Binaural Target Speaker Extraction using Individualized HRTF
por: Ellinson, Yoav, et al.
Publicado: (2025)
por: Ellinson, Yoav, et al.
Publicado: (2025)
Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction
por: Dai, Wang, et al.
Publicado: (2025)
por: Dai, Wang, et al.
Publicado: (2025)
Two-stage Audio-Visual Target Speaker Extraction System for Real-Time Processing On Edge Device
por: Li, Zixuan, et al.
Publicado: (2025)
por: Li, Zixuan, et al.
Publicado: (2025)
WeSep: A Scalable and Flexible Toolkit Towards Generalizable Target Speaker Extraction
por: Wang, Shuai, et al.
Publicado: (2024)
por: Wang, Shuai, et al.
Publicado: (2024)
Speaker Targeting via Self-Speaker Adaptation for Multi-talker ASR
por: Wang, Weiqing, et al.
Publicado: (2025)
por: Wang, Weiqing, et al.
Publicado: (2025)
Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data
por: Liu, Yun, et al.
Publicado: (2024)
por: Liu, Yun, et al.
Publicado: (2024)
Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR
por: Ma, Hao, et al.
Publicado: (2025)
por: Ma, Hao, et al.
Publicado: (2025)
Towards Streaming Target Speaker Extraction via Chunk-wise Interleaved Splicing of Autoregressive Language Model
por: Peng, Shuhai, et al.
Publicado: (2026)
por: Peng, Shuhai, et al.
Publicado: (2026)
Binaural Selective Attention Model for Target Speaker Extraction
por: Meng, Hanyu, et al.
Publicado: (2024)
por: Meng, Hanyu, et al.
Publicado: (2024)
FlowTSE: Target Speaker Extraction with Flow Matching
por: Navon, Aviv, et al.
Publicado: (2025)
por: Navon, Aviv, et al.
Publicado: (2025)
HRTF-guided Binaural Target Speaker Extraction with Real-World Validation
por: Ellinson, Yoav, et al.
Publicado: (2026)
por: Ellinson, Yoav, et al.
Publicado: (2026)
TSELM: Target Speaker Extraction using Discrete Tokens and Language Models
por: Tang, Beilong, et al.
Publicado: (2024)
por: Tang, Beilong, et al.
Publicado: (2024)
USED: Universal Speaker Extraction and Diarization
por: Ao, Junyi, et al.
Publicado: (2023)
por: Ao, Junyi, et al.
Publicado: (2023)
Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion
por: Jin, Zhan, et al.
Publicado: (2025)
por: Jin, Zhan, et al.
Publicado: (2025)
Multi-Target Backdoor Attacks Against Speaker Recognition
por: Fortier, Alexandrine, et al.
Publicado: (2025)
por: Fortier, Alexandrine, et al.
Publicado: (2025)
Mask2Flow-TSE: Two-Stage Target Speaker Extraction with Masking and Flow Matching
por: Moon, Junwon, et al.
Publicado: (2026)
por: Moon, Junwon, et al.
Publicado: (2026)
Training-Free Multi-Step Audio Source Separation
por: Zang, Yongyi, et al.
Publicado: (2025)
por: Zang, Yongyi, et al.
Publicado: (2025)
Ejemplares similares
-
An Investigation on Speaker Augmentation for End-to-End Speaker Extraction
por: You, Zhenghai, et al.
Publicado: (2025) -
A Comprehensive Investigation on Speaker Augmentation for Speaker Recognition
por: Zhou, Zhenyu, et al.
Publicado: (2024) -
Multi-Level Speaker Representation for Target Speaker Extraction
por: Zhang, Ke, et al.
Publicado: (2024) -
SE/BN Adapter: Parametric Efficient Domain Adaptation for Speaker Recognition
por: Wang, Tianhao, et al.
Publicado: (2024) -
MT-HuBERT: Self-Supervised Mix-Training for Few-Shot Keyword Spotting in Mixed Speech
por: Yuan, Junming, et al.
Publicado: (2025)