Target Speaker Extraction by Directly Exploiting Contextual Information in the Time-Frequency Domain
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Xue, Bao, Changchun, Zhou, Jing, Chen, Xianhong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions
di: Xue, Ke, et al.
Pubblicazione: (2025)
di: Xue, Ke, et al.
Pubblicazione: (2025)
Multi-View Based Audio Visual Target Speaker Extraction
di: Yang, Peijun, et al.
Pubblicazione: (2026)
di: Yang, Peijun, et al.
Pubblicazione: (2026)
Multi-Level Speaker Representation for Target Speaker Extraction
di: Zhang, Ke, et al.
Pubblicazione: (2024)
di: Zhang, Ke, et al.
Pubblicazione: (2024)
EvoTSE: Evolving Enrollment for Target Speaker Extraction
di: Liu, Zikai, et al.
Pubblicazione: (2026)
di: Liu, Zikai, et al.
Pubblicazione: (2026)
Adaptive Deterministic Flow Matching for Target Speaker Extraction
di: Hsieh, Tsun-An, et al.
Pubblicazione: (2025)
di: Hsieh, Tsun-An, et al.
Pubblicazione: (2025)
3S-TSE: Efficient Three-Stage Target Speaker Extraction for Real-Time and Low-Resource Applications
di: He, Shulin, et al.
Pubblicazione: (2023)
di: He, Shulin, et al.
Pubblicazione: (2023)
Target Speaker Extraction with Curriculum Learning
di: Liu, Yun, et al.
Pubblicazione: (2024)
di: Liu, Yun, et al.
Pubblicazione: (2024)
Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling
di: Wu, Shu, et al.
Pubblicazione: (2025)
di: Wu, Shu, et al.
Pubblicazione: (2025)
Effective Modeling of Critical Contextual Information for TDNN-based Speaker Verification
di: Weng, Shilong, et al.
Pubblicazione: (2025)
di: Weng, Shilong, et al.
Pubblicazione: (2025)
Listen to Extract: Onset-Prompted Target Speaker Extraction
di: Shen, Pengjie, et al.
Pubblicazione: (2025)
di: Shen, Pengjie, et al.
Pubblicazione: (2025)
MC-LExt: Multi-Channel Target Speaker Extraction with Onset-Prompted Speaker Conditioning Mechanism
di: Ling, Tongtao, et al.
Pubblicazione: (2025)
di: Ling, Tongtao, et al.
Pubblicazione: (2025)
TGIF: Talker Group-Informed Familiarization of Target Speaker Extraction
di: Hsieh, Tsun-An, et al.
Pubblicazione: (2025)
di: Hsieh, Tsun-An, et al.
Pubblicazione: (2025)
Detect, Attend and Extract: Keyword Guided Target Speaker Extraction
di: Li, Haoyu, et al.
Pubblicazione: (2026)
di: Li, Haoyu, et al.
Pubblicazione: (2026)
GAN-Based Multi-Microphone Spatial Target Speaker Extraction
di: Shetu, Shrishti Saha, et al.
Pubblicazione: (2025)
di: Shetu, Shrishti Saha, et al.
Pubblicazione: (2025)
Neural Network-Based Time-Frequency-Bin-Wise Linear Combination of Beamformers for Underdetermined Target Source Extraction
di: Chen, Changda, et al.
Pubblicazione: (2026)
di: Chen, Changda, et al.
Pubblicazione: (2026)
USEF-TSE: Universal Speaker Embedding Free Target Speaker Extraction
di: Zeng, Bang, et al.
Pubblicazione: (2024)
di: Zeng, Bang, et al.
Pubblicazione: (2024)
Improved Feature Extraction Network for Neuro-Oriented Target Speaker Extraction
di: Fan, Cunhang, et al.
Pubblicazione: (2025)
di: Fan, Cunhang, et al.
Pubblicazione: (2025)
On the effectiveness of enrollment speech augmentation for Target Speaker Extraction
di: Li, Junjie, et al.
Pubblicazione: (2024)
di: Li, Junjie, et al.
Pubblicazione: (2024)
Binaural Target Speaker Extraction using Individualized HRTF
di: Ellinson, Yoav, et al.
Pubblicazione: (2025)
di: Ellinson, Yoav, et al.
Pubblicazione: (2025)
Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction
di: Korse, Srikanth, et al.
Pubblicazione: (2025)
di: Korse, Srikanth, et al.
Pubblicazione: (2025)
Universal Speaker Embedding Free Target Speaker Extraction and Personal Voice Activity Detection
di: Zeng, Bang, et al.
Pubblicazione: (2025)
di: Zeng, Bang, et al.
Pubblicazione: (2025)
Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
An Investigation on Speaker Augmentation for End-to-End Speaker Extraction
di: You, Zhenghai, et al.
Pubblicazione: (2025)
di: You, Zhenghai, et al.
Pubblicazione: (2025)
pTSE-T: Presentation Target Speaker Extraction using Unaligned Text Cues
di: Jiang, Ziyang, et al.
Pubblicazione: (2024)
di: Jiang, Ziyang, et al.
Pubblicazione: (2024)
Robust Target Speaker Direction of Arrival Estimation
di: Li, Zixuan, et al.
Pubblicazione: (2024)
di: Li, Zixuan, et al.
Pubblicazione: (2024)
Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR
di: Ma, Hao, et al.
Pubblicazione: (2025)
di: Ma, Hao, et al.
Pubblicazione: (2025)
Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data
di: Liu, Yun, et al.
Pubblicazione: (2024)
di: Liu, Yun, et al.
Pubblicazione: (2024)
Inter-Speaker Relative Cues for Two-Stage Text-Guided Target Speech Extraction
di: Dai, Wang, et al.
Pubblicazione: (2026)
di: Dai, Wang, et al.
Pubblicazione: (2026)
MeanFlow-TSE: One-Step Generative Target Speaker Extraction with Mean Flow
di: Shimizu, Riki, et al.
Pubblicazione: (2025)
di: Shimizu, Riki, et al.
Pubblicazione: (2025)
Beyond Speaker Identity: Text Guided Target Speech Extraction
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction
di: Fan, Cunhang, et al.
Pubblicazione: (2025)
di: Fan, Cunhang, et al.
Pubblicazione: (2025)
Binaural Selective Attention Model for Target Speaker Extraction
di: Meng, Hanyu, et al.
Pubblicazione: (2024)
di: Meng, Hanyu, et al.
Pubblicazione: (2024)
Two-stage Audio-Visual Target Speaker Extraction System for Real-Time Processing On Edge Device
di: Li, Zixuan, et al.
Pubblicazione: (2025)
di: Li, Zixuan, et al.
Pubblicazione: (2025)
Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction
di: Dai, Wang, et al.
Pubblicazione: (2025)
di: Dai, Wang, et al.
Pubblicazione: (2025)
HRTF-guided Binaural Target Speaker Extraction with Real-World Validation
di: Ellinson, Yoav, et al.
Pubblicazione: (2026)
di: Ellinson, Yoav, et al.
Pubblicazione: (2026)
Discriminative-Generative Target Speaker Extraction with Decoder-Only Language Models
di: Zeng, Bang, et al.
Pubblicazione: (2026)
di: Zeng, Bang, et al.
Pubblicazione: (2026)
Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion
di: Jin, Zhan, et al.
Pubblicazione: (2025)
di: Jin, Zhan, et al.
Pubblicazione: (2025)
Listening for "You": Enhancing Speech Image Retrieval via Target Speaker Extraction
di: Yang, Wenhao, et al.
Pubblicazione: (2025)
di: Yang, Wenhao, et al.
Pubblicazione: (2025)
Speech Enhancement with Dual-path Multi-Channel Linear Prediction Filter and Multi-norm Beamforming
di: Qin, Chengyuan, et al.
Pubblicazione: (2025)
di: Qin, Chengyuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DualStream Contextual Fusion Network: Efficient Target Speaker Extraction by Leveraging Mixture and Enrollment Interactions
di: Xue, Ke, et al.
Pubblicazione: (2025) -
Multi-View Based Audio Visual Target Speaker Extraction
di: Yang, Peijun, et al.
Pubblicazione: (2026) -
Multi-Level Speaker Representation for Target Speaker Extraction
di: Zhang, Ke, et al.
Pubblicazione: (2024) -
EvoTSE: Evolving Enrollment for Target Speaker Extraction
di: Liu, Zikai, et al.
Pubblicazione: (2026) -
Adaptive Deterministic Flow Matching for Target Speaker Extraction
di: Hsieh, Tsun-An, et al.
Pubblicazione: (2025)