Multi-View Based Audio Visual Target Speaker Extraction
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Peijun, Jin, Zhan, Liu, Juan, Li, Ming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion
di: Jin, Zhan, et al.
Pubblicazione: (2025)
di: Jin, Zhan, et al.
Pubblicazione: (2025)
Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Speaker Diarization
di: Cheng, Ming, et al.
Pubblicazione: (2024)
di: Cheng, Ming, et al.
Pubblicazione: (2024)
Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025)
Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
Multi-Level Speaker Representation for Target Speaker Extraction
di: Zhang, Ke, et al.
Pubblicazione: (2024)
di: Zhang, Ke, et al.
Pubblicazione: (2024)
USEF-TSE: Universal Speaker Embedding Free Target Speaker Extraction
di: Zeng, Bang, et al.
Pubblicazione: (2024)
di: Zeng, Bang, et al.
Pubblicazione: (2024)
Online Audio-Visual Autoregressive Speaker Extraction
di: Pan, Zexu, et al.
Pubblicazione: (2025)
di: Pan, Zexu, et al.
Pubblicazione: (2025)
GAN-Based Multi-Microphone Spatial Target Speaker Extraction
di: Shetu, Shrishti Saha, et al.
Pubblicazione: (2025)
di: Shetu, Shrishti Saha, et al.
Pubblicazione: (2025)
Universal Speaker Embedding Free Target Speaker Extraction and Personal Voice Activity Detection
di: Zeng, Bang, et al.
Pubblicazione: (2025)
di: Zeng, Bang, et al.
Pubblicazione: (2025)
Two-stage Audio-Visual Target Speaker Extraction System for Real-Time Processing On Edge Device
di: Li, Zixuan, et al.
Pubblicazione: (2025)
di: Li, Zixuan, et al.
Pubblicazione: (2025)
Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
di: Kwak, Doyeop, et al.
Pubblicazione: (2026)
EvoTSE: Evolving Enrollment for Target Speaker Extraction
di: Liu, Zikai, et al.
Pubblicazione: (2026)
di: Liu, Zikai, et al.
Pubblicazione: (2026)
Target Speaker Extraction with Curriculum Learning
di: Liu, Yun, et al.
Pubblicazione: (2024)
di: Liu, Yun, et al.
Pubblicazione: (2024)
MC-LExt: Multi-Channel Target Speaker Extraction with Onset-Prompted Speaker Conditioning Mechanism
di: Ling, Tongtao, et al.
Pubblicazione: (2025)
di: Ling, Tongtao, et al.
Pubblicazione: (2025)
Discriminative-Generative Target Speaker Extraction with Decoder-Only Language Models
di: Zeng, Bang, et al.
Pubblicazione: (2026)
di: Zeng, Bang, et al.
Pubblicazione: (2026)
Audio-Visual Speech Enhancement In Complex Scenarios With Separation And Dereverberation Joint Modeling
di: Du, Jiarong, et al.
Pubblicazione: (2025)
di: Du, Jiarong, et al.
Pubblicazione: (2025)
Detect, Attend and Extract: Keyword Guided Target Speaker Extraction
di: Li, Haoyu, et al.
Pubblicazione: (2026)
di: Li, Haoyu, et al.
Pubblicazione: (2026)
Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction
di: Korse, Srikanth, et al.
Pubblicazione: (2025)
di: Korse, Srikanth, et al.
Pubblicazione: (2025)
Adaptive Deterministic Flow Matching for Target Speaker Extraction
di: Hsieh, Tsun-An, et al.
Pubblicazione: (2025)
di: Hsieh, Tsun-An, et al.
Pubblicazione: (2025)
Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling
di: Wu, Shu, et al.
Pubblicazione: (2025)
di: Wu, Shu, et al.
Pubblicazione: (2025)
Target Speaker Extraction by Directly Exploiting Contextual Information in the Time-Frequency Domain
di: Yang, Xue, et al.
Pubblicazione: (2024)
di: Yang, Xue, et al.
Pubblicazione: (2024)
On the effectiveness of enrollment speech augmentation for Target Speaker Extraction
di: Li, Junjie, et al.
Pubblicazione: (2024)
di: Li, Junjie, et al.
Pubblicazione: (2024)
Target Speaker Extraction through Comparing Noisy Positive and Negative Audio Enrollments
di: Xu, Shitong, et al.
Pubblicazione: (2025)
di: Xu, Shitong, et al.
Pubblicazione: (2025)
Flexible Multi-Channel Target Speaker Extraction Using Geometry-Conditioned Spatially Selective Non-linear Filters
di: Li, Jiatong, et al.
Pubblicazione: (2026)
di: Li, Jiatong, et al.
Pubblicazione: (2026)
TGIF: Talker Group-Informed Familiarization of Target Speaker Extraction
di: Hsieh, Tsun-An, et al.
Pubblicazione: (2025)
di: Hsieh, Tsun-An, et al.
Pubblicazione: (2025)
Libri2Vox Dataset: Target Speaker Extraction with Diverse Speaker Conditions and Synthetic Data
di: Liu, Yun, et al.
Pubblicazione: (2024)
di: Liu, Yun, et al.
Pubblicazione: (2024)
Multi-Channel Multi-Speaker ASR Using Target Speaker's Solo Segment
di: Shao, Yiwen, et al.
Pubblicazione: (2024)
di: Shao, Yiwen, et al.
Pubblicazione: (2024)
$C^2$AV-TSE: Context and Confidence-aware Audio Visual Target Speaker Extraction
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
di: Wu, Wenxuan, et al.
Pubblicazione: (2025)
Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR
di: Ma, Hao, et al.
Pubblicazione: (2025)
di: Ma, Hao, et al.
Pubblicazione: (2025)
Beyond Lips: Integrating Gesture and Lip Cues for Robust Audio-visual Speaker Extraction
di: Pan, Zexu, et al.
Pubblicazione: (2026)
di: Pan, Zexu, et al.
Pubblicazione: (2026)
Improved Feature Extraction Network for Neuro-Oriented Target Speaker Extraction
di: Fan, Cunhang, et al.
Pubblicazione: (2025)
di: Fan, Cunhang, et al.
Pubblicazione: (2025)
Beyond Speaker Identity: Text Guided Target Speech Extraction
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
Listen to Extract: Onset-Prompted Target Speaker Extraction
di: Shen, Pengjie, et al.
Pubblicazione: (2025)
di: Shen, Pengjie, et al.
Pubblicazione: (2025)
Binaural Target Speaker Extraction using Individualized HRTF
di: Ellinson, Yoav, et al.
Pubblicazione: (2025)
di: Ellinson, Yoav, et al.
Pubblicazione: (2025)
M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction
di: Fan, Cunhang, et al.
Pubblicazione: (2025)
di: Fan, Cunhang, et al.
Pubblicazione: (2025)
TSELM: Target Speaker Extraction using Discrete Tokens and Language Models
di: Tang, Beilong, et al.
Pubblicazione: (2024)
di: Tang, Beilong, et al.
Pubblicazione: (2024)
RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
di: Pan, Tianrui, et al.
Pubblicazione: (2024)
Inter-Speaker Relative Cues for Two-Stage Text-Guided Target Speech Extraction
di: Dai, Wang, et al.
Pubblicazione: (2026)
di: Dai, Wang, et al.
Pubblicazione: (2026)
MeanFlow-TSE: One-Step Generative Target Speaker Extraction with Mean Flow
di: Shimizu, Riki, et al.
Pubblicazione: (2025)
di: Shimizu, Riki, et al.
Pubblicazione: (2025)
3S-TSE: Efficient Three-Stage Target Speaker Extraction for Real-Time and Low-Resource Applications
di: He, Shulin, et al.
Pubblicazione: (2023)
di: He, Shulin, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion
di: Jin, Zhan, et al.
Pubblicazione: (2025) -
Multi-Input Multi-Output Target-Speaker Voice Activity Detection For Unified, Flexible, and Robust Audio-Visual Speaker Diarization
di: Cheng, Ming, et al.
Pubblicazione: (2024) -
Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation
di: Zhang, Jing-Xuan, et al.
Pubblicazione: (2025) -
Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention
di: Tao, Ruijie, et al.
Pubblicazione: (2024) -
Multi-Level Speaker Representation for Target Speaker Extraction
di: Zhang, Ke, et al.
Pubblicazione: (2024)