Binaural Selective Attention Model for Target Speaker Extraction
Fuente:
arXiv
Salvato in:
| Autori principali: | Meng, Hanyu, Zhang, Qiquan, Zhang, Xiangyu, Sethu, Vidhyasaharan, Ambikairajah, Eliathamby |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
What is Learnt by the LEArnable Front-end (LEAF)? Adapting Per-Channel Energy Normalisation (PCEN) to Noisy Conditions
di: Meng, Hanyu, et al.
Pubblicazione: (2024)
di: Meng, Hanyu, et al.
Pubblicazione: (2024)
Adaptive Per-Channel Energy Normalization Front-end for Robust Audio Signal Processing
di: Meng, Hanyu, et al.
Pubblicazione: (2025)
di: Meng, Hanyu, et al.
Pubblicazione: (2025)
Blind Estimation of Sub-band Acoustic Parameters from Ambisonics Recordings using Spectro-Spatial Covariance Features
di: Meng, Hanyu, et al.
Pubblicazione: (2024)
di: Meng, Hanyu, et al.
Pubblicazione: (2024)
Should Audio Front-ends be Adaptive? Comparing Learnable and Adaptive Front-ends
di: Zhang, Qiquan, et al.
Pubblicazione: (2025)
di: Zhang, Qiquan, et al.
Pubblicazione: (2025)
Mamba in Speech: Towards an Alternative to Self-Attention
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)
An Empirical Study on the Impact of Positional Encoding in Transformer-based Monaural Speech Enhancement
di: Zhang, Qiquan, et al.
Pubblicazione: (2024)
di: Zhang, Qiquan, et al.
Pubblicazione: (2024)
Comparison of Frequency-Fusion Mechanisms for Binaural Direction-of-Arrival Estimation for Multiple Speakers
di: Fejgin, Daniel, et al.
Pubblicazione: (2024)
di: Fejgin, Daniel, et al.
Pubblicazione: (2024)
Characterization of Speech Similarity Between Australian Aboriginal and High-Resource Languages: A Case Study on Dharawal
di: Dang, Ting, et al.
Pubblicazione: (2025)
di: Dang, Ting, et al.
Pubblicazione: (2025)
Exploiting an External Microphone for Binaural RTF-Vector-Based Direction of Arrival Estimation for Multiple Speakers
di: Fejgin, Daniel, et al.
Pubblicazione: (2023)
di: Fejgin, Daniel, et al.
Pubblicazione: (2023)
SpeakerBeam-SS: Real-time Target Speaker Extraction with Lightweight Conv-TasNet and State Space Modeling
di: Sato, Hiroshi, et al.
Pubblicazione: (2024)
di: Sato, Hiroshi, et al.
Pubblicazione: (2024)
Binaural Target Speaker Extraction using Individualized HRTF
di: Ellinson, Yoav, et al.
Pubblicazione: (2025)
di: Ellinson, Yoav, et al.
Pubblicazione: (2025)
A Novel Markovian Framework for Integrating Absolute and Relative Ordinal Emotion Information
di: Wu, Jingyao, et al.
Pubblicazione: (2021)
di: Wu, Jingyao, et al.
Pubblicazione: (2021)
HRTF-guided Binaural Target Speaker Extraction with Real-World Validation
di: Ellinson, Yoav, et al.
Pubblicazione: (2026)
di: Ellinson, Yoav, et al.
Pubblicazione: (2026)
Do Music Source Separation Models Preserve Spatial Information in Binaural Audio?
di: Namballa, Richa, et al.
Pubblicazione: (2025)
di: Namballa, Richa, et al.
Pubblicazione: (2025)
Array-Aware Ambisonics and HRTF Encoding for Binaural Reproduction With Wearable Arrays
di: Gayer, Yhonatan, et al.
Pubblicazione: (2025)
di: Gayer, Yhonatan, et al.
Pubblicazione: (2025)
BRUDEX Database: Binaural Room Impulse Responses with Uniformly Distributed External Microphones
di: Fejgin, Daniel, et al.
Pubblicazione: (2023)
di: Fejgin, Daniel, et al.
Pubblicazione: (2023)
Audio-Visual Target Speaker Extraction with Reverse Selective Auditory Attention
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
di: Tao, Ruijie, et al.
Pubblicazione: (2024)
Online Similarity-and-Independence-Aware Beamformer for Low-latency Target Sound Extraction
di: Hiroe, Atsuo
Pubblicazione: (2023)
di: Hiroe, Atsuo
Pubblicazione: (2023)
Tracking of Intermittent and Moving Speakers : Dataset and Metrics
di: Iatariene, Taous, et al.
Pubblicazione: (2025)
di: Iatariene, Taous, et al.
Pubblicazione: (2025)
Multi-Level Speaker Representation for Target Speaker Extraction
di: Zhang, Ke, et al.
Pubblicazione: (2024)
di: Zhang, Ke, et al.
Pubblicazione: (2024)
AuralNet: Hierarchical Attention-based 3D Binaural Localization of Overlapping Speakers
di: Fu, Linya, et al.
Pubblicazione: (2025)
di: Fu, Linya, et al.
Pubblicazione: (2025)
Improved Feature Extraction Network for Neuro-Oriented Target Speaker Extraction
di: Fan, Cunhang, et al.
Pubblicazione: (2025)
di: Fan, Cunhang, et al.
Pubblicazione: (2025)
Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling
di: Wu, Shu, et al.
Pubblicazione: (2025)
di: Wu, Shu, et al.
Pubblicazione: (2025)
Completing Sets of Prototype Transfer Functions for Subspace-based Direction of Arrival Estimation of Multiple Speakers
di: Fejgin, Daniel, et al.
Pubblicazione: (2025)
di: Fejgin, Daniel, et al.
Pubblicazione: (2025)
AADNet: An End-to-End Deep Learning Model for Auditory Attention Decoding
di: Nguyen, Nhan Duc Thanh, et al.
Pubblicazione: (2024)
di: Nguyen, Nhan Duc Thanh, et al.
Pubblicazione: (2024)
Live Vocal Extraction from K-pop Performances
di: Kim, Yujin, et al.
Pubblicazione: (2025)
di: Kim, Yujin, et al.
Pubblicazione: (2025)
Speaker-Independent Acoustic-to-Articulatory Inversion through Multi-Channel Attention Discriminator
di: Chung, Woo-Jin, et al.
Pubblicazione: (2024)
di: Chung, Woo-Jin, et al.
Pubblicazione: (2024)
An Exploration of Length Generalization in Transformer-Based Speech Enhancement
di: Zhang, Qiquan, et al.
Pubblicazione: (2024)
di: Zhang, Qiquan, et al.
Pubblicazione: (2024)
Exploring Length Generalization For Transformer-based Speech Enhancement
di: Zhang, Qiquan, et al.
Pubblicazione: (2025)
di: Zhang, Qiquan, et al.
Pubblicazione: (2025)
Frequency-Based Alignment of EEG and Audio Signals Using Contrastive Learning and SincNet for Auditory Attention Detection
di: Liao, Yuan, et al.
Pubblicazione: (2025)
di: Liao, Yuan, et al.
Pubblicazione: (2025)
Neural Tracking of Sustained Attention, Attention Switching, and Natural Conversation in Audiovisual Environments using Mobile EEG
di: Wilroth, Johanna, et al.
Pubblicazione: (2026)
di: Wilroth, Johanna, et al.
Pubblicazione: (2026)
On the effectiveness of enrollment speech augmentation for Target Speaker Extraction
di: Li, Junjie, et al.
Pubblicazione: (2024)
di: Li, Junjie, et al.
Pubblicazione: (2024)
Target Speaker Extraction with Curriculum Learning
di: Liu, Yun, et al.
Pubblicazione: (2024)
di: Liu, Yun, et al.
Pubblicazione: (2024)
Listen to Extract: Onset-Prompted Target Speaker Extraction
di: Shen, Pengjie, et al.
Pubblicazione: (2025)
di: Shen, Pengjie, et al.
Pubblicazione: (2025)
A Multimodal Data Fusion Attention-Empowered Generative Adversarial Network for Real Time 3D Underwater Sound Speed Field Construction
di: Huang, Wei, et al.
Pubblicazione: (2025)
di: Huang, Wei, et al.
Pubblicazione: (2025)
Bird Vocalization Embedding Extraction Using Self-Supervised Disentangled Representation Learning
di: Shi, Runwu, et al.
Pubblicazione: (2024)
di: Shi, Runwu, et al.
Pubblicazione: (2024)
Wavelet-Based Time-Frequency Fingerprinting for Feature Extraction of Traditional Irish Music
di: Shore, Noah
Pubblicazione: (2025)
di: Shore, Noah
Pubblicazione: (2025)
Multi-Speaker DOA Estimation in Binaural Hearing Aids using Deep Learning and Speaker Count Fusion
di: Jazaeri, Farnaz, et al.
Pubblicazione: (2025)
di: Jazaeri, Farnaz, et al.
Pubblicazione: (2025)
SSM2Mel: State Space Model to Reconstruct Mel Spectrogram from the EEG
di: Fan, Cunhang, et al.
Pubblicazione: (2025)
di: Fan, Cunhang, et al.
Pubblicazione: (2025)
USEF-TSE: Universal Speaker Embedding Free Target Speaker Extraction
di: Zeng, Bang, et al.
Pubblicazione: (2024)
di: Zeng, Bang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
What is Learnt by the LEArnable Front-end (LEAF)? Adapting Per-Channel Energy Normalisation (PCEN) to Noisy Conditions
di: Meng, Hanyu, et al.
Pubblicazione: (2024) -
Adaptive Per-Channel Energy Normalization Front-end for Robust Audio Signal Processing
di: Meng, Hanyu, et al.
Pubblicazione: (2025) -
Blind Estimation of Sub-band Acoustic Parameters from Ambisonics Recordings using Spectro-Spatial Covariance Features
di: Meng, Hanyu, et al.
Pubblicazione: (2024) -
Should Audio Front-ends be Adaptive? Comparing Learnable and Adaptive Front-ends
di: Zhang, Qiquan, et al.
Pubblicazione: (2025) -
Mamba in Speech: Towards an Alternative to Self-Attention
di: Zhang, Xiangyu, et al.
Pubblicazione: (2024)