Inter-Speaker Relative Cues for Two-Stage Text-Guided Target Speech Extraction
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dai, Wang, Politis, Archontis, Virtanen, Tuomas |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction
par: Dai, Wang, et autres
Publié: (2025)
par: Dai, Wang, et autres
Publié: (2025)
Attractor-Based Speech Separation of Multiple Utterances by Unknown Number of Speakers
par: Wang, Yuzhu, et autres
Publié: (2025)
par: Wang, Yuzhu, et autres
Publié: (2025)
Reference Channel Selection by Multi-Channel Masking for End-to-End Multi-Channel Speech Enhancement
par: Dai, Wang, et autres
Publié: (2024)
par: Dai, Wang, et autres
Publié: (2024)
Moving Speaker Separation via Parallel Spectral-Spatial Processing
par: Wang, Yuzhu, et autres
Publié: (2026)
par: Wang, Yuzhu, et autres
Publié: (2026)
Dependence on Early and Late Reverberation of Single-Channel Speaker Distance Estimation
par: Neri, Michael, et autres
Publié: (2026)
par: Neri, Michael, et autres
Publié: (2026)
Multi-Utterance Speech Separation and Association Trained on Short Segments
par: Wang, Yuzhu, et autres
Publié: (2025)
par: Wang, Yuzhu, et autres
Publié: (2025)
Neural Ambisonics encoding for compact irregular microphone arrays
par: Heikkinen, Mikko, et autres
Publié: (2024)
par: Heikkinen, Mikko, et autres
Publié: (2024)
Speaker Distance Estimation in Enclosures from Single-Channel Audio
par: Neri, Michael, et autres
Publié: (2024)
par: Neri, Michael, et autres
Publié: (2024)
Beyond Omnidirectional: Neural Ambisonics Encoding for Arbitrary Microphone Directivity Patterns using Cross-Attention
par: Heikkinen, Mikko, et autres
Publié: (2026)
par: Heikkinen, Mikko, et autres
Publié: (2026)
Gen-A: Generalizing Ambisonics Neural Encoding to Unseen Microphone Arrays
par: Heikkinen, Mikko, et autres
Publié: (2025)
par: Heikkinen, Mikko, et autres
Publié: (2025)
Score-informed Music Source Separation: Improving Synthetic-to-real Generalization in Classical Music
par: Tunturi, Eetu, et autres
Publié: (2025)
par: Tunturi, Eetu, et autres
Publié: (2025)
Gaunt coefficients for complex and real spherical harmonics with applications to spherical array processing and Ambisonics
par: Politis, Archontis
Publié: (2024)
par: Politis, Archontis
Publié: (2024)
Beyond Speaker Identity: Text Guided Target Speech Extraction
par: Huo, Mingyue, et autres
Publié: (2025)
par: Huo, Mingyue, et autres
Publié: (2025)
Towards Spatial Audio Understanding via Question Answering
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
Permutation Invariant Recurrent Neural Networks for Sound Source Tracking Applications
par: Diaz-Guerra, David, et autres
Publié: (2023)
par: Diaz-Guerra, David, et autres
Publié: (2023)
Impact of Microphone Array Mismatches to Learning-based Replay Speech Detection
par: Neri, Michael, et autres
Publié: (2025)
par: Neri, Michael, et autres
Publié: (2025)
Multi-channel Replay Speech Detection using an Adaptive Learnable Beamformer
par: Neri, Michael, et autres
Publié: (2025)
par: Neri, Michael, et autres
Publié: (2025)
pTSE-T: Presentation Target Speaker Extraction using Unaligned Text Cues
par: Jiang, Ziyang, et autres
Publié: (2024)
par: Jiang, Ziyang, et autres
Publié: (2024)
Class-Incremental Learning for Sound Event Localization and Detection
par: Pandey, Ruchi, et autres
Publié: (2024)
par: Pandey, Ruchi, et autres
Publié: (2024)
Detect, Attend and Extract: Keyword Guided Target Speaker Extraction
par: Li, Haoyu, et autres
Publié: (2026)
par: Li, Haoyu, et autres
Publié: (2026)
SynthSOD: Developing an Heterogeneous Dataset for Orchestra Music Source Separation
par: Garcia-Martinez, Jaime, et autres
Publié: (2024)
par: Garcia-Martinez, Jaime, et autres
Publié: (2024)
Integrating Continuous and Binary Relevances in Audio-Text Relevance Learning
par: Xie, Huang, et autres
Publié: (2024)
par: Xie, Huang, et autres
Publié: (2024)
Multi-Channel Replay Speech Detection using Acoustic Maps
par: Neri, Michael, et autres
Publié: (2026)
par: Neri, Michael, et autres
Publié: (2026)
Typing to Listen at the Cocktail Party: Text-Guided Target Speaker Extraction
par: Hao, Xiang, et autres
Publié: (2023)
par: Hao, Xiang, et autres
Publié: (2023)
Perceptually-motivated Spatial Audio Codec for Higher-Order Ambisonics Compression
par: Hold, Christoph, et autres
Publié: (2024)
par: Hold, Christoph, et autres
Publié: (2024)
Text-based Audio Retrieval by Learning from Similarities between Audio Captions
par: Xie, Huang, et autres
Publié: (2024)
par: Xie, Huang, et autres
Publié: (2024)
Acoustic Simulation Framework for Multi-channel Replay Speech Detection
par: Neri, Michael, et autres
Publié: (2025)
par: Neri, Michael, et autres
Publié: (2025)
Multi-Level Speaker Representation for Target Speaker Extraction
par: Zhang, Ke, et autres
Publié: (2024)
par: Zhang, Ke, et autres
Publié: (2024)
EvoTSE: Evolving Enrollment for Target Speaker Extraction
par: Liu, Zikai, et autres
Publié: (2026)
par: Liu, Zikai, et autres
Publié: (2026)
Sound Event Detection and Localization with Distance Estimation
par: Krause, Daniel Aleksander, et autres
Publié: (2024)
par: Krause, Daniel Aleksander, et autres
Publié: (2024)
Beyond Lips: Integrating Gesture and Lip Cues for Robust Audio-visual Speaker Extraction
par: Pan, Zexu, et autres
Publié: (2026)
par: Pan, Zexu, et autres
Publié: (2026)
Enhancing Intelligibility for Generative Target Speech Extraction via Joint Optimization with Target Speaker ASR
par: Ma, Hao, et autres
Publié: (2025)
par: Ma, Hao, et autres
Publié: (2025)
Contextual Speech Extraction: Leveraging Textual History as an Implicit Cue for Target Speech Extraction
par: Kim, Minsu, et autres
Publié: (2025)
par: Kim, Minsu, et autres
Publié: (2025)
MC-LExt: Multi-Channel Target Speaker Extraction with Onset-Prompted Speaker Conditioning Mechanism
par: Ling, Tongtao, et autres
Publié: (2025)
par: Ling, Tongtao, et autres
Publié: (2025)
Evaluating the Temporal Detection Capability of Integrated Gradients Applied on Sound Classifier
par: Dumpis, Martynas, et autres
Publié: (2026)
par: Dumpis, Martynas, et autres
Publié: (2026)
Adaptive Deterministic Flow Matching for Target Speaker Extraction
par: Hsieh, Tsun-An, et autres
Publié: (2025)
par: Hsieh, Tsun-An, et autres
Publié: (2025)
Target Speaker Extraction with Curriculum Learning
par: Liu, Yun, et autres
Publié: (2024)
par: Liu, Yun, et autres
Publié: (2024)
Enhancing Target Speaker Extraction with Explicit Speaker Consistency Modeling
par: Wu, Shu, et autres
Publié: (2025)
par: Wu, Shu, et autres
Publié: (2025)
Listening for "You": Enhancing Speech Image Retrieval via Target Speaker Extraction
par: Yang, Wenhao, et autres
Publié: (2025)
par: Yang, Wenhao, et autres
Publié: (2025)
Study on Inter and Intra Speaker Variability in Speaker Recognition
par: Okhotnikov, Anton, et autres
Publié: (2024)
par: Okhotnikov, Anton, et autres
Publié: (2024)
Documents similaires
-
Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction
par: Dai, Wang, et autres
Publié: (2025) -
Attractor-Based Speech Separation of Multiple Utterances by Unknown Number of Speakers
par: Wang, Yuzhu, et autres
Publié: (2025) -
Reference Channel Selection by Multi-Channel Masking for End-to-End Multi-Channel Speech Enhancement
par: Dai, Wang, et autres
Publié: (2024) -
Moving Speaker Separation via Parallel Spectral-Spatial Processing
par: Wang, Yuzhu, et autres
Publié: (2026) -
Dependence on Early and Late Reverberation of Single-Channel Speaker Distance Estimation
par: Neri, Michael, et autres
Publié: (2026)