State Space and Self-Attention Collaborative Network with Feature Aggregation for DOA Estimation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | You, Qi, Huang, Qinghua, Lin, Yi-Cheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Modulation Feature Enhancement with a Multi-Stage Attention Network for Underwater Acoustic Target Recognition
par: Yu, Jiaping, et autres
Publié: (2026)
par: Yu, Jiaping, et autres
Publié: (2026)
An Attention-Assisted Multi-Modal Data Fusion Model for Real-Time Estimation of Underwater Sound Velocity
par: Wu, Pengfei, et autres
Publié: (2025)
par: Wu, Pengfei, et autres
Publié: (2025)
Multimodal Self-Attention Network with Temporal Alignment for Audio-Visual Emotion Recognition
par: Koo, Inyong, et autres
Publié: (2026)
par: Koo, Inyong, et autres
Publié: (2026)
Efficient Solutions for Mitigating Initialization Bias in Unsupervised Self-Adaptive Auditory Attention Decoding
par: Yao, Yuanyuan, et autres
Publié: (2025)
par: Yao, Yuanyuan, et autres
Publié: (2025)
Reverberation-based Features for Sound Event Localization and Detection with Distance Estimation
par: Berghi, Davide, et autres
Publié: (2025)
par: Berghi, Davide, et autres
Publié: (2025)
Generic Speech Enhancement with Self-Supervised Representation Space Loss
par: Sato, Hiroshi, et autres
Publié: (2025)
par: Sato, Hiroshi, et autres
Publié: (2025)
A Multimodal Data Fusion Attention-Empowered Generative Adversarial Network for Real Time 3D Underwater Sound Speed Field Construction
par: Huang, Wei, et autres
Publié: (2025)
par: Huang, Wei, et autres
Publié: (2025)
How Does Instrumental Music Help SingFake Detection?
par: Chen, Xuanjun, et autres
Publié: (2025)
par: Chen, Xuanjun, et autres
Publié: (2025)
Investigation of Feature Selection and Pooling Methods for Environmental Sound Classification
par: Dehaghani, Parinaz Binandeh, et autres
Publié: (2025)
par: Dehaghani, Parinaz Binandeh, et autres
Publié: (2025)
SSM2Mel: State Space Model to Reconstruct Mel Spectrogram from the EEG
par: Fan, Cunhang, et autres
Publié: (2025)
par: Fan, Cunhang, et autres
Publié: (2025)
SpeakerBeam-SS: Real-time Target Speaker Extraction with Lightweight Conv-TasNet and State Space Modeling
par: Sato, Hiroshi, et autres
Publié: (2024)
par: Sato, Hiroshi, et autres
Publié: (2024)
Neural Tracking of Sustained Attention, Attention Switching, and Natural Conversation in Audiovisual Environments using Mobile EEG
par: Wilroth, Johanna, et autres
Publié: (2026)
par: Wilroth, Johanna, et autres
Publié: (2026)
Bridging the Gap: Integrating Pre-trained Speech Enhancement and Recognition Models for Robust Speech Recognition
par: Wang, Kuan-Chen, et autres
Publié: (2024)
par: Wang, Kuan-Chen, et autres
Publié: (2024)
Frequency-Based Alignment of EEG and Audio Signals Using Contrastive Learning and SincNet for Auditory Attention Detection
par: Liao, Yuan, et autres
Publié: (2025)
par: Liao, Yuan, et autres
Publié: (2025)
A Data-Centric Approach to Generalizable Speech Deepfake Detection
par: Huang, Wen, et autres
Publié: (2025)
par: Huang, Wen, et autres
Publié: (2025)
Binaural Selective Attention Model for Target Speaker Extraction
par: Meng, Hanyu, et autres
Publié: (2024)
par: Meng, Hanyu, et autres
Publié: (2024)
PAVITS: Exploring Prosody-aware VITS for End-to-End Emotional Voice Conversion
par: Qi, Tianhua, et autres
Publié: (2024)
par: Qi, Tianhua, et autres
Publié: (2024)
Using Ear-EEG to Decode Auditory Attention in Multiple-speaker Environment
par: Zhu, Haolin, et autres
Publié: (2024)
par: Zhu, Haolin, et autres
Publié: (2024)
AADNet: An End-to-End Deep Learning Model for Auditory Attention Decoding
par: Nguyen, Nhan Duc Thanh, et autres
Publié: (2024)
par: Nguyen, Nhan Duc Thanh, et autres
Publié: (2024)
Towards Realistic Emotional Voice Conversion using Controllable Emotional Intensity
par: Qi, Tianhua, et autres
Publié: (2024)
par: Qi, Tianhua, et autres
Publié: (2024)
STNet: Prediction of Underwater Sound Speed Profiles with An Advanced Semi-Transformer Neural Network
par: Huang, Wei, et autres
Publié: (2025)
par: Huang, Wei, et autres
Publié: (2025)
Adaptive Control Attention Network for Underwater Acoustic Localization and Domain Adaptation
par: Vo, Quoc Thinh, et autres
Publié: (2025)
par: Vo, Quoc Thinh, et autres
Publié: (2025)
Significance of Chirp MFCC as a Feature in Speech and Audio Applications
par: Joysingh, S. Johanan, et autres
Publié: (2024)
par: Joysingh, S. Johanan, et autres
Publié: (2024)
Acoustical Features as Knee Health Biomarkers: A Critical Analysis
par: Kechris, Christodoulos, et autres
Publié: (2024)
par: Kechris, Christodoulos, et autres
Publié: (2024)
Speech-Declipping Transformer with Complex Spectrogram and Learnerble Temporal Features
par: Kwon, Younghoo, et autres
Publié: (2024)
par: Kwon, Younghoo, et autres
Publié: (2024)
A Domain-Knowledge-Inspired Music Embedding Space and a Novel Attention Mechanism for Symbolic Music Modeling
par: Guo, Z., et autres
Publié: (2022)
par: Guo, Z., et autres
Publié: (2022)
PromptEVC: Controllable Emotional Voice Conversion with Natural Language Prompts
par: Qi, Tianhua, et autres
Publié: (2025)
par: Qi, Tianhua, et autres
Publié: (2025)
Joint Frequency-Space Sparse Reconstruction for DOA Estimation under Coherent Sources and Amplitude-Phase Errors
par: Chen, Yutong, et autres
Publié: (2025)
par: Chen, Yutong, et autres
Publié: (2025)
Wavelet-Based Time-Frequency Fingerprinting for Feature Extraction of Traditional Irish Music
par: Shore, Noah
Publié: (2025)
par: Shore, Noah
Publié: (2025)
GAN-Based Speech Enhancement for Low SNR Using Latent Feature Conditioning
par: Shetu, Shrishti Saha, et autres
Publié: (2024)
par: Shetu, Shrishti Saha, et autres
Publié: (2024)
Future Full-Ocean Deep SSPs Prediction based on Hierarchical Long Short-Term Memory Neural Networks
par: Lu, Jiajun, et autres
Publié: (2023)
par: Lu, Jiajun, et autres
Publié: (2023)
Blind Estimation of Sub-band Acoustic Parameters from Ambisonics Recordings using Spectro-Spatial Covariance Features
par: Meng, Hanyu, et autres
Publié: (2024)
par: Meng, Hanyu, et autres
Publié: (2024)
Self-supervised Multimodal Speech Representations for the Assessment of Schizophrenia Symptoms
par: Premananth, Gowtham, et autres
Publié: (2024)
par: Premananth, Gowtham, et autres
Publié: (2024)
Brain-to-Speech: Prosody Feature Engineering and Transformer-Based Reconstruction
par: Al-Radhi, Mohammed Salah, et autres
Publié: (2026)
par: Al-Radhi, Mohammed Salah, et autres
Publié: (2026)
RIFT: Entropy-Optimised Fractional Wavelet Constellations for Ideal Time-Frequency Estimation
par: Cozens, James M., et autres
Publié: (2025)
par: Cozens, James M., et autres
Publié: (2025)
Steered Response Power-Based Direction-of-Arrival Estimation Exploiting an Auxiliary Microphone
par: Brümann, Klaus, et autres
Publié: (2024)
par: Brümann, Klaus, et autres
Publié: (2024)
Comparison of Frequency-Fusion Mechanisms for Binaural Direction-of-Arrival Estimation for Multiple Speakers
par: Fejgin, Daniel, et autres
Publié: (2024)
par: Fejgin, Daniel, et autres
Publié: (2024)
Bird Vocalization Embedding Extraction Using Self-Supervised Disentangled Representation Learning
par: Shi, Runwu, et autres
Publié: (2024)
par: Shi, Runwu, et autres
Publié: (2024)
A Machine Hearing System for Robust Cough Detection Based on a High-Level Representation of Band-Specific Audio Features
par: Monge-Alvarez, Jesús, et autres
Publié: (2024)
par: Monge-Alvarez, Jesús, et autres
Publié: (2024)
Completing Sets of Prototype Transfer Functions for Subspace-based Direction of Arrival Estimation of Multiple Speakers
par: Fejgin, Daniel, et autres
Publié: (2025)
par: Fejgin, Daniel, et autres
Publié: (2025)
Documents similaires
-
Modulation Feature Enhancement with a Multi-Stage Attention Network for Underwater Acoustic Target Recognition
par: Yu, Jiaping, et autres
Publié: (2026) -
An Attention-Assisted Multi-Modal Data Fusion Model for Real-Time Estimation of Underwater Sound Velocity
par: Wu, Pengfei, et autres
Publié: (2025) -
Multimodal Self-Attention Network with Temporal Alignment for Audio-Visual Emotion Recognition
par: Koo, Inyong, et autres
Publié: (2026) -
Efficient Solutions for Mitigating Initialization Bias in Unsupervised Self-Adaptive Auditory Attention Decoding
par: Yao, Yuanyuan, et autres
Publié: (2025) -
Reverberation-based Features for Sound Event Localization and Detection with Distance Estimation
par: Berghi, Davide, et autres
Publié: (2025)