Reference Channel Selection by Multi-Channel Masking for End-to-End Multi-Channel Speech Enhancement
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dai, Wang, Li, Xiaofei, Politis, Archontis, Virtanen, Tuomas |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Inter-Speaker Relative Cues for Two-Stage Text-Guided Target Speech Extraction
par: Dai, Wang, et autres
Publié: (2026)
par: Dai, Wang, et autres
Publié: (2026)
Dependence on Early and Late Reverberation of Single-Channel Speaker Distance Estimation
par: Neri, Michael, et autres
Publié: (2026)
par: Neri, Michael, et autres
Publié: (2026)
Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction
par: Dai, Wang, et autres
Publié: (2025)
par: Dai, Wang, et autres
Publié: (2025)
Multi-Utterance Speech Separation and Association Trained on Short Segments
par: Wang, Yuzhu, et autres
Publié: (2025)
par: Wang, Yuzhu, et autres
Publié: (2025)
Speaker Distance Estimation in Enclosures from Single-Channel Audio
par: Neri, Michael, et autres
Publié: (2024)
par: Neri, Michael, et autres
Publié: (2024)
Attractor-Based Speech Separation of Multiple Utterances by Unknown Number of Speakers
par: Wang, Yuzhu, et autres
Publié: (2025)
par: Wang, Yuzhu, et autres
Publié: (2025)
Neural Ambisonics encoding for compact irregular microphone arrays
par: Heikkinen, Mikko, et autres
Publié: (2024)
par: Heikkinen, Mikko, et autres
Publié: (2024)
Multi-Channel Replay Speech Detection using Acoustic Maps
par: Neri, Michael, et autres
Publié: (2026)
par: Neri, Michael, et autres
Publié: (2026)
Beyond Omnidirectional: Neural Ambisonics Encoding for Arbitrary Microphone Directivity Patterns using Cross-Attention
par: Heikkinen, Mikko, et autres
Publié: (2026)
par: Heikkinen, Mikko, et autres
Publié: (2026)
Moving Speaker Separation via Parallel Spectral-Spatial Processing
par: Wang, Yuzhu, et autres
Publié: (2026)
par: Wang, Yuzhu, et autres
Publié: (2026)
Lightweight and Robust Multi-Channel End-to-End Speech Recognition with Spherical Harmonic Transform
par: Kong, Xiangzhu, et autres
Publié: (2025)
par: Kong, Xiangzhu, et autres
Publié: (2025)
Gen-A: Generalizing Ambisonics Neural Encoding to Unseen Microphone Arrays
par: Heikkinen, Mikko, et autres
Publié: (2025)
par: Heikkinen, Mikko, et autres
Publié: (2025)
CUSIDE-array: A Streaming Multi-Channel End-to-End Speech Recognition System with Realistic Evaluations
par: Kong, Xiangzhu, et autres
Publié: (2024)
par: Kong, Xiangzhu, et autres
Publié: (2024)
Score-informed Music Source Separation: Improving Synthetic-to-real Generalization in Classical Music
par: Tunturi, Eetu, et autres
Publié: (2025)
par: Tunturi, Eetu, et autres
Publié: (2025)
ARiSE: Auto-Regressive Multi-Channel Speech Enhancement
par: Shen, Pengjie, et autres
Publié: (2025)
par: Shen, Pengjie, et autres
Publié: (2025)
Attention-Based Beamformer For Multi-Channel Speech Enhancement
par: Bai, Jinglin, et autres
Publié: (2024)
par: Bai, Jinglin, et autres
Publié: (2024)
Unified Diffusion Refinement for Multi-Channel Speech Enhancement and Separation
par: Xu, Zhongweiyang, et autres
Publié: (2026)
par: Xu, Zhongweiyang, et autres
Publié: (2026)
Gaunt coefficients for complex and real spherical harmonics with applications to spherical array processing and Ambisonics
par: Politis, Archontis
Publié: (2024)
par: Politis, Archontis
Publié: (2024)
Multi-modal Speech Enhancement with Limited Electromyography Channels
par: Feng, Fuyuan, et autres
Publié: (2025)
par: Feng, Fuyuan, et autres
Publié: (2025)
Multi-channel Replay Speech Detection using an Adaptive Learnable Beamformer
par: Neri, Michael, et autres
Publié: (2025)
par: Neri, Michael, et autres
Publié: (2025)
Self-Supervised Learning of Spatial Acoustic Representation with Cross-Channel Signal Reconstruction and Multi-Channel Conformer
par: Yang, Bing, et autres
Publié: (2023)
par: Yang, Bing, et autres
Publié: (2023)
Sparsity-Driven EEG Channel Selection for Brain-Assisted Speech Enhancement
par: Zhang, Jie, et autres
Publié: (2023)
par: Zhang, Jie, et autres
Publié: (2023)
ArrayDPS-Refine: Generative Refinement of Discriminative Multi-Channel Speech Enhancement
par: Xu, Zhongweiyang, et autres
Publié: (2026)
par: Xu, Zhongweiyang, et autres
Publié: (2026)
Towards Spatial Audio Understanding via Question Answering
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
par: Sudarsanam, Parthasaarathy, et autres
Publié: (2025)
Permutation Invariant Recurrent Neural Networks for Sound Source Tracking Applications
par: Diaz-Guerra, David, et autres
Publié: (2023)
par: Diaz-Guerra, David, et autres
Publié: (2023)
FlexIO: Flexible Single- and Multi-Channel Speech Separation and Enhancement
par: Masuyama, Yoshiki, et autres
Publié: (2025)
par: Masuyama, Yoshiki, et autres
Publié: (2025)
Speech Enhancement with Dual-path Multi-Channel Linear Prediction Filter and Multi-norm Beamforming
par: Qin, Chengyuan, et autres
Publié: (2025)
par: Qin, Chengyuan, et autres
Publié: (2025)
Geometry-Constrained EEG Channel Selection for Brain-Assisted Speech Enhancement
par: Zuo, Keying, et autres
Publié: (2024)
par: Zuo, Keying, et autres
Publié: (2024)
Acoustic Simulation Framework for Multi-channel Replay Speech Detection
par: Neri, Michael, et autres
Publié: (2025)
par: Neri, Michael, et autres
Publié: (2025)
End-to-End Speech Recognition with Pre-trained Masked Language Model
par: Higuchi, Yosuke, et autres
Publié: (2024)
par: Higuchi, Yosuke, et autres
Publié: (2024)
SoulX-Transcriber: A Robust End-to-End Framework for Multi-Speaker Speech Transcription
par: Dai, Yuhang, et autres
Publié: (2026)
par: Dai, Yuhang, et autres
Publié: (2026)
Impact of Microphone Array Mismatches to Learning-based Replay Speech Detection
par: Neri, Michael, et autres
Publié: (2025)
par: Neri, Michael, et autres
Publié: (2025)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
par: Dai, Yuhang, et autres
Publié: (2025)
par: Dai, Yuhang, et autres
Publié: (2025)
End-to-End DOA-Guided Speech Extraction in Noisy Multi-Talker Scenarios
par: Jing, Kangqi, et autres
Publié: (2025)
par: Jing, Kangqi, et autres
Publié: (2025)
Improving Practical Aspects of End-to-End Multi-Talker Speech Recognition for Online and Offline Scenarios
par: Subramanian, Aswin Shanmugam, et autres
Publié: (2025)
par: Subramanian, Aswin Shanmugam, et autres
Publié: (2025)
Class-Incremental Learning for Sound Event Localization and Detection
par: Pandey, Ruchi, et autres
Publié: (2024)
par: Pandey, Ruchi, et autres
Publié: (2024)
FullSubNet: A Full-Band and Sub-Band Fusion Model for Real-Time Single-Channel Speech Enhancement
par: Hao, Xiang, et autres
Publié: (2020)
par: Hao, Xiang, et autres
Publié: (2020)
Study of Lightweight Transformer Architectures for Single-Channel Speech Enhancement
par: Zhao, Haixin, et autres
Publié: (2025)
par: Zhao, Haixin, et autres
Publié: (2025)
A Lightweight Hybrid Dual Channel Speech Enhancement System under Low-SNR Conditions
par: Wang, Zheng, et autres
Publié: (2025)
par: Wang, Zheng, et autres
Publié: (2025)
Enhancing Fully Formatted End-to-End Speech Recognition with Knowledge Distillation via Multi-Codebook Vector Quantization
par: You, Jian, et autres
Publié: (2025)
par: You, Jian, et autres
Publié: (2025)
Documents similaires
-
Inter-Speaker Relative Cues for Two-Stage Text-Guided Target Speech Extraction
par: Dai, Wang, et autres
Publié: (2026) -
Dependence on Early and Late Reverberation of Single-Channel Speaker Distance Estimation
par: Neri, Michael, et autres
Publié: (2026) -
Inter-Speaker Relative Cues for Text-Guided Target Speech Extraction
par: Dai, Wang, et autres
Publié: (2025) -
Multi-Utterance Speech Separation and Association Trained on Short Segments
par: Wang, Yuzhu, et autres
Publié: (2025) -
Speaker Distance Estimation in Enclosures from Single-Channel Audio
par: Neri, Michael, et autres
Publié: (2024)