Inter-channel Conv-TasNet for multichannel speech enhancement
Fuente:
arXiv
Guardado en:
| Autores principales: | Lee, Dongheon, Kim, Seongrae, Choi, Jung-Woo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2021
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SpeakerBeam-SS: Real-time Target Speaker Extraction with Lightweight Conv-TasNet and State Space Modeling
por: Sato, Hiroshi, et al.
Publicado: (2024)
por: Sato, Hiroshi, et al.
Publicado: (2024)
DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
por: Lee, Dongheon, et al.
Publicado: (2024)
por: Lee, Dongheon, et al.
Publicado: (2024)
DeepASA: An Object-Oriented Multi-Purpose Network for Auditory Scene Analysis
por: Lee, Dongheon, et al.
Publicado: (2025)
por: Lee, Dongheon, et al.
Publicado: (2025)
Spatial-Magnifier: Spatial upsampling for multichannel speech enhancement
por: Lee, Dongheon, et al.
Publicado: (2026)
por: Lee, Dongheon, et al.
Publicado: (2026)
Real-time multichannel deep speech enhancement in hearing aids: Comparing monaural and binaural processing in complex acoustic scenarios
por: Westhausen, Nils L., et al.
Publicado: (2024)
por: Westhausen, Nils L., et al.
Publicado: (2024)
DISPATCH: Distilling Selective Patches for Speech Enhancement
por: Kim, Dohwan, et al.
Publicado: (2025)
por: Kim, Dohwan, et al.
Publicado: (2025)
SEMamba++: A General Speech Restoration Framework Leveraging Global, Local, and Periodic Spectral Patterns
por: Lee, Yongjoon, et al.
Publicado: (2026)
por: Lee, Yongjoon, et al.
Publicado: (2026)
RAF: Relativistic Adversarial Feedback For Universal Speech Synthesis
por: Lee, Yongjoon, et al.
Publicado: (2026)
por: Lee, Yongjoon, et al.
Publicado: (2026)
Single-channel speech enhancement by using psychoacoustical model inspired fusion framework
por: Samui, Suman
Publicado: (2022)
por: Samui, Suman
Publicado: (2022)
Deep low-latency joint speech transmission and enhancement over a gaussian channel
por: Bokaei, Mohammad, et al.
Publicado: (2024)
por: Bokaei, Mohammad, et al.
Publicado: (2024)
Real-time Low-latency Music Source Separation using Hybrid Spectrogram-TasNet
por: Venkatesh, Satvik, et al.
Publicado: (2024)
por: Venkatesh, Satvik, et al.
Publicado: (2024)
TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet
por: Jeong, Jaeseok, et al.
Publicado: (2025)
por: Jeong, Jaeseok, et al.
Publicado: (2025)
KS-Net: Multi-band joint speech restoration and enhancement network for 2024 ICASSP SSI Challenge
por: Yu, Guochen, et al.
Publicado: (2024)
por: Yu, Guochen, et al.
Publicado: (2024)
A lightweight dual-stage framework for personalized speech enhancement based on DeepFilterNet2
por: Serre, Thomas, et al.
Publicado: (2024)
por: Serre, Thomas, et al.
Publicado: (2024)
3D Room Geometry Inference from Multichannel Room Impulse Response using Deep Neural Network
por: Yeon, Inmo, et al.
Publicado: (2024)
por: Yeon, Inmo, et al.
Publicado: (2024)
DeFTAN-II: Efficient Multichannel Speech Enhancement with Subgroup Processing
por: Lee, Dongheon, et al.
Publicado: (2023)
por: Lee, Dongheon, et al.
Publicado: (2023)
Single-channel speech enhancement using learnable loss mixup
por: Chang, Oscar, et al.
Publicado: (2023)
por: Chang, Oscar, et al.
Publicado: (2023)
Towards noise-robust speech inversion through multi-task learning with speech enhancement
por: Tabatabaee, Saba, et al.
Publicado: (2026)
por: Tabatabaee, Saba, et al.
Publicado: (2026)
RGI-Net: 3D Room Geometry Inference from Room Impulse Responses With Hidden First-Order Reflections
por: Yeon, Inmo, et al.
Publicado: (2023)
por: Yeon, Inmo, et al.
Publicado: (2023)
COVID-19 Diagnosis from Cough Acoustics using ConvNets and Data Augmentation
por: Mahanta, Saranga Kingkor, et al.
Publicado: (2021)
por: Mahanta, Saranga Kingkor, et al.
Publicado: (2021)
Unsupervised speech enhancement with spectral kurtosis and double deep priors
por: Ohnaka, Hien, et al.
Publicado: (2024)
por: Ohnaka, Hien, et al.
Publicado: (2024)
SPGM: Prioritizing Local Features for enhanced speech separation performance
por: Yip, Jia Qi, et al.
Publicado: (2023)
por: Yip, Jia Qi, et al.
Publicado: (2023)
RaD-Net 2: A causal two-stage repairing and denoising speech enhancement network with knowledge distillation and complex axial self-attention
por: Liu, Mingshuai, et al.
Publicado: (2024)
por: Liu, Mingshuai, et al.
Publicado: (2024)
GDiffuSE: Diffusion-based speech enhancement with noise model guidance
por: Yanir, Efrayim, et al.
Publicado: (2025)
por: Yanir, Efrayim, et al.
Publicado: (2025)
Monaural speech enhancement on drone via Adapter based transfer learning
por: Chen, Xingyu, et al.
Publicado: (2024)
por: Chen, Xingyu, et al.
Publicado: (2024)
Speech-Declipping Transformer with Complex Spectrogram and Learnerble Temporal Features
por: Kwon, Younghoo, et al.
Publicado: (2024)
por: Kwon, Younghoo, et al.
Publicado: (2024)
Throat and acoustic paired speech dataset for deep learning-based speech enhancement
por: Kim, Yunsik, et al.
Publicado: (2025)
por: Kim, Yunsik, et al.
Publicado: (2025)
Modeling strategies for speech enhancement in the latent space of a neural audio codec
por: Kammoun, Sofiene, et al.
Publicado: (2025)
por: Kammoun, Sofiene, et al.
Publicado: (2025)
Using RLHF to align speech enhancement approaches to mean-opinion quality scores
por: Kumar, Anurag, et al.
Publicado: (2024)
por: Kumar, Anurag, et al.
Publicado: (2024)
EchoScan: Scanning Complex Room Geometries via Acoustic Echoes
por: Yeon, Inmo, et al.
Publicado: (2023)
por: Yeon, Inmo, et al.
Publicado: (2023)
The CHiME-7 UDASE task: Unsupervised domain adaptation for conversational speech enhancement
por: Leglaive, Simon, et al.
Publicado: (2023)
por: Leglaive, Simon, et al.
Publicado: (2023)
Configurable EBEN: Extreme Bandwidth Extension Network to enhance body-conducted speech capture
por: Hauret, Julien, et al.
Publicado: (2023)
por: Hauret, Julien, et al.
Publicado: (2023)
Multichannel-to-Multichannel Target Sound Extraction Using Direction and Timestamp Clues
por: Choi, Dayun, et al.
Publicado: (2024)
por: Choi, Dayun, et al.
Publicado: (2024)
SoundCompass: Navigating Target Sound Extraction With Effective Directional Clue Integration In Complex Acoustic Scenes
por: Choi, Dayun, et al.
Publicado: (2025)
por: Choi, Dayun, et al.
Publicado: (2025)
Self-Guided Target Sound Extraction and Classification Through Universal Sound Separation Model and Multiple Clues
por: Kwon, Younghoo, et al.
Publicado: (2025)
por: Kwon, Younghoo, et al.
Publicado: (2025)
An adaptive filter bank based neural network approach for time delay estimation and speech enhancement
por: Ma, Lu
Publicado: (2025)
por: Ma, Lu
Publicado: (2025)
A two-step approach for speech enhancement in low-SNR scenarios using cyclostationary beamforming and DNNs
por: Bologni, Giovanni, et al.
Publicado: (2026)
por: Bologni, Giovanni, et al.
Publicado: (2026)
LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition
por: Kwak, Doyeop, et al.
Publicado: (2026)
por: Kwak, Doyeop, et al.
Publicado: (2026)
Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks
por: Maiti, Soumi, et al.
Publicado: (2023)
por: Maiti, Soumi, et al.
Publicado: (2023)
An automatic mixing speech enhancement system for multi-track audio
por: Liu, Xiaojing, et al.
Publicado: (2024)
por: Liu, Xiaojing, et al.
Publicado: (2024)
Ejemplares similares
-
SpeakerBeam-SS: Real-time Target Speaker Extraction with Lightweight Conv-TasNet and State Space Modeling
por: Sato, Hiroshi, et al.
Publicado: (2024) -
DeFT-Mamba: Universal Multichannel Sound Separation and Polyphonic Audio Classification
por: Lee, Dongheon, et al.
Publicado: (2024) -
DeepASA: An Object-Oriented Multi-Purpose Network for Auditory Scene Analysis
por: Lee, Dongheon, et al.
Publicado: (2025) -
Spatial-Magnifier: Spatial upsampling for multichannel speech enhancement
por: Lee, Dongheon, et al.
Publicado: (2026) -
Real-time multichannel deep speech enhancement in hearing aids: Comparing monaural and binaural processing in complex acoustic scenarios
por: Westhausen, Nils L., et al.
Publicado: (2024)