DBMIF: a deep balanced multimodal iterative fusion framework for air- and bone-conduction speech enhancement
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Yilei, Zheng, Changyan, Zhang, Xingyu, Zhang, Yakun, Zheng, Chengshi, Yang, Shuang, Yan, Ye, Yin, Erwei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition
por: Wu, Linzhi, et al.
Publicado: (2026)
por: Wu, Linzhi, et al.
Publicado: (2026)
Single-channel speech enhancement by using psychoacoustical model inspired fusion framework
por: Samui, Suman
Publicado: (2022)
por: Samui, Suman
Publicado: (2022)
AVE Speech: A Comprehensive Multi-Modal Dataset for Speech Recognition Integrating Audio, Visual, and Electromyographic Signals
por: Zhou, Dongliang, et al.
Publicado: (2025)
por: Zhou, Dongliang, et al.
Publicado: (2025)
Index-MSR: A high-efficiency multimodal fusion framework for speech recognition
por: Chen, Jinming, et al.
Publicado: (2025)
por: Chen, Jinming, et al.
Publicado: (2025)
Unsupervised speech enhancement with spectral kurtosis and double deep priors
por: Ohnaka, Hien, et al.
Publicado: (2024)
por: Ohnaka, Hien, et al.
Publicado: (2024)
SLM-S2ST: A multimodal language model for direct speech-to-speech translation
por: Hu, Yuxuan, et al.
Publicado: (2025)
por: Hu, Yuxuan, et al.
Publicado: (2025)
End-to-end multi-channel speaker extraction and binaural speech synthesis
por: Chi, Cheng, et al.
Publicado: (2024)
por: Chi, Cheng, et al.
Publicado: (2024)
Monaural speech enhancement on drone via Adapter based transfer learning
por: Chen, Xingyu, et al.
Publicado: (2024)
por: Chen, Xingyu, et al.
Publicado: (2024)
TokenSE: a Mamba-based discrete token speech enhancement framework for cochlear implants
por: Chiang, Hsin-Tien, et al.
Publicado: (2026)
por: Chiang, Hsin-Tien, et al.
Publicado: (2026)
Throat and acoustic paired speech dataset for deep learning-based speech enhancement
por: Kim, Yunsik, et al.
Publicado: (2025)
por: Kim, Yunsik, et al.
Publicado: (2025)
Configurable EBEN: Extreme Bandwidth Extension Network to enhance body-conducted speech capture
por: Hauret, Julien, et al.
Publicado: (2023)
por: Hauret, Julien, et al.
Publicado: (2023)
Online neural fusion of distortionless differential beamformers for robust speech enhancement
por: Qian, Yuanhang, et al.
Publicado: (2025)
por: Qian, Yuanhang, et al.
Publicado: (2025)
Boosting Diffusion Model for Spectrogram Up-sampling in Text-to-speech: An Empirical Study
por: Zhang, Chong, et al.
Publicado: (2024)
por: Zhang, Chong, et al.
Publicado: (2024)
Rethinking the joint estimation of magnitude and phase for time-frequency domain neural vocoders
por: Dai, Lingling, et al.
Publicado: (2025)
por: Dai, Lingling, et al.
Publicado: (2025)
Lightweight speech enhancement guided target speech extraction in noisy multi-speaker scenarios
por: Huang, Ziling, et al.
Publicado: (2025)
por: Huang, Ziling, et al.
Publicado: (2025)
Neural Vocoders as Speech Enhancers
por: Li, Andong, et al.
Publicado: (2025)
por: Li, Andong, et al.
Publicado: (2025)
KS-Net: Multi-band joint speech restoration and enhancement network for 2024 ICASSP SSI Challenge
por: Yu, Guochen, et al.
Publicado: (2024)
por: Yu, Guochen, et al.
Publicado: (2024)
Spatial-Magnifier: Spatial upsampling for multichannel speech enhancement
por: Lee, Dongheon, et al.
Publicado: (2026)
por: Lee, Dongheon, et al.
Publicado: (2026)
A lightweight dual-stage framework for personalized speech enhancement based on DeepFilterNet2
por: Serre, Thomas, et al.
Publicado: (2024)
por: Serre, Thomas, et al.
Publicado: (2024)
Predicting speech intelligibility in older adults for speech enhancement using the Gammachirp Envelope Similarity Index, GESI
por: Yamamoto, Ayako, et al.
Publicado: (2025)
por: Yamamoto, Ayako, et al.
Publicado: (2025)
Graph-based multi-Feature fusion method for speech emotion recognition
por: Liu, Xueyu, et al.
Publicado: (2024)
por: Liu, Xueyu, et al.
Publicado: (2024)
SPGM: Prioritizing Local Features for enhanced speech separation performance
por: Yip, Jia Qi, et al.
Publicado: (2023)
por: Yip, Jia Qi, et al.
Publicado: (2023)
Towards noise-robust speech inversion through multi-task learning with speech enhancement
por: Tabatabaee, Saba, et al.
Publicado: (2026)
por: Tabatabaee, Saba, et al.
Publicado: (2026)
Real-time multichannel deep speech enhancement in hearing aids: Comparing monaural and binaural processing in complex acoustic scenarios
por: Westhausen, Nils L., et al.
Publicado: (2024)
por: Westhausen, Nils L., et al.
Publicado: (2024)
Treble10: A high-quality dataset for far-field speech recognition, dereverberation, and enhancement
por: Mullins, Sarabeth S., et al.
Publicado: (2025)
por: Mullins, Sarabeth S., et al.
Publicado: (2025)
Spatial Reconstructed Local Attention Res2Net with F0 Subband for Fake Speech Detection
por: Fan, Cunhang, et al.
Publicado: (2023)
por: Fan, Cunhang, et al.
Publicado: (2023)
Spatially constrained vs. unconstrained filtering in neural spatiospectral filters for multichannel speech enhancement
por: Briegleb, Annika, et al.
Publicado: (2024)
por: Briegleb, Annika, et al.
Publicado: (2024)
Heterogeneous bimodal attention fusion for speech emotion recognition
por: Luo, Jiachen, et al.
Publicado: (2025)
por: Luo, Jiachen, et al.
Publicado: (2025)
Inter-channel Conv-TasNet for multichannel speech enhancement
por: Lee, Dongheon, et al.
Publicado: (2021)
por: Lee, Dongheon, et al.
Publicado: (2021)
FreeCodec: A disentangled neural speech codec with fewer tokens
por: Zheng, Youqiang, et al.
Publicado: (2024)
por: Zheng, Youqiang, et al.
Publicado: (2024)
GDiffuSE: Diffusion-based speech enhancement with noise model guidance
por: Yanir, Efrayim, et al.
Publicado: (2025)
por: Yanir, Efrayim, et al.
Publicado: (2025)
Real-time speech enhancement in noise for throat microphone using neural audio codec as foundation model
por: Hauret, Julien, et al.
Publicado: (2025)
por: Hauret, Julien, et al.
Publicado: (2025)
I2TTS: Image-indicated Immersive Text-to-speech Synthesis with Spatial Perception
por: Zhang, Jiawei, et al.
Publicado: (2024)
por: Zhang, Jiawei, et al.
Publicado: (2024)
BSDB-Net: Band-Split Dual-Branch Network with Selective State Spaces Mechanism for Monaural Speech Enhancement
por: Fan, Cunhang, et al.
Publicado: (2024)
por: Fan, Cunhang, et al.
Publicado: (2024)
Modeling strategies for speech enhancement in the latent space of a neural audio codec
por: Kammoun, Sofiene, et al.
Publicado: (2025)
por: Kammoun, Sofiene, et al.
Publicado: (2025)
Using RLHF to align speech enhancement approaches to mean-opinion quality scores
por: Kumar, Anurag, et al.
Publicado: (2024)
por: Kumar, Anurag, et al.
Publicado: (2024)
Late fusion ensembles for speech recognition on diverse input audio representations
por: Jezidžić, Marin, et al.
Publicado: (2024)
por: Jezidžić, Marin, et al.
Publicado: (2024)
Speech enhancement deep-learning architecture for efficient edge processing
por: Pal, Monisankha, et al.
Publicado: (2024)
por: Pal, Monisankha, et al.
Publicado: (2024)
A framework of text-dependent speaker verification for chinese numerical string corpus
por: Zheng, Litong, et al.
Publicado: (2024)
por: Zheng, Litong, et al.
Publicado: (2024)
The CHiME-7 UDASE task: Unsupervised domain adaptation for conversational speech enhancement
por: Leglaive, Simon, et al.
Publicado: (2023)
por: Leglaive, Simon, et al.
Publicado: (2023)
Ejemplares similares
-
Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition
por: Wu, Linzhi, et al.
Publicado: (2026) -
Single-channel speech enhancement by using psychoacoustical model inspired fusion framework
por: Samui, Suman
Publicado: (2022) -
AVE Speech: A Comprehensive Multi-Modal Dataset for Speech Recognition Integrating Audio, Visual, and Electromyographic Signals
por: Zhou, Dongliang, et al.
Publicado: (2025) -
Index-MSR: A high-efficiency multimodal fusion framework for speech recognition
por: Chen, Jinming, et al.
Publicado: (2025) -
Unsupervised speech enhancement with spectral kurtosis and double deep priors
por: Ohnaka, Hien, et al.
Publicado: (2024)