TokenSE: a Mamba-based discrete token speech enhancement framework for cochlear implants
Fuente:
arXiv
Guardado en:
| Autores principales: | Chiang, Hsin-Tien, Hansen, John H. L. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Restorative Speech Enhancement: A Progressive Approach Using SE and Codec Modules
por: Chiang, Hsin-Tien, et al.
Publicado: (2024)
por: Chiang, Hsin-Tien, et al.
Publicado: (2024)
GDiffuSE: Diffusion-based speech enhancement with noise model guidance
por: Yanir, Efrayim, et al.
Publicado: (2025)
por: Yanir, Efrayim, et al.
Publicado: (2025)
A computational loudness model for electrical stimulation with cochlear implants
por: Alvarez, Franklin, et al.
Publicado: (2025)
por: Alvarez, Franklin, et al.
Publicado: (2025)
FreeCodec: A disentangled neural speech codec with fewer tokens
por: Zheng, Youqiang, et al.
Publicado: (2024)
por: Zheng, Youqiang, et al.
Publicado: (2024)
Enhancing spatial hearing with cochlear implants: exploring the role of AI, multimodal interaction and perceptual training
por: Picinali, Lorenzo, et al.
Publicado: (2026)
por: Picinali, Lorenzo, et al.
Publicado: (2026)
Omni-directional attention mechanism based on Mamba for speech separation
por: Xue, Ke, et al.
Publicado: (2026)
por: Xue, Ke, et al.
Publicado: (2026)
DBMIF: a deep balanced multimodal iterative fusion framework for air- and bone-conduction speech enhancement
por: Wu, Yilei, et al.
Publicado: (2026)
por: Wu, Yilei, et al.
Publicado: (2026)
End-to-end audio-visual learning for cochlear implant sound coding simulations in noisy environments
por: Lin, Meng-Ping, et al.
Publicado: (2025)
por: Lin, Meng-Ping, et al.
Publicado: (2025)
Advancing automatic speech recognition using feature fusion with self-supervised learning features: A case study on Fearless Steps Apollo corpus
por: Chen, Szu-Jui, et al.
Publicado: (2026)
por: Chen, Szu-Jui, et al.
Publicado: (2026)
A lightweight dual-stage framework for personalized speech enhancement based on DeepFilterNet2
por: Serre, Thomas, et al.
Publicado: (2024)
por: Serre, Thomas, et al.
Publicado: (2024)
Single-channel speech enhancement by using psychoacoustical model inspired fusion framework
por: Samui, Suman
Publicado: (2022)
por: Samui, Suman
Publicado: (2022)
Lightweight speech enhancement guided target speech extraction in noisy multi-speaker scenarios
por: Huang, Ziling, et al.
Publicado: (2025)
por: Huang, Ziling, et al.
Publicado: (2025)
DAT-CFTNet: Speech Enhancement for Cochlear Implant Recipients using Attention-based Dual-Path Recurrent Neural Network
por: Mamun, Nursadul, et al.
Publicado: (2026)
por: Mamun, Nursadul, et al.
Publicado: (2026)
Spatial-Magnifier: Spatial upsampling for multichannel speech enhancement
por: Lee, Dongheon, et al.
Publicado: (2026)
por: Lee, Dongheon, et al.
Publicado: (2026)
Predicting speech intelligibility in older adults for speech enhancement using the Gammachirp Envelope Similarity Index, GESI
por: Yamamoto, Ayako, et al.
Publicado: (2025)
por: Yamamoto, Ayako, et al.
Publicado: (2025)
Monaural speech enhancement on drone via Adapter based transfer learning
por: Chen, Xingyu, et al.
Publicado: (2024)
por: Chen, Xingyu, et al.
Publicado: (2024)
Predicting positive transfer for improved low-resource speech recognition using acoustic pseudo-tokens
por: San, Nay, et al.
Publicado: (2024)
por: San, Nay, et al.
Publicado: (2024)
Towards noise-robust speech inversion through multi-task learning with speech enhancement
por: Tabatabaee, Saba, et al.
Publicado: (2026)
por: Tabatabaee, Saba, et al.
Publicado: (2026)
Activation Steering for Accent-Neutralized Zero-Shot Text-To-Speech
por: Yang, Mu, et al.
Publicado: (2026)
por: Yang, Mu, et al.
Publicado: (2026)
Distilling a speech and music encoder with task arithmetic
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2025)
por: Ritter-Gutierrez, Fabian, et al.
Publicado: (2025)
Spatially constrained vs. unconstrained filtering in neural spatiospectral filters for multichannel speech enhancement
por: Briegleb, Annika, et al.
Publicado: (2024)
por: Briegleb, Annika, et al.
Publicado: (2024)
Throat and acoustic paired speech dataset for deep learning-based speech enhancement
por: Kim, Yunsik, et al.
Publicado: (2025)
por: Kim, Yunsik, et al.
Publicado: (2025)
An adaptive filter bank based neural network approach for time delay estimation and speech enhancement
por: Ma, Lu
Publicado: (2025)
por: Ma, Lu
Publicado: (2025)
Unsupervised speech enhancement with spectral kurtosis and double deep priors
por: Ohnaka, Hien, et al.
Publicado: (2024)
por: Ohnaka, Hien, et al.
Publicado: (2024)
SPGM: Prioritizing Local Features for enhanced speech separation performance
por: Yip, Jia Qi, et al.
Publicado: (2023)
por: Yip, Jia Qi, et al.
Publicado: (2023)
Inter-channel Conv-TasNet for multichannel speech enhancement
por: Lee, Dongheon, et al.
Publicado: (2021)
por: Lee, Dongheon, et al.
Publicado: (2021)
The CHiME-7 UDASE task: Unsupervised domain adaptation for conversational speech enhancement
por: Leglaive, Simon, et al.
Publicado: (2023)
por: Leglaive, Simon, et al.
Publicado: (2023)
Real-time speech enhancement in noise for throat microphone using neural audio codec as foundation model
por: Hauret, Julien, et al.
Publicado: (2025)
por: Hauret, Julien, et al.
Publicado: (2025)
Modeling strategies for speech enhancement in the latent space of a neural audio codec
por: Kammoun, Sofiene, et al.
Publicado: (2025)
por: Kammoun, Sofiene, et al.
Publicado: (2025)
Universal Speech Enhancement with Regression and Generative Mamba
por: Chao, Rong, et al.
Publicado: (2025)
por: Chao, Rong, et al.
Publicado: (2025)
Deep low-latency joint speech transmission and enhancement over a gaussian channel
por: Bokaei, Mohammad, et al.
Publicado: (2024)
por: Bokaei, Mohammad, et al.
Publicado: (2024)
U-Mamba-Net: A highly efficient Mamba-based U-net style network for noisy and reverberant speech separation
por: Dang, Shaoxiang, et al.
Publicado: (2024)
por: Dang, Shaoxiang, et al.
Publicado: (2024)
Using RLHF to align speech enhancement approaches to mean-opinion quality scores
por: Kumar, Anurag, et al.
Publicado: (2024)
por: Kumar, Anurag, et al.
Publicado: (2024)
Direct Punjabi to English speech translation using discrete units
por: Kaur, Prabhjot, et al.
Publicado: (2024)
por: Kaur, Prabhjot, et al.
Publicado: (2024)
Granite-speech: open-source speech-aware LLMs with strong English ASR capabilities
por: Saon, George, et al.
Publicado: (2025)
por: Saon, George, et al.
Publicado: (2025)
SLM-S2ST: A multimodal language model for direct speech-to-speech translation
por: Hu, Yuxuan, et al.
Publicado: (2025)
por: Hu, Yuxuan, et al.
Publicado: (2025)
Joint decoding method for controllable contextual speech recognition based on Speech LLM
por: Fang, Yangui, et al.
Publicado: (2025)
por: Fang, Yangui, et al.
Publicado: (2025)
Assessing speech quality metrics for evaluation of neural audio codecs under clean speech conditions
por: Mack, Wolfgang, et al.
Publicado: (2025)
por: Mack, Wolfgang, et al.
Publicado: (2025)
Real-time multichannel deep speech enhancement in hearing aids: Comparing monaural and binaural processing in complex acoustic scenarios
por: Westhausen, Nils L., et al.
Publicado: (2024)
por: Westhausen, Nils L., et al.
Publicado: (2024)
Configurable EBEN: Extreme Bandwidth Extension Network to enhance body-conducted speech capture
por: Hauret, Julien, et al.
Publicado: (2023)
por: Hauret, Julien, et al.
Publicado: (2023)
Ejemplares similares
-
Restorative Speech Enhancement: A Progressive Approach Using SE and Codec Modules
por: Chiang, Hsin-Tien, et al.
Publicado: (2024) -
GDiffuSE: Diffusion-based speech enhancement with noise model guidance
por: Yanir, Efrayim, et al.
Publicado: (2025) -
A computational loudness model for electrical stimulation with cochlear implants
por: Alvarez, Franklin, et al.
Publicado: (2025) -
FreeCodec: A disentangled neural speech codec with fewer tokens
por: Zheng, Youqiang, et al.
Publicado: (2024) -
Enhancing spatial hearing with cochlear implants: exploring the role of AI, multimodal interaction and perceptual training
por: Picinali, Lorenzo, et al.
Publicado: (2026)