Enhancement by postfiltering for speech and audio coding in ad-hoc sensor networks
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Das, Sneha, Bäckström, Tom |
|---|---|
| Format: | Preprint |
| Publié: |
2020
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Privacy in Speech Technology
par: Bäckström, Tom
Publié: (2023)
par: Bäckström, Tom
Publié: (2023)
Modeling strategies for speech enhancement in the latent space of a neural audio codec
par: Kammoun, Sofiene, et autres
Publié: (2025)
par: Kammoun, Sofiene, et autres
Publié: (2025)
An automatic mixing speech enhancement system for multi-track audio
par: Liu, Xiaojing, et autres
Publié: (2024)
par: Liu, Xiaojing, et autres
Publié: (2024)
Examining the Interplay Between Privacy and Fairness for Speech Processing: A Review and Perspective
par: Leschanowsky, Anna, et autres
Publié: (2024)
par: Leschanowsky, Anna, et autres
Publié: (2024)
LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition
par: Kwak, Doyeop, et autres
Publié: (2026)
par: Kwak, Doyeop, et autres
Publié: (2026)
Scaling up masked audio encoder learning for general audio classification
par: Dinkel, Heinrich, et autres
Publié: (2024)
par: Dinkel, Heinrich, et autres
Publié: (2024)
Can large audio language models understand child stuttering speech? speech summarization, and source separation
par: Okocha, Chibuzor, et autres
Publié: (2025)
par: Okocha, Chibuzor, et autres
Publié: (2025)
Late fusion ensembles for speech recognition on diverse input audio representations
par: Jezidžić, Marin, et autres
Publié: (2024)
par: Jezidžić, Marin, et autres
Publié: (2024)
Exploring Local Interpretable Model-Agnostic Explanations for Speech Emotion Recognition with Distribution-Shift
par: Hjuler, Maja J., et autres
Publié: (2025)
par: Hjuler, Maja J., et autres
Publié: (2025)
AEROMamba: An efficient architecture for audio super-resolution using generative adversarial networks and state space models
par: Abreu, Wallace, et autres
Publié: (2024)
par: Abreu, Wallace, et autres
Publié: (2024)
LABNet: A Lightweight Attentive Beamforming Network for Ad-hoc Multichannel Microphone Invariant Real-Time Speech Enhancement
par: Yan, Haoyin, et autres
Publié: (2025)
par: Yan, Haoyin, et autres
Publié: (2025)
Towards audio language modeling -- an overview
par: Wu, Haibin, et autres
Publié: (2024)
par: Wu, Haibin, et autres
Publié: (2024)
Are audio DeepFake detection models polyglots?
par: Marek, Bartłomiej, et autres
Publié: (2024)
par: Marek, Bartłomiej, et autres
Publié: (2024)
The role of audio-visual integration in the time course of phonetic encoding in self-supervised speech models
par: Wang, Yi, et autres
Publié: (2025)
par: Wang, Yi, et autres
Publié: (2025)
An adaptive filter bank based neural network approach for time delay estimation and speech enhancement
par: Ma, Lu
Publié: (2025)
par: Ma, Lu
Publié: (2025)
Tweaking autoregressive methods for inpainting of gaps in audio signals
par: Mokrý, Ondřej, et autres
Publié: (2024)
par: Mokrý, Ondřej, et autres
Publié: (2024)
MBCodec:Thorough disentangle for high-fidelity audio compression
par: Zhang, Ruonan, et autres
Publié: (2025)
par: Zhang, Ruonan, et autres
Publié: (2025)
Real-time implementation of vibrato transfer as an audio effect
par: Hyrkas, Jeremy
Publié: (2025)
par: Hyrkas, Jeremy
Publié: (2025)
KS-Net: Multi-band joint speech restoration and enhancement network for 2024 ICASSP SSI Challenge
par: Yu, Guochen, et autres
Publié: (2024)
par: Yu, Guochen, et autres
Publié: (2024)
Multi-modal Speech Enhancement with Limited Electromyography Channels
par: Feng, Fuyuan, et autres
Publié: (2025)
par: Feng, Fuyuan, et autres
Publié: (2025)
Speaker anonymization using neural audio codec language models
par: Panariello, Michele, et autres
Publié: (2023)
par: Panariello, Michele, et autres
Publié: (2023)
FxSearcher: gradient-free text-driven audio transformation
par: Ki, Hojoon, et autres
Publié: (2025)
par: Ki, Hojoon, et autres
Publié: (2025)
Regularized autoregressive modeling and its application to audio signal reconstruction
par: Mokrý, Ondřej, et autres
Publié: (2024)
par: Mokrý, Ondřej, et autres
Publié: (2024)
EDTC: enhance depth of text comprehension in automated audio captioning
par: Tan, Liwen, et autres
Publié: (2024)
par: Tan, Liwen, et autres
Publié: (2024)
Towards noise-robust speech inversion through multi-task learning with speech enhancement
par: Tabatabaee, Saba, et autres
Publié: (2026)
par: Tabatabaee, Saba, et autres
Publié: (2026)
EBEN: Extreme bandwidth extension network applied to speech signals captured with noise-resilient body-conduction microphones
par: Hauret, Julien, et autres
Publié: (2022)
par: Hauret, Julien, et autres
Publié: (2022)
On the relationship between speech and hearing
par: Umesh, Srinivasan, et autres
Publié: (2024)
par: Umesh, Srinivasan, et autres
Publié: (2024)
Towards generalizing deep-audio fake detection networks
par: Gasenzer, Konstantin, et autres
Publié: (2023)
par: Gasenzer, Konstantin, et autres
Publié: (2023)
Robust fine-tuning of speech recognition models via model merging: application to disordered speech
par: Ducorroy, Alexandre, et autres
Publié: (2025)
par: Ducorroy, Alexandre, et autres
Publié: (2025)
AxLSTMs: learning self-supervised audio representations with xLSTMs
par: Yadav, Sarthak, et autres
Publié: (2024)
par: Yadav, Sarthak, et autres
Publié: (2024)
STASE: A spatialized text-to-audio synthesis engine for music generation
par: Chi, Tutti, et autres
Publié: (2025)
par: Chi, Tutti, et autres
Publié: (2025)
Deep learning based spatial aliasing reduction in beamforming for audio capture
par: Guzik, Mateusz, et autres
Publié: (2025)
par: Guzik, Mateusz, et autres
Publié: (2025)
Human-CLAP: Human-perception-based contrastive language-audio pretraining
par: Takano, Taisei, et autres
Publié: (2025)
par: Takano, Taisei, et autres
Publié: (2025)
DashengTokenizer: One layer is enough for unified audio understanding and generation
par: Dinkel, Heinrich, et autres
Publié: (2026)
par: Dinkel, Heinrich, et autres
Publié: (2026)
DualSep: A Light-weight dual-encoder convolutional recurrent network for real-time in-car speech separation
par: Wang, Ziqian, et autres
Publié: (2024)
par: Wang, Ziqian, et autres
Publié: (2024)
An interpretable speech foundation model for depression detection by revealing prediction-relevant acoustic features from long speech
par: Deng, Qingkun, et autres
Publié: (2024)
par: Deng, Qingkun, et autres
Publié: (2024)
RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio
par: Kanamori, Yusuke, et autres
Publié: (2025)
par: Kanamori, Yusuke, et autres
Publié: (2025)
ICGAN: An implicit conditioning method for interpretable feature control of neural audio synthesis
par: Liu, Yunyi, et autres
Publié: (2024)
par: Liu, Yunyi, et autres
Publié: (2024)
A robust audio deepfake detection system via multi-view feature
par: Yang, Yujie, et autres
Publié: (2024)
par: Yang, Yujie, et autres
Publié: (2024)
Reconstructing the Charlie Parker Omnibook using an audio-to-score automatic transcription pipeline
par: Riley, Xavier, et autres
Publié: (2024)
par: Riley, Xavier, et autres
Publié: (2024)
Documents similaires
-
Privacy in Speech Technology
par: Bäckström, Tom
Publié: (2023) -
Modeling strategies for speech enhancement in the latent space of a neural audio codec
par: Kammoun, Sofiene, et autres
Publié: (2025) -
An automatic mixing speech enhancement system for multi-track audio
par: Liu, Xiaojing, et autres
Publié: (2024) -
Examining the Interplay Between Privacy and Fairness for Speech Processing: A Review and Perspective
par: Leschanowsky, Anna, et autres
Publié: (2024) -
LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition
par: Kwak, Doyeop, et autres
Publié: (2026)