CleanMel: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR
Fuente:
arXiv
Salvato in:
| Autori principali: | Shao, Nian, Zhou, Rui, Wang, Pengyu, Li, Xian, Fang, Ying, Yang, Yujie, Li, Xiaofei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mel-FullSubNet: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR
di: Zhou, Rui, et al.
Pubblicazione: (2024)
di: Zhou, Rui, et al.
Pubblicazione: (2024)
Mel-McNet: A Mel-Scale Framework for Online Multichannel Speech Enhancement
di: Yang, Yujie, et al.
Pubblicazione: (2025)
di: Yang, Yujie, et al.
Pubblicazione: (2025)
A Mel Spectrogram Enhancement Paradigm Based on CWT in Speech Synthesis
di: Hu, Guoqiang, et al.
Pubblicazione: (2024)
di: Hu, Guoqiang, et al.
Pubblicazione: (2024)
DMF2Mel: A Dynamic Multiscale Fusion Network for EEG-Driven Mel Spectrogram Reconstruction
di: Fan, Cunhang, et al.
Pubblicazione: (2025)
di: Fan, Cunhang, et al.
Pubblicazione: (2025)
Mel-Refine: A Plug-and-Play Approach to Refine Mel-Spectrogram in Audio Generation
di: Guo, Hongming, et al.
Pubblicazione: (2024)
di: Guo, Hongming, et al.
Pubblicazione: (2024)
SSM2Mel: State Space Model to Reconstruct Mel Spectrogram from the EEG
di: Fan, Cunhang, et al.
Pubblicazione: (2025)
di: Fan, Cunhang, et al.
Pubblicazione: (2025)
Mel-Spectrogram Inversion via Alternating Direction Method of Multipliers
di: Masuyama, Yoshiki, et al.
Pubblicazione: (2025)
di: Masuyama, Yoshiki, et al.
Pubblicazione: (2025)
ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram
di: Jiang, Xiao-Hang, et al.
Pubblicazione: (2024)
di: Jiang, Xiao-Hang, et al.
Pubblicazione: (2024)
Music Genre Classification: A Comparative Analysis of CNN and XGBoost Approaches with Mel-frequency cepstral coefficients and Mel Spectrograms
di: Meng, Yigang
Pubblicazione: (2024)
di: Meng, Yigang
Pubblicazione: (2024)
RealMAN: A Real-Recorded and Annotated Microphone Array Dataset for Dynamic Speech Enhancement and Localization
di: Yang, Bing, et al.
Pubblicazione: (2024)
di: Yang, Bing, et al.
Pubblicazione: (2024)
FreeV: Free Lunch For Vocoders Through Pseudo Inversed Mel Filter
di: Lv, Yuanjun, et al.
Pubblicazione: (2024)
di: Lv, Yuanjun, et al.
Pubblicazione: (2024)
Fine-tune the pretrained ATST model for sound event detection
di: Shao, Nian, et al.
Pubblicazione: (2023)
di: Shao, Nian, et al.
Pubblicazione: (2023)
MelTok: 2D Tokenization for Single-Codebook Audio Compression
di: Li, Jingyi, et al.
Pubblicazione: (2025)
di: Li, Jingyi, et al.
Pubblicazione: (2025)
Mel-RoFormer for Vocal Separation and Vocal Melody Transcription
di: Wang, Ju-Chiang, et al.
Pubblicazione: (2024)
di: Wang, Ju-Chiang, et al.
Pubblicazione: (2024)
dMel: Speech Tokenization made Simple
di: Bai, Richard He, et al.
Pubblicazione: (2024)
di: Bai, Richard He, et al.
Pubblicazione: (2024)
MelHuBERT: A simplified HuBERT on Mel spectrograms
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2022)
di: Lin, Tzu-Quan, et al.
Pubblicazione: (2022)
Mamba for Streaming ASR Combined with Unimodal Aggregation
di: Fang, Ying, et al.
Pubblicazione: (2024)
di: Fang, Ying, et al.
Pubblicazione: (2024)
StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
Is GAN Necessary for Mel-Spectrogram-based Neural Vocoder?
di: Du, Hui-Peng, et al.
Pubblicazione: (2025)
di: Du, Hui-Peng, et al.
Pubblicazione: (2025)
Dual-View Predictive Diffusion: Lightweight Speech Enhancement via Spectrogram-Image Synergy
di: Xue, Ke, et al.
Pubblicazione: (2026)
di: Xue, Ke, et al.
Pubblicazione: (2026)
Multichannel Long-Term Streaming Neural Speech Enhancement for Static and Moving Speakers
di: Quan, Changsheng, et al.
Pubblicazione: (2024)
di: Quan, Changsheng, et al.
Pubblicazione: (2024)
Pseudo-Cepstrum: Pitch Modification for Mel-Based Neural Vocoders
di: Ellinas, Nikolaos, et al.
Pubblicazione: (2025)
di: Ellinas, Nikolaos, et al.
Pubblicazione: (2025)
Unimodal Aggregation for CTC-based Speech Recognition
di: Fang, Ying, et al.
Pubblicazione: (2023)
di: Fang, Ying, et al.
Pubblicazione: (2023)
Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment
di: Wang, Wei, et al.
Pubblicazione: (2025)
di: Wang, Wei, et al.
Pubblicazione: (2025)
Real-Time Streaming Mel Vocoding with Generative Flow Matching
di: Welker, Simon, et al.
Pubblicazione: (2025)
di: Welker, Simon, et al.
Pubblicazione: (2025)
Speech Emotion Recognition with ASR Integration
di: Li, Yuanchao
Pubblicazione: (2026)
di: Li, Yuanchao
Pubblicazione: (2026)
Audio Signal Processing Using Time Domain Mel-Frequency Wavelet Coefficient
di: Sebastian, Rinku, et al.
Pubblicazione: (2025)
di: Sebastian, Rinku, et al.
Pubblicazione: (2025)
MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables
di: Yeh, Sung-Lin, et al.
Pubblicazione: (2026)
di: Yeh, Sung-Lin, et al.
Pubblicazione: (2026)
Comparative Analysis of Mel-Frequency Cepstral Coefficients and Wavelet Based Audio Signal Processing for Emotion Detection and Mental Health Assessment in Spoken Speech
di: Agbo, Idoko, et al.
Pubblicazione: (2024)
di: Agbo, Idoko, et al.
Pubblicazione: (2024)
RCT: Random Consistency Training for Semi-supervised Sound Event Detection
di: Shao, Nian, et al.
Pubblicazione: (2021)
di: Shao, Nian, et al.
Pubblicazione: (2021)
Real-Time Emergency Vehicle Detection using Mel Spectrograms and Regular Expressions
di: Pacheco-Gonzalez, Alberto, et al.
Pubblicazione: (2023)
di: Pacheco-Gonzalez, Alberto, et al.
Pubblicazione: (2023)
Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition
di: Bai, Ye, et al.
Pubblicazione: (2024)
di: Bai, Ye, et al.
Pubblicazione: (2024)
A Neural Denoising Vocoder for Clean Waveform Generation from Noisy Mel-Spectrogram based on Amplitude and Phase Predictions
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
Synchronized Video-to-Audio Generation via Mel Quantization-Continuum Decomposition
di: Wang, Juncheng, et al.
Pubblicazione: (2025)
di: Wang, Juncheng, et al.
Pubblicazione: (2025)
Improved Remixing Process for Domain Adaptation-Based Speech Enhancement by Mitigating Data Imbalance in Signal-to-Noise Ratio
di: Li, Li, et al.
Pubblicazione: (2024)
di: Li, Li, et al.
Pubblicazione: (2024)
Improving Speech Enhancement by Cross- and Sub-band Processing with State Space Model
di: Li, Jizhen, et al.
Pubblicazione: (2025)
di: Li, Jizhen, et al.
Pubblicazione: (2025)
Crab: Multi Layer Contrastive Supervision to Improve Speech Emotion Recognition Under Both Acted and Natural Speech Condition
di: Ueda, Lucas H., et al.
Pubblicazione: (2026)
di: Ueda, Lucas H., et al.
Pubblicazione: (2026)
Improving Design of Input Condition Invariant Speech Enhancement
di: Zhang, Wangyou, et al.
Pubblicazione: (2024)
di: Zhang, Wangyou, et al.
Pubblicazione: (2024)
Dynamic Frequency-Adaptive Knowledge Distillation for Speech Enhancement
di: Yuan, Xihao, et al.
Pubblicazione: (2025)
di: Yuan, Xihao, et al.
Pubblicazione: (2025)
Enhanced Heart Sound Classification Using Mel Frequency Cepstral Coefficients and Comparative Analysis of Single vs. Ensemble Classifier Strategies
di: Rahmani, Amir Masoud, et al.
Pubblicazione: (2024)
di: Rahmani, Amir Masoud, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Mel-FullSubNet: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR
di: Zhou, Rui, et al.
Pubblicazione: (2024) -
Mel-McNet: A Mel-Scale Framework for Online Multichannel Speech Enhancement
di: Yang, Yujie, et al.
Pubblicazione: (2025) -
A Mel Spectrogram Enhancement Paradigm Based on CWT in Speech Synthesis
di: Hu, Guoqiang, et al.
Pubblicazione: (2024) -
DMF2Mel: A Dynamic Multiscale Fusion Network for EEG-Driven Mel Spectrogram Reconstruction
di: Fan, Cunhang, et al.
Pubblicazione: (2025) -
Mel-Refine: A Plug-and-Play Approach to Refine Mel-Spectrogram in Audio Generation
di: Guo, Hongming, et al.
Pubblicazione: (2024)