A Survey of Deep Learning for Complex Speech Spectrograms
Fuente:
arXiv
Guardado en:
| Autores principales: | Xie, Yuying, Tan, Zheng-Hua |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Complex Recurrent Variational Autoencoder with Application to Speech Enhancement
por: Xie, Yuying, et al.
Publicado: (2022)
por: Xie, Yuying, et al.
Publicado: (2022)
A Mel Spectrogram Enhancement Paradigm Based on CWT in Speech Synthesis
por: Hu, Guoqiang, et al.
Publicado: (2024)
por: Hu, Guoqiang, et al.
Publicado: (2024)
Explaining Spectrograms in Machine Learning: A Study on Neural Networks for Speech Classification
por: James, Jesin, et al.
Publicado: (2024)
por: James, Jesin, et al.
Publicado: (2024)
CleanMel: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR
por: Shao, Nian, et al.
Publicado: (2025)
por: Shao, Nian, et al.
Publicado: (2025)
Deepfake Audio Detection Using Spectrogram-based Feature and Ensemble of Deep Learning Models
por: Pham, Lam, et al.
Publicado: (2024)
por: Pham, Lam, et al.
Publicado: (2024)
xLSTM-SENet: xLSTM for Single-Channel Speech Enhancement
por: Kühne, Nikolai Lund, et al.
Publicado: (2025)
por: Kühne, Nikolai Lund, et al.
Publicado: (2025)
Efficient Fine-tuning of Audio Spectrogram Transformers via Soft Mixture of Adapters
por: Cappellazzo, Umberto, et al.
Publicado: (2024)
por: Cappellazzo, Umberto, et al.
Publicado: (2024)
MambAttention: Mamba with Multi-Head Attention for Generalizable Single-Channel Speech Enhancement
por: Kühne, Nikolai Lund, et al.
Publicado: (2025)
por: Kühne, Nikolai Lund, et al.
Publicado: (2025)
Exploring Resolution-Wise Shared Attention in Hybrid Mamba-U-Nets for Improved Cross-Corpus Speech Enhancement
por: Kühne, Nikolai Lund, et al.
Publicado: (2025)
por: Kühne, Nikolai Lund, et al.
Publicado: (2025)
ElasticAST: An Audio Spectrogram Transformer for All Length and Resolutions
por: Feng, Jiu, et al.
Publicado: (2024)
por: Feng, Jiu, et al.
Publicado: (2024)
Learning Temporal Resolution in Spectrogram for Audio Classification
por: Liu, Haohe, et al.
Publicado: (2022)
por: Liu, Haohe, et al.
Publicado: (2022)
OpenSTBench: Beyond Semantic Evaluation for Speech Translation
por: An, Yanjie, et al.
Publicado: (2026)
por: An, Yanjie, et al.
Publicado: (2026)
DSpAST: Disentangled Representations for Spatial Audio Reasoning with Large Language Models
por: Wilkinghoff, Kevin, et al.
Publicado: (2025)
por: Wilkinghoff, Kevin, et al.
Publicado: (2025)
Audio Mamba: Selective State Spaces for Self-Supervised Audio Representations
por: Yadav, Sarthak, et al.
Publicado: (2024)
por: Yadav, Sarthak, et al.
Publicado: (2024)
Robust Audio Anti-Spoofing with Fusion-Reconstruction Learning on Multi-Order Spectrograms
por: Wen, Penghui, et al.
Publicado: (2023)
por: Wen, Penghui, et al.
Publicado: (2023)
MixRep: Hidden Representation Mixup for Low-Resource Speech Recognition
por: Xie, Jiamin, et al.
Publicado: (2023)
por: Xie, Jiamin, et al.
Publicado: (2023)
Continuous Modeling of the Denoising Process for Speech Enhancement Based on Deep Learning
por: Guo, Zilu, et al.
Publicado: (2023)
por: Guo, Zilu, et al.
Publicado: (2023)
Bilingual Dual-Head Deep Model for Parkinson's Disease Detection from Speech
por: La Quatra, Moreno, et al.
Publicado: (2025)
por: La Quatra, Moreno, et al.
Publicado: (2025)
Heterogeneous Space Fusion and Dual-Dimension Attention: A New Paradigm for Speech Enhancement
por: Zheng, Tao, et al.
Publicado: (2024)
por: Zheng, Tao, et al.
Publicado: (2024)
Transfer Learning-Based Deep Residual Learning for Speech Recognition in Clean and Noisy Environments
por: Djeffal, Noussaiba, et al.
Publicado: (2025)
por: Djeffal, Noussaiba, et al.
Publicado: (2025)
Real-Time Pitch/F0 Detection Using Spectrogram Images and Convolutional Neural Networks
por: Zhao, Xufang, et al.
Publicado: (2025)
por: Zhao, Xufang, et al.
Publicado: (2025)
DualSpec: Text-to-spatial-audio Generation via Dual-Spectrogram Guided Diffusion Model
por: Zhao, Lei, et al.
Publicado: (2025)
por: Zhao, Lei, et al.
Publicado: (2025)
Spectrogram features for audio and speech analysis
por: McLoughlin, Ian, et al.
Publicado: (2026)
por: McLoughlin, Ian, et al.
Publicado: (2026)
Thinking in Directivity: Speech Large Language Model for Multi-Talker Directional Speech Recognition
por: Xie, Jiamin, et al.
Publicado: (2025)
por: Xie, Jiamin, et al.
Publicado: (2025)
AudioMAE++: learning better masked audio representations with SwiGLU FFNs
por: Yadav, Sarthak, et al.
Publicado: (2025)
por: Yadav, Sarthak, et al.
Publicado: (2025)
An overview of neural architectures for self-supervised audio representation learning from masked spectrograms
por: Yadav, Sarthak, et al.
Publicado: (2025)
por: Yadav, Sarthak, et al.
Publicado: (2025)
Neural Speech Embeddings for Speech Synthesis Based on Deep Generative Networks
por: Lee, Seo-Hyun, et al.
Publicado: (2023)
por: Lee, Seo-Hyun, et al.
Publicado: (2023)
Speaker and Style Disentanglement of Speech Based on Contrastive Predictive Coding Supported Factorized Variational Autoencoder
por: Xie, Yuying, et al.
Publicado: (2024)
por: Xie, Yuying, et al.
Publicado: (2024)
DEFORMER: Coupling Deformed Localized Patterns with Global Context for Robust End-to-end Speech Recognition
por: Xie, Jiamin, et al.
Publicado: (2022)
por: Xie, Jiamin, et al.
Publicado: (2022)
Music Genre Classification: A Comparative Analysis of CNN and XGBoost Approaches with Mel-frequency cepstral coefficients and Mel Spectrograms
por: Meng, Yigang
Publicado: (2024)
por: Meng, Yigang
Publicado: (2024)
The X-LANCE Technical Report for Interspeech 2024 Speech Processing Using Discrete Speech Unit Challenge
por: Guo, Yiwei, et al.
Publicado: (2024)
por: Guo, Yiwei, et al.
Publicado: (2024)
SpecWav-Attack: Leveraging Spectrogram Resizing and Wav2Vec 2.0 for Attacking Anonymized Speech
por: Li, Yuqi, et al.
Publicado: (2025)
por: Li, Yuqi, et al.
Publicado: (2025)
Linear-Complexity Self-Supervised Learning for Speech Processing
por: Zhang, Shucong, et al.
Publicado: (2024)
por: Zhang, Shucong, et al.
Publicado: (2024)
Qieemo: Speech Is All You Need in the Emotion Recognition in Conversations
por: Chen, Jinming, et al.
Publicado: (2025)
por: Chen, Jinming, et al.
Publicado: (2025)
Speech Emotion Recognition Using MFCC Features and LSTM-Based Deep Learning Model
por: Oluwademilade, Adelekun, et al.
Publicado: (2026)
por: Oluwademilade, Adelekun, et al.
Publicado: (2026)
Explaining Deep Learning Embeddings for Speech Emotion Recognition by Predicting Interpretable Acoustic Features
por: Dixit, Satvik, et al.
Publicado: (2024)
por: Dixit, Satvik, et al.
Publicado: (2024)
Stage-Wise and Prior-Aware Neural Speech Phase Prediction
por: Liu, Fei, et al.
Publicado: (2024)
por: Liu, Fei, et al.
Publicado: (2024)
Automatic Speech Recognition using Advanced Deep Learning Approaches: A survey
por: Kheddar, Hamza, et al.
Publicado: (2024)
por: Kheddar, Hamza, et al.
Publicado: (2024)
APG-MOS: Auditory Perception Guided-MOS Predictor for Synthetic Speech
por: Lian, Zhicheng, et al.
Publicado: (2025)
por: Lian, Zhicheng, et al.
Publicado: (2025)
Active Speech Enhancement: Active Speech Denoising Decliping and Deveraberation
por: Yaish, Ofir, et al.
Publicado: (2025)
por: Yaish, Ofir, et al.
Publicado: (2025)
Ejemplares similares
-
Complex Recurrent Variational Autoencoder with Application to Speech Enhancement
por: Xie, Yuying, et al.
Publicado: (2022) -
A Mel Spectrogram Enhancement Paradigm Based on CWT in Speech Synthesis
por: Hu, Guoqiang, et al.
Publicado: (2024) -
Explaining Spectrograms in Machine Learning: A Study on Neural Networks for Speech Classification
por: James, Jesin, et al.
Publicado: (2024) -
CleanMel: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR
por: Shao, Nian, et al.
Publicado: (2025) -
Deepfake Audio Detection Using Spectrogram-based Feature and Ensemble of Deep Learning Models
por: Pham, Lam, et al.
Publicado: (2024)