Mel-Spectrogram Inversion via Alternating Direction Method of Multipliers
Fuente:
arXiv
Guardado en:
| Autores principales: | Masuyama, Yoshiki, Ueno, Natsuki, Ono, Nobutaka |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DMF2Mel: A Dynamic Multiscale Fusion Network for EEG-Driven Mel Spectrogram Reconstruction
por: Fan, Cunhang, et al.
Publicado: (2025)
por: Fan, Cunhang, et al.
Publicado: (2025)
ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram
por: Jiang, Xiao-Hang, et al.
Publicado: (2024)
por: Jiang, Xiao-Hang, et al.
Publicado: (2024)
Mel-Refine: A Plug-and-Play Approach to Refine Mel-Spectrogram in Audio Generation
por: Guo, Hongming, et al.
Publicado: (2024)
por: Guo, Hongming, et al.
Publicado: (2024)
SSM2Mel: State Space Model to Reconstruct Mel Spectrogram from the EEG
por: Fan, Cunhang, et al.
Publicado: (2025)
por: Fan, Cunhang, et al.
Publicado: (2025)
SELEBI: Percussion-aware Time Stretching via Selective Magnitude Spectrogram Compression by Nonstationary Gabor Transform
por: Akaishi, Natsuki, et al.
Publicado: (2026)
por: Akaishi, Natsuki, et al.
Publicado: (2026)
CleanMel: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR
por: Shao, Nian, et al.
Publicado: (2025)
por: Shao, Nian, et al.
Publicado: (2025)
Exploring the Capability of Mamba in Speech Applications
por: Miyazaki, Koichi, et al.
Publicado: (2024)
por: Miyazaki, Koichi, et al.
Publicado: (2024)
Mamba-based Decoder-Only Approach with Bidirectional Speech Modeling for Speech Recognition
por: Masuyama, Yoshiki, et al.
Publicado: (2024)
por: Masuyama, Yoshiki, et al.
Publicado: (2024)
What Do Neurons Listen To? A Neuron-level Dissection of a General-purpose Audio Model
por: Kawamura, Takao, et al.
Publicado: (2026)
por: Kawamura, Takao, et al.
Publicado: (2026)
On the Invariance of Cross-Correlation Peak Positions Under Monotonic Signal Transformations, with Application to Fast Time Difference Estimation
por: Ueno, Natsuki, et al.
Publicado: (2025)
por: Ueno, Natsuki, et al.
Publicado: (2025)
A Mel Spectrogram Enhancement Paradigm Based on CWT in Speech Synthesis
por: Hu, Guoqiang, et al.
Publicado: (2024)
por: Hu, Guoqiang, et al.
Publicado: (2024)
Music Genre Classification: A Comparative Analysis of CNN and XGBoost Approaches with Mel-frequency cepstral coefficients and Mel Spectrograms
por: Meng, Yigang
Publicado: (2024)
por: Meng, Yigang
Publicado: (2024)
Physics-Informed Direction-Aware Neural Acoustic Fields
por: Masuyama, Yoshiki, et al.
Publicado: (2025)
por: Masuyama, Yoshiki, et al.
Publicado: (2025)
Retrieval-Augmented Neural Field for HRTF Upsampling and Personalization
por: Masuyama, Yoshiki, et al.
Publicado: (2025)
por: Masuyama, Yoshiki, et al.
Publicado: (2025)
Physics-Informed Machine Learning For Sound Field Estimation
por: Koyama, Shoichi, et al.
Publicado: (2024)
por: Koyama, Shoichi, et al.
Publicado: (2024)
ASM: Audio Spectrogram Mixer
por: Ji, Qingfeng, et al.
Publicado: (2024)
por: Ji, Qingfeng, et al.
Publicado: (2024)
NIIRF: Neural IIR Filter Field for HRTF Upsampling and Personalization
por: Masuyama, Yoshiki, et al.
Publicado: (2024)
por: Masuyama, Yoshiki, et al.
Publicado: (2024)
FAST: Fast Audio Spectrogram Transformer
por: Naman, Anugunj, et al.
Publicado: (2025)
por: Naman, Anugunj, et al.
Publicado: (2025)
Velocity Potential Neural Field for Efficient Ambisonics Impulse Response Modeling
por: Masuyama, Yoshiki, et al.
Publicado: (2026)
por: Masuyama, Yoshiki, et al.
Publicado: (2026)
Mel-McNet: A Mel-Scale Framework for Online Multichannel Speech Enhancement
por: Yang, Yujie, et al.
Publicado: (2025)
por: Yang, Yujie, et al.
Publicado: (2025)
Mel-RoFormer for Vocal Separation and Vocal Melody Transcription
por: Wang, Ju-Chiang, et al.
Publicado: (2024)
por: Wang, Ju-Chiang, et al.
Publicado: (2024)
Dual-View Predictive Diffusion: Lightweight Speech Enhancement via Spectrogram-Image Synergy
por: Xue, Ke, et al.
Publicado: (2026)
por: Xue, Ke, et al.
Publicado: (2026)
MelTok: 2D Tokenization for Single-Codebook Audio Compression
por: Li, Jingyi, et al.
Publicado: (2025)
por: Li, Jingyi, et al.
Publicado: (2025)
Enhancing Spectrogram Realism in Singing Voice Synthesis via Explicit Bandwidth Extension Prior to Vocoder
por: Yang, Runxuan, et al.
Publicado: (2025)
por: Yang, Runxuan, et al.
Publicado: (2025)
FreeV: Free Lunch For Vocoders Through Pseudo Inversed Mel Filter
por: Lv, Yuanjun, et al.
Publicado: (2024)
por: Lv, Yuanjun, et al.
Publicado: (2024)
Leveraging AM and FM Rhythm Spectrograms for Dementia Classification and Assessment
por: Gogoi, Parismita, et al.
Publicado: (2025)
por: Gogoi, Parismita, et al.
Publicado: (2025)
Vision Language Models Are Few-Shot Audio Spectrogram Classifiers
por: Dixit, Satvik, et al.
Publicado: (2024)
por: Dixit, Satvik, et al.
Publicado: (2024)
A Practical Guide to Spectrogram Analysis for Audio Signal Processing
por: Khodzhaev, Zulfidin
Publicado: (2024)
por: Khodzhaev, Zulfidin
Publicado: (2024)
Comparison Performance of Spectrogram and Scalogram as Input of Acoustic Recognition Task
por: Phan, Dang Thoai
Publicado: (2024)
por: Phan, Dang Thoai
Publicado: (2024)
Adapter Incremental Continual Learning of Efficient Audio Spectrogram Transformers
por: Selvaraj, Nithish Muthuchamy, et al.
Publicado: (2023)
por: Selvaraj, Nithish Muthuchamy, et al.
Publicado: (2023)
ASGIR: Audio Spectrogram Transformer Guided Classification And Information Retrieval For Birds
por: Chaudhuri, Yashwardhan, et al.
Publicado: (2024)
por: Chaudhuri, Yashwardhan, et al.
Publicado: (2024)
FasTUSS: Faster Task-Aware Unified Source Separation
por: Paissan, Francesco, et al.
Publicado: (2025)
por: Paissan, Francesco, et al.
Publicado: (2025)
Distilling Spectrograms into Tokens: Fast and Lightweight Bioacoustic Classification for BirdCLEF+ 2025
por: Miyaguchi, Anthony, et al.
Publicado: (2025)
por: Miyaguchi, Anthony, et al.
Publicado: (2025)
Evaluating CNN with Stacked Feature Representations and Audio Spectrogram Transformer Models for Sound Classification
por: Dehaghania, Parinaz Binandeh, et al.
Publicado: (2026)
por: Dehaghania, Parinaz Binandeh, et al.
Publicado: (2026)
Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training
por: Schmid, Florian, et al.
Publicado: (2024)
por: Schmid, Florian, et al.
Publicado: (2024)
SpecMaskGIT: Masked Generative Modeling of Audio Spectrograms for Efficient Audio Synthesis and Beyond
por: Comunità, Marco, et al.
Publicado: (2024)
por: Comunità, Marco, et al.
Publicado: (2024)
SGPA: Spectrogram-Guided Phonetic Alignment for Feasible Shapley Value Explanations in Multimodal Large Language Models
por: Pozorski, Paweł, et al.
Publicado: (2026)
por: Pozorski, Paweł, et al.
Publicado: (2026)
Speech-Declipping Transformer with Complex Spectrogram and Learnerble Temporal Features
por: Kwon, Younghoo, et al.
Publicado: (2024)
por: Kwon, Younghoo, et al.
Publicado: (2024)
FlexIO: Flexible Single- and Multi-Channel Speech Separation and Enhancement
por: Masuyama, Yoshiki, et al.
Publicado: (2025)
por: Masuyama, Yoshiki, et al.
Publicado: (2025)
Music De-limiter Networks via Sample-wise Gain Inversion
por: Jeon, Chang-Bin, et al.
Publicado: (2023)
por: Jeon, Chang-Bin, et al.
Publicado: (2023)
Ejemplares similares
-
DMF2Mel: A Dynamic Multiscale Fusion Network for EEG-Driven Mel Spectrogram Reconstruction
por: Fan, Cunhang, et al.
Publicado: (2025) -
ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram
por: Jiang, Xiao-Hang, et al.
Publicado: (2024) -
Mel-Refine: A Plug-and-Play Approach to Refine Mel-Spectrogram in Audio Generation
por: Guo, Hongming, et al.
Publicado: (2024) -
SSM2Mel: State Space Model to Reconstruct Mel Spectrogram from the EEG
por: Fan, Cunhang, et al.
Publicado: (2025) -
SELEBI: Percussion-aware Time Stretching via Selective Magnitude Spectrogram Compression by Nonstationary Gabor Transform
por: Akaishi, Natsuki, et al.
Publicado: (2026)