Wavehax: Aliasing-Free Neural Waveform Synthesis Based on 2D Convolution and Harmonic Prior for Reliable Complex Spectrogram Estimation
Fuente:
arXiv
Salvato in:
| Autori principali: | Yoneyama, Reo, Miyashita, Atsushi, Yamamoto, Ryuichi, Toda, Tomoki |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments
di: Yoneyama, Reo, et al.
Pubblicazione: (2025)
di: Yoneyama, Reo, et al.
Pubblicazione: (2025)
Learning Multidimensional Disentangled Representations of Instrumental Sounds for Musical Similarity Assessment
di: Hashizume, Yuka, et al.
Pubblicazione: (2024)
di: Hashizume, Yuka, et al.
Pubblicazione: (2024)
Learning Separated Representations for Instrument-based Music Similarity
di: Hashizume, Yuka, et al.
Pubblicazione: (2025)
di: Hashizume, Yuka, et al.
Pubblicazione: (2025)
QHARMA-GAN: Quasi-Harmonic Neural Vocoder based on Autoregressive Moving Average Model
di: Chen, Shaowen, et al.
Pubblicazione: (2025)
di: Chen, Shaowen, et al.
Pubblicazione: (2025)
Aliasing-Free Neural Audio Synthesis
di: Gu, Yicheng, et al.
Pubblicazione: (2025)
di: Gu, Yicheng, et al.
Pubblicazione: (2025)
Electrolaryngeal Speech Intelligibility Enhancement Through Robust Linguistic Encoders
di: Violeta, Lester Phillip, et al.
Pubblicazione: (2023)
di: Violeta, Lester Phillip, et al.
Pubblicazione: (2023)
Eigenvoice Synthesis based on Model Editing for Speaker Generation
di: Murata, Masato, et al.
Pubblicazione: (2025)
di: Murata, Masato, et al.
Pubblicazione: (2025)
SVDD 2024: The Inaugural Singing Voice Deepfake Detection Challenge
di: Zhang, You, et al.
Pubblicazione: (2024)
di: Zhang, You, et al.
Pubblicazione: (2024)
Investigation of perceptual music similarity focusing on each instrumental part
di: Hashizume, Yuka, et al.
Pubblicazione: (2025)
di: Hashizume, Yuka, et al.
Pubblicazione: (2025)
SHEET: A Multi-purpose Open-source Speech Human Evaluation Estimation Toolkit
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2025)
Serial-OE: Anomalous sound detection based on serial method with outlier exposure capable of using small amounts of anomalous data for training
di: Kuroyanagi, Ibuki, et al.
Pubblicazione: (2025)
di: Kuroyanagi, Ibuki, et al.
Pubblicazione: (2025)
Enhancing Spectrogram Realism in Singing Voice Synthesis via Explicit Bandwidth Extension Prior to Vocoder
di: Yang, Runxuan, et al.
Pubblicazione: (2025)
di: Yang, Runxuan, et al.
Pubblicazione: (2025)
Improved Architecture for High-resolution Piano Transcription to Efficiently Capture Acoustic Characteristics of Music Signals
di: Mi, Jinyi, et al.
Pubblicazione: (2024)
di: Mi, Jinyi, et al.
Pubblicazione: (2024)
Improvements of Discriminative Feature Space Training for Anomalous Sound Detection in Unlabeled Conditions
di: Fujimura, Takuya, et al.
Pubblicazione: (2024)
di: Fujimura, Takuya, et al.
Pubblicazione: (2024)
MOS-Bench: Benchmarking Generalization Abilities of Subjective Speech Quality Assessment Models
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)
di: Huang, Wen-Chin, et al.
Pubblicazione: (2024)
Audio Classification of Low Feature Spectrograms Utilizing Convolutional Neural Networks
di: Elias, Noel
Pubblicazione: (2024)
di: Elias, Noel
Pubblicazione: (2024)
Serenade: A Singing Style Conversion Framework Based On Audio Infilling
di: Violeta, Lester Phillip, et al.
Pubblicazione: (2025)
di: Violeta, Lester Phillip, et al.
Pubblicazione: (2025)
Improving Anomalous Sound Detection through Pseudo-anomalous Set Selection and Pseudo-label Utilization under Unlabeled Conditions
di: Kuroyanagi, Ibuki, et al.
Pubblicazione: (2025)
di: Kuroyanagi, Ibuki, et al.
Pubblicazione: (2025)
Distinguishing Neural Speech Synthesis Models Through Fingerprints in Speech Waveforms
di: Zhang, Chu Yuan, et al.
Pubblicazione: (2023)
di: Zhang, Chu Yuan, et al.
Pubblicazione: (2023)
Music Similarity Representation Learning Focusing on Individual Instruments with Source Separation and Human Preference
di: Imamura, Takehiro, et al.
Pubblicazione: (2025)
di: Imamura, Takehiro, et al.
Pubblicazione: (2025)
Unifying Listener Scoring Scales: Comparison Learning Framework for Speech Quality Assessment and Continuous Speech Emotion Recognition
di: Hu, Cheng-Hung, et al.
Pubblicazione: (2025)
di: Hu, Cheng-Hung, et al.
Pubblicazione: (2025)
CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection
di: Zang, Yongyi, et al.
Pubblicazione: (2024)
di: Zang, Yongyi, et al.
Pubblicazione: (2024)
SVDD Challenge 2024: A Singing Voice Deepfake Detection Challenge Evaluation Plan
di: Zhang, You, et al.
Pubblicazione: (2024)
di: Zhang, You, et al.
Pubblicazione: (2024)
ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram
di: Jiang, Xiao-Hang, et al.
Pubblicazione: (2024)
di: Jiang, Xiao-Hang, et al.
Pubblicazione: (2024)
Layer-wise Analysis for Quality of Multilingual Synthesized Speech
di: Cooper, Erica, et al.
Pubblicazione: (2025)
di: Cooper, Erica, et al.
Pubblicazione: (2025)
ASM: Audio Spectrogram Mixer
di: Ji, Qingfeng, et al.
Pubblicazione: (2024)
di: Ji, Qingfeng, et al.
Pubblicazione: (2024)
Real-Time Pitch/F0 Detection Using Spectrogram Images and Convolutional Neural Networks
di: Zhao, Xufang, et al.
Pubblicazione: (2025)
di: Zhao, Xufang, et al.
Pubblicazione: (2025)
Aliasing Reduction in Neural Amp Modeling by Smoothing Activations
di: Sato, Ryota, et al.
Pubblicazione: (2025)
di: Sato, Ryota, et al.
Pubblicazione: (2025)
Convolutional Variational Autoencoders for Spectrogram Compression in Automatic Speech Recognition
di: Iakovenko, Olga, et al.
Pubblicazione: (2024)
di: Iakovenko, Olga, et al.
Pubblicazione: (2024)
FAST: Fast Audio Spectrogram Transformer
di: Naman, Anugunj, et al.
Pubblicazione: (2025)
di: Naman, Anugunj, et al.
Pubblicazione: (2025)
SpecMaskGIT: Masked Generative Modeling of Audio Spectrograms for Efficient Audio Synthesis and Beyond
di: Comunità, Marco, et al.
Pubblicazione: (2024)
di: Comunità, Marco, et al.
Pubblicazione: (2024)
PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding
di: He, Jiajun, et al.
Pubblicazione: (2025)
di: He, Jiajun, et al.
Pubblicazione: (2025)
Handling Domain Shifts for Anomalous Sound Detection: A Review of DCASE-Related Work
di: Wilkinghoff, Kevin, et al.
Pubblicazione: (2025)
di: Wilkinghoff, Kevin, et al.
Pubblicazione: (2025)
Ambisonics Super-Resolution Using A Waveform-Domain Neural Network
di: Nawfal, Ismael, et al.
Pubblicazione: (2025)
di: Nawfal, Ismael, et al.
Pubblicazione: (2025)
An Attribute Interpolation Method in Speech Synthesis by Model Merging
di: Murata, Masato, et al.
Pubblicazione: (2024)
di: Murata, Masato, et al.
Pubblicazione: (2024)
Mel-Spectrogram Inversion via Alternating Direction Method of Multipliers
di: Masuyama, Yoshiki, et al.
Pubblicazione: (2025)
di: Masuyama, Yoshiki, et al.
Pubblicazione: (2025)
Vision Language Models Are Few-Shot Audio Spectrogram Classifiers
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
di: Dixit, Satvik, et al.
Pubblicazione: (2024)
A Practical Guide to Spectrogram Analysis for Audio Signal Processing
di: Khodzhaev, Zulfidin
Pubblicazione: (2024)
di: Khodzhaev, Zulfidin
Pubblicazione: (2024)
Comparison Performance of Spectrogram and Scalogram as Input of Acoustic Recognition Task
di: Phan, Dang Thoai
Pubblicazione: (2024)
di: Phan, Dang Thoai
Pubblicazione: (2024)
Leveraging AM and FM Rhythm Spectrograms for Dementia Classification and Assessment
di: Gogoi, Parismita, et al.
Pubblicazione: (2025)
di: Gogoi, Parismita, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments
di: Yoneyama, Reo, et al.
Pubblicazione: (2025) -
Learning Multidimensional Disentangled Representations of Instrumental Sounds for Musical Similarity Assessment
di: Hashizume, Yuka, et al.
Pubblicazione: (2024) -
Learning Separated Representations for Instrument-based Music Similarity
di: Hashizume, Yuka, et al.
Pubblicazione: (2025) -
QHARMA-GAN: Quasi-Harmonic Neural Vocoder based on Autoregressive Moving Average Model
di: Chen, Shaowen, et al.
Pubblicazione: (2025) -
Aliasing-Free Neural Audio Synthesis
di: Gu, Yicheng, et al.
Pubblicazione: (2025)