A Universal Harmonic Discriminator for High-quality GAN-based Vocoder
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Nan, Huang, Zhaolong, Zeng, Xiao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MDDM: A Multi-view Discriminative Enhanced Diffusion-based Model for Speech Enhancement
di: Xu, Nan, et al.
Pubblicazione: (2025)
di: Xu, Nan, et al.
Pubblicazione: (2025)
FA-GAN: Artifacts-free and Phase-aware High-fidelity GAN-based Vocoder
di: Shen, Rubing, et al.
Pubblicazione: (2024)
di: Shen, Rubing, et al.
Pubblicazione: (2024)
Is GAN Necessary for Mel-Spectrogram-based Neural Vocoder?
di: Du, Hui-Peng, et al.
Pubblicazione: (2025)
di: Du, Hui-Peng, et al.
Pubblicazione: (2025)
VNet: A GAN-based Multi-Tier Discriminator Network for Speech Synthesis Vocoders
di: Cao, Yubing, et al.
Pubblicazione: (2024)
di: Cao, Yubing, et al.
Pubblicazione: (2024)
QHARMA-GAN: Quasi-Harmonic Neural Vocoder based on Autoregressive Moving Average Model
di: Chen, Shaowen, et al.
Pubblicazione: (2025)
di: Chen, Shaowen, et al.
Pubblicazione: (2025)
An Investigation of Time-Frequency Representation Discriminators for High-Fidelity Vocoder
di: Gu, Yicheng, et al.
Pubblicazione: (2024)
di: Gu, Yicheng, et al.
Pubblicazione: (2024)
BigVSAN: Enhancing GAN-based Neural Vocoders with Slicing Adversarial Network
di: Shibuya, Takashi, et al.
Pubblicazione: (2023)
di: Shibuya, Takashi, et al.
Pubblicazione: (2023)
Vocoder-Projected Feature Discriminator
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2025)
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2025)
WaveNeXt 2: ConvNeXt-Based Fast Neural Vocoders With Residual Denoising and Sub-Modeling for GAN and Diffusion Models
di: Zhou, Wangzixi, et al.
Pubblicazione: (2026)
di: Zhou, Wangzixi, et al.
Pubblicazione: (2026)
BiVocoder: A Bidirectional Neural Vocoder Integrating Feature Extraction and Waveform Generation
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
Ultra-Low-Bitrate Mel-Spectrogram-based Neural Speech Coding with Flow-Matching-based Refinement and Vocoding-driven Reconstruction
di: Du, Hui-Peng, et al.
Pubblicazione: (2026)
di: Du, Hui-Peng, et al.
Pubblicazione: (2026)
Leveraging Discriminative Latent Representations for Conditioning GAN-Based Speech Enhancement
di: Shetu, Shrishti Saha, et al.
Pubblicazione: (2025)
di: Shetu, Shrishti Saha, et al.
Pubblicazione: (2025)
Neural Vocoders as Speech Enhancers
di: Li, Andong, et al.
Pubblicazione: (2025)
di: Li, Andong, et al.
Pubblicazione: (2025)
A Distilled Low-Latency Neural Vocoder with Explicit Amplitude and Phase Prediction
di: Du, Hui-Peng, et al.
Pubblicazione: (2025)
di: Du, Hui-Peng, et al.
Pubblicazione: (2025)
MusicHiFi: Fast High-Fidelity Stereo Vocoding
di: Zhu, Ge, et al.
Pubblicazione: (2024)
di: Zhu, Ge, et al.
Pubblicazione: (2024)
ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram
di: Jiang, Xiao-Hang, et al.
Pubblicazione: (2024)
di: Jiang, Xiao-Hang, et al.
Pubblicazione: (2024)
Non-Causal to Causal SSL-Supported Transfer Learning: Towards a High-Performance Low-Latency Speech Vocoder
di: Shi, Renzheng, et al.
Pubblicazione: (2024)
di: Shi, Renzheng, et al.
Pubblicazione: (2024)
Towards Out-of-Distribution Detection in Vocoder Recognition via Latent Feature Reconstruction
di: Du, Renmingyue, et al.
Pubblicazione: (2024)
di: Du, Renmingyue, et al.
Pubblicazione: (2024)
Training Generative Adversarial Network-Based Vocoder with Limited Data Using Augmentation-Conditional Discriminator
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2024)
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2024)
Training Universal Vocoders with Feature Smoothing-Based Augmentation Methods for High-Quality TTS Systems
di: Liu, Jeongmin, et al.
Pubblicazione: (2024)
di: Liu, Jeongmin, et al.
Pubblicazione: (2024)
Improving Resource-Efficient Speech Enhancement via Neural Differentiable DSP Vocoder Refinement
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025)
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025)
A Neural Denoising Vocoder for Clean Waveform Generation from Noisy Mel-Spectrogram based on Amplitude and Phase Predictions
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments
di: Yoneyama, Reo, et al.
Pubblicazione: (2025)
di: Yoneyama, Reo, et al.
Pubblicazione: (2025)
Leveraging Self-Supervised Audio-Visual Pretrained Models to Improve Vocoded Speech Intelligibility in Cochlear Implant Simulation
di: Lai, Richard Lee, et al.
Pubblicazione: (2023)
di: Lai, Richard Lee, et al.
Pubblicazione: (2023)
Flow2GAN: Hybrid Flow Matching and GAN with Multi-Resolution Network for Few-step High-Fidelity Audio Generation
di: Yao, Zengwei, et al.
Pubblicazione: (2025)
di: Yao, Zengwei, et al.
Pubblicazione: (2025)
FreeV: Free Lunch For Vocoders Through Pseudo Inversed Mel Filter
di: Lv, Yuanjun, et al.
Pubblicazione: (2024)
di: Lv, Yuanjun, et al.
Pubblicazione: (2024)
WaveFM: A High-Fidelity and Efficient Vocoder Based on Flow Matching
di: Luo, Tianze, et al.
Pubblicazione: (2025)
di: Luo, Tianze, et al.
Pubblicazione: (2025)
UniCATS: A Unified Context-Aware Text-to-Speech Framework with Contextual VQ-Diffusion and Vocoding
di: Du, Chenpeng, et al.
Pubblicazione: (2023)
di: Du, Chenpeng, et al.
Pubblicazione: (2023)
Enhancing Spectrogram Realism in Singing Voice Synthesis via Explicit Bandwidth Extension Prior to Vocoder
di: Yang, Runxuan, et al.
Pubblicazione: (2025)
di: Yang, Runxuan, et al.
Pubblicazione: (2025)
Ultra-lightweight Neural Differential DSP Vocoder For High Quality Speech Synthesis
di: Agrawal, Prabhav, et al.
Pubblicazione: (2024)
di: Agrawal, Prabhav, et al.
Pubblicazione: (2024)
Wave-Trainer-Fit: Neural Vocoder with Trainable Prior and Fixed-Point Iteration towards High-Quality Speech Generation from SSL features
di: Ohnaka, Hien, et al.
Pubblicazione: (2026)
di: Ohnaka, Hien, et al.
Pubblicazione: (2026)
A Hybrid Discriminative and Generative System for Universal Speech Enhancement
di: Liu, Yinghao, et al.
Pubblicazione: (2026)
di: Liu, Yinghao, et al.
Pubblicazione: (2026)
Vocoder-Free Non-Parallel Conversion of Whispered Speech With Masked Cycle-Consistent Generative Adversarial Networks
di: Wagner, Dominik, et al.
Pubblicazione: (2023)
di: Wagner, Dominik, et al.
Pubblicazione: (2023)
FreGrad: Lightweight and Fast Frequency-aware Diffusion Vocoder
di: Nguyen, Tan Dat, et al.
Pubblicazione: (2024)
di: Nguyen, Tan Dat, et al.
Pubblicazione: (2024)
LDCodec: A high quality neural audio codec with low-complexity decoder
di: Jiang, Jiawei, et al.
Pubblicazione: (2025)
di: Jiang, Jiawei, et al.
Pubblicazione: (2025)
ArrayDPS-Refine: Generative Refinement of Discriminative Multi-Channel Speech Enhancement
di: Xu, Zhongweiyang, et al.
Pubblicazione: (2026)
di: Xu, Zhongweiyang, et al.
Pubblicazione: (2026)
Enhancing Kurdish Text-to-Speech with Native Corpus Training: A High-Quality WaveGlow Vocoder Approach
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2024)
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2024)
Pseudo-Cepstrum: Pitch Modification for Mel-Based Neural Vocoders
di: Ellinas, Nikolaos, et al.
Pubblicazione: (2025)
di: Ellinas, Nikolaos, et al.
Pubblicazione: (2025)
Lightweight and Robust Multi-Channel End-to-End Speech Recognition with Spherical Harmonic Transform
di: Kong, Xiangzhu, et al.
Pubblicazione: (2025)
di: Kong, Xiangzhu, et al.
Pubblicazione: (2025)
Peransformer: Improving Low-informed Expressive Performance Rendering with Score-aware Discriminator
di: He, Xian, et al.
Pubblicazione: (2025)
di: He, Xian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MDDM: A Multi-view Discriminative Enhanced Diffusion-based Model for Speech Enhancement
di: Xu, Nan, et al.
Pubblicazione: (2025) -
FA-GAN: Artifacts-free and Phase-aware High-fidelity GAN-based Vocoder
di: Shen, Rubing, et al.
Pubblicazione: (2024) -
Is GAN Necessary for Mel-Spectrogram-based Neural Vocoder?
di: Du, Hui-Peng, et al.
Pubblicazione: (2025) -
VNet: A GAN-based Multi-Tier Discriminator Network for Speech Synthesis Vocoders
di: Cao, Yubing, et al.
Pubblicazione: (2024) -
QHARMA-GAN: Quasi-Harmonic Neural Vocoder based on Autoregressive Moving Average Model
di: Chen, Shaowen, et al.
Pubblicazione: (2025)