Learning Neural Vocoder from Range-Null Space Decomposition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Andong, Lei, Tong, Sun, Zhihang, Chen, Rilin, Yin, Erwei, Li, Xiaodong, Zheng, Chengshi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scalable Neural Vocoder from Range-Null Space Decomposition
par: Li, Andong, et autres
Publié: (2026)
par: Li, Andong, et autres
Publié: (2026)
Neural Vocoders as Speech Enhancers
par: Li, Andong, et autres
Publié: (2025)
par: Li, Andong, et autres
Publié: (2025)
BridgeVoC: Revitalizing Neural Vocoder from a Restoration Perspective
par: Li, Andong, et autres
Publié: (2025)
par: Li, Andong, et autres
Publié: (2025)
GOMPSNR: Reflourish the Signal-to-Noise Ratio Metric for Audio Generation Tasks
par: Dai, Lingling, et autres
Publié: (2026)
par: Dai, Lingling, et autres
Publié: (2026)
SMRU: Split-and-Merge Recurrent-based UNet for Acoustic Echo Cancellation and Noise Suppression
par: Sun, Zhihang, et autres
Publié: (2024)
par: Sun, Zhihang, et autres
Publié: (2024)
Target matching based generative model for speech enhancement
par: Wang, Taihui, et autres
Publié: (2025)
par: Wang, Taihui, et autres
Publié: (2025)
NaturalL2S: End-to-End High-quality Multispeaker Lip-to-Speech Synthesis with Differential Digital Signal Processing
par: Liang, Yifan, et autres
Publié: (2025)
par: Liang, Yifan, et autres
Publié: (2025)
BSDB-Net: Band-Split Dual-Branch Network with Selective State Spaces Mechanism for Monaural Speech Enhancement
par: Fan, Cunhang, et autres
Publié: (2024)
par: Fan, Cunhang, et autres
Publié: (2024)
From Continuous to Discrete: Cross-Domain Collaborative General Speech Enhancement via Hierarchical Language Models
par: Mu, Zhaoxi, et autres
Publié: (2025)
par: Mu, Zhaoxi, et autres
Publié: (2025)
Gen-SER: When the generative model meets speech emotion recognition
par: Wang, Taihui, et autres
Publié: (2026)
par: Wang, Taihui, et autres
Publié: (2026)
BiVocoder: A Bidirectional Neural Vocoder Integrating Feature Extraction and Waveform Generation
par: Du, Hui-Peng, et autres
Publié: (2024)
par: Du, Hui-Peng, et autres
Publié: (2024)
High-Fidelity Music Vocoder using Neural Audio Codecs
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
par: Lanzendörfer, Luca A., et autres
Publié: (2025)
FreeV: Free Lunch For Vocoders Through Pseudo Inversed Mel Filter
par: Lv, Yuanjun, et autres
Publié: (2024)
par: Lv, Yuanjun, et autres
Publié: (2024)
End-to-end multi-channel speaker extraction and binaural speech synthesis
par: Chi, Cheng, et autres
Publié: (2024)
par: Chi, Cheng, et autres
Publié: (2024)
ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram
par: Jiang, Xiao-Hang, et autres
Publié: (2024)
par: Jiang, Xiao-Hang, et autres
Publié: (2024)
Pseudo-Cepstrum: Pitch Modification for Mel-Based Neural Vocoders
par: Ellinas, Nikolaos, et autres
Publié: (2025)
par: Ellinas, Nikolaos, et autres
Publié: (2025)
QHARMA-GAN: Quasi-Harmonic Neural Vocoder based on Autoregressive Moving Average Model
par: Chen, Shaowen, et autres
Publié: (2025)
par: Chen, Shaowen, et autres
Publié: (2025)
Enhancing Spectrogram Realism in Singing Voice Synthesis via Explicit Bandwidth Extension Prior to Vocoder
par: Yang, Runxuan, et autres
Publié: (2025)
par: Yang, Runxuan, et autres
Publié: (2025)
Video-to-Audio Generation with Fine-grained Temporal Semantics
par: Hu, Yuchen, et autres
Publié: (2024)
par: Hu, Yuchen, et autres
Publié: (2024)
Improving Resource-Efficient Speech Enhancement via Neural Differentiable DSP Vocoder Refinement
par: Guimarães, Heitor R., et autres
Publié: (2025)
par: Guimarães, Heitor R., et autres
Publié: (2025)
Global Rotation Equivariant Phase Modeling for Speech Enhancement with Deep Magnitude-Phase Interaction
par: Wang, Chengzhong, et autres
Publié: (2026)
par: Wang, Chengzhong, et autres
Publié: (2026)
Prosody-Guided Harmonic Attention for Phase-Coherent Neural Vocoding in the Complex Spectrum
par: Al-Radhi, Mohammed Salah, et autres
Publié: (2026)
par: Al-Radhi, Mohammed Salah, et autres
Publié: (2026)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
par: Zhao, Junqi, et autres
Publié: (2025)
par: Zhao, Junqi, et autres
Publié: (2025)
An Investigation of Time-Frequency Representation Discriminators for High-Fidelity Vocoder
par: Gu, Yicheng, et autres
Publié: (2024)
par: Gu, Yicheng, et autres
Publié: (2024)
RingFormer: A Neural Vocoder with Ring Attention and Convolution-Augmented Transformer
par: Hong, Seongho, et autres
Publié: (2025)
par: Hong, Seongho, et autres
Publié: (2025)
Ultra-lightweight Neural Differential DSP Vocoder For High Quality Speech Synthesis
par: Agrawal, Prabhav, et autres
Publié: (2024)
par: Agrawal, Prabhav, et autres
Publié: (2024)
BigVSAN: Enhancing GAN-based Neural Vocoders with Slicing Adversarial Network
par: Shibuya, Takashi, et autres
Publié: (2023)
par: Shibuya, Takashi, et autres
Publié: (2023)
LTA-L2S: Lexical Tone-Aware Lip-to-Speech Synthesis for Mandarin with Cross-Lingual Transfer Learning
par: Yang, Kang, et autres
Publié: (2025)
par: Yang, Kang, et autres
Publié: (2025)
vec2wav 2.0: Advancing Voice Conversion via Discrete Token Vocoders
par: Guo, Yiwei, et autres
Publié: (2024)
par: Guo, Yiwei, et autres
Publié: (2024)
Vocoder-Projected Feature Discriminator
par: Kaneko, Takuhiro, et autres
Publié: (2025)
par: Kaneko, Takuhiro, et autres
Publié: (2025)
UniCATS: A Unified Context-Aware Text-to-Speech Framework with Contextual VQ-Diffusion and Vocoding
par: Du, Chenpeng, et autres
Publié: (2023)
par: Du, Chenpeng, et autres
Publié: (2023)
LDM-SVC: Latent Diffusion Model Based Zero-Shot Any-to-Any Singing Voice Conversion with Singer Guidance
par: Chen, Shihao, et autres
Publié: (2024)
par: Chen, Shihao, et autres
Publié: (2024)
Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments
par: Yoneyama, Reo, et autres
Publié: (2025)
par: Yoneyama, Reo, et autres
Publié: (2025)
SemanticVocoder: Bridging Audio Generation and Audio Understanding via Semantic Latents
par: Xie, Zeyu, et autres
Publié: (2026)
par: Xie, Zeyu, et autres
Publié: (2026)
Deep Learning for Personalized Binaural Audio Reproduction
par: Lu, Xikun, et autres
Publié: (2025)
par: Lu, Xikun, et autres
Publié: (2025)
FoleySpace: Vision-Aligned Binaural Spatial Audio Generation
par: Zhao, Lei, et autres
Publié: (2025)
par: Zhao, Lei, et autres
Publié: (2025)
Wave-Trainer-Fit: Neural Vocoder with Trainable Prior and Fixed-Point Iteration towards High-Quality Speech Generation from SSL features
par: Ohnaka, Hien, et autres
Publié: (2026)
par: Ohnaka, Hien, et autres
Publié: (2026)
LCM-SVC: Latent Diffusion Model Based Singing Voice Conversion with Inference Acceleration via Latent Consistency Distillation
par: Chen, Shihao, et autres
Publié: (2024)
par: Chen, Shihao, et autres
Publié: (2024)
Rethinking the joint estimation of magnitude and phase for time-frequency domain neural vocoders
par: Dai, Lingling, et autres
Publié: (2025)
par: Dai, Lingling, et autres
Publié: (2025)
MusicHiFi: Fast High-Fidelity Stereo Vocoding
par: Zhu, Ge, et autres
Publié: (2024)
par: Zhu, Ge, et autres
Publié: (2024)
Documents similaires
-
Scalable Neural Vocoder from Range-Null Space Decomposition
par: Li, Andong, et autres
Publié: (2026) -
Neural Vocoders as Speech Enhancers
par: Li, Andong, et autres
Publié: (2025) -
BridgeVoC: Revitalizing Neural Vocoder from a Restoration Perspective
par: Li, Andong, et autres
Publié: (2025) -
GOMPSNR: Reflourish the Signal-to-Noise Ratio Metric for Audio Generation Tasks
par: Dai, Lingling, et autres
Publié: (2026) -
SMRU: Split-and-Merge Recurrent-based UNet for Acoustic Echo Cancellation and Noise Suppression
par: Sun, Zhihang, et autres
Publié: (2024)