Scalable Neural Vocoder from Range-Null Space Decomposition
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Andong, Lei, Tong, Sun, Zhihang, Chen, Rilin, Li, Xiaodong, Yu, Dong, Zheng, Chengshi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning Neural Vocoder from Range-Null Space Decomposition
di: Li, Andong, et al.
Pubblicazione: (2025)
di: Li, Andong, et al.
Pubblicazione: (2025)
BridgeVoC: Revitalizing Neural Vocoder from a Restoration Perspective
di: Li, Andong, et al.
Pubblicazione: (2025)
di: Li, Andong, et al.
Pubblicazione: (2025)
Neural Vocoders as Speech Enhancers
di: Li, Andong, et al.
Pubblicazione: (2025)
di: Li, Andong, et al.
Pubblicazione: (2025)
SMRU: Split-and-Merge Recurrent-based UNet for Acoustic Echo Cancellation and Noise Suppression
di: Sun, Zhihang, et al.
Pubblicazione: (2024)
di: Sun, Zhihang, et al.
Pubblicazione: (2024)
Target matching based generative model for speech enhancement
di: Wang, Taihui, et al.
Pubblicazione: (2025)
di: Wang, Taihui, et al.
Pubblicazione: (2025)
GOMPSNR: Reflourish the Signal-to-Noise Ratio Metric for Audio Generation Tasks
di: Dai, Lingling, et al.
Pubblicazione: (2026)
di: Dai, Lingling, et al.
Pubblicazione: (2026)
NaturalL2S: End-to-End High-quality Multispeaker Lip-to-Speech Synthesis with Differential Digital Signal Processing
di: Liang, Yifan, et al.
Pubblicazione: (2025)
di: Liang, Yifan, et al.
Pubblicazione: (2025)
From Continuous to Discrete: Cross-Domain Collaborative General Speech Enhancement via Hierarchical Language Models
di: Mu, Zhaoxi, et al.
Pubblicazione: (2025)
di: Mu, Zhaoxi, et al.
Pubblicazione: (2025)
Gen-SER: When the generative model meets speech emotion recognition
di: Wang, Taihui, et al.
Pubblicazione: (2026)
di: Wang, Taihui, et al.
Pubblicazione: (2026)
BSDB-Net: Band-Split Dual-Branch Network with Selective State Spaces Mechanism for Monaural Speech Enhancement
di: Fan, Cunhang, et al.
Pubblicazione: (2024)
di: Fan, Cunhang, et al.
Pubblicazione: (2024)
Video-to-Audio Generation with Fine-grained Temporal Semantics
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
BiVocoder: A Bidirectional Neural Vocoder Integrating Feature Extraction and Waveform Generation
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
AudioRAG+: Feedback-driven Retrieval-augmented Audio Generation with Large Audio Language Models
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
di: Zhao, Junqi, et al.
Pubblicazione: (2025)
High-Fidelity Music Vocoder using Neural Audio Codecs
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
di: Lanzendörfer, Luca A., et al.
Pubblicazione: (2025)
FreeV: Free Lunch For Vocoders Through Pseudo Inversed Mel Filter
di: Lv, Yuanjun, et al.
Pubblicazione: (2024)
di: Lv, Yuanjun, et al.
Pubblicazione: (2024)
End-to-end multi-channel speaker extraction and binaural speech synthesis
di: Chi, Cheng, et al.
Pubblicazione: (2024)
di: Chi, Cheng, et al.
Pubblicazione: (2024)
ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram
di: Jiang, Xiao-Hang, et al.
Pubblicazione: (2024)
di: Jiang, Xiao-Hang, et al.
Pubblicazione: (2024)
SemanticVocoder: Bridging Audio Generation and Audio Understanding via Semantic Latents
di: Xie, Zeyu, et al.
Pubblicazione: (2026)
di: Xie, Zeyu, et al.
Pubblicazione: (2026)
STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment
di: Ren, Yong, et al.
Pubblicazione: (2024)
di: Ren, Yong, et al.
Pubblicazione: (2024)
Pseudo-Cepstrum: Pitch Modification for Mel-Based Neural Vocoders
di: Ellinas, Nikolaos, et al.
Pubblicazione: (2025)
di: Ellinas, Nikolaos, et al.
Pubblicazione: (2025)
QHARMA-GAN: Quasi-Harmonic Neural Vocoder based on Autoregressive Moving Average Model
di: Chen, Shaowen, et al.
Pubblicazione: (2025)
di: Chen, Shaowen, et al.
Pubblicazione: (2025)
Enhancing Spectrogram Realism in Singing Voice Synthesis via Explicit Bandwidth Extension Prior to Vocoder
di: Yang, Runxuan, et al.
Pubblicazione: (2025)
di: Yang, Runxuan, et al.
Pubblicazione: (2025)
Global Rotation Equivariant Phase Modeling for Speech Enhancement with Deep Magnitude-Phase Interaction
di: Wang, Chengzhong, et al.
Pubblicazione: (2026)
di: Wang, Chengzhong, et al.
Pubblicazione: (2026)
Improving Resource-Efficient Speech Enhancement via Neural Differentiable DSP Vocoder Refinement
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025)
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025)
Prosody-Guided Harmonic Attention for Phase-Coherent Neural Vocoding in the Complex Spectrum
di: Al-Radhi, Mohammed Salah, et al.
Pubblicazione: (2026)
di: Al-Radhi, Mohammed Salah, et al.
Pubblicazione: (2026)
vec2wav 2.0: Advancing Voice Conversion via Discrete Token Vocoders
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
di: Guo, Yiwei, et al.
Pubblicazione: (2024)
LDM-SVC: Latent Diffusion Model Based Zero-Shot Any-to-Any Singing Voice Conversion with Singer Guidance
di: Chen, Shihao, et al.
Pubblicazione: (2024)
di: Chen, Shihao, et al.
Pubblicazione: (2024)
UniCATS: A Unified Context-Aware Text-to-Speech Framework with Contextual VQ-Diffusion and Vocoding
di: Du, Chenpeng, et al.
Pubblicazione: (2023)
di: Du, Chenpeng, et al.
Pubblicazione: (2023)
SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis
di: Wang, Helin, et al.
Pubblicazione: (2024)
di: Wang, Helin, et al.
Pubblicazione: (2024)
An Investigation of Time-Frequency Representation Discriminators for High-Fidelity Vocoder
di: Gu, Yicheng, et al.
Pubblicazione: (2024)
di: Gu, Yicheng, et al.
Pubblicazione: (2024)
Ultra-lightweight Neural Differential DSP Vocoder For High Quality Speech Synthesis
di: Agrawal, Prabhav, et al.
Pubblicazione: (2024)
di: Agrawal, Prabhav, et al.
Pubblicazione: (2024)
BigVSAN: Enhancing GAN-based Neural Vocoders with Slicing Adversarial Network
di: Shibuya, Takashi, et al.
Pubblicazione: (2023)
di: Shibuya, Takashi, et al.
Pubblicazione: (2023)
RingFormer: A Neural Vocoder with Ring Attention and Convolution-Augmented Transformer
di: Hong, Seongho, et al.
Pubblicazione: (2025)
di: Hong, Seongho, et al.
Pubblicazione: (2025)
LCM-SVC: Latent Diffusion Model Based Singing Voice Conversion with Inference Acceleration via Latent Consistency Distillation
di: Chen, Shihao, et al.
Pubblicazione: (2024)
di: Chen, Shihao, et al.
Pubblicazione: (2024)
Vocoder-Projected Feature Discriminator
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2025)
di: Kaneko, Takuhiro, et al.
Pubblicazione: (2025)
Rethinking the joint estimation of magnitude and phase for time-frequency domain neural vocoders
di: Dai, Lingling, et al.
Pubblicazione: (2025)
di: Dai, Lingling, et al.
Pubblicazione: (2025)
Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments
di: Yoneyama, Reo, et al.
Pubblicazione: (2025)
di: Yoneyama, Reo, et al.
Pubblicazione: (2025)
FoleySpace: Vision-Aligned Binaural Spatial Audio Generation
di: Zhao, Lei, et al.
Pubblicazione: (2025)
di: Zhao, Lei, et al.
Pubblicazione: (2025)
Wave-Trainer-Fit: Neural Vocoder with Trainable Prior and Fixed-Point Iteration towards High-Quality Speech Generation from SSL features
di: Ohnaka, Hien, et al.
Pubblicazione: (2026)
di: Ohnaka, Hien, et al.
Pubblicazione: (2026)
LTA-L2S: Lexical Tone-Aware Lip-to-Speech Synthesis for Mandarin with Cross-Lingual Transfer Learning
di: Yang, Kang, et al.
Pubblicazione: (2025)
di: Yang, Kang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Learning Neural Vocoder from Range-Null Space Decomposition
di: Li, Andong, et al.
Pubblicazione: (2025) -
BridgeVoC: Revitalizing Neural Vocoder from a Restoration Perspective
di: Li, Andong, et al.
Pubblicazione: (2025) -
Neural Vocoders as Speech Enhancers
di: Li, Andong, et al.
Pubblicazione: (2025) -
SMRU: Split-and-Merge Recurrent-based UNet for Acoustic Echo Cancellation and Noise Suppression
di: Sun, Zhihang, et al.
Pubblicazione: (2024) -
Target matching based generative model for speech enhancement
di: Wang, Taihui, et al.
Pubblicazione: (2025)