WaveFM: A High-Fidelity and Efficient Vocoder Based on Flow Matching
Fuente:
arXiv
Salvato in:
| Autori principali: | Luo, Tianze, Miao, Xingchen, Duan, Wenbo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing Kurdish Text-to-Speech with Native Corpus Training: A High-Quality WaveGlow Vocoder Approach
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2024)
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2024)
MusicHiFi: Fast High-Fidelity Stereo Vocoding
di: Zhu, Ge, et al.
Pubblicazione: (2024)
di: Zhu, Ge, et al.
Pubblicazione: (2024)
An Investigation of Time-Frequency Representation Discriminators for High-Fidelity Vocoder
di: Gu, Yicheng, et al.
Pubblicazione: (2024)
di: Gu, Yicheng, et al.
Pubblicazione: (2024)
High-Fidelity Simultaneous Speech-To-Speech Translation
di: Labiausse, Tom, et al.
Pubblicazione: (2025)
di: Labiausse, Tom, et al.
Pubblicazione: (2025)
Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments
di: Yoneyama, Reo, et al.
Pubblicazione: (2025)
di: Yoneyama, Reo, et al.
Pubblicazione: (2025)
ProsodyFM: Unsupervised Phrasing and Intonation Control for Intelligible Speech Synthesis
di: He, Xiangheng, et al.
Pubblicazione: (2024)
di: He, Xiangheng, et al.
Pubblicazione: (2024)
AccentBox: Towards High-Fidelity Zero-Shot Accent Generation
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2024)
di: Zhong, Jinzuomu, et al.
Pubblicazione: (2024)
FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
BiVocoder: A Bidirectional Neural Vocoder Integrating Feature Extraction and Waveform Generation
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
di: Du, Hui-Peng, et al.
Pubblicazione: (2024)
FLowHigh: Towards Efficient and High-Quality Audio Super-Resolution with Single-Step Flow Matching
di: Yun, Jun-Hak, et al.
Pubblicazione: (2025)
di: Yun, Jun-Hak, et al.
Pubblicazione: (2025)
Whistle: Data-Efficient Multilingual and Crosslingual Speech Recognition via Weakly Phonetic Supervision
di: Yusuyin, Saierdaer, et al.
Pubblicazione: (2024)
di: Yusuyin, Saierdaer, et al.
Pubblicazione: (2024)
High Fidelity Text-Guided Music Editing via Single-Stage Flow Matching
di: Lan, Gael Le, et al.
Pubblicazione: (2024)
di: Lan, Gael Le, et al.
Pubblicazione: (2024)
Neural Vocoders as Speech Enhancers
di: Li, Andong, et al.
Pubblicazione: (2025)
di: Li, Andong, et al.
Pubblicazione: (2025)
Real-Time Streaming Mel Vocoding with Generative Flow Matching
di: Welker, Simon, et al.
Pubblicazione: (2025)
di: Welker, Simon, et al.
Pubblicazione: (2025)
Wave-Trainer-Fit: Neural Vocoder with Trainable Prior and Fixed-Point Iteration towards High-Quality Speech Generation from SSL features
di: Ohnaka, Hien, et al.
Pubblicazione: (2026)
di: Ohnaka, Hien, et al.
Pubblicazione: (2026)
Improving Resource-Efficient Speech Enhancement via Neural Differentiable DSP Vocoder Refinement
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025)
di: Guimarães, Heitor R., et al.
Pubblicazione: (2025)
Speech Foundation Models and Crowdsourcing for Efficient, High-Quality Data Collection
di: Lee, Beomseok, et al.
Pubblicazione: (2024)
di: Lee, Beomseok, et al.
Pubblicazione: (2024)
SimpleSpeech 2: Towards Simple and Efficient Text-to-Speech with Flow-based Scalar Latent Transformer Diffusion Models
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
di: Yang, Dongchao, et al.
Pubblicazione: (2024)
EdgeSpot: Efficient and High-Performance Few-Shot Model for Keyword Spotting
di: Buyuksolak, Oguzhan, et al.
Pubblicazione: (2026)
di: Buyuksolak, Oguzhan, et al.
Pubblicazione: (2026)
Conan: A Chunkwise Online Network for Zero-Shot Adaptive Voice Conversion
di: Zhang, Yu, et al.
Pubblicazione: (2025)
di: Zhang, Yu, et al.
Pubblicazione: (2025)
Making Flow-Matching-Based Zero-Shot Text-to-Speech Laugh as You Like
di: Kanda, Naoyuki, et al.
Pubblicazione: (2024)
di: Kanda, Naoyuki, et al.
Pubblicazione: (2024)
A Benchmark for Multi-speaker Anonymization
di: Miao, Xiaoxiao, et al.
Pubblicazione: (2024)
di: Miao, Xiaoxiao, et al.
Pubblicazione: (2024)
Generative Pre-training for Speech with Flow Matching
di: Liu, Alexander H., et al.
Pubblicazione: (2023)
di: Liu, Alexander H., et al.
Pubblicazione: (2023)
Spontaneous Speech-Based Suicide Risk Detection Using Whisper and Large Language Models
di: Cui, Ziyun, et al.
Pubblicazione: (2024)
di: Cui, Ziyun, et al.
Pubblicazione: (2024)
Chunk Based Speech Pre-training with High Resolution Finite Scalar Quantization
di: Tang, Yun, et al.
Pubblicazione: (2025)
di: Tang, Yun, et al.
Pubblicazione: (2025)
NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR
di: Xie, Yuan, et al.
Pubblicazione: (2026)
di: Xie, Yuan, et al.
Pubblicazione: (2026)
DiaMoE-TTS: A Unified IPA-Based Dialect TTS Framework with Mixture-of-Experts and Parameter-Efficient Zero-Shot Adaptation
di: Chen, Ziqi, et al.
Pubblicazione: (2025)
di: Chen, Ziqi, et al.
Pubblicazione: (2025)
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch
di: Song, Xingchen, et al.
Pubblicazione: (2024)
di: Song, Xingchen, et al.
Pubblicazione: (2024)
ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram
di: Jiang, Xiao-Hang, et al.
Pubblicazione: (2024)
di: Jiang, Xiao-Hang, et al.
Pubblicazione: (2024)
UniverSR: Unified and Versatile Audio Super-Resolution via Vocoder-Free Flow Matching
di: Choi, Woongjib, et al.
Pubblicazione: (2025)
di: Choi, Woongjib, et al.
Pubblicazione: (2025)
Generating Data with Text-to-Speech and Large-Language Models for Conversational Speech Recognition
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
di: Cornell, Samuele, et al.
Pubblicazione: (2024)
Hidden in the Noise: Unveiling Backdoors in Audio LLMs Alignment through Latent Acoustic Pattern Triggers
di: Lin, Liang, et al.
Pubblicazione: (2025)
di: Lin, Liang, et al.
Pubblicazione: (2025)
FlowAVSE: Efficient Audio-Visual Speech Enhancement with Conditional Flow Matching
di: Jung, Chaeyoung, et al.
Pubblicazione: (2024)
di: Jung, Chaeyoung, et al.
Pubblicazione: (2024)
FreeV: Free Lunch For Vocoders Through Pseudo Inversed Mel Filter
di: Lv, Yuanjun, et al.
Pubblicazione: (2024)
di: Lv, Yuanjun, et al.
Pubblicazione: (2024)
Borderless Long Speech Synthesis
di: Song, Xingchen, et al.
Pubblicazione: (2026)
di: Song, Xingchen, et al.
Pubblicazione: (2026)
FlashAudio: Rectified Flows for Fast and High-Fidelity Text-to-Audio Generation
di: Liu, Huadai, et al.
Pubblicazione: (2024)
di: Liu, Huadai, et al.
Pubblicazione: (2024)
Efficient Interleaved Speech Modeling through Knowledge Distillation
di: Nouriborji, Mohammadmahdi, et al.
Pubblicazione: (2025)
di: Nouriborji, Mohammadmahdi, et al.
Pubblicazione: (2025)
EMMeTT: Efficient Multimodal Machine Translation Training
di: Żelasko, Piotr, et al.
Pubblicazione: (2024)
di: Żelasko, Piotr, et al.
Pubblicazione: (2024)
Efficient Speech Translation through Model Compression and Knowledge Distillation
di: Moslem, Yasmin
Pubblicazione: (2025)
di: Moslem, Yasmin
Pubblicazione: (2025)
Documenti analoghi
-
Enhancing Kurdish Text-to-Speech with Native Corpus Training: A High-Quality WaveGlow Vocoder Approach
di: Abdullah, Abdulhady Abas, et al.
Pubblicazione: (2024) -
MusicHiFi: Fast High-Fidelity Stereo Vocoding
di: Zhu, Ge, et al.
Pubblicazione: (2024) -
An Investigation of Time-Frequency Representation Discriminators for High-Fidelity Vocoder
di: Gu, Yicheng, et al.
Pubblicazione: (2024) -
High-Fidelity Simultaneous Speech-To-Speech Translation
di: Labiausse, Tom, et al.
Pubblicazione: (2025) -
Comparative Analysis of Fast and High-Fidelity Neural Vocoders for Low-Latency Streaming Synthesis in Resource-Constrained Environments
di: Yoneyama, Reo, et al.
Pubblicazione: (2025)