UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Guan, Wenhao, Niu, Zhikang, Jiang, Ziyue, Wang, Kaidi, Chen, Peijie, Hong, Qingyang, Li, Lin, Chen, Xie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization
di: Ren, Pengyu, et al.
Pubblicazione: (2025)
di: Ren, Pengyu, et al.
Pubblicazione: (2025)
Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion
di: Wang, Kaidi, et al.
Pubblicazione: (2025)
di: Wang, Kaidi, et al.
Pubblicazione: (2025)
F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching
di: Chen, Yushen, et al.
Pubblicazione: (2024)
di: Chen, Yushen, et al.
Pubblicazione: (2024)
ReFlow-TTS: A Rectified Flow Model for High-fidelity Text-to-Speech
di: Guan, Wenhao, et al.
Pubblicazione: (2023)
di: Guan, Wenhao, et al.
Pubblicazione: (2023)
DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec
di: Chen, Peijie, et al.
Pubblicazione: (2025)
di: Chen, Peijie, et al.
Pubblicazione: (2025)
LAFMA: A Latent Flow Matching Model for Text-to-Audio Generation
di: Guan, Wenhao, et al.
Pubblicazione: (2024)
di: Guan, Wenhao, et al.
Pubblicazione: (2024)
DiTReducio: A Training-Free Acceleration for DiT-Based TTS via Progressive Calibration
di: Huo, Yanru, et al.
Pubblicazione: (2025)
di: Huo, Yanru, et al.
Pubblicazione: (2025)
Phoenix-VAD: Streaming Semantic Endpoint Detection for Full-Duplex Speech Interaction
di: Wu, Weijie, et al.
Pubblicazione: (2025)
di: Wu, Weijie, et al.
Pubblicazione: (2025)
Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling
di: Zheng, Qixi, et al.
Pubblicazione: (2025)
di: Zheng, Qixi, et al.
Pubblicazione: (2025)
XMUspeech Systems for the ASVspoof 5 Challenge
di: Li, Wangjie, et al.
Pubblicazione: (2025)
di: Li, Wangjie, et al.
Pubblicazione: (2025)
VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation
di: Peng, Puyuan, et al.
Pubblicazione: (2025)
di: Peng, Puyuan, et al.
Pubblicazione: (2025)
MM-TTS: Multi-modal Prompt based Style Transfer for Expressive Text-to-Speech Synthesis
di: Guan, Wenhao, et al.
Pubblicazione: (2023)
di: Guan, Wenhao, et al.
Pubblicazione: (2023)
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
E1 TTS: Simple and Fast Non-Autoregressive TTS
di: Liu, Zhijun, et al.
Pubblicazione: (2024)
di: Liu, Zhijun, et al.
Pubblicazione: (2024)
Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
di: Zuo, Jialong, et al.
Pubblicazione: (2025)
Flow-TSVAD: Target-Speaker Voice Activity Detection via Latent Flow Matching
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
Zero-shot Cross-lingual Voice Transfer for TTS
di: Biadsy, Fadi, et al.
Pubblicazione: (2024)
di: Biadsy, Fadi, et al.
Pubblicazione: (2024)
E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS
di: Eskimez, Sefik Emre, et al.
Pubblicazione: (2024)
di: Eskimez, Sefik Emre, et al.
Pubblicazione: (2024)
SponTTS: modeling and transferring spontaneous style for TTS
di: Li, Hanzhao, et al.
Pubblicazione: (2023)
di: Li, Hanzhao, et al.
Pubblicazione: (2023)
Enhancing Code-Switching Speech Recognition with LID-Based Collaborative Mixture of Experts Model
di: Huang, Hukai, et al.
Pubblicazione: (2024)
di: Huang, Hukai, et al.
Pubblicazione: (2024)
ReStyle-TTS: Relative and Continuous Style Control for Zero-Shot Speech Synthesis
di: Li, Haitao, et al.
Pubblicazione: (2026)
di: Li, Haitao, et al.
Pubblicazione: (2026)
UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information
di: Wang, Rui, et al.
Pubblicazione: (2025)
di: Wang, Rui, et al.
Pubblicazione: (2025)
SyncVoice: Towards Video Dubbing with Vision-Augmented Pretrained TTS Model
di: Wang, Kaidi, et al.
Pubblicazione: (2025)
di: Wang, Kaidi, et al.
Pubblicazione: (2025)
NDVQ: Robust Neural Audio Codec with Normal Distribution-Based Vector Quantization
di: Niu, Zhikang, et al.
Pubblicazione: (2024)
di: Niu, Zhikang, et al.
Pubblicazione: (2024)
LatentVoiceGrad: Nonparallel Voice Conversion with Latent Diffusion/Flow-Matching Models
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2025)
di: Kameoka, Hirokazu, et al.
Pubblicazione: (2025)
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
di: Yao, Jixun, et al.
Pubblicazione: (2024)
di: Yao, Jixun, et al.
Pubblicazione: (2024)
F5R-TTS: Improving Flow-Matching based Text-to-Speech with Group Relative Policy Optimization
di: Sun, Xiaohui, et al.
Pubblicazione: (2025)
di: Sun, Xiaohui, et al.
Pubblicazione: (2025)
Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis
di: Jiang, Ziyue, et al.
Pubblicazione: (2023)
di: Jiang, Ziyue, et al.
Pubblicazione: (2023)
VoiceRestore: Flow-Matching Transformers for Speech Recording Quality Restoration
di: Kirdey, Stanislav
Pubblicazione: (2025)
di: Kirdey, Stanislav
Pubblicazione: (2025)
UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook
di: Jiang, Yidi, et al.
Pubblicazione: (2025)
di: Jiang, Yidi, et al.
Pubblicazione: (2025)
Technical Report: A Practical Guide to Kaldi ASR Optimization
di: Hong, Mengze, et al.
Pubblicazione: (2025)
di: Hong, Mengze, et al.
Pubblicazione: (2025)
VECL-TTS: Voice identity and Emotional style controllable Cross-Lingual Text-to-Speech
di: Gudmalwar, Ashishkumar, et al.
Pubblicazione: (2024)
di: Gudmalwar, Ashishkumar, et al.
Pubblicazione: (2024)
Compact Neural TTS Voices for Accessibility
di: Jain, Kunal, et al.
Pubblicazione: (2025)
di: Jain, Kunal, et al.
Pubblicazione: (2025)
Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
di: Choi, Jeongsoo, et al.
Pubblicazione: (2025)
MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts
di: Xue, Heyang, et al.
Pubblicazione: (2025)
di: Xue, Heyang, et al.
Pubblicazione: (2025)
UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching
di: Glazer, Neta, et al.
Pubblicazione: (2025)
di: Glazer, Neta, et al.
Pubblicazione: (2025)
LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control
di: Ohmura, Junki, et al.
Pubblicazione: (2025)
di: Ohmura, Junki, et al.
Pubblicazione: (2025)
ZipVoice: Fast and High-Quality Zero-Shot Text-to-Speech with Flow Matching
di: Zhu, Han, et al.
Pubblicazione: (2025)
di: Zhu, Han, et al.
Pubblicazione: (2025)
Habibi: Laying the Open-Source Foundation of Unified-Dialectal Arabic Speech Synthesis
di: Chen, Yushen, et al.
Pubblicazione: (2026)
di: Chen, Yushen, et al.
Pubblicazione: (2026)
Explore the Reinforcement Learning for the LLM based ASR and TTS system
di: Gao, Changfeng, et al.
Pubblicazione: (2025)
di: Gao, Changfeng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ReFlow-VC: Zero-shot Voice Conversion Based on Rectified Flow and Speaker Feature Optimization
di: Ren, Pengyu, et al.
Pubblicazione: (2025) -
Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion
di: Wang, Kaidi, et al.
Pubblicazione: (2025) -
F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching
di: Chen, Yushen, et al.
Pubblicazione: (2024) -
ReFlow-TTS: A Rectified Flow Model for High-fidelity Text-to-Speech
di: Guan, Wenhao, et al.
Pubblicazione: (2023) -
DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec
di: Chen, Peijie, et al.
Pubblicazione: (2025)