ManchuTTS: Towards High-Quality Manchu Speech Synthesis via Flow Matching and Hierarchical Text Representation
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Suhua, Wang, Zifan, Sun, Xiaoxin, Wang, D. J., Liu, Zhanbo, Li, Xin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ManWav: The First Manchu ASR Model
di: Seo, Jean, et al.
Pubblicazione: (2024)
di: Seo, Jean, et al.
Pubblicazione: (2024)
Mergen: The First Manchu-Korean Machine Translation Model Trained on Augmented Data
di: Seo, Jean, et al.
Pubblicazione: (2023)
di: Seo, Jean, et al.
Pubblicazione: (2023)
Understanding In-Context Machine Translation for Low-Resource Languages: A Case Study on Manchu
di: Pei, Renhao, et al.
Pubblicazione: (2025)
di: Pei, Renhao, et al.
Pubblicazione: (2025)
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
di: Liu, Jiaxuan, et al.
Pubblicazione: (2024)
di: Liu, Jiaxuan, et al.
Pubblicazione: (2024)
RapFlow-TTS: Rapid and High-Fidelity Text-to-Speech with Improved Consistency Flow Matching
di: Park, Hyun Joon, et al.
Pubblicazione: (2025)
di: Park, Hyun Joon, et al.
Pubblicazione: (2025)
TMD-TTS: A Unified Tibetan Multi-Dialect Text-to-Speech Framework for Ü-Tsang, Amdo and Kham Speech Dataset Generation
di: Liu, Yutong, et al.
Pubblicazione: (2025)
di: Liu, Yutong, et al.
Pubblicazione: (2025)
FMSD-TTS: Few-shot Multi-Speaker Multi-Dialect Text-to-Speech Synthesis for Ü-Tsang, Amdo and Kham Speech Dataset Generation
di: Liu, Yutong, et al.
Pubblicazione: (2025)
di: Liu, Yutong, et al.
Pubblicazione: (2025)
Clip-TTS: Contrastive Text-content and Mel-spectrogram, A High-Quality Text-to-Speech Method based on Contextual Semantic Understanding
di: Liu, Tianyun
Pubblicazione: (2025)
di: Liu, Tianyun
Pubblicazione: (2025)
Bailing-TTS: Chinese Dialectal Speech Synthesis Towards Human-like Spontaneous Representation
di: Di, Xinhan, et al.
Pubblicazione: (2024)
di: Di, Xinhan, et al.
Pubblicazione: (2024)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
di: Ma, Ziyang, et al.
Pubblicazione: (2023)
di: Ma, Ziyang, et al.
Pubblicazione: (2023)
AutoStyle-TTS: Retrieval-Augmented Generation based Automatic Style Matching Text-to-Speech Synthesis
di: Luo, Dan, et al.
Pubblicazione: (2025)
di: Luo, Dan, et al.
Pubblicazione: (2025)
Learning the Manchu Writing System: The Role of Intra‐Symbol Processing in Orthography Acquisition
di: Bai Li, et al.
Pubblicazione: (2026)
di: Bai Li, et al.
Pubblicazione: (2026)
TTS-Transducer: End-to-End Speech Synthesis with Neural Transducer
di: Bataev, Vladimir, et al.
Pubblicazione: (2025)
di: Bataev, Vladimir, et al.
Pubblicazione: (2025)
MOSS-Speech: Towards True Speech-to-Speech Models Without Text Guidance
di: Zhao, Xingjian, et al.
Pubblicazione: (2025)
di: Zhao, Xingjian, et al.
Pubblicazione: (2025)
DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Factorized Discrete Flow Matching
di: Nguyen, Ngoc-Son, et al.
Pubblicazione: (2025)
di: Nguyen, Ngoc-Son, et al.
Pubblicazione: (2025)
IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech
di: Zhou, Siyi, et al.
Pubblicazione: (2025)
di: Zhou, Siyi, et al.
Pubblicazione: (2025)
Autoregressive Diffusion Transformer for Text-to-Speech Synthesis
di: Liu, Zhijun, et al.
Pubblicazione: (2024)
di: Liu, Zhijun, et al.
Pubblicazione: (2024)
FLowHigh: Towards Efficient and High-Quality Audio Super-Resolution with Single-Step Flow Matching
di: Yun, Jun-Hak, et al.
Pubblicazione: (2025)
di: Yun, Jun-Hak, et al.
Pubblicazione: (2025)
Shallow Flow Matching for Coarse-to-Fine Text-to-Speech Synthesis
di: Yang, Dong, et al.
Pubblicazione: (2025)
di: Yang, Dong, et al.
Pubblicazione: (2025)
Evaluating Ethnic Income Gap in China: The Case of Han, Mongol, and Manchu in Liaoning and Inner Mongolia
di: Deng, Xinyan
Pubblicazione: (2025)
di: Deng, Xinyan
Pubblicazione: (2025)
VocalNet: Speech LLM with Multi-Token Prediction for Faster and High-Quality Generation
di: Wang, Yuhao, et al.
Pubblicazione: (2025)
di: Wang, Yuhao, et al.
Pubblicazione: (2025)
MahaTTS: A Unified Framework for Multilingual Text-to-Speech Synthesis
di: Singh, Jaskaran, et al.
Pubblicazione: (2025)
di: Singh, Jaskaran, et al.
Pubblicazione: (2025)
Towards Hierarchical Multi-Step Reward Models for Enhanced Reasoning in Large Language Models
di: Wang, Teng, et al.
Pubblicazione: (2025)
di: Wang, Teng, et al.
Pubblicazione: (2025)
TruthFlow: Truthful LLM Generation via Representation Flow Correction
di: Wang, Hanyu, et al.
Pubblicazione: (2025)
di: Wang, Hanyu, et al.
Pubblicazione: (2025)
HQA-Attack: Toward High Quality Black-Box Hard-Label Adversarial Attack on Text
di: Liu, Han, et al.
Pubblicazione: (2024)
di: Liu, Han, et al.
Pubblicazione: (2024)
DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific Factors
di: Lee, Keon, et al.
Pubblicazione: (2024)
di: Lee, Keon, et al.
Pubblicazione: (2024)
SpeechJudge: Towards Human-Level Judgment for Speech Naturalness
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
Generative Language Models with Retrieval Augmented Generation for Automated Short Answer Scoring
di: Wang, Zifan, et al.
Pubblicazione: (2024)
di: Wang, Zifan, et al.
Pubblicazione: (2024)
DiffuSpeech: Silent Thought, Spoken Answer via Unified Speech-Text Diffusion
di: Lou, Yuxuan, et al.
Pubblicazione: (2026)
di: Lou, Yuxuan, et al.
Pubblicazione: (2026)
IntelliAsk: Learning to Ask High-Quality Research Questions via RLVR
di: Sharma, Karun, et al.
Pubblicazione: (2026)
di: Sharma, Karun, et al.
Pubblicazione: (2026)
DrDiff: Dynamic Routing Diffusion with Hierarchical Attention for Breaking the Efficiency-Quality Trade-off
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
MOSS-TTS Technical Report
di: Gong, Yitian, et al.
Pubblicazione: (2026)
di: Gong, Yitian, et al.
Pubblicazione: (2026)
Finetuning Vision-Language Models as OCR Systems for Low-Resource Languages: A Case Study of Manchu
di: Chung, Yan Hon Michael, et al.
Pubblicazione: (2025)
di: Chung, Yan Hon Michael, et al.
Pubblicazione: (2025)
FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching
di: Wang, Hui, et al.
Pubblicazione: (2025)
di: Wang, Hui, et al.
Pubblicazione: (2025)
ComCLIP: Training-Free Compositional Image and Text Matching
di: Jiang, Kenan, et al.
Pubblicazione: (2022)
di: Jiang, Kenan, et al.
Pubblicazione: (2022)
Interpretable Discriminative Text Representations via Agreement and Label Disentanglement
di: Wang, Tong, et al.
Pubblicazione: (2026)
di: Wang, Tong, et al.
Pubblicazione: (2026)
Soundwave: Less is More for Speech-Text Alignment in LLMs
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
di: Zhang, Yuhao, et al.
Pubblicazione: (2025)
Towards Linguistically-informed Representations for English as a Second or Foreign Language: Review, Construction and Application
di: Li, Wenxi, et al.
Pubblicazione: (2026)
di: Li, Wenxi, et al.
Pubblicazione: (2026)
Flamed-TTS: Flow Matching Attention-Free Models for Efficient Generating and Dynamic Pacing Zero-shot Text-to-Speech
di: Huynh-Nguyen, Hieu-Nghia, et al.
Pubblicazione: (2025)
di: Huynh-Nguyen, Hieu-Nghia, et al.
Pubblicazione: (2025)
DuplexCascade: Full-Duplex Speech-to-Speech Dialogue with VAD-Free Cascaded ASR-LLM-TTS Pipeline and Micro-Turn Optimization
di: Yang, Jianing, et al.
Pubblicazione: (2026)
di: Yang, Jianing, et al.
Pubblicazione: (2026)
Documenti analoghi
-
ManWav: The First Manchu ASR Model
di: Seo, Jean, et al.
Pubblicazione: (2024) -
Mergen: The First Manchu-Korean Machine Translation Model Trained on Augmented Data
di: Seo, Jean, et al.
Pubblicazione: (2023) -
Understanding In-Context Machine Translation for Low-Resource Languages: A Case Study on Manchu
di: Pei, Renhao, et al.
Pubblicazione: (2025) -
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
di: Liu, Jiaxuan, et al.
Pubblicazione: (2024) -
RapFlow-TTS: Rapid and High-Fidelity Text-to-Speech with Improved Consistency Flow Matching
di: Park, Hyun Joon, et al.
Pubblicazione: (2025)