ManchuTTS: Towards High-Quality Manchu Speech Synthesis via Flow Matching and Hierarchical Text Representation
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Suhua, Wang, Zifan, Sun, Xiaoxin, Wang, D. J., Liu, Zhanbo, Li, Xin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ManWav: The First Manchu ASR Model
por: Seo, Jean, et al.
Publicado: (2024)
por: Seo, Jean, et al.
Publicado: (2024)
Mergen: The First Manchu-Korean Machine Translation Model Trained on Augmented Data
por: Seo, Jean, et al.
Publicado: (2023)
por: Seo, Jean, et al.
Publicado: (2023)
Understanding In-Context Machine Translation for Low-Resource Languages: A Case Study on Manchu
por: Pei, Renhao, et al.
Publicado: (2025)
por: Pei, Renhao, et al.
Publicado: (2025)
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
por: Liu, Jiaxuan, et al.
Publicado: (2024)
por: Liu, Jiaxuan, et al.
Publicado: (2024)
RapFlow-TTS: Rapid and High-Fidelity Text-to-Speech with Improved Consistency Flow Matching
por: Park, Hyun Joon, et al.
Publicado: (2025)
por: Park, Hyun Joon, et al.
Publicado: (2025)
TMD-TTS: A Unified Tibetan Multi-Dialect Text-to-Speech Framework for Ü-Tsang, Amdo and Kham Speech Dataset Generation
por: Liu, Yutong, et al.
Publicado: (2025)
por: Liu, Yutong, et al.
Publicado: (2025)
FMSD-TTS: Few-shot Multi-Speaker Multi-Dialect Text-to-Speech Synthesis for Ü-Tsang, Amdo and Kham Speech Dataset Generation
por: Liu, Yutong, et al.
Publicado: (2025)
por: Liu, Yutong, et al.
Publicado: (2025)
Clip-TTS: Contrastive Text-content and Mel-spectrogram, A High-Quality Text-to-Speech Method based on Contextual Semantic Understanding
por: Liu, Tianyun
Publicado: (2025)
por: Liu, Tianyun
Publicado: (2025)
Bailing-TTS: Chinese Dialectal Speech Synthesis Towards Human-like Spontaneous Representation
por: Di, Xinhan, et al.
Publicado: (2024)
por: Di, Xinhan, et al.
Publicado: (2024)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
por: Ma, Ziyang, et al.
Publicado: (2023)
por: Ma, Ziyang, et al.
Publicado: (2023)
AutoStyle-TTS: Retrieval-Augmented Generation based Automatic Style Matching Text-to-Speech Synthesis
por: Luo, Dan, et al.
Publicado: (2025)
por: Luo, Dan, et al.
Publicado: (2025)
Learning the Manchu Writing System: The Role of Intra‐Symbol Processing in Orthography Acquisition
por: Bai Li, et al.
Publicado: (2026)
por: Bai Li, et al.
Publicado: (2026)
TTS-Transducer: End-to-End Speech Synthesis with Neural Transducer
por: Bataev, Vladimir, et al.
Publicado: (2025)
por: Bataev, Vladimir, et al.
Publicado: (2025)
MOSS-Speech: Towards True Speech-to-Speech Models Without Text Guidance
por: Zhao, Xingjian, et al.
Publicado: (2025)
por: Zhao, Xingjian, et al.
Publicado: (2025)
DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Factorized Discrete Flow Matching
por: Nguyen, Ngoc-Son, et al.
Publicado: (2025)
por: Nguyen, Ngoc-Son, et al.
Publicado: (2025)
IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech
por: Zhou, Siyi, et al.
Publicado: (2025)
por: Zhou, Siyi, et al.
Publicado: (2025)
Autoregressive Diffusion Transformer for Text-to-Speech Synthesis
por: Liu, Zhijun, et al.
Publicado: (2024)
por: Liu, Zhijun, et al.
Publicado: (2024)
FLowHigh: Towards Efficient and High-Quality Audio Super-Resolution with Single-Step Flow Matching
por: Yun, Jun-Hak, et al.
Publicado: (2025)
por: Yun, Jun-Hak, et al.
Publicado: (2025)
Shallow Flow Matching for Coarse-to-Fine Text-to-Speech Synthesis
por: Yang, Dong, et al.
Publicado: (2025)
por: Yang, Dong, et al.
Publicado: (2025)
Evaluating Ethnic Income Gap in China: The Case of Han, Mongol, and Manchu in Liaoning and Inner Mongolia
por: Deng, Xinyan
Publicado: (2025)
por: Deng, Xinyan
Publicado: (2025)
VocalNet: Speech LLM with Multi-Token Prediction for Faster and High-Quality Generation
por: Wang, Yuhao, et al.
Publicado: (2025)
por: Wang, Yuhao, et al.
Publicado: (2025)
MahaTTS: A Unified Framework for Multilingual Text-to-Speech Synthesis
por: Singh, Jaskaran, et al.
Publicado: (2025)
por: Singh, Jaskaran, et al.
Publicado: (2025)
Towards Hierarchical Multi-Step Reward Models for Enhanced Reasoning in Large Language Models
por: Wang, Teng, et al.
Publicado: (2025)
por: Wang, Teng, et al.
Publicado: (2025)
TruthFlow: Truthful LLM Generation via Representation Flow Correction
por: Wang, Hanyu, et al.
Publicado: (2025)
por: Wang, Hanyu, et al.
Publicado: (2025)
HQA-Attack: Toward High Quality Black-Box Hard-Label Adversarial Attack on Text
por: Liu, Han, et al.
Publicado: (2024)
por: Liu, Han, et al.
Publicado: (2024)
DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific Factors
por: Lee, Keon, et al.
Publicado: (2024)
por: Lee, Keon, et al.
Publicado: (2024)
SpeechJudge: Towards Human-Level Judgment for Speech Naturalness
por: Zhang, Xueyao, et al.
Publicado: (2025)
por: Zhang, Xueyao, et al.
Publicado: (2025)
Generative Language Models with Retrieval Augmented Generation for Automated Short Answer Scoring
por: Wang, Zifan, et al.
Publicado: (2024)
por: Wang, Zifan, et al.
Publicado: (2024)
DiffuSpeech: Silent Thought, Spoken Answer via Unified Speech-Text Diffusion
por: Lou, Yuxuan, et al.
Publicado: (2026)
por: Lou, Yuxuan, et al.
Publicado: (2026)
IntelliAsk: Learning to Ask High-Quality Research Questions via RLVR
por: Sharma, Karun, et al.
Publicado: (2026)
por: Sharma, Karun, et al.
Publicado: (2026)
DrDiff: Dynamic Routing Diffusion with Hierarchical Attention for Breaking the Efficiency-Quality Trade-off
por: Zhang, Jusheng, et al.
Publicado: (2025)
por: Zhang, Jusheng, et al.
Publicado: (2025)
MOSS-TTS Technical Report
por: Gong, Yitian, et al.
Publicado: (2026)
por: Gong, Yitian, et al.
Publicado: (2026)
Finetuning Vision-Language Models as OCR Systems for Low-Resource Languages: A Case Study of Manchu
por: Chung, Yan Hon Michael, et al.
Publicado: (2025)
por: Chung, Yan Hon Michael, et al.
Publicado: (2025)
FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
ComCLIP: Training-Free Compositional Image and Text Matching
por: Jiang, Kenan, et al.
Publicado: (2022)
por: Jiang, Kenan, et al.
Publicado: (2022)
Interpretable Discriminative Text Representations via Agreement and Label Disentanglement
por: Wang, Tong, et al.
Publicado: (2026)
por: Wang, Tong, et al.
Publicado: (2026)
Soundwave: Less is More for Speech-Text Alignment in LLMs
por: Zhang, Yuhao, et al.
Publicado: (2025)
por: Zhang, Yuhao, et al.
Publicado: (2025)
Towards Linguistically-informed Representations for English as a Second or Foreign Language: Review, Construction and Application
por: Li, Wenxi, et al.
Publicado: (2026)
por: Li, Wenxi, et al.
Publicado: (2026)
Flamed-TTS: Flow Matching Attention-Free Models for Efficient Generating and Dynamic Pacing Zero-shot Text-to-Speech
por: Huynh-Nguyen, Hieu-Nghia, et al.
Publicado: (2025)
por: Huynh-Nguyen, Hieu-Nghia, et al.
Publicado: (2025)
DuplexCascade: Full-Duplex Speech-to-Speech Dialogue with VAD-Free Cascaded ASR-LLM-TTS Pipeline and Micro-Turn Optimization
por: Yang, Jianing, et al.
Publicado: (2026)
por: Yang, Jianing, et al.
Publicado: (2026)
Ejemplares similares
-
ManWav: The First Manchu ASR Model
por: Seo, Jean, et al.
Publicado: (2024) -
Mergen: The First Manchu-Korean Machine Translation Model Trained on Augmented Data
por: Seo, Jean, et al.
Publicado: (2023) -
Understanding In-Context Machine Translation for Low-Resource Languages: A Case Study on Manchu
por: Pei, Renhao, et al.
Publicado: (2025) -
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
por: Liu, Jiaxuan, et al.
Publicado: (2024) -
RapFlow-TTS: Rapid and High-Fidelity Text-to-Speech with Improved Consistency Flow Matching
por: Park, Hyun Joon, et al.
Publicado: (2025)