BreezyVoice: Adapting TTS for Taiwanese Mandarin with Enhanced Polyphone Disambiguation -- Challenges and Insights
Fuente:
arXiv
Saved in:
| Main Authors: | Hsu, Chan-Jan, Lin, Yi-Cheng, Lin, Chia-Chun, Chen, Wei-Chih, Chung, Ho Lam, Li, Chen-An, Chen, Yi-Chang, Yu, Chien-Yu, Lee, Ming-Ji, Chen, Chien-Cheng, Huang, Ru-Heng, Lee, Hung-yi, Shiu, Da-Shan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Polyphone Disambiguation in Mandarin Chinese with Semi-Supervised Learning
by: Shi, Yi, et al.
Published: (2021)
by: Shi, Yi, et al.
Published: (2021)
Measuring Taiwanese Mandarin Language Understanding
by: Chen, Po-Heng, et al.
Published: (2024)
by: Chen, Po-Heng, et al.
Published: (2024)
Building a Taiwanese Mandarin Spoken Language Model: A First Attempt
by: Yang, Chih-Kai, et al.
Published: (2024)
by: Yang, Chih-Kai, et al.
Published: (2024)
A Preliminary Exploration with GPT-4o Voice Mode
by: Lin, Yu-Xiang, et al.
Published: (2025)
by: Lin, Yu-Xiang, et al.
Published: (2025)
Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models
by: Ieong, Lok-Lam, et al.
Published: (2026)
by: Ieong, Lok-Lam, et al.
Published: (2026)
Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models
by: Lin, Yi-Cheng, et al.
Published: (2024)
by: Lin, Yi-Cheng, et al.
Published: (2024)
Taiwan Safety Benchmark and Breeze Guard: Toward Trustworthy AI for Taiwanese Mandarin
by: Hsu, Po-Chun, et al.
Published: (2026)
by: Hsu, Po-Chun, et al.
Published: (2026)
The Binding Effect: Analyzing How Multi-Dimensional Cues Form Gender Bias in Instruction TTS
by: Chen, Kuan-Yu, et al.
Published: (2026)
by: Chen, Kuan-Yu, et al.
Published: (2026)
Causal Tracing of Audio-Text Fusion in Large Audio Language Models
by: Chen, Wei-Chih, et al.
Published: (2026)
by: Chen, Wei-Chih, et al.
Published: (2026)
ToxicTone: A Mandarin Audio Dataset Annotated for Toxicity and Toxic Utterance Tonality
by: Luo, Yu-Xiang, et al.
Published: (2025)
by: Luo, Yu-Xiang, et al.
Published: (2025)
MMMOS: Multi-domain Multi-axis Audio Quality Assessment
by: Lin, Yi-Cheng, et al.
Published: (2025)
by: Lin, Yi-Cheng, et al.
Published: (2025)
Benchmarking Cognitive Domains for LLMs: Insights from Taiwanese Hakka Culture
by: Chang, Chen-Chi, et al.
Published: (2024)
by: Chang, Chen-Chi, et al.
Published: (2024)
Real‐World Evidence That Non‐Smokers With High PD‐L1 Non‐Squamous NSCLC Have Poorer Outcomes With Immune Checkpoint Inhibitors
by: Yu‐Chu Kuo, et al.
Published: (2025)
by: Yu‐Chu Kuo, et al.
Published: (2025)
Pharmacogenomic Calling From Whole‐Exome Sequencing in the Taiwanese Population—A Real‐World Experience
by: Hsu‐Heng Lin, et al.
Published: (2026)
by: Hsu‐Heng Lin, et al.
Published: (2026)
CO-VADA: A Confidence-Oriented Voice Augmentation Debiasing Approach for Fair Speech Emotion Recognition
by: Tsai, Yun-Shao, et al.
Published: (2025)
by: Tsai, Yun-Shao, et al.
Published: (2025)
Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency
by: Lin, Guan-Ting, et al.
Published: (2026)
by: Lin, Guan-Ting, et al.
Published: (2026)
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech
by: Lin, Yi-Cheng, et al.
Published: (2026)
by: Lin, Yi-Cheng, et al.
Published: (2026)
Mitigating Subgroup Disparities in Multi-Label Speech Emotion Recognition: A Pseudo-Labeling and Unsupervised Learning Approach
by: Lin, Yi-Cheng, et al.
Published: (2025)
by: Lin, Yi-Cheng, et al.
Published: (2025)
Breeze Taigi: Benchmarks and Models for Taiwanese Hokkien Speech Recognition and Synthesis
by: Lan, Yu-Siang, et al.
Published: (2026)
by: Lan, Yu-Siang, et al.
Published: (2026)
Optimizing lipid control in Taiwanese diabetic patients: A collaborative consensus by the Diabetes Association of the Republic of China (Taiwan) and the Taiwanese Association of Diabetes Educators
by: Feng‐Chih Shen, et al.
Published: (2024)
by: Feng‐Chih Shen, et al.
Published: (2024)
Do You Hear What I Mean? Quantifying the Instruction-Perception Gap in Instruction-Guided Expressive Text-To-Speech Systems
by: Lin, Yi-Cheng, et al.
Published: (2025)
by: Lin, Yi-Cheng, et al.
Published: (2025)
Polymorphisms of HLA genes and hypersensitivity to penicillin among patients in a Taiwanese population
by: Chih‐Chun Wang, et al.
Published: (2024)
by: Chih‐Chun Wang, et al.
Published: (2024)
Stereotactic ablative radiotherapy versus conventional fractionated radiotherapy for clinical early‐stage non‐small‐cell lung cancer: a population‐based study
by: Hung‐Jen Chen, et al.
Published: (2024)
by: Hung‐Jen Chen, et al.
Published: (2024)
TML‐6, A Novel Oral Multi‐Target Drug: Design of a Global Phase II Trial Investigating Safety, Tolerability, and Efficacy with Integration of Blood Biomarkers in Early Alzheimer’s Disease.
by: Chien Hong Lin, et al.
Published: (2025)
by: Chien Hong Lin, et al.
Published: (2025)
A Preliminary Study of RAG for Taiwanese Historical Archives
by: Lin, Claire, et al.
Published: (2025)
by: Lin, Claire, et al.
Published: (2025)
Multi‐level Nonvolatile Transistor Memory With Optical Rewritability Utilizing Reverse‐Bias P‐N Junction of Oriented Rod‐Like Organic Molecules
by: Yi‐Sa Lin, et al.
Published: (2024)
by: Yi‐Sa Lin, et al.
Published: (2024)
Long‐term outcomes of fertility‐sparing treatment in endometrial carcinoma and endometrial intraepithelial neoplasia: Recurrence risk factors over a 9‐year follow‐up
by: Ya‐Ting Hsu, et al.
Published: (2025)
by: Ya‐Ting Hsu, et al.
Published: (2025)
Chronic Cough Caused by Adenoid Cystic Carcinoma
by: Yu‐Tzu Chien, et al.
Published: (2025)
by: Yu‐Tzu Chien, et al.
Published: (2025)
BOFormer: Learning to Solve Multi-Objective Bayesian Optimization via Non-Markovian RL
by: Hung, Yu-Heng, et al.
Published: (2025)
by: Hung, Yu-Heng, et al.
Published: (2025)
Towards General-Purpose Text-Instruction-Guided Voice Conversion
by: Kuan, Chun-Yi, et al.
Published: (2023)
by: Kuan, Chun-Yi, et al.
Published: (2023)
Listen and Speak Fairly: A Study on Semantic Gender Bias in Speech Integrated Large Language Models
by: Lin, Yi-Cheng, et al.
Published: (2024)
by: Lin, Yi-Cheng, et al.
Published: (2024)
Active Learning-Driven Lightweight YOLOv9: Enhancing Efficiency in Smart Agriculture
by: Tu, Hung-Chih, et al.
Published: (2026)
by: Tu, Hung-Chih, et al.
Published: (2026)
MI-Fuse: Label Fusion for Unsupervised Domain Adaptation with Closed-Source Large-Audio Language Model
by: Huang, Hsiao-Ying, et al.
Published: (2025)
by: Huang, Hsiao-Ying, et al.
Published: (2025)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
by: Tseng, Liang-Hsuan, et al.
Published: (2025)
by: Tseng, Liang-Hsuan, et al.
Published: (2025)
Development of Next‐Generation Flood Inundation Maps: A Case Study in Kaohsiung City, Taiwan
by: Chih‐Hung Hsu, et al.
Published: (2026)
by: Chih‐Hung Hsu, et al.
Published: (2026)
Navigating the dilemmas of educational reform: A case study of Montessori implementation in a Taiwanese public school
by: Ming‐Wen Chang, et al.
Published: (2025)
by: Ming‐Wen Chang, et al.
Published: (2025)
Rethinking Dense Sequential Chains: Reasoning Language Models Can Extract Answers from Sparse, Order-Shuffling Chain-of-Thoughts
by: Chen, Yi-Chang, et al.
Published: (2026)
by: Chen, Yi-Chang, et al.
Published: (2026)
A Real‐World Experience of Prognostic Factors of Survival Outcomes in a Taiwanese Population With Unresectable Hepatocellular Carcinoma Treated With First‐Line Lenvatinib
by: Shou‐Wu Lee, et al.
Published: (2026)
by: Shou‐Wu Lee, et al.
Published: (2026)
Vaccine‐Induced Immune Thrombotic Thrombocytopenia Caused by Zoetis PR‐VAC PLUS in Pseudorabies Virus‐Free Danish Purebred Pigs
by: Chien‐Cheng Chen
Published: (2025)
by: Chien‐Cheng Chen
Published: (2025)
Improving Speech Emotion Recognition in Under-Resourced Languages via Speech-to-Speech Translation with Bootstrapping Data Selection
by: Lin, Hsi-Che, et al.
Published: (2024)
by: Lin, Hsi-Che, et al.
Published: (2024)
Similar Items
-
Polyphone Disambiguation in Mandarin Chinese with Semi-Supervised Learning
by: Shi, Yi, et al.
Published: (2021) -
Measuring Taiwanese Mandarin Language Understanding
by: Chen, Po-Heng, et al.
Published: (2024) -
Building a Taiwanese Mandarin Spoken Language Model: A First Attempt
by: Yang, Chih-Kai, et al.
Published: (2024) -
A Preliminary Exploration with GPT-4o Voice Mode
by: Lin, Yu-Xiang, et al.
Published: (2025) -
Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Models
by: Ieong, Lok-Lam, et al.
Published: (2026)