Towards Prosodically Informed Mizo TTS without Explicit Tone Markings
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mohanta, Abhijit, Remruatpuii, Sarmah, Priyankoo, Sinha, Rohit, Lalhminghlui, Wendy |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Tone recognition in low-resource languages of North-East India: peeling the layers of SSL-based speech models
par: Gogoi, Parismita, et autres
Publié: (2025)
par: Gogoi, Parismita, et autres
Publié: (2025)
Analyzing long-term rhythm variations in Mising and Assamese using frequency domain correlates
par: Gogoi, Parismita, et autres
Publié: (2024)
par: Gogoi, Parismita, et autres
Publié: (2024)
Prosodic Parameter Manipulation in TTS generated speech for Controlled Speech Generation
par: Chary, Podakanti Satyajith
Publié: (2024)
par: Chary, Podakanti Satyajith
Publié: (2024)
Exploring rhythm formant analysis for Indic language classification
par: Gogoi, Parismita, et autres
Publié: (2024)
par: Gogoi, Parismita, et autres
Publié: (2024)
Towards Flow-Matching-based TTS without Classifier-Free Guidance
par: Liang, Yuzhe, et autres
Publié: (2025)
par: Liang, Yuzhe, et autres
Publié: (2025)
Traceable TTS: Toward Watermark-Free TTS with Strong Traceability
par: Zhao, Yuxiang, et autres
Publié: (2025)
par: Zhao, Yuxiang, et autres
Publié: (2025)
EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge
par: Manku, Ruskin Raj, et autres
Publié: (2025)
par: Manku, Ruskin Raj, et autres
Publié: (2025)
Revisiting MFCCs: Evidence for Spectral-Prosodic Coupling
par: Bezerra, Vitor Magno de O. S., et autres
Publié: (2025)
par: Bezerra, Vitor Magno de O. S., et autres
Publié: (2025)
Grapheme-Coherent Phonemic and Prosodic Annotation of Speech by Implicit and Explicit Grapheme Conditioning
par: Ohnaka, Hien, et autres
Publié: (2025)
par: Ohnaka, Hien, et autres
Publié: (2025)
Leveraging AM and FM Rhythm Spectrograms for Dementia Classification and Assessment
par: Gogoi, Parismita, et autres
Publié: (2025)
par: Gogoi, Parismita, et autres
Publié: (2025)
Nord-Parl-TTS: Finnish and Swedish TTS Dataset from Parliament Speech
par: Li, Zirui, et autres
Publié: (2025)
par: Li, Zirui, et autres
Publié: (2025)
How Open is Open TTS? A Practical Evaluation of Open Source TTS Tools
par: Răgman, Teodora, et autres
Publié: (2026)
par: Răgman, Teodora, et autres
Publié: (2026)
Cross-linguistic Prosodic Analysis of Autistic and Non-autistic Child Speech in Finnish, French and Slovak
par: Myllylä, Ida-Lotta, et autres
Publié: (2026)
par: Myllylä, Ida-Lotta, et autres
Publié: (2026)
ProSDD: Learning Prosodic Representations for Speech Deepfake Detection against Expressive and Emotional Attacks
par: Mahapatra, Aurosweta, et autres
Publié: (2026)
par: Mahapatra, Aurosweta, et autres
Publié: (2026)
Intelli-Z: Toward Intelligible Zero-Shot TTS
par: Jung, Sunghee, et autres
Publié: (2024)
par: Jung, Sunghee, et autres
Publié: (2024)
Scalable Controllable Accented TTS
par: Xinyuan, Henry Li, et autres
Publié: (2025)
par: Xinyuan, Henry Li, et autres
Publié: (2025)
Zero-Shot TTS With Enhanced Audio Prompts: Bsc Submission For The 2026 Wildspoof Challenge TTS Track
par: Giraldo, Jose, et autres
Publié: (2026)
par: Giraldo, Jose, et autres
Publié: (2026)
AutoProsody: A Prosodic Feature Extraction Tool for Indian Languages
par: Thinakaran, Preethi, et autres
Publié: (2025)
par: Thinakaran, Preethi, et autres
Publié: (2025)
SponTTS: modeling and transferring spontaneous style for TTS
par: Li, Hanzhao, et autres
Publié: (2023)
par: Li, Hanzhao, et autres
Publié: (2023)
T5Gemma-TTS Technical Report
par: Arata, Chihiro, et autres
Publié: (2026)
par: Arata, Chihiro, et autres
Publié: (2026)
UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information
par: Wang, Rui, et autres
Publié: (2025)
par: Wang, Rui, et autres
Publié: (2025)
E1 TTS: Simple and Fast Non-Autoregressive TTS
par: Liu, Zhijun, et autres
Publié: (2024)
par: Liu, Zhijun, et autres
Publié: (2024)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
par: Chen, Weidong, et autres
Publié: (2025)
par: Chen, Weidong, et autres
Publié: (2025)
OV-InstructTTS: Towards Open-Vocabulary Instruct Text-to-Speech
par: Ren, Yong, et autres
Publié: (2026)
par: Ren, Yong, et autres
Publié: (2026)
WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark
par: Ma, Linhan, et autres
Publié: (2024)
par: Ma, Linhan, et autres
Publié: (2024)
PSST! Prosodic Speech Segmentation with Transformers
par: Roll, Nathan, et autres
Publié: (2023)
par: Roll, Nathan, et autres
Publié: (2023)
Towards Generalizability to Tone and Content Variations in the Transcription of Amplifier Rendered Electric Guitar Audio
par: Chen, Yu-Hua, et autres
Publié: (2025)
par: Chen, Yu-Hua, et autres
Publié: (2025)
Evaluation of preprocessing pipelines in the creation of in-the-wild TTS datasets
par: Di Bernardo, Matías, et autres
Publié: (2025)
par: Di Bernardo, Matías, et autres
Publié: (2025)
E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS
par: Eskimez, Sefik Emre, et autres
Publié: (2024)
par: Eskimez, Sefik Emre, et autres
Publié: (2024)
ManaTTS Persian: a recipe for creating TTS datasets for lower resource languages
par: Qharabagh, Mahta Fetrat, et autres
Publié: (2024)
par: Qharabagh, Mahta Fetrat, et autres
Publié: (2024)
Natural Yet Challenging to Detect: Robust In-the-Wild TTS through EMA and Dual-Scoring Prompt Selection -- Submission for WildSpoof 2026 TTS Track
par: Sun, Renhe, et autres
Publié: (2026)
par: Sun, Renhe, et autres
Publié: (2026)
FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot
par: Xie, Kun, et autres
Publié: (2025)
par: Xie, Kun, et autres
Publié: (2025)
Which Prosodic Features Matter Most for Pragmatics?
par: Ward, Nigel G., et autres
Publié: (2024)
par: Ward, Nigel G., et autres
Publié: (2024)
Exploring speech style spaces with language models: Emotional TTS without emotion labels
par: Chandra, Shreeram Suresh, et autres
Publié: (2024)
par: Chandra, Shreeram Suresh, et autres
Publié: (2024)
Sounding Like a Winner? Prosodic Differences in Post-Match Interviews
par: Kakouros, Sofoklis, et autres
Publié: (2025)
par: Kakouros, Sofoklis, et autres
Publié: (2025)
Emotion-Aware Prefix: Towards Explicit Emotion Control in Voice Conversion Models
par: Yang, Haoyuan, et autres
Publié: (2026)
par: Yang, Haoyuan, et autres
Publié: (2026)
Prosodically Enhanced Foreign Accent Simulation by Discrete Token-based Resynthesis Only with Native Speech Corpora
par: Onda, Kentaro, et autres
Publié: (2025)
par: Onda, Kentaro, et autres
Publié: (2025)
Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech
par: Kim, Semin, et autres
Publié: (2026)
par: Kim, Semin, et autres
Publié: (2026)
MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts
par: Xue, Heyang, et autres
Publié: (2025)
par: Xue, Heyang, et autres
Publié: (2025)
Enhancing Conversational TTS with Cascaded Prompting and ICL-Based Online Reinforcement Learning
par: Ouyang, Zhicheng, et autres
Publié: (2026)
par: Ouyang, Zhicheng, et autres
Publié: (2026)
Documents similaires
-
Tone recognition in low-resource languages of North-East India: peeling the layers of SSL-based speech models
par: Gogoi, Parismita, et autres
Publié: (2025) -
Analyzing long-term rhythm variations in Mising and Assamese using frequency domain correlates
par: Gogoi, Parismita, et autres
Publié: (2024) -
Prosodic Parameter Manipulation in TTS generated speech for Controlled Speech Generation
par: Chary, Podakanti Satyajith
Publié: (2024) -
Exploring rhythm formant analysis for Indic language classification
par: Gogoi, Parismita, et autres
Publié: (2024) -
Towards Flow-Matching-based TTS without Classifier-Free Guidance
par: Liang, Yuzhe, et autres
Publié: (2025)