Intelligibility of Text-to-Speech Systems for Mathematical Expressions
Fuente:
arXiv
Salvato in:
| Autori principali: | Roychowdhury, Sujoy, Ranjani, H. G., Soman, Sumit, Paul, Nishtha, Bandyopadhyay, Subhadip, Iyengar, Siddhanth |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MathReader : Text-to-Speech for Mathematical Documents
di: Hyeon, Sieun, et al.
Pubblicazione: (2025)
di: Hyeon, Sieun, et al.
Pubblicazione: (2025)
Text-To-Speech Synthesis In The Wild
di: Jung, Jee-weon, et al.
Pubblicazione: (2024)
di: Jung, Jee-weon, et al.
Pubblicazione: (2024)
Revival with Voice: Multi-modal Controllable Text-to-Speech Synthesis
di: Kim, Minsu, et al.
Pubblicazione: (2025)
di: Kim, Minsu, et al.
Pubblicazione: (2025)
Zero-Shot Text-to-Speech as Golden Speech Generator: A Systematic Framework and its Applicability in Automatic Pronunciation Assessment
di: Lo, Tien-Hong, et al.
Pubblicazione: (2024)
di: Lo, Tien-Hong, et al.
Pubblicazione: (2024)
Crowdsourced Multilingual Speech Intelligibility Testing
di: Lechler, Laura, et al.
Pubblicazione: (2024)
di: Lechler, Laura, et al.
Pubblicazione: (2024)
PS-TTS: Phonetic Synchronization in Text-to-Speech for Achieving Natural Automated Dubbing
di: Hong, Changi, et al.
Pubblicazione: (2026)
di: Hong, Changi, et al.
Pubblicazione: (2026)
CapSpeech: Enabling Downstream Applications in Style-Captioned Text-to-Speech
di: Wang, Helin, et al.
Pubblicazione: (2025)
di: Wang, Helin, et al.
Pubblicazione: (2025)
IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System
di: Deng, Wei, et al.
Pubblicazione: (2025)
di: Deng, Wei, et al.
Pubblicazione: (2025)
DEX-TTS: Diffusion-based EXpressive Text-to-Speech with Style Modeling on Time Variability
di: Park, Hyun Joon, et al.
Pubblicazione: (2024)
di: Park, Hyun Joon, et al.
Pubblicazione: (2024)
Voice Mapping of Text-to-Speech Systems: A Metric-Based Approach for Voice Quality Assessment
di: Cai, Huanchen, et al.
Pubblicazione: (2026)
di: Cai, Huanchen, et al.
Pubblicazione: (2026)
RapFlow-TTS: Rapid and High-Fidelity Text-to-Speech with Improved Consistency Flow Matching
di: Park, Hyun Joon, et al.
Pubblicazione: (2025)
di: Park, Hyun Joon, et al.
Pubblicazione: (2025)
A Multi-modal Approach to Dysarthria Detection and Severity Assessment Using Speech and Text Information
di: M, Anuprabha, et al.
Pubblicazione: (2024)
di: M, Anuprabha, et al.
Pubblicazione: (2024)
Embedded Acoustic Intelligence for Automotive Systems
di: Rajagopal, Renjith, et al.
Pubblicazione: (2025)
di: Rajagopal, Renjith, et al.
Pubblicazione: (2025)
Adaptive Duration Model for Text Speech Alignment
di: Cao, Junjie
Pubblicazione: (2025)
di: Cao, Junjie
Pubblicazione: (2025)
Towards Improving NAM-to-Speech Synthesis Intelligibility using Self-Supervised Speech Models
di: Shah, Neil, et al.
Pubblicazione: (2024)
di: Shah, Neil, et al.
Pubblicazione: (2024)
Handling Numeric Expressions in Automatic Speech Recognition
di: Huber, Christian, et al.
Pubblicazione: (2024)
di: Huber, Christian, et al.
Pubblicazione: (2024)
Facial Expression-Enhanced TTS: Combining Face Representation and Emotion Intensity for Adaptive Speech
di: Chu, Yunji, et al.
Pubblicazione: (2024)
di: Chu, Yunji, et al.
Pubblicazione: (2024)
SoloSpeech: Enhancing Intelligibility and Quality in Target Speech Extraction through a Cascaded Generative Pipeline
di: Wang, Helin, et al.
Pubblicazione: (2025)
di: Wang, Helin, et al.
Pubblicazione: (2025)
Unveiling the Best Practices for Applying Speech Foundation Models to Speech Intelligibility Prediction for Hearing-Impaired People
di: Zhou, Haoshuai, et al.
Pubblicazione: (2025)
di: Zhou, Haoshuai, et al.
Pubblicazione: (2025)
ARCHI-TTS: A flow-matching-based Text-to-Speech Model with Self-supervised Semantic Aligner and Accelerated Inference
di: Wu, Chunyat, et al.
Pubblicazione: (2026)
di: Wu, Chunyat, et al.
Pubblicazione: (2026)
Improved Intelligibility of Dysarthric Speech using Conditional Flow Matching
di: Das, Shoutrik, et al.
Pubblicazione: (2025)
di: Das, Shoutrik, et al.
Pubblicazione: (2025)
No Audiogram: Leveraging Existing Scores for Personalized Speech Intelligibility Prediction
di: Zhou, Haoshuai, et al.
Pubblicazione: (2025)
di: Zhou, Haoshuai, et al.
Pubblicazione: (2025)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
di: Wang, Xinsheng, et al.
Pubblicazione: (2025)
di: Wang, Xinsheng, et al.
Pubblicazione: (2025)
Shallow Flow Matching for Coarse-to-Fine Text-to-Speech Synthesis
di: Yang, Dong, et al.
Pubblicazione: (2025)
di: Yang, Dong, et al.
Pubblicazione: (2025)
LoRP-TTS: Low-Rank Personalized Text-To-Speech
di: Bondaruk, Łukasz, et al.
Pubblicazione: (2025)
di: Bondaruk, Łukasz, et al.
Pubblicazione: (2025)
Audio Deepfake Detection in the Age of Advanced Text-to-Speech models
di: Singh, Robin, et al.
Pubblicazione: (2026)
di: Singh, Robin, et al.
Pubblicazione: (2026)
DART: Disentanglement of Accent and Speaker Representation in Multispeaker Text-to-Speech
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
di: Melechovsky, Jan, et al.
Pubblicazione: (2024)
Streaming Speech-to-Text Translation with a SpeechLLM
di: Parcollet, Titouan, et al.
Pubblicazione: (2026)
di: Parcollet, Titouan, et al.
Pubblicazione: (2026)
Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis
di: Mayer, Paul, et al.
Pubblicazione: (2025)
di: Mayer, Paul, et al.
Pubblicazione: (2025)
Lina-Speech: Gated Linear Attention and Initial-State Tuning for Multi-Sample Prompting Text-To-Speech Synthesis
di: Lemerle, Théodor, et al.
Pubblicazione: (2024)
di: Lemerle, Théodor, et al.
Pubblicazione: (2024)
MixRep: Hidden Representation Mixup for Low-Resource Speech Recognition
di: Xie, Jiamin, et al.
Pubblicazione: (2023)
di: Xie, Jiamin, et al.
Pubblicazione: (2023)
Multi-Source Spatial Knowledge Understanding for Immersive Visual Text-to-Speech
di: He, Shuwei, et al.
Pubblicazione: (2024)
di: He, Shuwei, et al.
Pubblicazione: (2024)
Incremental FastPitch: Chunk-based High Quality Text to Speech
di: Du, Muyang, et al.
Pubblicazione: (2024)
di: Du, Muyang, et al.
Pubblicazione: (2024)
Active Speech Enhancement: Active Speech Denoising Decliping and Deveraberation
di: Yaish, Ofir, et al.
Pubblicazione: (2025)
di: Yaish, Ofir, et al.
Pubblicazione: (2025)
Emotional Text-To-Speech Based on Mutual-Information-Guided Emotion-Timbre Disentanglement
di: Yang, Jianing, et al.
Pubblicazione: (2025)
di: Yang, Jianing, et al.
Pubblicazione: (2025)
MultiVerse: Efficient and Expressive Zero-Shot Multi-Task Text-to-Speech
di: Bak, Taejun, et al.
Pubblicazione: (2024)
di: Bak, Taejun, et al.
Pubblicazione: (2024)
NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
di: Ni, Qinke, et al.
Pubblicazione: (2026)
di: Ni, Qinke, et al.
Pubblicazione: (2026)
DEFORMER: Coupling Deformed Localized Patterns with Global Context for Robust End-to-end Speech Recognition
di: Xie, Jiamin, et al.
Pubblicazione: (2022)
di: Xie, Jiamin, et al.
Pubblicazione: (2022)
Leveraging Multiple Speech Enhancers for Non-Intrusive Intelligibility Prediction for Hearing-Impaired Listeners
di: Cao, Boxuan, et al.
Pubblicazione: (2025)
di: Cao, Boxuan, et al.
Pubblicazione: (2025)
Generative Data Augmentation Challenge: Zero-Shot Speech Synthesis for Personalized Speech Enhancement
di: Bae, Jae-Sung, et al.
Pubblicazione: (2025)
di: Bae, Jae-Sung, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MathReader : Text-to-Speech for Mathematical Documents
di: Hyeon, Sieun, et al.
Pubblicazione: (2025) -
Text-To-Speech Synthesis In The Wild
di: Jung, Jee-weon, et al.
Pubblicazione: (2024) -
Revival with Voice: Multi-modal Controllable Text-to-Speech Synthesis
di: Kim, Minsu, et al.
Pubblicazione: (2025) -
Zero-Shot Text-to-Speech as Golden Speech Generator: A Systematic Framework and its Applicability in Automatic Pronunciation Assessment
di: Lo, Tien-Hong, et al.
Pubblicazione: (2024) -
Crowdsourced Multilingual Speech Intelligibility Testing
di: Lechler, Laura, et al.
Pubblicazione: (2024)