The State Of TTS: A Case Study with Human Fooling Rates
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Varadhan, Praveen Srinivasa, Thomas, Sherry, S., Sai Teja M., Bhooshan, Suvrat, Khapra, Mitesh M. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing Out-of-Vocabulary Performance of Indian TTS Systems for Practical Applications through Low-Effort Data Strategies
par: Anand, Srija, et autres
Publié: (2024)
par: Anand, Srija, et autres
Publié: (2024)
Phir Hera Fairy: An English Fairytaler is a Strong Faker of Fluent Speech in Low-Resource Indian Languages
par: Varadhan, Praveen Srinivasa, et autres
Publié: (2025)
par: Varadhan, Praveen Srinivasa, et autres
Publié: (2025)
Rasa: Building Expressive Speech Synthesis Systems for Indian Languages in Low-resource Settings
par: Varadhan, Praveen Srinivasa, et autres
Publié: (2024)
par: Varadhan, Praveen Srinivasa, et autres
Publié: (2024)
Rethinking MUSHRA: Addressing Modern Challenges in Text-to-Speech Evaluation
par: Varadhan, Praveen Srinivasa, et autres
Publié: (2024)
par: Varadhan, Praveen Srinivasa, et autres
Publié: (2024)
ELAICHI: Enhancing Low-resource TTS by Addressing Infrequent and Low-frequency Character Bigrams
par: Anand, Srija, et autres
Publié: (2024)
par: Anand, Srija, et autres
Publié: (2024)
Praxy Voice: Voice-Prompt Recovery + BUPS for Commercial-Class Indic TTS from a Frozen Non-Indic Base at Zero Commercial-Training-Data Cost
par: Menta, Venkata Pushpak Teja
Publié: (2026)
par: Menta, Venkata Pushpak Teja
Publié: (2026)
Empowering Low-Resource Language ASR via Large-Scale Pseudo Labeling
par: Bhogale, Kaushal Santosh, et autres
Publié: (2024)
par: Bhogale, Kaushal Santosh, et autres
Publié: (2024)
EE-TTS: Emphatic Expressive TTS with Linguistic Information
par: Zhong, Yi, et autres
Publié: (2023)
par: Zhong, Yi, et autres
Publié: (2023)
TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch
par: Song, Xingchen, et autres
Publié: (2024)
par: Song, Xingchen, et autres
Publié: (2024)
Voice Impression Control in Zero-Shot TTS
par: Fujita, Kenichi, et autres
Publié: (2025)
par: Fujita, Kenichi, et autres
Publié: (2025)
Bailing-TTS: Chinese Dialectal Speech Synthesis Towards Human-like Spontaneous Representation
par: Di, Xinhan, et autres
Publié: (2024)
par: Di, Xinhan, et autres
Publié: (2024)
Voice of India: A Large-Scale Benchmark for Real-World Speech Recognition in India
par: Bhogale, Kaushal, et autres
Publié: (2026)
par: Bhogale, Kaushal, et autres
Publié: (2026)
Can Emotion Fool Anti-spoofing?
par: Mahapatra, Aurosweta, et autres
Publié: (2025)
par: Mahapatra, Aurosweta, et autres
Publié: (2025)
Qwen3-TTS Technical Report
par: Hu, Hangrui, et autres
Publié: (2026)
par: Hu, Hangrui, et autres
Publié: (2026)
HyperTTS: Parameter Efficient Adaptation in Text to Speech using Hypernetworks
par: Li, Yingting, et autres
Publié: (2024)
par: Li, Yingting, et autres
Publié: (2024)
Multi-interaction TTS toward professional recording reproduction
par: Kanagawa, Hiroki, et autres
Publié: (2025)
par: Kanagawa, Hiroki, et autres
Publié: (2025)
MunTTS: A Text-to-Speech System for Mundari
par: Gumma, Varun, et autres
Publié: (2024)
par: Gumma, Varun, et autres
Publié: (2024)
Llama-VITS: Enhancing TTS Synthesis with Semantic Awareness
par: Feng, Xincan, et autres
Publié: (2024)
par: Feng, Xincan, et autres
Publié: (2024)
RWKVTTS: Yet another TTS based on RWKV-7
par: yueyu, Lin, et autres
Publié: (2025)
par: yueyu, Lin, et autres
Publié: (2025)
IndicVoices-R: Unlocking a Massive Multilingual Multi-speaker Speech Corpus for Scaling Indian TTS
par: Sankar, Ashwin, et autres
Publié: (2024)
par: Sankar, Ashwin, et autres
Publié: (2024)
DiaMoE-TTS: A Unified IPA-Based Dialect TTS Framework with Mixture-of-Experts and Parameter-Efficient Zero-Shot Adaptation
par: Chen, Ziqi, et autres
Publié: (2025)
par: Chen, Ziqi, et autres
Publié: (2025)
LASE: Language-Adversarial Speaker Encoding for Indic Cross-Script Identity Preservation
par: Menta, Venkata Pushpak Teja
Publié: (2026)
par: Menta, Venkata Pushpak Teja
Publié: (2026)
Word-wise intonation model for cross-language TTS systems
par: A., Tomilov A., et autres
Publié: (2024)
par: A., Tomilov A., et autres
Publié: (2024)
An investigation of phrase break prediction in an End-to-End TTS system
par: Vadapalli, Anandaswarup
Publié: (2023)
par: Vadapalli, Anandaswarup
Publié: (2023)
JoyTTS: LLM-based Spoken Chatbot With Voice Cloning
par: Zhou, Fangru, et autres
Publié: (2025)
par: Zhou, Fangru, et autres
Publié: (2025)
A Language Modeling Approach to Diacritic-Free Hebrew TTS
par: Roth, Amit, et autres
Publié: (2024)
par: Roth, Amit, et autres
Publié: (2024)
SP-MCQA: Evaluating Intelligibility of TTS Beyond the Word Level
par: Tee, Hitomi Jin Ling, et autres
Publié: (2025)
par: Tee, Hitomi Jin Ling, et autres
Publié: (2025)
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
par: Lian, Jiachen, et autres
Publié: (2022)
par: Lian, Jiachen, et autres
Publié: (2022)
LibriTTS-P: A Corpus with Speaking Style and Speaker Identity Prompts for Text-to-Speech and Style Captioning
par: Kawamura, Masaya, et autres
Publié: (2024)
par: Kawamura, Masaya, et autres
Publié: (2024)
Scaling NVIDIA's Multi-speaker Multi-lingual TTS Systems with Zero-Shot TTS to Indic Languages
par: Arora, Akshit, et autres
Publié: (2024)
par: Arora, Akshit, et autres
Publié: (2024)
SponTTS: modeling and transferring spontaneous style for TTS
par: Li, Hanzhao, et autres
Publié: (2023)
par: Li, Hanzhao, et autres
Publié: (2023)
Transfer the linguistic representations from TTS to accent conversion with non-parallel data
par: Chen, Xi, et autres
Publié: (2024)
par: Chen, Xi, et autres
Publié: (2024)
Daisy-TTS: Simulating Wider Spectrum of Emotions via Prosody Embedding Decomposition
par: Chevi, Rendi, et autres
Publié: (2024)
par: Chevi, Rendi, et autres
Publié: (2024)
VECL-TTS: Voice identity and Emotional style controllable Cross-Lingual Text-to-Speech
par: Gudmalwar, Ashishkumar, et autres
Publié: (2024)
par: Gudmalwar, Ashishkumar, et autres
Publié: (2024)
Compact Neural TTS Voices for Accessibility
par: Jain, Kunal, et autres
Publié: (2025)
par: Jain, Kunal, et autres
Publié: (2025)
E1 TTS: Simple and Fast Non-Autoregressive TTS
par: Liu, Zhijun, et autres
Publié: (2024)
par: Liu, Zhijun, et autres
Publié: (2024)
GOAT-TTS: Expressive and Realistic Speech Generation via A Dual-Branch LLM
par: Song, Yaodong, et autres
Publié: (2025)
par: Song, Yaodong, et autres
Publié: (2025)
Can we reconstruct a dysarthric voice with the large speech model Parler TTS?
par: Sanchez, Ariadna, et autres
Publié: (2025)
par: Sanchez, Ariadna, et autres
Publié: (2025)
GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor
par: Lee, Seokgi, et autres
Publié: (2025)
par: Lee, Seokgi, et autres
Publié: (2025)
Leveraging the Interplay Between Syntactic and Acoustic Cues for Optimizing Korean TTS Pause Formation
par: Jeon, Yejin, et autres
Publié: (2024)
par: Jeon, Yejin, et autres
Publié: (2024)
Documents similaires
-
Enhancing Out-of-Vocabulary Performance of Indian TTS Systems for Practical Applications through Low-Effort Data Strategies
par: Anand, Srija, et autres
Publié: (2024) -
Phir Hera Fairy: An English Fairytaler is a Strong Faker of Fluent Speech in Low-Resource Indian Languages
par: Varadhan, Praveen Srinivasa, et autres
Publié: (2025) -
Rasa: Building Expressive Speech Synthesis Systems for Indian Languages in Low-resource Settings
par: Varadhan, Praveen Srinivasa, et autres
Publié: (2024) -
Rethinking MUSHRA: Addressing Modern Challenges in Text-to-Speech Evaluation
par: Varadhan, Praveen Srinivasa, et autres
Publié: (2024) -
ELAICHI: Enhancing Low-resource TTS by Addressing Infrequent and Low-frequency Character Bigrams
par: Anand, Srija, et autres
Publié: (2024)