IndicVoices-R: Unlocking a Massive Multilingual Multi-speaker Speech Corpus for Scaling Indian TTS
Fuente:
arXiv
Salvato in:
| Autori principali: | Sankar, Ashwin, Anand, Srija, Varadhan, Praveen Srinivasa, Thomas, Sherry, Singal, Mehak, Kumar, Shridhar, Mehendale, Deovrat, Krishana, Aditi, Raju, Giri, Khapra, Mitesh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ELAICHI: Enhancing Low-resource TTS by Addressing Infrequent and Low-frequency Character Bigrams
di: Anand, Srija, et al.
Pubblicazione: (2024)
di: Anand, Srija, et al.
Pubblicazione: (2024)
Enhancing Out-of-Vocabulary Performance of Indian TTS Systems for Practical Applications through Low-Effort Data Strategies
di: Anand, Srija, et al.
Pubblicazione: (2024)
di: Anand, Srija, et al.
Pubblicazione: (2024)
Rasa: Building Expressive Speech Synthesis Systems for Indian Languages in Low-resource Settings
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2024)
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2024)
Phir Hera Fairy: An English Fairytaler is a Strong Faker of Fluent Speech in Low-Resource Indian Languages
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2025)
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2025)
The State Of TTS: A Case Study with Human Fooling Rates
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2025)
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2025)
IndicVoices: Towards building an Inclusive Multilingual Speech Dataset for Indian Languages
di: Javed, Tahir, et al.
Pubblicazione: (2024)
di: Javed, Tahir, et al.
Pubblicazione: (2024)
RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations
di: Sankar, Ashwin, et al.
Pubblicazione: (2025)
di: Sankar, Ashwin, et al.
Pubblicazione: (2025)
Rethinking MUSHRA: Addressing Modern Challenges in Text-to-Speech Evaluation
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2024)
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2024)
Preferences of a Voice-First Nation: Large-Scale Pairwise Evaluation and Preference Analysis for TTS in Indian Languages
di: Anand, Srija, et al.
Pubblicazione: (2026)
di: Anand, Srija, et al.
Pubblicazione: (2026)
LAHAJA: A Robust Multi-accent Benchmark for Evaluating Hindi ASR Systems
di: Javed, Tahir, et al.
Pubblicazione: (2024)
di: Javed, Tahir, et al.
Pubblicazione: (2024)
DexAssist: A Voice-Enabled Dual-LLM Framework for Accessible Web Navigation
di: Mehendale, Shridhar, et al.
Pubblicazione: (2024)
di: Mehendale, Shridhar, et al.
Pubblicazione: (2024)
Empowering Low-Resource Language ASR via Large-Scale Pseudo Labeling
di: Bhogale, Kaushal Santosh, et al.
Pubblicazione: (2024)
di: Bhogale, Kaushal Santosh, et al.
Pubblicazione: (2024)
IndicDLP: A Foundational Dataset for Multi-Lingual and Multi-Domain Document Layout Parsing
di: Nath, Oikantik, et al.
Pubblicazione: (2025)
di: Nath, Oikantik, et al.
Pubblicazione: (2025)
Scaling NVIDIA's Multi-speaker Multi-lingual TTS Systems with Zero-Shot TTS to Indic Languages
di: Arora, Akshit, et al.
Pubblicazione: (2024)
di: Arora, Akshit, et al.
Pubblicazione: (2024)
Efficacy of Large Language Models in Systematic Reviews
di: Shah, Aaditya, et al.
Pubblicazione: (2024)
di: Shah, Aaditya, et al.
Pubblicazione: (2024)
Praxy Voice: Voice-Prompt Recovery + BUPS for Commercial-Class Indic TTS from a Frozen Non-Indic Base at Zero Commercial-Training-Data Cost
di: Menta, Venkata Pushpak Teja
Pubblicazione: (2026)
di: Menta, Venkata Pushpak Teja
Pubblicazione: (2026)
IndicLLMSuite: A Blueprint for Creating Pre-training and Fine-Tuning Datasets for Indian Languages
di: Khan, Mohammed Safi Ur Rahman, et al.
Pubblicazione: (2024)
di: Khan, Mohammed Safi Ur Rahman, et al.
Pubblicazione: (2024)
NIRANTAR: Continual Learning with New Languages and Domains on Real-world Speech Data
di: Javed, Tahir, et al.
Pubblicazione: (2025)
di: Javed, Tahir, et al.
Pubblicazione: (2025)
Recognizing Every Voice: Towards Inclusive ASR for Rural Bhojpuri Women
di: Joshi, Sakshi, et al.
Pubblicazione: (2025)
di: Joshi, Sakshi, et al.
Pubblicazione: (2025)
Conditioned free-energy density of proteins using unbalanced solutions to constraint satisfaction problems
di: Worah, Pratik, et al.
Pubblicazione: (2026)
di: Worah, Pratik, et al.
Pubblicazione: (2026)
IndicEval-XL: Bridging Linguistic Diversity in Code Generation Across Indic Languages
di: Singh, Ujjwal, et al.
Pubblicazione: (2025)
di: Singh, Ujjwal, et al.
Pubblicazione: (2025)
Towards Building Large Scale Datasets and State-of-the-Art Automatic Speech Translation Systems for 14 Indian Languages
di: Sankar, Ashwin, et al.
Pubblicazione: (2024)
di: Sankar, Ashwin, et al.
Pubblicazione: (2024)
LibriTTS-VI: A Public Corpus and Novel Methods for Efficient Voice Impression Control
di: Ohmura, Junki, et al.
Pubblicazione: (2025)
di: Ohmura, Junki, et al.
Pubblicazione: (2025)
Desarrollo de un pseudo-elemento de interfaz para el modelado de mampostería de ladrillo reforzado
di: S. Mehendale
Pubblicazione: (2017)
di: S. Mehendale
Pubblicazione: (2017)
Reflections on the Diverse Voices speaker series
di: Regan Mudhar, et al.
Pubblicazione: (2025)
di: Regan Mudhar, et al.
Pubblicazione: (2025)
Bayesian Imputation for Unplayed Games in Round-Robin Chess Tournaments: Application to Grand Chess Tour, Bucharest 2026
di: Varadhan, Ravi
Pubblicazione: (2026)
di: Varadhan, Ravi
Pubblicazione: (2026)
Exploring an Inter-Pausal Unit (IPU) based Approach for Indic End-to-End TTS Systems
di: Prakash, Anusha, et al.
Pubblicazione: (2024)
di: Prakash, Anusha, et al.
Pubblicazione: (2024)
Can Vision-Language Models Evaluate Handwritten Math?
di: Nath, Oikantik, et al.
Pubblicazione: (2025)
di: Nath, Oikantik, et al.
Pubblicazione: (2025)
Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models
di: Khan, Mohammed Safi Ur Rahman, et al.
Pubblicazione: (2026)
di: Khan, Mohammed Safi Ur Rahman, et al.
Pubblicazione: (2026)
Finding Blind Spots in Evaluator LLMs with Interpretable Checklists
di: Doddapaneni, Sumanth, et al.
Pubblicazione: (2024)
di: Doddapaneni, Sumanth, et al.
Pubblicazione: (2024)
Compact Neural TTS Voices for Accessibility
di: Jain, Kunal, et al.
Pubblicazione: (2025)
di: Jain, Kunal, et al.
Pubblicazione: (2025)
Exploring synthetic data for cross-speaker style transfer in style representation based TTS
di: Ueda, Lucas H., et al.
Pubblicazione: (2024)
di: Ueda, Lucas H., et al.
Pubblicazione: (2024)
Voice Impression Control in Zero-Shot TTS
di: Fujita, Kenichi, et al.
Pubblicazione: (2025)
di: Fujita, Kenichi, et al.
Pubblicazione: (2025)
Towards A Comprehensive Assessment of AI's Environmental Impact
di: Chakraborty, Srija
Pubblicazione: (2024)
di: Chakraborty, Srija
Pubblicazione: (2024)
Data-Centric Safety and Ethical Measures for Data and AI Governance
di: Chakraborty, Srija
Pubblicazione: (2025)
di: Chakraborty, Srija
Pubblicazione: (2025)
A Polynomial Space Lower Bound for Diameter Estimation in Dynamic Streams
di: Khanna, Sanjeev, et al.
Pubblicazione: (2025)
di: Khanna, Sanjeev, et al.
Pubblicazione: (2025)
An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS
di: Kunešová, Marie, et al.
Pubblicazione: (2025)
di: Kunešová, Marie, et al.
Pubblicazione: (2025)
NLIP_Lab-IITH Low-Resource MT System for WMT24 Indic MT Shared Task
di: Sahoo, Pramit, et al.
Pubblicazione: (2024)
di: Sahoo, Pramit, et al.
Pubblicazione: (2024)
Hamiltonian Graphs and the Traveling Salesman Problem
di: Mehendale, Dhananjay P.
Pubblicazione: (2007)
di: Mehendale, Dhananjay P.
Pubblicazione: (2007)
On Gracefully Labeling Trees
di: Mehendale, Dhananjay P.
Pubblicazione: (2005)
di: Mehendale, Dhananjay P.
Pubblicazione: (2005)
Documenti analoghi
-
ELAICHI: Enhancing Low-resource TTS by Addressing Infrequent and Low-frequency Character Bigrams
di: Anand, Srija, et al.
Pubblicazione: (2024) -
Enhancing Out-of-Vocabulary Performance of Indian TTS Systems for Practical Applications through Low-Effort Data Strategies
di: Anand, Srija, et al.
Pubblicazione: (2024) -
Rasa: Building Expressive Speech Synthesis Systems for Indian Languages in Low-resource Settings
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2024) -
Phir Hera Fairy: An English Fairytaler is a Strong Faker of Fluent Speech in Low-Resource Indian Languages
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2025) -
The State Of TTS: A Case Study with Human Fooling Rates
di: Varadhan, Praveen Srinivasa, et al.
Pubblicazione: (2025)