Evaluation of preprocessing pipelines in the creation of in-the-wild TTS datasets
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Di Bernardo, Matías, Misley, Emmanuel, Correa, Ignacio, Iacovelli, Mateo García, Mellino, Simón, Barrios, Gala Lucía Gonzalez |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ManaTTS Persian: a recipe for creating TTS datasets for lower resource languages
par: Qharabagh, Mahta Fetrat, et autres
Publié: (2024)
par: Qharabagh, Mahta Fetrat, et autres
Publié: (2024)
How Open is Open TTS? A Practical Evaluation of Open Source TTS Tools
par: Răgman, Teodora, et autres
Publié: (2026)
par: Răgman, Teodora, et autres
Publié: (2026)
An Exhaustive Evaluation of TTS- and VC-based Data Augmentation for ASR
par: Ogun, Sewade, et autres
Publié: (2025)
par: Ogun, Sewade, et autres
Publié: (2025)
Traceable TTS: Toward Watermark-Free TTS with Strong Traceability
par: Zhao, Yuxiang, et autres
Publié: (2025)
par: Zhao, Yuxiang, et autres
Publié: (2025)
Scalable Controllable Accented TTS
par: Xinyuan, Henry Li, et autres
Publié: (2025)
par: Xinyuan, Henry Li, et autres
Publié: (2025)
Nord-Parl-TTS: Finnish and Swedish TTS Dataset from Parliament Speech
par: Li, Zirui, et autres
Publié: (2025)
par: Li, Zirui, et autres
Publié: (2025)
SponTTS: modeling and transferring spontaneous style for TTS
par: Li, Hanzhao, et autres
Publié: (2023)
par: Li, Hanzhao, et autres
Publié: (2023)
Zero-Shot TTS With Enhanced Audio Prompts: Bsc Submission For The 2026 Wildspoof Challenge TTS Track
par: Giraldo, Jose, et autres
Publié: (2026)
par: Giraldo, Jose, et autres
Publié: (2026)
E1 TTS: Simple and Fast Non-Autoregressive TTS
par: Liu, Zhijun, et autres
Publié: (2024)
par: Liu, Zhijun, et autres
Publié: (2024)
T5Gemma-TTS Technical Report
par: Arata, Chihiro, et autres
Publié: (2026)
par: Arata, Chihiro, et autres
Publié: (2026)
Low-Resource Self-Supervised Learning with SSL-Enhanced TTS
par: Hsu, Po-chun, et autres
Publié: (2023)
par: Hsu, Po-chun, et autres
Publié: (2023)
WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark
par: Ma, Linhan, et autres
Publié: (2024)
par: Ma, Linhan, et autres
Publié: (2024)
E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS
par: Eskimez, Sefik Emre, et autres
Publié: (2024)
par: Eskimez, Sefik Emre, et autres
Publié: (2024)
Reconstructing the Charlie Parker Omnibook using an audio-to-score automatic transcription pipeline
par: Riley, Xavier, et autres
Publié: (2024)
par: Riley, Xavier, et autres
Publié: (2024)
Natural Yet Challenging to Detect: Robust In-the-Wild TTS through EMA and Dual-Scoring Prompt Selection -- Submission for WildSpoof 2026 TTS Track
par: Sun, Renhe, et autres
Publié: (2026)
par: Sun, Renhe, et autres
Publié: (2026)
TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch
par: Song, Xingchen, et autres
Publié: (2024)
par: Song, Xingchen, et autres
Publié: (2024)
MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts
par: Xue, Heyang, et autres
Publié: (2025)
par: Xue, Heyang, et autres
Publié: (2025)
Towards Prosodically Informed Mizo TTS without Explicit Tone Markings
par: Mohanta, Abhijit, et autres
Publié: (2026)
par: Mohanta, Abhijit, et autres
Publié: (2026)
Towards Flow-Matching-based TTS without Classifier-Free Guidance
par: Liang, Yuzhe, et autres
Publié: (2025)
par: Liang, Yuzhe, et autres
Publié: (2025)
Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech
par: Kim, Semin, et autres
Publié: (2026)
par: Kim, Semin, et autres
Publié: (2026)
Spatio-temporal Latent Representations for the Analysis of Acoustic Scenes in-the-wild
par: Montero-Ramírez, Claudia, et autres
Publié: (2024)
par: Montero-Ramírez, Claudia, et autres
Publié: (2024)
KazEmoTTS: A Dataset for Kazakh Emotional Text-to-Speech Synthesis
par: Abilbekov, Adal, et autres
Publié: (2024)
par: Abilbekov, Adal, et autres
Publié: (2024)
Arabic TTS with FastPitch: Reproducible Baselines, Adversarial Training, and Oversmoothing Analysis
par: Nippert, Lars
Publié: (2025)
par: Nippert, Lars
Publié: (2025)
Enhancing Conversational TTS with Cascaded Prompting and ICL-Based Online Reinforcement Learning
par: Ouyang, Zhicheng, et autres
Publié: (2026)
par: Ouyang, Zhicheng, et autres
Publié: (2026)
FNH-TTS: Mixture-of-Experts Duration Modeling for Robust Neural Speech Synthesis
par: Meng, Qingliang, et autres
Publié: (2025)
par: Meng, Qingliang, et autres
Publié: (2025)
T-Mimi: A Transformer-based Mimi Decoder for Real-Time On-Phone TTS
par: Wu, Haibin, et autres
Publié: (2026)
par: Wu, Haibin, et autres
Publié: (2026)
MELA-TTS: Joint transformer-diffusion model with representation alignment for speech synthesis
par: An, Keyu, et autres
Publié: (2025)
par: An, Keyu, et autres
Publié: (2025)
EE-TTS: Emphatic Expressive TTS with Linguistic Information
par: Zhong, Yi, et autres
Publié: (2023)
par: Zhong, Yi, et autres
Publié: (2023)
EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge
par: Manku, Ruskin Raj, et autres
Publié: (2025)
par: Manku, Ruskin Raj, et autres
Publié: (2025)
HiFiTTS-2: A Large-Scale High Bandwidth Speech Dataset
par: Langman, Ryan, et autres
Publié: (2025)
par: Langman, Ryan, et autres
Publié: (2025)
Measuring Prosody Diversity in Zero-Shot TTS: A New Metric, Benchmark, and Exploration
par: Yang, Yifan, et autres
Publié: (2025)
par: Yang, Yifan, et autres
Publié: (2025)
Accent-VITS:accent transfer for end-to-end TTS
par: Ma, Linhan, et autres
Publié: (2023)
par: Ma, Linhan, et autres
Publié: (2023)
A Dataset for Automatic Assessment of TTS Quality in Spanish
par: Welford, Alejandro Sosa, et autres
Publié: (2025)
par: Welford, Alejandro Sosa, et autres
Publié: (2025)
Intelli-Z: Toward Intelligible Zero-Shot TTS
par: Jung, Sunghee, et autres
Publié: (2024)
par: Jung, Sunghee, et autres
Publié: (2024)
Zero-shot Cross-lingual Voice Transfer for TTS
par: Biadsy, Fadi, et autres
Publié: (2024)
par: Biadsy, Fadi, et autres
Publié: (2024)
SelfTTS: cross-speaker style transfer through explicit embedding disentanglement and self-refinement using self-augmentation
par: Ueda, Lucas H., et autres
Publié: (2026)
par: Ueda, Lucas H., et autres
Publié: (2026)
Beyond Two-stage Diffusion TTS: Joint Structure and Content Refinement via Jump Diffusion
par: Ai, Jiabao, et autres
Publié: (2026)
par: Ai, Jiabao, et autres
Publié: (2026)
Time-Layer Adaptive Alignment for Speaker Similarity in Flow-Matching Based Zero-Shot TTS
par: Li, Haoyu, et autres
Publié: (2025)
par: Li, Haoyu, et autres
Publié: (2025)
Exploring an Inter-Pausal Unit (IPU) based Approach for Indic End-to-End TTS Systems
par: Prakash, Anusha, et autres
Publié: (2024)
par: Prakash, Anusha, et autres
Publié: (2024)
SP-MCQA: Evaluating Intelligibility of TTS Beyond the Word Level
par: Tee, Hitomi Jin Ling, et autres
Publié: (2025)
par: Tee, Hitomi Jin Ling, et autres
Publié: (2025)
Documents similaires
-
ManaTTS Persian: a recipe for creating TTS datasets for lower resource languages
par: Qharabagh, Mahta Fetrat, et autres
Publié: (2024) -
How Open is Open TTS? A Practical Evaluation of Open Source TTS Tools
par: Răgman, Teodora, et autres
Publié: (2026) -
An Exhaustive Evaluation of TTS- and VC-based Data Augmentation for ASR
par: Ogun, Sewade, et autres
Publié: (2025) -
Traceable TTS: Toward Watermark-Free TTS with Strong Traceability
par: Zhao, Yuxiang, et autres
Publié: (2025) -
Scalable Controllable Accented TTS
par: Xinyuan, Henry Li, et autres
Publié: (2025)