Natural Yet Challenging to Detect: Robust In-the-Wild TTS through EMA and Dual-Scoring Prompt Selection -- Submission for WildSpoof 2026 TTS Track
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sun, Renhe, Zhou, Jiayi, He, Haolin, Feng, Yueying, Liu, Jian |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
BUT Systems for WildSpoof Challenge: SASV in the Wild
par: Peng, Junyi, et autres
Publié: (2025)
par: Peng, Junyi, et autres
Publié: (2025)
Joint Optimization of ASV and CM tasks: BTUEF Team's Submission for WildSpoof Challenge
par: Kurnaz, Oguzhan, et autres
Publié: (2026)
par: Kurnaz, Oguzhan, et autres
Publié: (2026)
Zero-Shot TTS With Enhanced Audio Prompts: Bsc Submission For The 2026 Wildspoof Challenge TTS Track
par: Giraldo, Jose, et autres
Publié: (2026)
par: Giraldo, Jose, et autres
Publié: (2026)
LG Uplus System with Multi-Speaker IDs and Discriminator-based Sub-Judges for the WildSpoof Challenge
par: Park, Jinyoung, et autres
Publié: (2025)
par: Park, Jinyoung, et autres
Publié: (2025)
Robust TTS Training via Self-Purifying Flow Matching for the WildSpoof 2026 TTS Track
par: Yi, June Young, et autres
Publié: (2025)
par: Yi, June Young, et autres
Publié: (2025)
RWKVTTS: Yet another TTS based on RWKV-7
par: yueyu, Lin, et autres
Publié: (2025)
par: yueyu, Lin, et autres
Publié: (2025)
Traceable TTS: Toward Watermark-Free TTS with Strong Traceability
par: Zhao, Yuxiang, et autres
Publié: (2025)
par: Zhao, Yuxiang, et autres
Publié: (2025)
SponTTS: modeling and transferring spontaneous style for TTS
par: Li, Hanzhao, et autres
Publié: (2023)
par: Li, Hanzhao, et autres
Publié: (2023)
Nord-Parl-TTS: Finnish and Swedish TTS Dataset from Parliament Speech
par: Li, Zirui, et autres
Publié: (2025)
par: Li, Zirui, et autres
Publié: (2025)
SPAM: Style Prompt Adherence Metric for Prompt-based TTS
par: Cho, Chanhee, et autres
Publié: (2026)
par: Cho, Chanhee, et autres
Publié: (2026)
E1 TTS: Simple and Fast Non-Autoregressive TTS
par: Liu, Zhijun, et autres
Publié: (2024)
par: Liu, Zhijun, et autres
Publié: (2024)
How Open is Open TTS? A Practical Evaluation of Open Source TTS Tools
par: Răgman, Teodora, et autres
Publié: (2026)
par: Răgman, Teodora, et autres
Publié: (2026)
SpoofCeleb: Speech Deepfake Detection and SASV In The Wild
par: Jung, Jee-weon, et autres
Publié: (2024)
par: Jung, Jee-weon, et autres
Publié: (2024)
Scalable Controllable Accented TTS
par: Xinyuan, Henry Li, et autres
Publié: (2025)
par: Xinyuan, Henry Li, et autres
Publié: (2025)
Enhancing Conversational TTS with Cascaded Prompting and ICL-Based Online Reinforcement Learning
par: Ouyang, Zhicheng, et autres
Publié: (2026)
par: Ouyang, Zhicheng, et autres
Publié: (2026)
E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS
par: Eskimez, Sefik Emre, et autres
Publié: (2024)
par: Eskimez, Sefik Emre, et autres
Publié: (2024)
ManaTTS Persian: a recipe for creating TTS datasets for lower resource languages
par: Qharabagh, Mahta Fetrat, et autres
Publié: (2024)
par: Qharabagh, Mahta Fetrat, et autres
Publié: (2024)
T5Gemma-TTS Technical Report
par: Arata, Chihiro, et autres
Publié: (2026)
par: Arata, Chihiro, et autres
Publié: (2026)
Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech
par: Kim, Semin, et autres
Publié: (2026)
par: Kim, Semin, et autres
Publié: (2026)
EE-TTS: Emphatic Expressive TTS with Linguistic Information
par: Zhong, Yi, et autres
Publié: (2023)
par: Zhong, Yi, et autres
Publié: (2023)
Score-Based Training for Energy-Based TTS Models
par: Sun, Wanli, et autres
Publié: (2025)
par: Sun, Wanli, et autres
Publié: (2025)
FNH-TTS: Mixture-of-Experts Duration Modeling for Robust Neural Speech Synthesis
par: Meng, Qingliang, et autres
Publié: (2025)
par: Meng, Qingliang, et autres
Publié: (2025)
WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark
par: Ma, Linhan, et autres
Publié: (2024)
par: Ma, Linhan, et autres
Publié: (2024)
Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis
par: Jiang, Ziyue, et autres
Publié: (2023)
par: Jiang, Ziyue, et autres
Publié: (2023)
TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch
par: Song, Xingchen, et autres
Publié: (2024)
par: Song, Xingchen, et autres
Publié: (2024)
MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts
par: Xue, Heyang, et autres
Publié: (2025)
par: Xue, Heyang, et autres
Publié: (2025)
EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge
par: Manku, Ruskin Raj, et autres
Publié: (2025)
par: Manku, Ruskin Raj, et autres
Publié: (2025)
EnvSSLAM-FFN: Lightweight Layer-Fused System for ESDD 2026 Challenge
par: Guo, Xiaoxuan, et autres
Publié: (2025)
par: Guo, Xiaoxuan, et autres
Publié: (2025)
Evaluation of preprocessing pipelines in the creation of in-the-wild TTS datasets
par: Di Bernardo, Matías, et autres
Publié: (2025)
par: Di Bernardo, Matías, et autres
Publié: (2025)
A Preliminary Case Study on Long-Form In-the-Wild Audio Spoofing Detection
par: Liu, Xuechen, et autres
Publié: (2024)
par: Liu, Xuechen, et autres
Publié: (2024)
HD-PPT: Hierarchical Decoding of Content- and Prompt-Preference Tokens for Instruction-based TTS
par: Nie, Sihang, et autres
Publié: (2025)
par: Nie, Sihang, et autres
Publié: (2025)
VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation
par: Peng, Puyuan, et autres
Publié: (2025)
par: Peng, Puyuan, et autres
Publié: (2025)
UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information
par: Wang, Rui, et autres
Publié: (2025)
par: Wang, Rui, et autres
Publié: (2025)
WildScore: Benchmarking MLLMs in-the-Wild Symbolic Music Reasoning
par: Mundada, Gagan, et autres
Publié: (2025)
par: Mundada, Gagan, et autres
Publié: (2025)
MM-TTS: Multi-modal Prompt based Style Transfer for Expressive Text-to-Speech Synthesis
par: Guan, Wenhao, et autres
Publié: (2023)
par: Guan, Wenhao, et autres
Publié: (2023)
A2TTS: TTS for Low Resource Indian Languages
par: Bhadoriya, Ayush Singh, et autres
Publié: (2025)
par: Bhadoriya, Ayush Singh, et autres
Publié: (2025)
PS-TTS: Phonetic Synchronization in Text-to-Speech for Achieving Natural Automated Dubbing
par: Hong, Changi, et autres
Publié: (2026)
par: Hong, Changi, et autres
Publié: (2026)
Accent-VITS:accent transfer for end-to-end TTS
par: Ma, Linhan, et autres
Publié: (2023)
par: Ma, Linhan, et autres
Publié: (2023)
A Dataset for Automatic Assessment of TTS Quality in Spanish
par: Welford, Alejandro Sosa, et autres
Publié: (2025)
par: Welford, Alejandro Sosa, et autres
Publié: (2025)
Intelli-Z: Toward Intelligible Zero-Shot TTS
par: Jung, Sunghee, et autres
Publié: (2024)
par: Jung, Sunghee, et autres
Publié: (2024)
Documents similaires
-
BUT Systems for WildSpoof Challenge: SASV in the Wild
par: Peng, Junyi, et autres
Publié: (2025) -
Joint Optimization of ASV and CM tasks: BTUEF Team's Submission for WildSpoof Challenge
par: Kurnaz, Oguzhan, et autres
Publié: (2026) -
Zero-Shot TTS With Enhanced Audio Prompts: Bsc Submission For The 2026 Wildspoof Challenge TTS Track
par: Giraldo, Jose, et autres
Publié: (2026) -
LG Uplus System with Multi-Speaker IDs and Discriminator-based Sub-Judges for the WildSpoof Challenge
par: Park, Jinyoung, et autres
Publié: (2025) -
Robust TTS Training via Self-Purifying Flow Matching for the WildSpoof 2026 TTS Track
par: Yi, June Young, et autres
Publié: (2025)