Robust TTS Training via Self-Purifying Flow Matching for the WildSpoof 2026 TTS Track
Fuente:
arXiv
Guardado en:
| Autores principales: | Yi, June Young, Kim, Hyeongju, Lee, Juheon |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Training Flow Matching Models with Reliable Labels via Self-Purification
por: Kim, Hyeongju, et al.
Publicado: (2025)
por: Kim, Hyeongju, et al.
Publicado: (2025)
WildSpoof Challenge Evaluation Plan
por: Wu, Yihan, et al.
Publicado: (2025)
por: Wu, Yihan, et al.
Publicado: (2025)
DFKI-Speech System for WildSpoof Challenge: A robust framework for SASV In-the-Wild
por: Das, Arnab, et al.
Publicado: (2026)
por: Das, Arnab, et al.
Publicado: (2026)
Length-Aware Rotary Position Embedding for Text-Speech Alignment
por: Kim, Hyeongju, et al.
Publicado: (2025)
por: Kim, Hyeongju, et al.
Publicado: (2025)
Flamed-TTS: Flow Matching Attention-Free Models for Efficient Generating and Dynamic Pacing Zero-shot Text-to-Speech
por: Huynh-Nguyen, Hieu-Nghia, et al.
Publicado: (2025)
por: Huynh-Nguyen, Hieu-Nghia, et al.
Publicado: (2025)
SupertonicTTS: Towards Highly Efficient and Streamlined Text-to-Speech System
por: Kim, Hyeongju, et al.
Publicado: (2025)
por: Kim, Hyeongju, et al.
Publicado: (2025)
RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching
por: Yang, Jinhyeok, et al.
Publicado: (2026)
por: Yang, Jinhyeok, et al.
Publicado: (2026)
IndexTTS 2.5 Technical Report
por: Li, Yunpei, et al.
Publicado: (2026)
por: Li, Yunpei, et al.
Publicado: (2026)
MOSS-TTS Technical Report
por: Gong, Yitian, et al.
Publicado: (2026)
por: Gong, Yitian, et al.
Publicado: (2026)
AutoStyle-TTS: Retrieval-Augmented Generation based Automatic Style Matching Text-to-Speech Synthesis
por: Luo, Dan, et al.
Publicado: (2025)
por: Luo, Dan, et al.
Publicado: (2025)
UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information
por: Wang, Rui, et al.
Publicado: (2025)
por: Wang, Rui, et al.
Publicado: (2025)
A2TTS: TTS for Low Resource Indian Languages
por: Bhadoriya, Ayush Singh, et al.
Publicado: (2025)
por: Bhadoriya, Ayush Singh, et al.
Publicado: (2025)
Natural Yet Challenging to Detect: Robust In-the-Wild TTS through EMA and Dual-Scoring Prompt Selection -- Submission for WildSpoof 2026 TTS Track
por: Sun, Renhe, et al.
Publicado: (2026)
por: Sun, Renhe, et al.
Publicado: (2026)
DiEmo-TTS: Disentangled Emotion Representations via Self-Supervised Distillation for Cross-Speaker Emotion Transfer in Text-to-Speech
por: Cho, Deok-Hyeon, et al.
Publicado: (2025)
por: Cho, Deok-Hyeon, et al.
Publicado: (2025)
RRPO: Robust Reward Policy Optimization for LLM-based Emotional TTS
por: Wang, Cong, et al.
Publicado: (2025)
por: Wang, Cong, et al.
Publicado: (2025)
ZeSTA: Zero-Shot TTS Augmentation with Domain-Conditioned Training for Data-Efficient Personalized Speech Synthesis
por: Choi, Youngwon, et al.
Publicado: (2026)
por: Choi, Youngwon, et al.
Publicado: (2026)
Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting
por: Han, Wooseok, et al.
Publicado: (2024)
por: Han, Wooseok, et al.
Publicado: (2024)
A Self-Refining Framework for Enhancing ASR Using TTS-Synthesized Data
por: Chou, Cheng-Kang, et al.
Publicado: (2025)
por: Chou, Cheng-Kang, et al.
Publicado: (2025)
Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
por: Kim, Nam-Gyu, et al.
Publicado: (2025)
por: Kim, Nam-Gyu, et al.
Publicado: (2025)
On the Effectiveness of Acoustic BPE in Decoder-Only TTS
por: Li, Bohan, et al.
Publicado: (2024)
por: Li, Bohan, et al.
Publicado: (2024)
Towards Lightweight and Stable Zero-shot TTS with Self-distilled Representation Disentanglement
por: Chen, Qianniu, et al.
Publicado: (2025)
por: Chen, Qianniu, et al.
Publicado: (2025)
Unsupervised TTS Acoustic Modeling for TTS with Conditional Disentangled Sequential VAE
por: Lian, Jiachen, et al.
Publicado: (2022)
por: Lian, Jiachen, et al.
Publicado: (2022)
EmoSphere-TTS: Emotional Style and Intensity Modeling via Spherical Emotion Vector for Controllable Emotional Text-to-Speech
por: Cho, Deok-Hyeon, et al.
Publicado: (2024)
por: Cho, Deok-Hyeon, et al.
Publicado: (2024)
Prosodic Boundary-Aware Streaming Generation for LLM-Based TTS with Streaming Text Input
por: Liu, Changsong, et al.
Publicado: (2026)
por: Liu, Changsong, et al.
Publicado: (2026)
PFluxTTS: Hybrid Flow-Matching TTS with Robust Cross-Lingual Voice Cloning and Inference-Time Model Fusion
por: Pankov, Vikentii, et al.
Publicado: (2026)
por: Pankov, Vikentii, et al.
Publicado: (2026)
EmoSteer-TTS: Fine-Grained and Training-Free Emotion-Controllable Text-to-Speech via Activation Steering
por: Xie, Tianxin, et al.
Publicado: (2025)
por: Xie, Tianxin, et al.
Publicado: (2025)
Differentiable Reward Optimization for LLM based TTS system
por: Gao, Changfeng, et al.
Publicado: (2025)
por: Gao, Changfeng, et al.
Publicado: (2025)
A Non-autoregressive Model for Joint STT and TTS
por: Sunder, Vishal, et al.
Publicado: (2025)
por: Sunder, Vishal, et al.
Publicado: (2025)
Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models
por: Lee, Kyowoon, et al.
Publicado: (2025)
por: Lee, Kyowoon, et al.
Publicado: (2025)
TTS-1 Technical Report
por: Atamanenko, Oleg, et al.
Publicado: (2025)
por: Atamanenko, Oleg, et al.
Publicado: (2025)
When Fine-Tuning Fails and when it Generalises: Role of Data Diversity and Mixed Training in LLM-based TTS
por: Purwar, Anupam, et al.
Publicado: (2026)
por: Purwar, Anupam, et al.
Publicado: (2026)
Explore the Reinforcement Learning for the LLM based ASR and TTS system
por: Gao, Changfeng, et al.
Publicado: (2025)
por: Gao, Changfeng, et al.
Publicado: (2025)
LoRP-TTS: Low-Rank Personalized Text-To-Speech
por: Bondaruk, Łukasz, et al.
Publicado: (2025)
por: Bondaruk, Łukasz, et al.
Publicado: (2025)
No Verifiable Reward for Prosody: Toward Preference-Guided Prosody Learning in TTS
por: Shin, Seungyoun, et al.
Publicado: (2025)
por: Shin, Seungyoun, et al.
Publicado: (2025)
Mitigating Hallucinations in LM-Based TTS Models via Distribution Alignment Using GFlowNets
por: Liu, Chenlin, et al.
Publicado: (2025)
por: Liu, Chenlin, et al.
Publicado: (2025)
SpoofCeleb: Speech Deepfake Detection and SASV In The Wild
por: Jung, Jee-weon, et al.
Publicado: (2024)
por: Jung, Jee-weon, et al.
Publicado: (2024)
Assessing the Ability of Neural TTS Systems to Model Consonant-Induced F0 Perturbation
por: Yang, Tianle, et al.
Publicado: (2026)
por: Yang, Tianle, et al.
Publicado: (2026)
CTC-TTS: LLM-based dual-streaming text-to-speech with CTC alignment
por: Liu, Hanwen, et al.
Publicado: (2026)
por: Liu, Hanwen, et al.
Publicado: (2026)
Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS
por: Seo, Deokjin, et al.
Publicado: (2026)
por: Seo, Deokjin, et al.
Publicado: (2026)
DPI-TTS: Directional Patch Interaction for Fast-Converging and Style Temporal Modeling in Text-to-Speech
por: Qi, Xin, et al.
Publicado: (2024)
por: Qi, Xin, et al.
Publicado: (2024)
Ejemplares similares
-
Training Flow Matching Models with Reliable Labels via Self-Purification
por: Kim, Hyeongju, et al.
Publicado: (2025) -
WildSpoof Challenge Evaluation Plan
por: Wu, Yihan, et al.
Publicado: (2025) -
DFKI-Speech System for WildSpoof Challenge: A robust framework for SASV In-the-Wild
por: Das, Arnab, et al.
Publicado: (2026) -
Length-Aware Rotary Position Embedding for Text-Speech Alignment
por: Kim, Hyeongju, et al.
Publicado: (2025) -
Flamed-TTS: Flow Matching Attention-Free Models for Efficient Generating and Dynamic Pacing Zero-shot Text-to-Speech
por: Huynh-Nguyen, Hieu-Nghia, et al.
Publicado: (2025)