Vox-Evaluator: Enhancing Stability and Fidelity for Zero-shot TTS with A Multi-Level Evaluator
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Hualei, Li, Na, Wang, Chuke, Wu, Shu, Li, Zhifeng, Yu, Dong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
USM-VC: Mitigating Timbre Leakage with Universal Semantic Mapping Residual Block for Voice Conversion
por: Li, Na, et al.
Publicado: (2025)
por: Li, Na, et al.
Publicado: (2025)
Iterate to Differentiate: Enhancing Discriminability and Reliability in Zero-Shot TTS Evaluation
por: Shen, Shengfan, et al.
Publicado: (2026)
por: Shen, Shengfan, et al.
Publicado: (2026)
VoxCPM: Tokenizer-Free TTS for Context-Aware Speech Generation and True-to-Life Voice Cloning
por: Zhou, Yixuan, et al.
Publicado: (2025)
por: Zhou, Yixuan, et al.
Publicado: (2025)
M3-TTS: Multi-modal DiT Alignment & Mel-latent for Zero-shot High-fidelity Speech Synthesis
por: Wang, Xiaopeng, et al.
Publicado: (2025)
por: Wang, Xiaopeng, et al.
Publicado: (2025)
Zero-shot Cross-lingual Voice Transfer for TTS
por: Biadsy, Fadi, et al.
Publicado: (2024)
por: Biadsy, Fadi, et al.
Publicado: (2024)
SP-MCQA: Evaluating Intelligibility of TTS Beyond the Word Level
por: Tee, Hitomi Jin Ling, et al.
Publicado: (2025)
por: Tee, Hitomi Jin Ling, et al.
Publicado: (2025)
StyleFusion TTS: Multimodal Style-control and Enhanced Feature Fusion for Zero-shot Text-to-speech Synthesis
por: Chen, Zhiyong, et al.
Publicado: (2024)
por: Chen, Zhiyong, et al.
Publicado: (2024)
IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System
por: Deng, Wei, et al.
Publicado: (2025)
por: Deng, Wei, et al.
Publicado: (2025)
Towards Lightweight and Stable Zero-shot TTS with Self-distilled Representation Disentanglement
por: Chen, Qianniu, et al.
Publicado: (2025)
por: Chen, Qianniu, et al.
Publicado: (2025)
An Exploration of ECAPA-TDNN and x-vector Speaker Representations in Zero-shot Multi-speaker TTS
por: Kunešová, Marie, et al.
Publicado: (2025)
por: Kunešová, Marie, et al.
Publicado: (2025)
FlexiVoice: Enabling Flexible Style Control in Zero-Shot TTS with Natural Language Instructions
por: Chen, Dekun, et al.
Publicado: (2026)
por: Chen, Dekun, et al.
Publicado: (2026)
VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents
por: Wu, Weihao, et al.
Publicado: (2025)
por: Wu, Weihao, et al.
Publicado: (2025)
Enhancing Zero-Shot Multi-Speaker TTS with Negated Speaker Representations
por: Jeon, Yejin, et al.
Publicado: (2024)
por: Jeon, Yejin, et al.
Publicado: (2024)
ZMM-TTS: Zero-shot Multilingual and Multispeaker Speech Synthesis Conditioned on Self-supervised Discrete Speech Representations
por: Gong, Cheng, et al.
Publicado: (2023)
por: Gong, Cheng, et al.
Publicado: (2023)
VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models
por: Wang, Yuxiang, et al.
Publicado: (2026)
por: Wang, Yuxiang, et al.
Publicado: (2026)
IndexTTS 2.5 Technical Report
por: Li, Yunpei, et al.
Publicado: (2026)
por: Li, Yunpei, et al.
Publicado: (2026)
EMORL-TTS: Reinforcement Learning for Fine-Grained Emotion Control in LLM-based TTS
por: Li, Haoxun, et al.
Publicado: (2025)
por: Li, Haoxun, et al.
Publicado: (2025)
E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS
por: Eskimez, Sefik Emre, et al.
Publicado: (2024)
por: Eskimez, Sefik Emre, et al.
Publicado: (2024)
Audio-Thinker: Guiding Audio Language Model When and How to Think via Reinforcement Learning
por: Wu, Shu, et al.
Publicado: (2025)
por: Wu, Shu, et al.
Publicado: (2025)
VoxMorph: Scalable Zero-shot Voice Identity Morphing via Disentangled Embeddings
por: Krishnamurthy, Bharath, et al.
Publicado: (2026)
por: Krishnamurthy, Bharath, et al.
Publicado: (2026)
Improving Noise Robustness of LLM-based Zero-shot TTS via Discrete Acoustic Token Denoising
por: Lu, Ye-Xin, et al.
Publicado: (2025)
por: Lu, Ye-Xin, et al.
Publicado: (2025)
SynTTS-Commands: A Public Dataset for On-Device KWS via TTS-Synthesized Multilingual Speech
por: Gan, Lu, et al.
Publicado: (2025)
por: Gan, Lu, et al.
Publicado: (2025)
Flamed-TTS: Flow Matching Attention-Free Models for Efficient Generating and Dynamic Pacing Zero-shot Text-to-Speech
por: Huynh-Nguyen, Hieu-Nghia, et al.
Publicado: (2025)
por: Huynh-Nguyen, Hieu-Nghia, et al.
Publicado: (2025)
Scaling NVIDIA's Multi-speaker Multi-lingual TTS Systems with Zero-Shot TTS to Indic Languages
por: Arora, Akshit, et al.
Publicado: (2024)
por: Arora, Akshit, et al.
Publicado: (2024)
Listening Between the Frames: Bridging Temporal Gaps in Large Audio-Language Models
por: Wang, Hualei, et al.
Publicado: (2025)
por: Wang, Hualei, et al.
Publicado: (2025)
E1 TTS: Simple and Fast Non-Autoregressive TTS
por: Liu, Zhijun, et al.
Publicado: (2024)
por: Liu, Zhijun, et al.
Publicado: (2024)
MPE-TTS: Customized Emotion Zero-Shot Text-To-Speech Using Multi-Modal Prompt
por: Wu, Zhichao, et al.
Publicado: (2025)
por: Wu, Zhichao, et al.
Publicado: (2025)
Enhancing TTS Stability in Hebrew using Discrete Semantic Units
por: Zeldes, Ella, et al.
Publicado: (2024)
por: Zeldes, Ella, et al.
Publicado: (2024)
Investigation of Zero-shot Text-to-Speech Models for Enhancing Short-Utterance Speaker Verification
por: Zhao, Yiyang, et al.
Publicado: (2025)
por: Zhao, Yiyang, et al.
Publicado: (2025)
InstructDubber: Instruction-based Alignment for Zero-shot Movie Dubbing
por: Zhang, Zhedong, et al.
Publicado: (2025)
por: Zhang, Zhedong, et al.
Publicado: (2025)
Mobile Recording Device Recognition Based Cross-Scale and Multi-Level Representation Learning
por: Zeng, Chunyan, et al.
Publicado: (2024)
por: Zeng, Chunyan, et al.
Publicado: (2024)
MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts
por: Xue, Heyang, et al.
Publicado: (2025)
por: Xue, Heyang, et al.
Publicado: (2025)
CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTS
por: Chen, Junyang, et al.
Publicado: (2026)
por: Chen, Junyang, et al.
Publicado: (2026)
Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback
por: Chen, Chen, et al.
Publicado: (2024)
por: Chen, Chen, et al.
Publicado: (2024)
GLM-TTS Technical Report
por: Cui, Jiayan, et al.
Publicado: (2025)
por: Cui, Jiayan, et al.
Publicado: (2025)
EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge
por: Manku, Ruskin Raj, et al.
Publicado: (2025)
por: Manku, Ruskin Raj, et al.
Publicado: (2025)
Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment
por: Zhang, Xueyao, et al.
Publicado: (2025)
por: Zhang, Xueyao, et al.
Publicado: (2025)
VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation
por: Peng, Puyuan, et al.
Publicado: (2025)
por: Peng, Puyuan, et al.
Publicado: (2025)
VoxMind: An End-to-End Agentic Spoken Dialogue System
por: Liang, Tianle, et al.
Publicado: (2026)
por: Liang, Tianle, et al.
Publicado: (2026)
Multi-level Temporal-channel Speaker Retrieval for Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2023)
por: Wang, Zhichao, et al.
Publicado: (2023)
Ejemplares similares
-
USM-VC: Mitigating Timbre Leakage with Universal Semantic Mapping Residual Block for Voice Conversion
por: Li, Na, et al.
Publicado: (2025) -
Iterate to Differentiate: Enhancing Discriminability and Reliability in Zero-Shot TTS Evaluation
por: Shen, Shengfan, et al.
Publicado: (2026) -
VoxCPM: Tokenizer-Free TTS for Context-Aware Speech Generation and True-to-Life Voice Cloning
por: Zhou, Yixuan, et al.
Publicado: (2025) -
M3-TTS: Multi-modal DiT Alignment & Mel-latent for Zero-shot High-fidelity Speech Synthesis
por: Wang, Xiaopeng, et al.
Publicado: (2025) -
Zero-shot Cross-lingual Voice Transfer for TTS
por: Biadsy, Fadi, et al.
Publicado: (2024)