FlexiVoice: Enabling Flexible Style Control in Zero-Shot TTS with Natural Language Instructions
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Dekun, Zhang, Xueyao, Wang, Yuancheng, Dai, Kenan, Ma, Li, Wu, Zhizheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MimicLM: Zero-Shot Voice Imitation through Autoregressive Modeling of Pseudo-Parallel Speech Corpora
di: Feng, Tao, et al.
Pubblicazione: (2026)
di: Feng, Tao, et al.
Pubblicazione: (2026)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
di: Wang, Yuancheng, et al.
Pubblicazione: (2025)
di: Wang, Yuancheng, et al.
Pubblicazione: (2025)
VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models
di: Wang, Yuxiang, et al.
Pubblicazione: (2026)
di: Wang, Yuxiang, et al.
Pubblicazione: (2026)
Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
Vevo2: A Unified and Controllable Framework for Speech and Singing Voice Generation
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
ReStyle-TTS: Relative and Continuous Style Control for Zero-Shot Speech Synthesis
di: Li, Haitao, et al.
Pubblicazione: (2026)
di: Li, Haitao, et al.
Pubblicazione: (2026)
Voice Impression Control in Zero-Shot TTS
di: Fujita, Kenichi, et al.
Pubblicazione: (2025)
di: Fujita, Kenichi, et al.
Pubblicazione: (2025)
VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation
di: Peng, Puyuan, et al.
Pubblicazione: (2025)
di: Peng, Puyuan, et al.
Pubblicazione: (2025)
MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer
di: Wang, Yuancheng, et al.
Pubblicazione: (2024)
di: Wang, Yuancheng, et al.
Pubblicazione: (2024)
DS-TTS: Zero-Shot Speaker Style Adaptation from Voice Clips via Dynamic Dual-Style Feature Modulation
di: Meng, Ming, et al.
Pubblicazione: (2025)
di: Meng, Ming, et al.
Pubblicazione: (2025)
The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024
di: Zhou, Shuoyi, et al.
Pubblicazione: (2024)
di: Zhou, Shuoyi, et al.
Pubblicazione: (2024)
Noro: Noise-Robust One-shot Voice Conversion with Hidden Speaker Representation Learning
di: He, Haorui, et al.
Pubblicazione: (2024)
di: He, Haorui, et al.
Pubblicazione: (2024)
StyleStream: Real-Time Zero-Shot Voice Style Conversion
di: Liu, Yisi, et al.
Pubblicazione: (2026)
di: Liu, Yisi, et al.
Pubblicazione: (2026)
TCSinger: Zero-Shot Singing Voice Synthesis with Style Transfer and Multi-Level Style Control
di: Zhang, Yu, et al.
Pubblicazione: (2024)
di: Zhang, Yu, et al.
Pubblicazione: (2024)
SpeechJudge: Towards Human-Level Judgment for Speech Naturalness
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)
Multi-Metric Preference Alignment for Generative Speech Restoration
di: Zhang, Junan, et al.
Pubblicazione: (2025)
di: Zhang, Junan, et al.
Pubblicazione: (2025)
AnyAccomp: Generalizable Accompaniment Generation via Quantized Melodic Bottleneck
di: Zhang, Junan, et al.
Pubblicazione: (2025)
di: Zhang, Junan, et al.
Pubblicazione: (2025)
FlexiCodec: A Dynamic Neural Audio Codec for Low Frame Rates
di: Li, Jiaqi, et al.
Pubblicazione: (2025)
di: Li, Jiaqi, et al.
Pubblicazione: (2025)
SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset
di: Gu, Yicheng, et al.
Pubblicazione: (2025)
di: Gu, Yicheng, et al.
Pubblicazione: (2025)
Metis: A Foundation Speech Generation Model with Masked Generative Pre-training
di: Wang, Yuancheng, et al.
Pubblicazione: (2025)
di: Wang, Yuancheng, et al.
Pubblicazione: (2025)
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
di: Yao, Jixun, et al.
Pubblicazione: (2024)
di: Yao, Jixun, et al.
Pubblicazione: (2024)
Leveraging Diverse Semantic-based Audio Pretrained Models for Singing Voice Conversion
di: Zhang, Xueyao, et al.
Pubblicazione: (2023)
di: Zhang, Xueyao, et al.
Pubblicazione: (2023)
StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style Diffusion
di: Li, Yinghao Aaron, et al.
Pubblicazione: (2024)
di: Li, Yinghao Aaron, et al.
Pubblicazione: (2024)
Zero-shot Cross-lingual Voice Transfer for TTS
di: Biadsy, Fadi, et al.
Pubblicazione: (2024)
di: Biadsy, Fadi, et al.
Pubblicazione: (2024)
SingVisio: Visual Analytics of Diffusion Model for Singing Voice Conversion
di: Xue, Liumeng, et al.
Pubblicazione: (2024)
di: Xue, Liumeng, et al.
Pubblicazione: (2024)
Iterate to Differentiate: Enhancing Discriminability and Reliability in Zero-Shot TTS Evaluation
di: Shen, Shengfan, et al.
Pubblicazione: (2026)
di: Shen, Shengfan, et al.
Pubblicazione: (2026)
GSA-TTS : Toward Zero-Shot Speech Synthesis based on Gradual Style Adaptor
di: Lee, Seokgi, et al.
Pubblicazione: (2025)
di: Lee, Seokgi, et al.
Pubblicazione: (2025)
An Extensive Analysis of the Singing Voice Conversion Challenge 2025 Evaluation Results
di: Violeta, Lester Phillip, et al.
Pubblicazione: (2025)
di: Violeta, Lester Phillip, et al.
Pubblicazione: (2025)
AutoStyle-TTS: Retrieval-Augmented Generation based Automatic Style Matching Text-to-Speech Synthesis
di: Luo, Dan, et al.
Pubblicazione: (2025)
di: Luo, Dan, et al.
Pubblicazione: (2025)
SD-Eval: A Benchmark Dataset for Spoken Dialogue Understanding Beyond Words
di: Ao, Junyi, et al.
Pubblicazione: (2024)
di: Ao, Junyi, et al.
Pubblicazione: (2024)
X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning
di: Xu, Rixi, et al.
Pubblicazione: (2026)
di: Xu, Rixi, et al.
Pubblicazione: (2026)
StyleFusion TTS: Multimodal Style-control and Enhanced Feature Fusion for Zero-shot Text-to-speech Synthesis
di: Chen, Zhiyong, et al.
Pubblicazione: (2024)
di: Chen, Zhiyong, et al.
Pubblicazione: (2024)
E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS
di: Eskimez, Sefik Emre, et al.
Pubblicazione: (2024)
di: Eskimez, Sefik Emre, et al.
Pubblicazione: (2024)
Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis
di: Jiang, Ziyue, et al.
Pubblicazione: (2023)
di: Jiang, Ziyue, et al.
Pubblicazione: (2023)
Intelli-Z: Toward Intelligible Zero-Shot TTS
di: Jung, Sunghee, et al.
Pubblicazione: (2024)
di: Jung, Sunghee, et al.
Pubblicazione: (2024)
Cross-Lingual F5-TTS: Towards Language-Agnostic Voice Cloning and Speech Synthesis
di: Liu, Qingyu, et al.
Pubblicazione: (2025)
di: Liu, Qingyu, et al.
Pubblicazione: (2025)
Scaling NVIDIA's Multi-speaker Multi-lingual TTS Systems with Zero-Shot TTS to Indic Languages
di: Arora, Akshit, et al.
Pubblicazione: (2024)
di: Arora, Akshit, et al.
Pubblicazione: (2024)
LLaDA-TTS: Unifying Speech Synthesis and Zero-Shot Editing via Masked Diffusion Modeling
di: Fan, Xiaoyu, et al.
Pubblicazione: (2026)
di: Fan, Xiaoyu, et al.
Pubblicazione: (2026)
NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
di: Ni, Qinke, et al.
Pubblicazione: (2026)
di: Ni, Qinke, et al.
Pubblicazione: (2026)
Documenti analoghi
-
MimicLM: Zero-Shot Voice Imitation through Autoregressive Modeling of Pseudo-Parallel Speech Corpora
di: Feng, Tao, et al.
Pubblicazione: (2026) -
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
di: Wang, Yuancheng, et al.
Pubblicazione: (2025) -
VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models
di: Wang, Yuxiang, et al.
Pubblicazione: (2026) -
Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment
di: Zhang, Xueyao, et al.
Pubblicazione: (2025) -
Vevo2: A Unified and Controllable Framework for Speech and Singing Voice Generation
di: Zhang, Xueyao, et al.
Pubblicazione: (2025)