VStyle: A Benchmark for Voice Style Adaptation with Spoken Instructions
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhan, Jun, Han, Mingyang, Xie, Yuxuan, Wang, Chen, Zhang, Dong, Huang, Kexin, Shi, Haoxiang, Wang, DongXiao, Song, Tengtao, Cheng, Qinyuan, Li, Shimin, Song, Jun, Qiu, Xipeng, Zheng, Bo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems
di: Huang, Kexin, et al.
Pubblicazione: (2025)
di: Huang, Kexin, et al.
Pubblicazione: (2025)
CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation
di: Deng, Ruifan, et al.
Pubblicazione: (2025)
di: Deng, Ruifan, et al.
Pubblicazione: (2025)
SpeechGPT-Gen: Scaling Chain-of-Information Speech Generation
di: Zhang, Dong, et al.
Pubblicazione: (2024)
di: Zhang, Dong, et al.
Pubblicazione: (2024)
JoyTTS: LLM-based Spoken Chatbot With Voice Cloning
di: Zhou, Fangru, et al.
Pubblicazione: (2025)
di: Zhou, Fangru, et al.
Pubblicazione: (2025)
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
di: Zhang, Xin, et al.
Pubblicazione: (2023)
di: Zhang, Xin, et al.
Pubblicazione: (2023)
XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs
di: Gong, Yitian, et al.
Pubblicazione: (2025)
di: Gong, Yitian, et al.
Pubblicazione: (2025)
SD-Eval: A Benchmark Dataset for Spoken Dialogue Understanding Beyond Words
di: Ao, Junyi, et al.
Pubblicazione: (2024)
di: Ao, Junyi, et al.
Pubblicazione: (2024)
SpeechAlign: Aligning Speech Generation to Human Preferences
di: Zhang, Dong, et al.
Pubblicazione: (2024)
di: Zhang, Dong, et al.
Pubblicazione: (2024)
DS-TTS: Zero-Shot Speaker Style Adaptation from Voice Clips via Dynamic Dual-Style Feature Modulation
di: Meng, Ming, et al.
Pubblicazione: (2025)
di: Meng, Ming, et al.
Pubblicazione: (2025)
MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models
di: Gong, Yitian, et al.
Pubblicazione: (2026)
di: Gong, Yitian, et al.
Pubblicazione: (2026)
GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot
di: Zeng, Aohan, et al.
Pubblicazione: (2024)
di: Zeng, Aohan, et al.
Pubblicazione: (2024)
Keyword Mamba: Spoken Keyword Spotting with State Space Models
di: Ding, Hanyu, et al.
Pubblicazione: (2025)
di: Ding, Hanyu, et al.
Pubblicazione: (2025)
Fed-PISA: Federated Voice Cloning via Personalized Identity-Style Adaptation
di: Wang, Qi, et al.
Pubblicazione: (2025)
di: Wang, Qi, et al.
Pubblicazione: (2025)
X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning
di: Xu, Rixi, et al.
Pubblicazione: (2026)
di: Xu, Rixi, et al.
Pubblicazione: (2026)
SE/BN Adapter: Parametric Efficient Domain Adaptation for Speaker Recognition
di: Wang, Tianhao, et al.
Pubblicazione: (2024)
di: Wang, Tianhao, et al.
Pubblicazione: (2024)
JoyVoice: Long-Context Conditioning for Anthropomorphic Multi-Speaker Conversational Synthesis
di: Yu, Fan, et al.
Pubblicazione: (2025)
di: Yu, Fan, et al.
Pubblicazione: (2025)
ZSVC: Zero-shot Style Voice Conversion with Disentangled Latent Diffusion Models and Adversarial Training
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
di: Zhu, Xinfa, et al.
Pubblicazione: (2025)
Auden-Voice: General-Purpose Voice Encoder for Speech and Language Understanding
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
di: Huo, Mingyue, et al.
Pubblicazione: (2025)
SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant
di: Hou, Yixuan, et al.
Pubblicazione: (2025)
di: Hou, Yixuan, et al.
Pubblicazione: (2025)
CycleFlow: Leveraging Cycle Consistency in Flow Matching for Speaker Style Adaptation
di: Liang, Ziqi, et al.
Pubblicazione: (2025)
di: Liang, Ziqi, et al.
Pubblicazione: (2025)
RSET: Remapping-based Sorting Method for Emotion Transfer Speech Synthesis
di: Shi, Haoxiang, et al.
Pubblicazione: (2024)
di: Shi, Haoxiang, et al.
Pubblicazione: (2024)
Disentangling the Prosody and Semantic Information with Pre-trained Model for In-Context Learning based Zero-Shot Voice Conversion
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
di: Chen, Zhengyang, et al.
Pubblicazione: (2024)
Semantic-Aware Interruption Detection in Spoken Dialogue Systems: Benchmark, Metric, and Model
di: Xia, Kangxiang, et al.
Pubblicazione: (2026)
di: Xia, Kangxiang, et al.
Pubblicazione: (2026)
SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing
di: Zhang, Hanlin, et al.
Pubblicazione: (2026)
di: Zhang, Hanlin, et al.
Pubblicazione: (2026)
StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching
di: Yao, Jixun, et al.
Pubblicazione: (2024)
di: Yao, Jixun, et al.
Pubblicazione: (2024)
StreamVoice+: Evolving into End-to-end Streaming Zero-shot Voice Conversion
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
Music2Fail: Transfer Music to Failed Recorder Style
di: Leong, Chon In, et al.
Pubblicazione: (2024)
di: Leong, Chon In, et al.
Pubblicazione: (2024)
ParaLBench: A Large-Scale Benchmark for Computational Paralinguistics over Acoustic Foundation Models
di: Zhang, Zixing, et al.
Pubblicazione: (2024)
di: Zhang, Zixing, et al.
Pubblicazione: (2024)
StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
TCSinger: Zero-Shot Singing Voice Synthesis with Style Transfer and Multi-Level Style Control
di: Zhang, Yu, et al.
Pubblicazione: (2024)
di: Zhang, Yu, et al.
Pubblicazione: (2024)
MuSE-SVS: Multi-Singer Emotional Singing Voice Synthesizer that Controls Emotional Intensity
di: Kim, Sungjae, et al.
Pubblicazione: (2022)
di: Kim, Sungjae, et al.
Pubblicazione: (2022)
LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues
di: Ivry, Amir, et al.
Pubblicazione: (2026)
di: Ivry, Amir, et al.
Pubblicazione: (2026)
Joint Multi-scale Cross-lingual Speaking Style Transfer with Bidirectional Attention Mechanism for Automatic Dubbing
di: Li, Jingbei, et al.
Pubblicazione: (2023)
di: Li, Jingbei, et al.
Pubblicazione: (2023)
StyleSinger: Style Transfer for Out-of-Domain Singing Voice Synthesis
di: Zhang, Yu, et al.
Pubblicazione: (2023)
di: Zhang, Yu, et al.
Pubblicazione: (2023)
MINT-Bench: A Comprehensive Multilingual Benchmark for Instruction-Following Text-to-Speech
di: Chen, Huakang, et al.
Pubblicazione: (2026)
di: Chen, Huakang, et al.
Pubblicazione: (2026)
HybridVC: Efficient Voice Style Conversion with Text and Audio Prompts
di: Niu, Xinlei, et al.
Pubblicazione: (2024)
di: Niu, Xinlei, et al.
Pubblicazione: (2024)
Voice Conversion Improves Cross-Domain Robustness for Spoken Arabic Dialect Identification
di: Abdullah, Badr M., et al.
Pubblicazione: (2025)
di: Abdullah, Badr M., et al.
Pubblicazione: (2025)
SRC4VC: Smartphone-Recorded Corpus for Voice Conversion Benchmark
di: Saito, Yuki, et al.
Pubblicazione: (2024)
di: Saito, Yuki, et al.
Pubblicazione: (2024)
Voices of Civilizations: A Multilingual QA Benchmark for Global Music Understanding
di: Wu, Shangda, et al.
Pubblicazione: (2026)
di: Wu, Shangda, et al.
Pubblicazione: (2026)
From Turn-Taking to Synchronous Dialogue: A Survey of Full-Duplex Spoken Language Models
di: Chen, Yuxuan, et al.
Pubblicazione: (2025)
di: Chen, Yuxuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems
di: Huang, Kexin, et al.
Pubblicazione: (2025) -
CodecBench: A Comprehensive Benchmark for Acoustic and Semantic Evaluation
di: Deng, Ruifan, et al.
Pubblicazione: (2025) -
SpeechGPT-Gen: Scaling Chain-of-Information Speech Generation
di: Zhang, Dong, et al.
Pubblicazione: (2024) -
JoyTTS: LLM-based Spoken Chatbot With Voice Cloning
di: Zhou, Fangru, et al.
Pubblicazione: (2025) -
SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models
di: Zhang, Xin, et al.
Pubblicazione: (2023)