NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ni, Qinke, Liao, Huan, Chen, Dekun, Wang, Yuxiang, Wu, Zhizheng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models
par: Wang, Yuxiang, et autres
Publié: (2026)
par: Wang, Yuxiang, et autres
Publié: (2026)
MNV-17: A High-Quality Performative Mandarin Dataset for Nonverbal Vocalization Recognition in Speech
par: Mai, Jialong, et autres
Publié: (2025)
par: Mai, Jialong, et autres
Publié: (2025)
DiffCSS: Diverse and Expressive Conversational Speech Synthesis with Diffusion Models
par: wu, Weihao, et autres
Publié: (2025)
par: wu, Weihao, et autres
Publié: (2025)
VoxSafeBench: Not Just What Is Said, but Who, How, and Where
par: Wang, Yuxiang, et autres
Publié: (2026)
par: Wang, Yuxiang, et autres
Publié: (2026)
Metis: A Foundation Speech Generation Model with Masked Generative Pre-training
par: Wang, Yuancheng, et autres
Publié: (2025)
par: Wang, Yuancheng, et autres
Publié: (2025)
MultiVerse: Efficient and Expressive Zero-Shot Multi-Task Text-to-Speech
par: Bak, Taejun, et autres
Publié: (2024)
par: Bak, Taejun, et autres
Publié: (2024)
Learning Physiology-Informed Vocal Spectrotemporal Representations for Speech Emotion Recognition
par: Zhang, Xu, et autres
Publié: (2026)
par: Zhang, Xu, et autres
Publié: (2026)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
par: Wang, Yuancheng, et autres
Publié: (2025)
par: Wang, Yuancheng, et autres
Publié: (2025)
FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles
par: Zhang, Tian-Hao, et autres
Publié: (2025)
par: Zhang, Tian-Hao, et autres
Publié: (2025)
Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
par: Kim, Nam-Gyu, et autres
Publié: (2025)
par: Kim, Nam-Gyu, et autres
Publié: (2025)
Expressive Range Characterization of Open Text-to-Audio Models
par: Morse, Jonathan, et autres
Publié: (2025)
par: Morse, Jonathan, et autres
Publié: (2025)
Shallow Flow Matching for Coarse-to-Fine Text-to-Speech Synthesis
par: Yang, Dong, et autres
Publié: (2025)
par: Yang, Dong, et autres
Publié: (2025)
MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer
par: Wang, Yuancheng, et autres
Publié: (2024)
par: Wang, Yuancheng, et autres
Publié: (2024)
Prompt-Unseen-Emotion: Zero-shot Expressive Speech Synthesis with Prompt-LLM Contextual Knowledge for Mixed Emotions
par: Gao, Xiaoxue, et autres
Publié: (2025)
par: Gao, Xiaoxue, et autres
Publié: (2025)
Neural Speech Embeddings for Speech Synthesis Based on Deep Generative Networks
par: Lee, Seo-Hyun, et autres
Publié: (2023)
par: Lee, Seo-Hyun, et autres
Publié: (2023)
Expressive Music Data Processing and Generation
par: Liu, Jingwei
Publié: (2025)
par: Liu, Jingwei
Publié: (2025)
WoW-Bench: Evaluating Fine-Grained Acoustic Perception in Audio-Language Models via Marine Mammal Vocalizations
par: Kim, Jaeyeon, et autres
Publié: (2025)
par: Kim, Jaeyeon, et autres
Publié: (2025)
Lina-Speech: Gated Linear Attention and Initial-State Tuning for Multi-Sample Prompting Text-To-Speech Synthesis
par: Lemerle, Théodor, et autres
Publié: (2024)
par: Lemerle, Théodor, et autres
Publié: (2024)
Coding Speech through Vocal Tract Kinematics
par: Cho, Cheol Jun, et autres
Publié: (2024)
par: Cho, Cheol Jun, et autres
Publié: (2024)
Multi-Metric Preference Alignment for Generative Speech Restoration
par: Zhang, Junan, et autres
Publié: (2025)
par: Zhang, Junan, et autres
Publié: (2025)
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
par: Zhou, Xuehao, et autres
Publié: (2024)
par: Zhou, Xuehao, et autres
Publié: (2024)
Expressive MIDI-format Piano Performance Generation
par: Liu, Jingwei
Publié: (2024)
par: Liu, Jingwei
Publié: (2024)
Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding
par: Lin, Zijian, et autres
Publié: (2025)
par: Lin, Zijian, et autres
Publié: (2025)
Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting
par: Han, Wooseok, et autres
Publié: (2024)
par: Han, Wooseok, et autres
Publié: (2024)
SeamlessExpressiveLM: Speech Language Model for Expressive Speech-to-Speech Translation with Chain-of-Thought
par: Gong, Hongyu, et autres
Publié: (2024)
par: Gong, Hongyu, et autres
Publié: (2024)
VocalAgent: Large Language Models for Vocal Health Diagnostics with Safety-Aware Evaluation
par: Kim, Yubin, et autres
Publié: (2025)
par: Kim, Yubin, et autres
Publié: (2025)
Speech-DRAME: A Framework for Human-Aligned Benchmarks in Speech Role-Play
par: Shi, Jiatong, et autres
Publié: (2025)
par: Shi, Jiatong, et autres
Publié: (2025)
SongBench: A Fine-Grained Multi-Aspect Benchmark for Song Quality Assessment
par: Wu, Dapeng, et autres
Publié: (2026)
par: Wu, Dapeng, et autres
Publié: (2026)
VocalNet: Speech LLM with Multi-Token Prediction for Faster and High-Quality Generation
par: Wang, Yuhao, et autres
Publié: (2025)
par: Wang, Yuhao, et autres
Publié: (2025)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
par: Chen, Weidong, et autres
Publié: (2025)
par: Chen, Weidong, et autres
Publié: (2025)
FoleyBench: A Benchmark For Video-to-Audio Models
par: Dixit, Satvik, et autres
Publié: (2025)
par: Dixit, Satvik, et autres
Publié: (2025)
Overview of the Amphion Toolkit (v0.2)
par: Li, Jiaqi, et autres
Publié: (2025)
par: Li, Jiaqi, et autres
Publié: (2025)
CapSpeech: Enabling Downstream Applications in Style-Captioned Text-to-Speech
par: Wang, Helin, et autres
Publié: (2025)
par: Wang, Helin, et autres
Publié: (2025)
DASB - Discrete Audio and Speech Benchmark
par: Mousavi, Pooneh, et autres
Publié: (2024)
par: Mousavi, Pooneh, et autres
Publié: (2024)
Serialized Speech Information Guidance with Overlapped Encoding Separation for Multi-Speaker Automatic Speech Recognition
par: Shi, Hao, et autres
Publié: (2024)
par: Shi, Hao, et autres
Publié: (2024)
LLMs-Integrated Automatic Hate Speech Recognition Using Controllable Text Generation Models
par: Oshima, Ryutaro, et autres
Publié: (2026)
par: Oshima, Ryutaro, et autres
Publié: (2026)
MIDI-VALLE: Improving Expressive Piano Performance Synthesis Through Neural Codec Language Modelling
par: Tang, Jingjing, et autres
Publié: (2025)
par: Tang, Jingjing, et autres
Publié: (2025)
AImoclips: A Benchmark for Evaluating Emotion Conveyance in Text-to-Music Generation
par: Go, Gyehun, et autres
Publié: (2025)
par: Go, Gyehun, et autres
Publié: (2025)
Bridging ASR and LLMs for Dysarthric Speech Recognition: Benchmarking Self-Supervised and Generative Approaches
par: Aboeitta, Ahmed, et autres
Publié: (2025)
par: Aboeitta, Ahmed, et autres
Publié: (2025)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
par: Wang, Xinsheng, et autres
Publié: (2025)
par: Wang, Xinsheng, et autres
Publié: (2025)
Documents similaires
-
VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models
par: Wang, Yuxiang, et autres
Publié: (2026) -
MNV-17: A High-Quality Performative Mandarin Dataset for Nonverbal Vocalization Recognition in Speech
par: Mai, Jialong, et autres
Publié: (2025) -
DiffCSS: Diverse and Expressive Conversational Speech Synthesis with Diffusion Models
par: wu, Weihao, et autres
Publié: (2025) -
VoxSafeBench: Not Just What Is Said, but Who, How, and Where
par: Wang, Yuxiang, et autres
Publié: (2026) -
Metis: A Foundation Speech Generation Model with Masked Generative Pre-training
par: Wang, Yuancheng, et autres
Publié: (2025)