MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Qian, Zuo, Jialong, Su, Zhe, Jiang, Ziyue, Li, Mingze, Zhao, Zhou, Chen, Feiyang, Wang, Zhefeng, Huai, Baoxing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models
por: Ji, Shengpeng, et al.
Publicado: (2023)
por: Ji, Shengpeng, et al.
Publicado: (2023)
MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech
por: Ji, Shengpeng, et al.
Publicado: (2024)
por: Ji, Shengpeng, et al.
Publicado: (2024)
Language-Codec: Bridging Discrete Codec Representations and Speech Language Models
por: Ji, Shengpeng, et al.
Publicado: (2024)
por: Ji, Shengpeng, et al.
Publicado: (2024)
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
por: Zhu, Xinfa, et al.
Publicado: (2023)
por: Zhu, Xinfa, et al.
Publicado: (2023)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
por: Chen, Weidong, et al.
Publicado: (2025)
por: Chen, Weidong, et al.
Publicado: (2025)
Speech Watermarking with Discrete Intermediate Representations
por: Ji, Shengpeng, et al.
Publicado: (2024)
por: Ji, Shengpeng, et al.
Publicado: (2024)
Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling
por: Jiang, Yuepeng, et al.
Publicado: (2024)
por: Jiang, Yuepeng, et al.
Publicado: (2024)
Generative Expressive Conversational Speech Synthesis
por: Liu, Rui, et al.
Publicado: (2024)
por: Liu, Rui, et al.
Publicado: (2024)
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
por: Zuo, Jialong, et al.
Publicado: (2025)
por: Zuo, Jialong, et al.
Publicado: (2025)
Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis
por: Jiang, Ziyue, et al.
Publicado: (2023)
por: Jiang, Ziyue, et al.
Publicado: (2023)
Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation
por: Deng, Yimin, et al.
Publicado: (2024)
por: Deng, Yimin, et al.
Publicado: (2024)
MM-TTS: Multi-modal Prompt based Style Transfer for Expressive Text-to-Speech Synthesis
por: Guan, Wenhao, et al.
Publicado: (2023)
por: Guan, Wenhao, et al.
Publicado: (2023)
ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control
por: Ji, Shengpeng, et al.
Publicado: (2024)
por: Ji, Shengpeng, et al.
Publicado: (2024)
Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model
por: Zuo, Jialong, et al.
Publicado: (2025)
por: Zuo, Jialong, et al.
Publicado: (2025)
MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis
por: Jiang, Ziyue, et al.
Publicado: (2025)
por: Jiang, Ziyue, et al.
Publicado: (2025)
SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods
por: Huang, Wen, et al.
Publicado: (2025)
por: Huang, Wen, et al.
Publicado: (2025)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
por: Liao, Shijia, et al.
Publicado: (2024)
por: Liao, Shijia, et al.
Publicado: (2024)
DiffCSS: Diverse and Expressive Conversational Speech Synthesis with Diffusion Models
por: wu, Weihao, et al.
Publicado: (2025)
por: wu, Weihao, et al.
Publicado: (2025)
Distinguishing Neural Speech Synthesis Models Through Fingerprints in Speech Waveforms
por: Zhang, Chu Yuan, et al.
Publicado: (2023)
por: Zhang, Chu Yuan, et al.
Publicado: (2023)
ShiftySpeech: A Large-Scale Synthetic Speech Dataset with Distribution Shifts
por: Garg, Ashi, et al.
Publicado: (2025)
por: Garg, Ashi, et al.
Publicado: (2025)
Hierarchical Decoding for Discrete Speech Synthesis with Multi-Resolution Spoof Detection
por: Zhao, Junchuan, et al.
Publicado: (2026)
por: Zhao, Junchuan, et al.
Publicado: (2026)
VoxInstruct: Expressive Human Instruction-to-Speech Generation with Unified Multilingual Codec Language Modelling
por: Zhou, Yixuan, et al.
Publicado: (2024)
por: Zhou, Yixuan, et al.
Publicado: (2024)
DurIAN-E 2: Duration Informed Attention Network with Adaptive Variational Autoencoder and Adversarial Learning for Expressive Text-to-Speech Synthesis
por: Gu, Yu, et al.
Publicado: (2024)
por: Gu, Yu, et al.
Publicado: (2024)
Efficient Speech Watermarking for Speech Synthesis via Progressive Knowledge Distillation
por: Cui, Yang, et al.
Publicado: (2025)
por: Cui, Yang, et al.
Publicado: (2025)
SeamlessExpressiveLM: Speech Language Model for Expressive Speech-to-Speech Translation with Chain-of-Thought
por: Gong, Hongyu, et al.
Publicado: (2024)
por: Gong, Hongyu, et al.
Publicado: (2024)
AISHELL-5: The First Open-Source In-Car Multi-Channel Multi-Speaker Speech Dataset for Automatic Speech Diarization and Recognition
por: Dai, Yuhang, et al.
Publicado: (2025)
por: Dai, Yuhang, et al.
Publicado: (2025)
Hierarchical Control of Emotion Rendering in Speech Synthesis
por: Inoue, Sho, et al.
Publicado: (2024)
por: Inoue, Sho, et al.
Publicado: (2024)
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
por: Zhou, Xuehao, et al.
Publicado: (2024)
por: Zhou, Xuehao, et al.
Publicado: (2024)
StoryTTS: A Highly Expressive Text-to-Speech Dataset with Rich Textual Expressiveness Annotations
por: Liu, Sen, et al.
Publicado: (2024)
por: Liu, Sen, et al.
Publicado: (2024)
MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder
por: Zhang, Bowen, et al.
Publicado: (2025)
por: Zhang, Bowen, et al.
Publicado: (2025)
ToneUnit: A Speech Discretization Approach for Tonal Language Speech Synthesis
por: Tao, Dehua, et al.
Publicado: (2024)
por: Tao, Dehua, et al.
Publicado: (2024)
SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
A Neural Speech Codec for Noise Robust Speech Coding
por: Huang, Jiayi, et al.
Publicado: (2023)
por: Huang, Jiayi, et al.
Publicado: (2023)
Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation
por: Li, Jiaqi, et al.
Publicado: (2024)
por: Li, Jiaqi, et al.
Publicado: (2024)
Scale This, Not That: Investigating Key Dataset Attributes for Efficient Speech Enhancement Scaling
por: Zhang, Leying, et al.
Publicado: (2024)
por: Zhang, Leying, et al.
Publicado: (2024)
Multi-Step Prediction and Control of Hierarchical Emotion Distribution in Text-to-Speech Synthesis
por: Inoue, Sho, et al.
Publicado: (2025)
por: Inoue, Sho, et al.
Publicado: (2025)
S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation
por: Pan, Yu, et al.
Publicado: (2025)
por: Pan, Yu, et al.
Publicado: (2025)
FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles
por: Zhang, Tian-Hao, et al.
Publicado: (2025)
por: Zhang, Tian-Hao, et al.
Publicado: (2025)
Confidence-based Filtering for Speech Dataset Curation with Generative Speech Enhancement Using Discrete Tokens
por: Yamauchi, Kazuki, et al.
Publicado: (2026)
por: Yamauchi, Kazuki, et al.
Publicado: (2026)
Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis
por: Leung, Wing-Zin, et al.
Publicado: (2024)
por: Leung, Wing-Zin, et al.
Publicado: (2024)
Ejemplares similares
-
TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models
por: Ji, Shengpeng, et al.
Publicado: (2023) -
MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech
por: Ji, Shengpeng, et al.
Publicado: (2024) -
Language-Codec: Bridging Discrete Codec Representations and Speech Language Models
por: Ji, Shengpeng, et al.
Publicado: (2024) -
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
por: Zhu, Xinfa, et al.
Publicado: (2023) -
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
por: Chen, Weidong, et al.
Publicado: (2025)