Text-aware and Context-aware Expressive Audiobook Speech Synthesis
Fuente:
arXiv
Guardado en:
| Autores principales: | Guo, Dake, Zhu, Xinfa, Xue, Liumeng, Zhang, Yongmao, Tian, Wenjie, Xie, Lei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech
por: Ma, Linhan, et al.
Publicado: (2025)
por: Ma, Linhan, et al.
Publicado: (2025)
Llasa+: Free Lunch for Accelerated and Streaming Llama-Based Speech Synthesis
por: Tian, Wenjie, et al.
Publicado: (2025)
por: Tian, Wenjie, et al.
Publicado: (2025)
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
por: Zhu, Xinfa, et al.
Publicado: (2023)
por: Zhu, Xinfa, et al.
Publicado: (2023)
Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation
por: Li, Hanzhao, et al.
Publicado: (2024)
por: Li, Hanzhao, et al.
Publicado: (2024)
SponTTS: modeling and transferring spontaneous style for TTS
por: Li, Hanzhao, et al.
Publicado: (2023)
por: Li, Hanzhao, et al.
Publicado: (2023)
DialoSpeech: Dual-Speaker Dialogue Generation with LLM and Flow Matching
por: Xie, Hanke, et al.
Publicado: (2025)
por: Xie, Hanke, et al.
Publicado: (2025)
WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark
por: Ma, Linhan, et al.
Publicado: (2024)
por: Ma, Linhan, et al.
Publicado: (2024)
MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech
por: Xia, Kangxiang, et al.
Publicado: (2025)
por: Xia, Kangxiang, et al.
Publicado: (2025)
KALL-E:Autoregressive Speech Synthesis with Next-Distribution Prediction
por: Xia, Kangxiang, et al.
Publicado: (2024)
por: Xia, Kangxiang, et al.
Publicado: (2024)
Accent-VITS:accent transfer for end-to-end TTS
por: Ma, Linhan, et al.
Publicado: (2023)
por: Ma, Linhan, et al.
Publicado: (2023)
MINT-Bench: A Comprehensive Multilingual Benchmark for Instruction-Following Text-to-Speech
por: Chen, Huakang, et al.
Publicado: (2026)
por: Chen, Huakang, et al.
Publicado: (2026)
Audiobook-CC: Controllable Long-context Speech Generation for Multicast Audiobook
por: Liu, Min, et al.
Publicado: (2025)
por: Liu, Min, et al.
Publicado: (2025)
SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis
por: Guo, Haohan, et al.
Publicado: (2024)
por: Guo, Haohan, et al.
Publicado: (2024)
Text-aware Speech Separation for Multi-talker Keyword Spotting
por: Li, Haoyu, et al.
Publicado: (2024)
por: Li, Haoyu, et al.
Publicado: (2024)
DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis
por: Tian, Wenjie, et al.
Publicado: (2025)
por: Tian, Wenjie, et al.
Publicado: (2025)
U-SAM: An audio language Model for Unified Speech, Audio, and Music Understanding
por: Wang, Ziqian, et al.
Publicado: (2025)
por: Wang, Ziqian, et al.
Publicado: (2025)
CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions
por: Zhu, Xinfa, et al.
Publicado: (2025)
por: Zhu, Xinfa, et al.
Publicado: (2025)
Steering Language Model to Stable Speech Emotion Recognition via Contextual Perception and Chain of Thought
por: Zhao, Zhixian, et al.
Publicado: (2025)
por: Zhao, Zhixian, et al.
Publicado: (2025)
Evaluating the Expressive Appropriateness of Speech in Rich Contexts
por: Wang, Tianrui, et al.
Publicado: (2026)
por: Wang, Tianrui, et al.
Publicado: (2026)
Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling
por: Jiang, Yuepeng, et al.
Publicado: (2024)
por: Jiang, Yuepeng, et al.
Publicado: (2024)
SELM: Speech Enhancement Using Discrete Tokens and Language Models
por: Wang, Ziqian, et al.
Publicado: (2023)
por: Wang, Ziqian, et al.
Publicado: (2023)
StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding
por: Guo, Dake, et al.
Publicado: (2025)
por: Guo, Dake, et al.
Publicado: (2025)
PodEval: A Multimodal Evaluation Framework for Podcast Audio Generation
por: Xiao, Yujia, et al.
Publicado: (2025)
por: Xiao, Yujia, et al.
Publicado: (2025)
DurIAN-E 2: Duration Informed Attention Network with Adaptive Variational Autoencoder and Adversarial Learning for Expressive Text-to-Speech Synthesis
por: Gu, Yu, et al.
Publicado: (2024)
por: Gu, Yu, et al.
Publicado: (2024)
Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens
por: Wang, Xinsheng, et al.
Publicado: (2025)
por: Wang, Xinsheng, et al.
Publicado: (2025)
SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue
por: Li, Ruiqi, et al.
Publicado: (2026)
por: Li, Ruiqi, et al.
Publicado: (2026)
StoryTTS: A Highly Expressive Text-to-Speech Dataset with Rich Textual Expressiveness Annotations
por: Liu, Sen, et al.
Publicado: (2024)
por: Liu, Sen, et al.
Publicado: (2024)
ContextASR-Bench: A Massive Contextual Speech Recognition Benchmark
por: Wang, He, et al.
Publicado: (2025)
por: Wang, He, et al.
Publicado: (2025)
The NPU-HWC System for the ISCSLP 2024 Inspirational and Convincing Audio Generation Challenge
por: Guo, Dake, et al.
Publicado: (2024)
por: Guo, Dake, et al.
Publicado: (2024)
Multi-level Temporal-channel Speaker Retrieval for Zero-shot Voice Conversion
por: Wang, Zhichao, et al.
Publicado: (2023)
por: Wang, Zhichao, et al.
Publicado: (2023)
FlowSE: Efficient and High-Quality Speech Enhancement via Flow Matching
por: Wang, Ziqian, et al.
Publicado: (2025)
por: Wang, Ziqian, et al.
Publicado: (2025)
Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning
por: Tian, Wenjie, et al.
Publicado: (2026)
por: Tian, Wenjie, et al.
Publicado: (2026)
Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis
por: Yang, Yifan, et al.
Publicado: (2024)
por: Yang, Yifan, et al.
Publicado: (2024)
MM-TTS: Multi-modal Prompt based Style Transfer for Expressive Text-to-Speech Synthesis
por: Guan, Wenhao, et al.
Publicado: (2023)
por: Guan, Wenhao, et al.
Publicado: (2023)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
por: Yang, Qian, et al.
Publicado: (2024)
por: Yang, Qian, et al.
Publicado: (2024)
Debatts: Zero-Shot Debating Text-to-Speech Synthesis
por: Huang, Yiqiao, et al.
Publicado: (2024)
por: Huang, Yiqiao, et al.
Publicado: (2024)
Peransformer: Improving Low-informed Expressive Performance Rendering with Score-aware Discriminator
por: He, Xian, et al.
Publicado: (2025)
por: He, Xian, et al.
Publicado: (2025)
TaDiCodec: Text-aware Diffusion Speech Tokenizer for Speech Language Modeling
por: Wang, Yuancheng, et al.
Publicado: (2025)
por: Wang, Yuancheng, et al.
Publicado: (2025)
MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder
por: Zhang, Bowen, et al.
Publicado: (2025)
por: Zhang, Bowen, et al.
Publicado: (2025)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
por: Chen, Weidong, et al.
Publicado: (2025)
por: Chen, Weidong, et al.
Publicado: (2025)
Ejemplares similares
-
FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech
por: Ma, Linhan, et al.
Publicado: (2025) -
Llasa+: Free Lunch for Accelerated and Streaming Llama-Based Speech Synthesis
por: Tian, Wenjie, et al.
Publicado: (2025) -
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
por: Zhu, Xinfa, et al.
Publicado: (2023) -
Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation
por: Li, Hanzhao, et al.
Publicado: (2024) -
SponTTS: modeling and transferring spontaneous style for TTS
por: Li, Hanzhao, et al.
Publicado: (2023)