Generative Semantic Communication for Text-to-Speech Synthesis
Fuente:
arXiv
Guardado en:
| Autores principales: | Zheng, Jiahao, Ren, Jinke, Xu, Peng, Yuan, Zhihao, Xu, Jie, Wang, Fangxin, Gui, Gui, Cui, Shuguang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Parallel GPT: Harmonizing the Independence and Interdependence of Acoustic and Semantic Information for Zero-Shot Text-to-Speech
por: Xing, Jingyuan, et al.
Publicado: (2025)
por: Xing, Jingyuan, et al.
Publicado: (2025)
Semantic MIMO Systems for Speech-to-Text Transmission
por: Weng, Zhenzi, et al.
Publicado: (2024)
por: Weng, Zhenzi, et al.
Publicado: (2024)
SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis
por: Guo, Haohan, et al.
Publicado: (2024)
por: Guo, Haohan, et al.
Publicado: (2024)
TraceableSpeech: Towards Proactively Traceable Text-to-Speech with Watermarking
por: Zhou, Junzuo, et al.
Publicado: (2024)
por: Zhou, Junzuo, et al.
Publicado: (2024)
FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications
por: Guo, Hao-Han, et al.
Publicado: (2024)
por: Guo, Hao-Han, et al.
Publicado: (2024)
DAIEN-TTS: Disentangled Audio Infilling for Environment-Aware Text-to-Speech Synthesis
por: Lu, Ye-Xin, et al.
Publicado: (2025)
por: Lu, Ye-Xin, et al.
Publicado: (2025)
OV-InstructTTS: Towards Open-Vocabulary Instruct Text-to-Speech
por: Ren, Yong, et al.
Publicado: (2026)
por: Ren, Yong, et al.
Publicado: (2026)
Schrodinger Bridges Beat Diffusion Models on Text-to-Speech Synthesis
por: Chen, Zehua, et al.
Publicado: (2023)
por: Chen, Zehua, et al.
Publicado: (2023)
Hierarchical Emotion Prediction and Control in Text-to-Speech Synthesis
por: Inoue, Sho, et al.
Publicado: (2024)
por: Inoue, Sho, et al.
Publicado: (2024)
ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer
por: Liu, Huadai, et al.
Publicado: (2023)
por: Liu, Huadai, et al.
Publicado: (2023)
Training Data Augmentation for Dysarthric Automatic Speech Recognition by Text-to-Dysarthric-Speech Synthesis
por: Leung, Wing-Zin, et al.
Publicado: (2024)
por: Leung, Wing-Zin, et al.
Publicado: (2024)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
por: Liao, Shijia, et al.
Publicado: (2024)
por: Liao, Shijia, et al.
Publicado: (2024)
Semantic Communications for Speech Recognition
por: Weng, Zhenzi, et al.
Publicado: (2021)
por: Weng, Zhenzi, et al.
Publicado: (2021)
Active Learning for Text-to-Speech Synthesis with Informative Sample Collection
por: Seki, Kentaro, et al.
Publicado: (2025)
por: Seki, Kentaro, et al.
Publicado: (2025)
Communication-Efficient Personalized Federated Learning for Speech-to-Text Tasks
por: Du, Yichao, et al.
Publicado: (2024)
por: Du, Yichao, et al.
Publicado: (2024)
Parallel Synthesis for Autoregressive Speech Generation
por: Hsu, Po-chun, et al.
Publicado: (2022)
por: Hsu, Po-chun, et al.
Publicado: (2022)
Comprehend and Talk: Text to Speech Synthesis via Dual Language Modeling
por: Cao, Junjie, et al.
Publicado: (2025)
por: Cao, Junjie, et al.
Publicado: (2025)
Enabling Beam Search for Language Model-Based Text-to-Speech Synthesis
por: Tu, Zehai, et al.
Publicado: (2024)
por: Tu, Zehai, et al.
Publicado: (2024)
SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis
por: Wang, Helin, et al.
Publicado: (2024)
por: Wang, Helin, et al.
Publicado: (2024)
Evaluating Text-to-Speech Synthesis from a Large Discrete Token-based Speech Language Model
por: Wang, Siyang, et al.
Publicado: (2024)
por: Wang, Siyang, et al.
Publicado: (2024)
Retrieval Augmented Generation in Prompt-based Text-to-Speech Synthesis with Context-Aware Contrastive Language-Audio Pretraining
por: Xue, Jinlong, et al.
Publicado: (2024)
por: Xue, Jinlong, et al.
Publicado: (2024)
Empowering Communication: Speech Technology for Indian and Western Accents through AI-powered Speech Synthesis
por: R, Vinotha, et al.
Publicado: (2024)
por: R, Vinotha, et al.
Publicado: (2024)
Distinguishing Neural Speech Synthesis Models Through Fingerprints in Speech Waveforms
por: Zhang, Chu Yuan, et al.
Publicado: (2023)
por: Zhang, Chu Yuan, et al.
Publicado: (2023)
Long-Context Speech Synthesis with Context-Aware Memory
por: Li, Zhipeng, et al.
Publicado: (2025)
por: Li, Zhipeng, et al.
Publicado: (2025)
DUET: Unified Dual-Space Emotion Control for Diffusion and Flow-Matching Driven Text-to-Speech
por: Zhang, Xu, et al.
Publicado: (2026)
por: Zhang, Xu, et al.
Publicado: (2026)
Central Kurdish Text-to-Speech Synthesis with Novel End-to-End Transformer Training
por: Ahmad, Hawraz A., et al.
Publicado: (2024)
por: Ahmad, Hawraz A., et al.
Publicado: (2024)
Word-Level Emotional Expression Control in Zero-Shot Text-to-Speech Synthesis
por: Wang, Tianrui, et al.
Publicado: (2025)
por: Wang, Tianrui, et al.
Publicado: (2025)
Multi-Step Prediction and Control of Hierarchical Emotion Distribution in Text-to-Speech Synthesis
por: Inoue, Sho, et al.
Publicado: (2025)
por: Inoue, Sho, et al.
Publicado: (2025)
FusID: Modality-Fused Semantic IDs for Generative Music Recommendation
por: Kim, Haven, et al.
Publicado: (2026)
por: Kim, Haven, et al.
Publicado: (2026)
A Multilingual Framework for Dysarthria: Detection, Severity Classification, Speech-to-Text, and Clean Speech Generation
por: Raghu, Ananya, et al.
Publicado: (2025)
por: Raghu, Ananya, et al.
Publicado: (2025)
VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature
por: Du, Chenpeng, et al.
Publicado: (2022)
por: Du, Chenpeng, et al.
Publicado: (2022)
FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis
por: Guo, Yinlin, et al.
Publicado: (2024)
por: Guo, Yinlin, et al.
Publicado: (2024)
MacST: Multi-Accent Speech Synthesis via Text Transliteration for Accent Conversion
por: Inoue, Sho, et al.
Publicado: (2024)
por: Inoue, Sho, et al.
Publicado: (2024)
DiffATR: Diffusion-based Generative Modeling for Audio-Text Retrieval
por: Xin, Yifei, et al.
Publicado: (2024)
por: Xin, Yifei, et al.
Publicado: (2024)
Geometry-Constrained EEG Channel Selection for Brain-Assisted Speech Enhancement
por: Zuo, Keying, et al.
Publicado: (2024)
por: Zuo, Keying, et al.
Publicado: (2024)
A Multi-Stage Framework for Multimodal Controllable Speech Synthesis
por: Niu, Rui, et al.
Publicado: (2025)
por: Niu, Rui, et al.
Publicado: (2025)
Semantic Proximity Alignment: Towards Human Perception-consistent Audio Tagging by Aligning with Label Text Description
por: Liu, Wuyang, et al.
Publicado: (2023)
por: Liu, Wuyang, et al.
Publicado: (2023)
Chain-Talker: Chain Understanding and Rendering for Empathetic Conversational Speech Synthesis
por: Hu, Yifan, et al.
Publicado: (2025)
por: Hu, Yifan, et al.
Publicado: (2025)
MM-TTS: Multi-modal Prompt based Style Transfer for Expressive Text-to-Speech Synthesis
por: Guan, Wenhao, et al.
Publicado: (2023)
por: Guan, Wenhao, et al.
Publicado: (2023)
Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis
por: Zhou, Xuehao, et al.
Publicado: (2024)
por: Zhou, Xuehao, et al.
Publicado: (2024)
Ejemplares similares
-
Parallel GPT: Harmonizing the Independence and Interdependence of Acoustic and Semantic Information for Zero-Shot Text-to-Speech
por: Xing, Jingyuan, et al.
Publicado: (2025) -
Semantic MIMO Systems for Speech-to-Text Transmission
por: Weng, Zhenzi, et al.
Publicado: (2024) -
SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis
por: Guo, Haohan, et al.
Publicado: (2024) -
TraceableSpeech: Towards Proactively Traceable Text-to-Speech with Watermarking
por: Zhou, Junzuo, et al.
Publicado: (2024) -
FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications
por: Guo, Hao-Han, et al.
Publicado: (2024)