Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yongqi, Zhang, Chunlei, Chen, Hangting, Zhao, Zhou, Yu, Dong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark
por: Zhang, Han, et al.
Publicado: (2025)
por: Zhang, Han, et al.
Publicado: (2025)
StyleSpeech: Parameter-efficient Fine Tuning for Pre-trained Controllable Text-to-Speech
por: Lou, Haowei, et al.
Publicado: (2024)
por: Lou, Haowei, et al.
Publicado: (2024)
StyleSpeaker: Audio-Enhanced Fine-Grained Style Modeling for Speech-Driven 3D Facial Animation
por: Yang, An, et al.
Publicado: (2025)
por: Yang, An, et al.
Publicado: (2025)
SpeechEE: A Novel Benchmark for Speech Event Extraction
por: Wang, Bin, et al.
Publicado: (2024)
por: Wang, Bin, et al.
Publicado: (2024)
VSpeechLM: A Visual Speech Language Model for Visual Text-to-Speech Task
por: Wang, Yuyue, et al.
Publicado: (2025)
por: Wang, Yuyue, et al.
Publicado: (2025)
Differentially Processed Optimized Collaborative Rich Text Editor
por: Jatana, Nishtha, et al.
Publicado: (2024)
por: Jatana, Nishtha, et al.
Publicado: (2024)
UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts
por: Cheng, Zhi-Qi, et al.
Publicado: (2024)
por: Cheng, Zhi-Qi, et al.
Publicado: (2024)
SongBloom: Coherent Song Generation via Interleaved Autoregressive Sketching and Diffusion Refinement
por: Yang, Chenyu, et al.
Publicado: (2025)
por: Yang, Chenyu, et al.
Publicado: (2025)
DAE-Talker: High Fidelity Speech-Driven Talking Face Generation with Diffusion Autoencoder
por: Du, Chenpeng, et al.
Publicado: (2023)
por: Du, Chenpeng, et al.
Publicado: (2023)
VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations
por: Zhao, Baoquan, et al.
Publicado: (2025)
por: Zhao, Baoquan, et al.
Publicado: (2025)
EmotionTalk: An Interactive Chinese Multimodal Emotion Dataset With Rich Annotations
por: Sun, Haoqin, et al.
Publicado: (2025)
por: Sun, Haoqin, et al.
Publicado: (2025)
RFNNS: Robust Fixed Neural Network Steganography with Universal Text-to-Image Models
por: Cheng, Yu, et al.
Publicado: (2025)
por: Cheng, Yu, et al.
Publicado: (2025)
MoTAS: MoE-Guided Feature Selection from TTS-Augmented Speech for Enhanced Multimodal Alzheimer's Early Screening
por: Shao, Yongqi, et al.
Publicado: (2025)
por: Shao, Yongqi, et al.
Publicado: (2025)
Multimodal Fusion via Hypergraph Autoencoder and Contrastive Learning for Emotion Recognition in Conversation
por: Yi, Zijian, et al.
Publicado: (2024)
por: Yi, Zijian, et al.
Publicado: (2024)
COutfitGAN: Learning to Synthesize Compatible Outfits Supervised by Silhouette Masks and Fashion Styles
por: Zhou, Dongliang, et al.
Publicado: (2025)
por: Zhou, Dongliang, et al.
Publicado: (2025)
Demonstration of MaskSearch: Efficiently Querying Image Masks for Machine Learning Workflows
por: Wei, Lindsey Linxi, et al.
Publicado: (2024)
por: Wei, Lindsey Linxi, et al.
Publicado: (2024)
PAME: Self-Supervised Masked Autoencoder for No-Reference Point Cloud Quality Assessment
por: Shan, Ziyu, et al.
Publicado: (2024)
por: Shan, Ziyu, et al.
Publicado: (2024)
MaskSearch: Querying Image Masks at Scale
por: He, Dong, et al.
Publicado: (2023)
por: He, Dong, et al.
Publicado: (2023)
Hierarchical Semantic Correlation-Aware Masked Autoencoder for Unsupervised Audio-Visual Representation Learning
por: Zeng, Donghuo, et al.
Publicado: (2026)
por: Zeng, Donghuo, et al.
Publicado: (2026)
Towards Robust and Controllable Text-to-Motion via Masked Autoregressive Diffusion
por: Zhang, Zongye, et al.
Publicado: (2025)
por: Zhang, Zongye, et al.
Publicado: (2025)
Hyperbolic Multimodal Generative Representation Learning for Generalized Zero-Shot Multimodal Information Extraction
por: Zhou, Baohang, et al.
Publicado: (2026)
por: Zhou, Baohang, et al.
Publicado: (2026)
MU-MAE: Multimodal Masked Autoencoders-Based One-Shot Learning
por: Liu, Rex, et al.
Publicado: (2024)
por: Liu, Rex, et al.
Publicado: (2024)
Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis
por: Chen, Shuang, et al.
Publicado: (2026)
por: Chen, Shuang, et al.
Publicado: (2026)
TCAN: Text-oriented Cross Attention Network for Multimodal Sentiment Analysis
por: Quan, Weize, et al.
Publicado: (2024)
por: Quan, Weize, et al.
Publicado: (2024)
Efficient Speech Watermarking for Speech Synthesis via Progressive Knowledge Distillation
por: Cui, Yang, et al.
Publicado: (2025)
por: Cui, Yang, et al.
Publicado: (2025)
Mean Masked Autoencoder with Flow-Mixing for Encrypted Traffic Classification
por: Liu, Xiao, et al.
Publicado: (2026)
por: Liu, Xiao, et al.
Publicado: (2026)
Prototypical Prompting for Text-to-image Person Re-identification
por: Yan, Shuanglin, et al.
Publicado: (2024)
por: Yan, Shuanglin, et al.
Publicado: (2024)
Temporal-Spatial Decouple before Act: Disentangled Representation Learning for Multimodal Sentiment Analysis
por: Meng, Chunlei, et al.
Publicado: (2026)
por: Meng, Chunlei, et al.
Publicado: (2026)
HybridVC: Efficient Voice Style Conversion with Text and Audio Prompts
por: Niu, Xinlei, et al.
Publicado: (2024)
por: Niu, Xinlei, et al.
Publicado: (2024)
MViR: Multi-View Visual-Semantic Representation for Fake News Detection
por: Liang, Haochen, et al.
Publicado: (2026)
por: Liang, Haochen, et al.
Publicado: (2026)
Evolutionary Multimodal Reasoning via Hierarchical Semantic Representation for Intent Recognition
por: Zhou, Qianrui, et al.
Publicado: (2026)
por: Zhou, Qianrui, et al.
Publicado: (2026)
STCTS: Generative Semantic Compression for Ultra-Low Bitrate Speech via Explicit Text-Prosody-Timbre Decomposition
por: Wang, Siyu, et al.
Publicado: (2025)
por: Wang, Siyu, et al.
Publicado: (2025)
StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation
por: Wu, Yi, et al.
Publicado: (2025)
por: Wu, Yi, et al.
Publicado: (2025)
SonicGauss: Position-Aware Physical Sound Synthesis for 3D Gaussian Representations
por: Wang, Chunshi, et al.
Publicado: (2025)
por: Wang, Chunshi, et al.
Publicado: (2025)
SyncLipMAE: Contrastive Masked Pretraining for Audio-Visual Talking-Face Representation
por: Ling, Zeyu, et al.
Publicado: (2025)
por: Ling, Zeyu, et al.
Publicado: (2025)
MMoFusion: Multi-modal Co-Speech Motion Generation with Diffusion Model
por: Wang, Sen, et al.
Publicado: (2024)
por: Wang, Sen, et al.
Publicado: (2024)
Probing Commonsense Reasoning Capability of Text-to-Image Generative Models via Non-visual Description
por: Pan, Mianzhi, et al.
Publicado: (2023)
por: Pan, Mianzhi, et al.
Publicado: (2023)
MSRS: Training Multimodal Speech Recognition Models from Scratch with Sparse Mask Optimization
por: Fernandez-Lopez, Adriana, et al.
Publicado: (2024)
por: Fernandez-Lopez, Adriana, et al.
Publicado: (2024)
SpeechCraft: A Fine-grained Expressive Speech Dataset with Natural Language Description
por: Jin, Zeyu, et al.
Publicado: (2024)
por: Jin, Zeyu, et al.
Publicado: (2024)
Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance
por: Zhang, Beiyuan, et al.
Publicado: (2024)
por: Zhang, Beiyuan, et al.
Publicado: (2024)
Ejemplares similares
-
Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark
por: Zhang, Han, et al.
Publicado: (2025) -
StyleSpeech: Parameter-efficient Fine Tuning for Pre-trained Controllable Text-to-Speech
por: Lou, Haowei, et al.
Publicado: (2024) -
StyleSpeaker: Audio-Enhanced Fine-Grained Style Modeling for Speech-Driven 3D Facial Animation
por: Yang, An, et al.
Publicado: (2025) -
SpeechEE: A Novel Benchmark for Speech Event Extraction
por: Wang, Bin, et al.
Publicado: (2024) -
VSpeechLM: A Visual Speech Language Model for Visual Text-to-Speech Task
por: Wang, Yuyue, et al.
Publicado: (2025)