FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Tian-Hao, Zhang, Jiawei, Wang, Jun, Qian, Xinyuan, Yin, Xu-Cheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
I2TTS: Image-indicated Immersive Text-to-speech Synthesis with Spatial Perception
par: Zhang, Jiawei, et autres
Publié: (2024)
par: Zhang, Jiawei, et autres
Publié: (2024)
Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation
par: Deng, Yimin, et autres
Publié: (2024)
par: Deng, Yimin, et autres
Publié: (2024)
Expressive Speech Retrieval using Natural Language Descriptions of Speaking Style
par: Kang, Wonjune, et autres
Publié: (2025)
par: Kang, Wonjune, et autres
Publié: (2025)
MM-TTS: Multi-modal Prompt based Style Transfer for Expressive Text-to-Speech Synthesis
par: Guan, Wenhao, et autres
Publié: (2023)
par: Guan, Wenhao, et autres
Publié: (2023)
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
par: Yang, Qian, et autres
Publié: (2024)
par: Yang, Qian, et autres
Publié: (2024)
RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval
par: Sun, Haoqin, et autres
Publié: (2025)
par: Sun, Haoqin, et autres
Publié: (2025)
StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style Diffusion
par: Li, Yinghao Aaron, et autres
Publié: (2024)
par: Li, Yinghao Aaron, et autres
Publié: (2024)
ParaStyleTTS: Toward Efficient and Robust Paralinguistic Style Control for Expressive Text-to-Speech Generation
par: Lou, Haowei, et autres
Publié: (2025)
par: Lou, Haowei, et autres
Publié: (2025)
JIS: A Speech Corpus of Japanese Idol Speakers with Various Speaking Styles
par: Kondo, Yuto, et autres
Publié: (2025)
par: Kondo, Yuto, et autres
Publié: (2025)
Voice Quality Dimensions as Interpretable Primitives for Speaking Style for Atypical Speech and Affect
par: Narain, Jaya, et autres
Publié: (2025)
par: Narain, Jaya, et autres
Publié: (2025)
Generative Expressive Conversational Speech Synthesis
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions
par: Chen, Weidong, et autres
Publié: (2025)
par: Chen, Weidong, et autres
Publié: (2025)
Style Mixture of Experts for Expressive Text-To-Speech Synthesis
par: Jawaid, Ahad, et autres
Publié: (2024)
par: Jawaid, Ahad, et autres
Publié: (2024)
Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling
par: Jiang, Yuepeng, et autres
Publié: (2024)
par: Jiang, Yuepeng, et autres
Publié: (2024)
FLY-TTS: Fast, Lightweight and High-Quality End-to-End Text-to-Speech Synthesis
par: Guo, Yinlin, et autres
Publié: (2024)
par: Guo, Yinlin, et autres
Publié: (2024)
Boosting Multi-Speaker Expressive Speech Synthesis with Semi-supervised Contrastive Learning
par: Zhu, Xinfa, et autres
Publié: (2023)
par: Zhu, Xinfa, et autres
Publié: (2023)
Joint Multi-scale Cross-lingual Speaking Style Transfer with Bidirectional Attention Mechanism for Automatic Dubbing
par: Li, Jingbei, et autres
Publié: (2023)
par: Li, Jingbei, et autres
Publié: (2023)
Breaking Through the Spike: Spike Window Decoding for Accelerated and Precise Automatic Speech Recognition
par: Zhang, Wei, et autres
Publié: (2025)
par: Zhang, Wei, et autres
Publié: (2025)
Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
par: Kim, Nam-Gyu, et autres
Publié: (2025)
par: Kim, Nam-Gyu, et autres
Publié: (2025)
RSET: Remapping-based Sorting Method for Emotion Transfer Speech Synthesis
par: Shi, Haoxiang, et autres
Publié: (2024)
par: Shi, Haoxiang, et autres
Publié: (2024)
VoxInstruct: Expressive Human Instruction-to-Speech Generation with Unified Multilingual Codec Language Modelling
par: Zhou, Yixuan, et autres
Publié: (2024)
par: Zhou, Yixuan, et autres
Publié: (2024)
Mamba in Speech: Towards an Alternative to Self-Attention
par: Zhang, Xiangyu, et autres
Publié: (2024)
par: Zhang, Xiangyu, et autres
Publié: (2024)
Seed-TTS: A Family of High-Quality Versatile Speech Generation Models
par: Anastassiou, Philip, et autres
Publié: (2024)
par: Anastassiou, Philip, et autres
Publié: (2024)
Emotion-Coherent Speech Data Augmentation and Self-Supervised Contrastive Style Training for Enhancing Kids's Story Speech Synthesis
par: Chung, Raymond
Publié: (2026)
par: Chung, Raymond
Publié: (2026)
Meta-Learning Empowered Meta-Face: Personalized Speaking Style Adaptation for Audio-Driven 3D Talking Face Animation
par: Zhou, Xukun, et autres
Publié: (2024)
par: Zhou, Xukun, et autres
Publié: (2024)
Speech Synthesis along Perceptual Voice Quality Dimensions
par: Rautenberg, Frederik, et autres
Publié: (2025)
par: Rautenberg, Frederik, et autres
Publié: (2025)
ParaMETA: Towards Learning Disentangled Paralinguistic Speaking Styles Representations from Speech
par: Lou, Haowei, et autres
Publié: (2026)
par: Lou, Haowei, et autres
Publié: (2026)
MambaRate: Speech Quality Assessment Across Different Sampling Rates
par: Kakoulidis, Panos, et autres
Publié: (2025)
par: Kakoulidis, Panos, et autres
Publié: (2025)
Textless and Non-Parallel Speech-to-Speech Emotion Style Transfer
par: Dutta, Soumya, et autres
Publié: (2025)
par: Dutta, Soumya, et autres
Publié: (2025)
Improving Speech Enhancement with Multi-Metric Supervision from Learned Quality Assessment
par: Wang, Wei, et autres
Publié: (2025)
par: Wang, Wei, et autres
Publié: (2025)
Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis
par: Liao, Shijia, et autres
Publié: (2024)
par: Liao, Shijia, et autres
Publié: (2024)
CONTUNER: Singing Voice Beautifying with Pitch and Expressiveness Condition
par: Wang, Jianzong, et autres
Publié: (2024)
par: Wang, Jianzong, et autres
Publié: (2024)
Comparative Evaluation of Expressive Japanese Character Text-to-Speech with VITS and Style-BERT-VITS2
par: Rackauckas, Zackary, et autres
Publié: (2025)
par: Rackauckas, Zackary, et autres
Publié: (2025)
Enhancing Expressiveness in Dance Generation via Integrating Frequency and Music Style Information
par: Huang, Qiaochu, et autres
Publié: (2024)
par: Huang, Qiaochu, et autres
Publié: (2024)
Generative Speech Foundation Model Pretraining for High-Quality Speech Extraction and Restoration
par: Ku, Pin-Jui, et autres
Publié: (2024)
par: Ku, Pin-Jui, et autres
Publié: (2024)
Factor-Conditioned Speaking-Style Captioning
par: Ando, Atsushi, et autres
Publié: (2024)
par: Ando, Atsushi, et autres
Publié: (2024)
Vision-Integrated High-Quality Neural Speech Coding
par: Guo, Yao, et autres
Publié: (2025)
par: Guo, Yao, et autres
Publié: (2025)
Advanced Zero-Shot Text-to-Speech for Background Removal and Preservation with Controllable Masked Speech Prediction
par: Zhang, Leying, et autres
Publié: (2025)
par: Zhang, Leying, et autres
Publié: (2025)
Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis
par: Jiang, Ziyue, et autres
Publié: (2023)
par: Jiang, Ziyue, et autres
Publié: (2023)
DurIAN-E 2: Duration Informed Attention Network with Adaptive Variational Autoencoder and Adversarial Learning for Expressive Text-to-Speech Synthesis
par: Gu, Yu, et autres
Publié: (2024)
par: Gu, Yu, et autres
Publié: (2024)
Documents similaires
-
I2TTS: Image-indicated Immersive Text-to-speech Synthesis with Spatial Perception
par: Zhang, Jiawei, et autres
Publié: (2024) -
Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation
par: Deng, Yimin, et autres
Publié: (2024) -
Expressive Speech Retrieval using Natural Language Descriptions of Speaking Style
par: Kang, Wonjune, et autres
Publié: (2025) -
MM-TTS: Multi-modal Prompt based Style Transfer for Expressive Text-to-Speech Synthesis
par: Guan, Wenhao, et autres
Publié: (2023) -
MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis
par: Yang, Qian, et autres
Publié: (2024)