HiStyle: Hierarchical Style Embedding Predictor for Text-Prompt-Guided Controllable Speech Synthesis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Ziyu, Li, Hanzhao, Hu, Jingbin, Li, Wenhao, Xie, Lei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ReStyle-TTS: Relative and Continuous Style Control for Zero-Shot Speech Synthesis
par: Li, Haitao, et autres
Publié: (2026)
par: Li, Haitao, et autres
Publié: (2026)
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
par: Liu, Jiaxuan, et autres
Publié: (2024)
par: Liu, Jiaxuan, et autres
Publié: (2024)
AutoStyle-TTS: Retrieval-Augmented Generation based Automatic Style Matching Text-to-Speech Synthesis
par: Luo, Dan, et autres
Publié: (2025)
par: Luo, Dan, et autres
Publié: (2025)
FleSpeech: Flexibly Controllable Speech Generation with Various Prompts
par: Li, Hanzhao, et autres
Publié: (2025)
par: Li, Hanzhao, et autres
Publié: (2025)
Scaling Rich Style-Prompted Text-to-Speech Datasets
par: Diwan, Anuj, et autres
Publié: (2025)
par: Diwan, Anuj, et autres
Publié: (2025)
Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
par: Kim, Nam-Gyu
Publié: (2025)
par: Kim, Nam-Gyu
Publié: (2025)
Unlocking Fine-Grained and Within-Utterance Speaking Style Control in Prompt-Based Text-to-Speech Models
par: Kang, Jaehoon, et autres
Publié: (2026)
par: Kang, Jaehoon, et autres
Publié: (2026)
StyleSpeech: Parameter-efficient Fine Tuning for Pre-trained Controllable Text-to-Speech
par: Lou, Haowei, et autres
Publié: (2024)
par: Lou, Haowei, et autres
Publié: (2024)
StyleGuard: Preventing Text-to-Image-Model-based Style Mimicry Attacks by Style Perturbations
par: Li, Yanjie, et autres
Publié: (2025)
par: Li, Yanjie, et autres
Publié: (2025)
Text Prompt is Not Enough: Sound Event Enhanced Prompt Adapter for Target Style Audio Generation
par: Xiong, Chenxu, et autres
Publié: (2024)
par: Xiong, Chenxu, et autres
Publié: (2024)
Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech
par: Kim, Nam-Gyu, et autres
Publié: (2025)
par: Kim, Nam-Gyu, et autres
Publié: (2025)
Style-Talker: Finetuning Audio Language Model and Style-Based Text-to-Speech Model for Fast Spoken Dialogue Generation
par: Li, Yinghao Aaron, et autres
Publié: (2024)
par: Li, Yinghao Aaron, et autres
Publié: (2024)
StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation
par: Wu, Yi, et autres
Publié: (2025)
par: Wu, Yi, et autres
Publié: (2025)
StyleForge: Enhancing Text-to-Image Synthesis for Any Artistic Styles with Dual Binding
par: Park, Junseo, et autres
Publié: (2024)
par: Park, Junseo, et autres
Publié: (2024)
CapSpeech: Enabling Downstream Applications in Style-Captioned Text-to-Speech
par: Wang, Helin, et autres
Publié: (2025)
par: Wang, Helin, et autres
Publié: (2025)
HiCAST: Highly Customized Arbitrary Style Transfer with Adapter Enhanced Diffusion Models
par: Wang, Hanzhang, et autres
Publié: (2024)
par: Wang, Hanzhang, et autres
Publié: (2024)
Route-Induced Density and Stability (RIDE): Controlled Intervention and Mechanism Analysis of Routing-Style Meta Prompts on LLM Internal States
par: Zhang, Dianxing, et autres
Publié: (2026)
par: Zhang, Dianxing, et autres
Publié: (2026)
DPI-TTS: Directional Patch Interaction for Fast-Converging and Style Temporal Modeling in Text-to-Speech
par: Qi, Xin, et autres
Publié: (2024)
par: Qi, Xin, et autres
Publié: (2024)
ArtCrafter: Text-Image Aligning Style Transfer via Embedding Reframing
par: Huang, Nisha, et autres
Publié: (2025)
par: Huang, Nisha, et autres
Publié: (2025)
StyleVAR: Controllable Image Style Transfer via Visual Autoregressive Modeling
par: Jing, Liqi, et autres
Publié: (2026)
par: Jing, Liqi, et autres
Publié: (2026)
StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter
par: Liu, Gongye, et autres
Publié: (2023)
par: Liu, Gongye, et autres
Publié: (2023)
Speech-to-Speech Translation with Discrete-Unit-Based Style Transfer
par: Wang, Yongqi, et autres
Publié: (2023)
par: Wang, Yongqi, et autres
Publié: (2023)
Unsupervised Text Style Transfer via LLMs and Attention Masking with Multi-way Interactions
par: Pan, Lei, et autres
Publié: (2024)
par: Pan, Lei, et autres
Publié: (2024)
StyleLoco: Generative Adversarial Distillation for Natural Humanoid Robot Locomotion
par: Ma, Le, et autres
Publié: (2025)
par: Ma, Le, et autres
Publié: (2025)
PESTalk: Speech-Driven 3D Facial Animation with Personalized Emotional Styles
par: Han, Tianshun, et autres
Publié: (2025)
par: Han, Tianshun, et autres
Publié: (2025)
FonTS: Text Rendering with Typography and Style Controls
par: Shi, Wenda, et autres
Publié: (2024)
par: Shi, Wenda, et autres
Publié: (2024)
Causality Guided Representation Learning for Cross-Style Hate Speech Detection
par: Zhao, Chengshuai, et autres
Publié: (2025)
par: Zhao, Chengshuai, et autres
Publié: (2025)
Distilling Text Style Transfer With Self-Explanation From LLMs
par: Zhang, Chiyu, et autres
Publié: (2024)
par: Zhang, Chiyu, et autres
Publié: (2024)
StyleRec: A Benchmark Dataset for Prompt Recovery in Writing Style Transformation
par: Liu, Shenyang, et autres
Publié: (2025)
par: Liu, Shenyang, et autres
Publié: (2025)
Hi-Agent: Hierarchical Vision-Language Agents for Mobile Device Control
par: Wu, Zhe, et autres
Publié: (2025)
par: Wu, Zhe, et autres
Publié: (2025)
Mitigating Intra-Speaker Variability in Diarization with Style-Controllable Speech Augmentation
par: Kim, Miseul, et autres
Publié: (2025)
par: Kim, Miseul, et autres
Publié: (2025)
DEX-TTS: Diffusion-based EXpressive Text-to-Speech with Style Modeling on Time Variability
par: Park, Hyun Joon, et autres
Publié: (2024)
par: Park, Hyun Joon, et autres
Publié: (2024)
Unsupervised Disentanglement of Content and Style via Variance-Invariance Constraints
par: Wu, Yuxuan, et autres
Publié: (2024)
par: Wu, Yuxuan, et autres
Publié: (2024)
StyleDecipher: Robust and Explainable Detection of LLM-Generated Texts with Stylistic Analysis
par: Li, Siyuan, et autres
Publié: (2025)
par: Li, Siyuan, et autres
Publié: (2025)
FaceSpeak: Expressive and High-Quality Speech Synthesis from Human Portraits of Different Styles
par: Zhang, Tian-Hao, et autres
Publié: (2025)
par: Zhang, Tian-Hao, et autres
Publié: (2025)
Measuring Embedding Sensitivity to Authorial Style in French: Comparing Literary Texts with Language Model Rewritings
par: Icard, Benjamin, et autres
Publié: (2026)
par: Icard, Benjamin, et autres
Publié: (2026)
HiNet: Novel Multi-Scenario & Multi-Task Learning with Hierarchical Information Extraction
par: Zhou, Jie, et autres
Publié: (2023)
par: Zhou, Jie, et autres
Publié: (2023)
Style-Preserving Policy Optimization for Game Agents
par: Li, Lingfeng, et autres
Publié: (2025)
par: Li, Lingfeng, et autres
Publié: (2025)
StyleMamba : State Space Model for Efficient Text-driven Image Style Transfer
par: Wang, Zijia, et autres
Publié: (2024)
par: Wang, Zijia, et autres
Publié: (2024)
StyleShield: Exposing the Fragility of AIGC Detectors through Continuous Controllable Style Transfer
par: Zheng, Guantian
Publié: (2026)
par: Zheng, Guantian
Publié: (2026)
Documents similaires
-
ReStyle-TTS: Relative and Continuous Style Control for Zero-Shot Speech Synthesis
par: Li, Haitao, et autres
Publié: (2026) -
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
par: Liu, Jiaxuan, et autres
Publié: (2024) -
AutoStyle-TTS: Retrieval-Augmented Generation based Automatic Style Matching Text-to-Speech Synthesis
par: Luo, Dan, et autres
Publié: (2025) -
FleSpeech: Flexibly Controllable Speech Generation with Various Prompts
par: Li, Hanzhao, et autres
Publié: (2025) -
Scaling Rich Style-Prompted Text-to-Speech Datasets
par: Diwan, Anuj, et autres
Publié: (2025)