Enregistré dans:
| Auteurs principaux: | Shi, Jiacheng, Du, Hongfei, He, Yangfan, Hong, Y. Alicia, Gao, Ye |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2509.25416 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EMO-TTA: Improving Test-Time Adaptation of Audio-Language Models for Speech Emotion Recognition
par: Shi, Jiacheng, et autres
Publié: (2025)
par: Shi, Jiacheng, et autres
Publié: (2025)
AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling
par: Shi, Jiacheng, et autres
Publié: (2026)
par: Shi, Jiacheng, et autres
Publié: (2026)
AlignCap: Aligning Speech Emotion Captioning to Human Preferences
par: Liang, Ziqi, et autres
Publié: (2024)
par: Liang, Ziqi, et autres
Publié: (2024)
Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization
par: Majumder, Navonil, et autres
Publié: (2024)
par: Majumder, Navonil, et autres
Publié: (2024)
Plug-and-Play Emotion Graphs for Compositional Prompting in Zero-Shot Speech Emotion Recognition
par: Shi, Jiacheng, et autres
Publié: (2025)
par: Shi, Jiacheng, et autres
Publié: (2025)
Story2MIDI: Emotionally Aligned Music Generation from Text
par: Shokri, Mohammad, et autres
Publié: (2025)
par: Shokri, Mohammad, et autres
Publié: (2025)
Data-efficient Targeted Token-level Preference Optimization for LLM-based Text-to-Speech
par: Kotoge, Rikuto, et autres
Publié: (2025)
par: Kotoge, Rikuto, et autres
Publié: (2025)
SpeechAlign: Aligning Speech Generation to Human Preferences
par: Zhang, Dong, et autres
Publié: (2024)
par: Zhang, Dong, et autres
Publié: (2024)
Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization
par: Zhao, Mengjie, et autres
Publié: (2026)
par: Zhao, Mengjie, et autres
Publié: (2026)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
par: Ma, Ziyang, et autres
Publié: (2023)
par: Ma, Ziyang, et autres
Publié: (2023)
Recent Advances in End-to-End Simultaneous Speech Translation
par: Liu, Xiaoqian, et autres
Publié: (2024)
par: Liu, Xiaoqian, et autres
Publié: (2024)
DiffuSpeech: Silent Thought, Spoken Answer via Unified Speech-Text Diffusion
par: Lou, Yuxuan, et autres
Publié: (2026)
par: Lou, Yuxuan, et autres
Publié: (2026)
Sparse Autoencoders for Interpretable Emotion Control in Text-to-Speech
par: Du, Hongfei, et autres
Publié: (2026)
par: Du, Hongfei, et autres
Publié: (2026)
CLEP-DG: Contrastive Learning for Speech Emotion Domain Generalization via Soft Prompt Tuning
par: Shi, Jiacheng, et autres
Publié: (2025)
par: Shi, Jiacheng, et autres
Publié: (2025)
LatentSpeech: Latent Diffusion for Text-To-Speech Generation
par: Lou, Haowei, et autres
Publié: (2024)
par: Lou, Haowei, et autres
Publié: (2024)
Towards Emotionally Consistent Text-Based Speech Editing: Introducing EmoCorrector and The ECD-TSE Dataset
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling
par: Jiang, Yuxuan, et autres
Publié: (2025)
par: Jiang, Yuxuan, et autres
Publié: (2025)
BATON: Aligning Text-to-Audio Model with Human Preference Feedback
par: Liao, Huan, et autres
Publié: (2024)
par: Liao, Huan, et autres
Publié: (2024)
Cross-Attention is Half Explanation in Speech-to-Text Models
par: Papi, Sara, et autres
Publié: (2025)
par: Papi, Sara, et autres
Publié: (2025)
DiffStyleTTS: Diffusion-based Hierarchical Prosody Modeling for Text-to-Speech with Diverse and Controllable Styles
par: Liu, Jiaxuan, et autres
Publié: (2024)
par: Liu, Jiaxuan, et autres
Publié: (2024)
Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation
par: Xue, Jinlong, et autres
Publié: (2024)
par: Xue, Jinlong, et autres
Publié: (2024)
Hybrid CNN-Transformer Architecture for Arabic Speech Emotion Recognition
par: Gheffari, Youcef Soufiane, et autres
Publié: (2026)
par: Gheffari, Youcef Soufiane, et autres
Publié: (2026)
IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech
par: Zhou, Siyi, et autres
Publié: (2025)
par: Zhou, Siyi, et autres
Publié: (2025)
EchoX: Towards Mitigating Acoustic-Semantic Gap via Echo Training for Speech-to-Speech LLMs
par: Zhang, Yuhao, et autres
Publié: (2025)
par: Zhang, Yuhao, et autres
Publié: (2025)
SpeechParaling-Bench: A Comprehensive Benchmark for Paralinguistic-Aware Speech Generation
par: Liu, Ruohan, et autres
Publié: (2026)
par: Liu, Ruohan, et autres
Publié: (2026)
DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation
par: Jia, Dongya, et autres
Publié: (2025)
par: Jia, Dongya, et autres
Publié: (2025)
Aligner-Guided Training Paradigm: Advancing Text-to-Speech Models with Aligner Guided Duration
par: Lou, Haowei, et autres
Publié: (2024)
par: Lou, Haowei, et autres
Publié: (2024)
Dual Information Speech Language Models for Emotional Conversations
par: Wang, Chun, et autres
Publié: (2025)
par: Wang, Chun, et autres
Publié: (2025)
SloPal: A 60-Million-Word Slovak Parliamentary Corpus with Aligned Speech and Fine-Tuned ASR Models
par: Božík, Erik, et autres
Publié: (2025)
par: Božík, Erik, et autres
Publié: (2025)
Efficient Training for Cross-lingual Speech Language Models
par: Zhou, Yan, et autres
Publié: (2026)
par: Zhou, Yan, et autres
Publié: (2026)
STTATTS: Unified Speech-To-Text And Text-To-Speech Model
par: Toyin, Hawau Olamide, et autres
Publié: (2024)
par: Toyin, Hawau Olamide, et autres
Publié: (2024)
Soundwave: Less is More for Speech-Text Alignment in LLMs
par: Zhang, Yuhao, et autres
Publié: (2025)
par: Zhang, Yuhao, et autres
Publié: (2025)
Autoregressive Diffusion Transformer for Text-to-Speech Synthesis
par: Liu, Zhijun, et autres
Publié: (2024)
par: Liu, Zhijun, et autres
Publié: (2024)
TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization
par: Hung, Chia-Yu, et autres
Publié: (2024)
par: Hung, Chia-Yu, et autres
Publié: (2024)
Seamless Dysfluent Speech Text Alignment for Disordered Speech Analysis
par: Ye, Zongli, et autres
Publié: (2025)
par: Ye, Zongli, et autres
Publié: (2025)
Speech-FT: Merging Pre-trained And Fine-Tuned Speech Representation Models For Cross-Task Generalization
par: Lin, Tzu-Quan, et autres
Publié: (2025)
par: Lin, Tzu-Quan, et autres
Publié: (2025)
Aligning Text-to-Music Evaluation with Human Preferences
par: Huang, Yichen, et autres
Publié: (2025)
par: Huang, Yichen, et autres
Publié: (2025)
Beyond Hard Sharing: Efficient Multi-Task Speech-to-Text Modeling with Supervised Mixture of Experts
par: Jin, Hojun, et autres
Publié: (2025)
par: Jin, Hojun, et autres
Publié: (2025)
Emotional Text-To-Speech Based on Mutual-Information-Guided Emotion-Timbre Disentanglement
par: Yang, Jianing, et autres
Publié: (2025)
par: Yang, Jianing, et autres
Publié: (2025)
TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
par: Tseng, Liang-Hsuan, et autres
Publié: (2026)
par: Tseng, Liang-Hsuan, et autres
Publié: (2026)
Documents similaires
-
EMO-TTA: Improving Test-Time Adaptation of Audio-Language Models for Speech Emotion Recognition
par: Shi, Jiacheng, et autres
Publié: (2025) -
AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling
par: Shi, Jiacheng, et autres
Publié: (2026) -
AlignCap: Aligning Speech Emotion Captioning to Human Preferences
par: Liang, Ziqi, et autres
Publié: (2024) -
Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization
par: Majumder, Navonil, et autres
Publié: (2024) -
Plug-and-Play Emotion Graphs for Compositional Prompting in Zero-Shot Speech Emotion Recognition
par: Shi, Jiacheng, et autres
Publié: (2025)