EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Dingdong, Liu, Shujie, Zhang, Tianhua, Chen, Youjun, Li, Jinyu, Meng, Helen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition
por: Chen, Youjun, et al.
Publicado: (2025)
por: Chen, Youjun, et al.
Publicado: (2025)
Multi-Channel Speech Enhancement for Cocktail Party Speech Emotion Recognition
por: Chen, Youjun, et al.
Publicado: (2026)
por: Chen, Youjun, et al.
Publicado: (2026)
PAVITS: Exploring Prosody-aware VITS for End-to-End Emotional Voice Conversion
por: Qi, Tianhua, et al.
Publicado: (2024)
por: Qi, Tianhua, et al.
Publicado: (2024)
MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark
por: Wang, Dingdong, et al.
Publicado: (2025)
por: Wang, Dingdong, et al.
Publicado: (2025)
HuLA: Prosody-Aware Anti-Spoofing with Multi-Task Learning for Expressive and Emotional Synthetic Speech
por: Mahapatra, Aurosweta, et al.
Publicado: (2025)
por: Mahapatra, Aurosweta, et al.
Publicado: (2025)
AffectSpeech: A Large-Scale Emotional Speech Dataset with Fine-Grained Textual Descriptions for Speech Emotion Captioning and Synthesis
por: Qi, Tianhua, et al.
Publicado: (2026)
por: Qi, Tianhua, et al.
Publicado: (2026)
Emotion-Aware Quantization for Discrete Speech Representations: An Analysis of Emotion Preservation
por: Zhou, Haoguang, et al.
Publicado: (2026)
por: Zhou, Haoguang, et al.
Publicado: (2026)
Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs
por: Wang, Dingdong, et al.
Publicado: (2025)
por: Wang, Dingdong, et al.
Publicado: (2025)
SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models
por: Yang, Dongchao, et al.
Publicado: (2024)
por: Yang, Dongchao, et al.
Publicado: (2024)
Joint Speaker Features Learning for Audio-visual Multichannel Speech Separation and Recognition
por: Li, Guinan, et al.
Publicado: (2024)
por: Li, Guinan, et al.
Publicado: (2024)
Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models
por: He, Xiang, et al.
Publicado: (2026)
por: He, Xiang, et al.
Publicado: (2026)
Enhancing Speech Emotion Recognition with Multi-Task Learning and Dynamic Feature Fusion
por: Wang, Honghong, et al.
Publicado: (2025)
por: Wang, Honghong, et al.
Publicado: (2025)
A Comparative Study of Discrete Speech Tokens for Semantic-Related Tasks with Large Language Models
por: Wang, Dingdong, et al.
Publicado: (2024)
por: Wang, Dingdong, et al.
Publicado: (2024)
Closing the Modality Reasoning Gap for Speech Large Language Models
por: Wang, Chaoren, et al.
Publicado: (2026)
por: Wang, Chaoren, et al.
Publicado: (2026)
MECap-R1: Emotion-aware Policy with Reinforcement Learning for Multimodal Emotion Captioning
por: Sun, Haoqin, et al.
Publicado: (2025)
por: Sun, Haoqin, et al.
Publicado: (2025)
Emotion-Aware Speech Self-Supervised Representation Learning with Intensity Knowledge
por: Liu, Rui, et al.
Publicado: (2024)
por: Liu, Rui, et al.
Publicado: (2024)
Usefulness of Emotional Prosody in Neural Machine Translation
por: Brazier, Charles, et al.
Publicado: (2024)
por: Brazier, Charles, et al.
Publicado: (2024)
Autoregressive Speech Synthesis without Vector Quantization
por: Meng, Lingwei, et al.
Publicado: (2024)
por: Meng, Lingwei, et al.
Publicado: (2024)
EMO-RL: Emotion-Rule-Based Reinforcement Learning Enhanced Audio-Language Model for Generalized Speech Emotion Recognition
por: Li, Pengcheng, et al.
Publicado: (2025)
por: Li, Pengcheng, et al.
Publicado: (2025)
Emotion-Aware Contrastive Adaptation Network for Source-Free Cross-Corpus Speech Emotion Recognition
por: Zhao, Yan, et al.
Publicado: (2024)
por: Zhao, Yan, et al.
Publicado: (2024)
Speech Emotion Recognition via Entropy-Aware Score Selection
por: Chua, ChenYi, et al.
Publicado: (2025)
por: Chua, ChenYi, et al.
Publicado: (2025)
Towards Expressive Zero-Shot Speech Synthesis with Hierarchical Prosody Modeling
por: Jiang, Yuepeng, et al.
Publicado: (2024)
por: Jiang, Yuepeng, et al.
Publicado: (2024)
Explainable Transformer-CNN Fusion for Noise-Robust Speech Emotion Recognition
por: Chakrabarty, Sudip, et al.
Publicado: (2025)
por: Chakrabarty, Sudip, et al.
Publicado: (2025)
Emotion Neural Transducer for Fine-Grained Speech Emotion Recognition
por: Shen, Siyuan, et al.
Publicado: (2024)
por: Shen, Siyuan, et al.
Publicado: (2024)
Towards Realistic Emotional Voice Conversion using Controllable Emotional Intensity
por: Qi, Tianhua, et al.
Publicado: (2024)
por: Qi, Tianhua, et al.
Publicado: (2024)
Boosting Large Language Model for Speech Synthesis: An Empirical Study
por: Hao, Hongkun, et al.
Publicado: (2023)
por: Hao, Hongkun, et al.
Publicado: (2023)
AffectCodec: Emotion-Preserving Neural Speech Codec with Block-Diagonal Residual FSQ
por: Meng, Zhaoyang, et al.
Publicado: (2026)
por: Meng, Zhaoyang, et al.
Publicado: (2026)
ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis
por: Tang, Haobin, et al.
Publicado: (2024)
por: Tang, Haobin, et al.
Publicado: (2024)
Beyond Classification: Towards Speech Emotion Reasoning with Multitask AudioLLMs
por: Zhang, Wenyu, et al.
Publicado: (2025)
por: Zhang, Wenyu, et al.
Publicado: (2025)
EMORL-TTS: Reinforcement Learning for Fine-Grained Emotion Control in LLM-based TTS
por: Li, Haoxun, et al.
Publicado: (2025)
por: Li, Haoxun, et al.
Publicado: (2025)
CoLM-DSR: Leveraging Neural Codec Language Modeling for Multi-Modal Dysarthric Speech Reconstruction
por: Chen, Xueyuan, et al.
Publicado: (2024)
por: Chen, Xueyuan, et al.
Publicado: (2024)
Phone-purity Guided Discrete Tokens for Dysarthric Speech Recognition
por: Wang, Huimeng, et al.
Publicado: (2025)
por: Wang, Huimeng, et al.
Publicado: (2025)
Daisy-TTS: Simulating Wider Spectrum of Emotions via Prosody Embedding Decomposition
por: Chevi, Rendi, et al.
Publicado: (2024)
por: Chevi, Rendi, et al.
Publicado: (2024)
Speech Emotion Recognition with ASR Integration
por: Li, Yuanchao
Publicado: (2026)
por: Li, Yuanchao
Publicado: (2026)
Leveraging Speech PTM, Text LLM, and Emotional TTS for Speech Emotion Recognition
por: Ma, Ziyang, et al.
Publicado: (2023)
por: Ma, Ziyang, et al.
Publicado: (2023)
AffectCodec: Emotion-Preserving Neural Speech Codec for Expressive Speech Modeling
por: Shi, Jiacheng, et al.
Publicado: (2026)
por: Shi, Jiacheng, et al.
Publicado: (2026)
LipSody: Lip-to-Speech Synthesis with Enhanced Prosody Consistency
por: Lee, Jaejun, et al.
Publicado: (2026)
por: Lee, Jaejun, et al.
Publicado: (2026)
Hierarchical Control of Emotion Rendering in Speech Synthesis
por: Inoue, Sho, et al.
Publicado: (2024)
por: Inoue, Sho, et al.
Publicado: (2024)
ATRIE: Adaptive Tuning for Robust Inference and Emotion in Persona-Driven Speech Synthesis
por: Li, Aoduo, et al.
Publicado: (2026)
por: Li, Aoduo, et al.
Publicado: (2026)
Advanced Long-Content Speech Recognition With Factorized Neural Transducer
por: Gong, Xun, et al.
Publicado: (2024)
por: Gong, Xun, et al.
Publicado: (2024)
Ejemplares similares
-
Towards LLM-Empowered Fine-Grained Speech Descriptors for Explainable Emotion Recognition
por: Chen, Youjun, et al.
Publicado: (2025) -
Multi-Channel Speech Enhancement for Cocktail Party Speech Emotion Recognition
por: Chen, Youjun, et al.
Publicado: (2026) -
PAVITS: Exploring Prosody-aware VITS for End-to-End Emotional Voice Conversion
por: Qi, Tianhua, et al.
Publicado: (2024) -
MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark
por: Wang, Dingdong, et al.
Publicado: (2025) -
HuLA: Prosody-Aware Anti-Spoofing with Multi-Task Learning for Expressive and Emotional Synthetic Speech
por: Mahapatra, Aurosweta, et al.
Publicado: (2025)