MECap-R1: Emotion-aware Policy with Reinforcement Learning for Multimodal Emotion Captioning
Fuente:
arXiv
Guardado en:
| Autores principales: | Sun, Haoqin, Lyu, Chenyang, Kong, Xiangyu, Zhao, Shiwan, Zhou, Jiaming, Wang, Hui, Kong, Aobo, Zhao, Jinghua, Wang, Longyue, Luo, Weihua, Zhang, Kaifu, Qin, Yong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Iterative Prototype Refinement for Ambiguous Speech Emotion Recognition
por: Sun, Haoqin, et al.
Publicado: (2024)
por: Sun, Haoqin, et al.
Publicado: (2024)
Speech-XL: Towards Long-Form Speech Understanding in Large Speech Language Models
por: Sun, Haoqin, et al.
Publicado: (2026)
por: Sun, Haoqin, et al.
Publicado: (2026)
Enhancing Multimodal Emotion Recognition through Multi-Granularity Cross-Modal Alignment
por: Wang, Xuechen, et al.
Publicado: (2024)
por: Wang, Xuechen, et al.
Publicado: (2024)
Enhancing Emotion Recognition in Incomplete Data: A Novel Cross-Modal Alignment, Reconstruction, and Refinement Framework
por: Sun, Haoqin, et al.
Publicado: (2024)
por: Sun, Haoqin, et al.
Publicado: (2024)
Enhancing Dysarthric Speech Recognition for Unseen Speakers via Prototype-Based Adaptation
por: Wang, Shiyao, et al.
Publicado: (2024)
por: Wang, Shiyao, et al.
Publicado: (2024)
M2R-Whisper: Multi-stage and Multi-scale Retrieval Augmentation for Enhancing Whisper
por: Zhou, Jiaming, et al.
Publicado: (2024)
por: Zhou, Jiaming, et al.
Publicado: (2024)
RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval
por: Sun, Haoqin, et al.
Publicado: (2025)
por: Sun, Haoqin, et al.
Publicado: (2025)
EmotionTalk: An Interactive Chinese Multimodal Emotion Dataset With Rich Annotations
por: Sun, Haoqin, et al.
Publicado: (2025)
por: Sun, Haoqin, et al.
Publicado: (2025)
MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation
por: Liu, Cheng, et al.
Publicado: (2025)
por: Liu, Cheng, et al.
Publicado: (2025)
DIFFA: Large Language Diffusion Models Can Listen and Understand
por: Zhou, Jiaming, et al.
Publicado: (2025)
por: Zhou, Jiaming, et al.
Publicado: (2025)
The Affective Bridge: Preserving Speech Representations while Enhancing Deepfake Detection vian emotional Constraints
por: Li, Yupei, et al.
Publicado: (2025)
por: Li, Yupei, et al.
Publicado: (2025)
CS-Dialogue: A 104-Hour Dataset of Spontaneous Mandarin-English Code-Switching Dialogues for Speech Recognition
por: Zhou, Jiaming, et al.
Publicado: (2025)
por: Zhou, Jiaming, et al.
Publicado: (2025)
ChildMandarin: A Comprehensive Mandarin Speech Dataset for Young Children Aged 3-5
por: Zhou, Jiaming, et al.
Publicado: (2024)
por: Zhou, Jiaming, et al.
Publicado: (2024)
Zero- and One-Shot Data Augmentation for Sentence-Level Dysarthric Speech Recognition in Constrained Scenarios
por: Wang, Shiyao, et al.
Publicado: (2025)
por: Wang, Shiyao, et al.
Publicado: (2025)
Uncertainty-Aware Mean Opinion Score Prediction
por: Wang, Hui, et al.
Publicado: (2024)
por: Wang, Hui, et al.
Publicado: (2024)
Improving Zero-Shot Chinese-English Code-Switching ASR with kNN-CTC and Gated Monolingual Datastores
por: Zhou, Jiaming, et al.
Publicado: (2024)
por: Zhou, Jiaming, et al.
Publicado: (2024)
A Self-Training Approach for Whisper to Enhance Long Dysarthric Speech Recognition
por: Wang, Shiyao, et al.
Publicado: (2025)
por: Wang, Shiyao, et al.
Publicado: (2025)
PB-LRDWWS System for the SLT 2024 Low-Resource Dysarthria Wake-Up Word Spotting Challenge
por: Wang, Shiyao, et al.
Publicado: (2024)
por: Wang, Shiyao, et al.
Publicado: (2024)
Marco-Voice Technical Report
por: Tian, Fengping, et al.
Publicado: (2025)
por: Tian, Fengping, et al.
Publicado: (2025)
SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
Omni-CLST: Error-aware Curriculum Learning with guided Selective chain-of-Thought for audio question answering
por: Zhao, Jinghua, et al.
Publicado: (2025)
por: Zhao, Jinghua, et al.
Publicado: (2025)
Marco-ASR: A Principled and Metric-Driven Framework for Fine-Tuning Large-Scale ASR Models for Domain Adaptation
por: Ni, Xuanfan, et al.
Publicado: (2025)
por: Ni, Xuanfan, et al.
Publicado: (2025)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
GLAD: Global-Local Aware Dynamic Mixture-of-Experts for Multi-Talker ASR
por: Guo, Yujie, et al.
Publicado: (2025)
por: Guo, Yujie, et al.
Publicado: (2025)
TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
LongSpeech: A Scalable Benchmark for Transcription, Translation and Understanding in Long Speech
por: Yang, Fei, et al.
Publicado: (2026)
por: Yang, Fei, et al.
Publicado: (2026)
WildElder: A Chinese Elderly Speech Dataset from the Wild with Fine-Grained Manual Annotations
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework
por: Jia, Yuhang, et al.
Publicado: (2024)
por: Jia, Yuhang, et al.
Publicado: (2024)
kNN-CTC: Enhancing ASR via Retrieval of CTC Pseudo Labels
por: Zhou, Jiaming, et al.
Publicado: (2023)
por: Zhou, Jiaming, et al.
Publicado: (2023)
From Contrast to Commonality: Audio Commonality Captioning for Enhanced Audio-Text Cross-modal Understanding in Multimodal LLMs
por: Jia, Yuhang, et al.
Publicado: (2025)
por: Jia, Yuhang, et al.
Publicado: (2025)
Mind the Gap: Data Rewriting for Stable Off-Policy Supervised Fine-Tuning
por: Zhao, Shiwan, et al.
Publicado: (2025)
por: Zhao, Shiwan, et al.
Publicado: (2025)
FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching
por: Wang, Hui, et al.
Publicado: (2025)
por: Wang, Hui, et al.
Publicado: (2025)
EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning
por: Wang, Dingdong, et al.
Publicado: (2026)
por: Wang, Dingdong, et al.
Publicado: (2026)
EmoSURA: Towards Accurate Evaluation of Detailed and Long-Context Emotional Speech Captions
por: Jing, Xin, et al.
Publicado: (2026)
por: Jing, Xin, et al.
Publicado: (2026)
DIFFA-2: A Practical Diffusion Large Language Model for General Audio Understanding
por: Zhou, Jiaming, et al.
Publicado: (2026)
por: Zhou, Jiaming, et al.
Publicado: (2026)
CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTS
por: Chen, Junyang, et al.
Publicado: (2026)
por: Chen, Junyang, et al.
Publicado: (2026)
EMO-RL: Emotion-Rule-Based Reinforcement Learning Enhanced Audio-Language Model for Generalized Speech Emotion Recognition
por: Li, Pengcheng, et al.
Publicado: (2025)
por: Li, Pengcheng, et al.
Publicado: (2025)
Semantic-Emotional Resonance Embedding: A Semi-Supervised Paradigm for Cross-Lingual Speech Emotion Recognition
por: Zhao, Ya, et al.
Publicado: (2026)
por: Zhao, Ya, et al.
Publicado: (2026)
Discrete Audio Representations for Automated Audio Captioning
por: Tian, Jingguang, et al.
Publicado: (2025)
por: Tian, Jingguang, et al.
Publicado: (2025)
EmotionCaps: Enhancing Audio Captioning Through Emotion-Augmented Data Generation
por: Manivannan, Mithun, et al.
Publicado: (2024)
por: Manivannan, Mithun, et al.
Publicado: (2024)
Ejemplares similares
-
Iterative Prototype Refinement for Ambiguous Speech Emotion Recognition
por: Sun, Haoqin, et al.
Publicado: (2024) -
Speech-XL: Towards Long-Form Speech Understanding in Large Speech Language Models
por: Sun, Haoqin, et al.
Publicado: (2026) -
Enhancing Multimodal Emotion Recognition through Multi-Granularity Cross-Modal Alignment
por: Wang, Xuechen, et al.
Publicado: (2024) -
Enhancing Emotion Recognition in Incomplete Data: A Novel Cross-Modal Alignment, Reconstruction, and Refinement Framework
por: Sun, Haoqin, et al.
Publicado: (2024) -
Enhancing Dysarthric Speech Recognition for Unseen Speakers via Prototype-Based Adaptation
por: Wang, Shiyao, et al.
Publicado: (2024)