Benchmarking and Bridging Emotion Conflicts for Multimodal Emotion Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Zhiyuan, Zhu, Beier, Xu, Yanlong, Song, Peipei, Yang, Xun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Survey on Multimodal Music Emotion Recognition
par: Liyanarachchi, Rashini, et autres
Publié: (2025)
par: Liyanarachchi, Rashini, et autres
Publié: (2025)
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
par: Zhang, Xiaohui, et autres
Publié: (2024)
par: Zhang, Xiaohui, et autres
Publié: (2024)
SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering
par: Melechovsky, Jan, et autres
Publié: (2025)
par: Melechovsky, Jan, et autres
Publié: (2025)
Rethinking Masking Strategies for Masked Prediction-based Audio Self-supervised Learning
par: Niizumi, Daisuke, et autres
Publié: (2026)
par: Niizumi, Daisuke, et autres
Publié: (2026)
Coarse-to-Fine Proposal Refinement Framework for Audio Temporal Forgery Detection and Localization
par: Wu, Junyan, et autres
Publié: (2024)
par: Wu, Junyan, et autres
Publié: (2024)
EmoDubber: Towards High Quality and Emotion Controllable Movie Dubbing
par: Cong, Gaoxiang, et autres
Publié: (2024)
par: Cong, Gaoxiang, et autres
Publié: (2024)
Emotion-Aligned Contrastive Learning Between Images and Music
par: Stewart, Shanti, et autres
Publié: (2023)
par: Stewart, Shanti, et autres
Publié: (2023)
Can Sound Replace Vision in LLaVA With Token Substitution?
par: Vosoughi, Ali, et autres
Publié: (2025)
par: Vosoughi, Ali, et autres
Publié: (2025)
Dopamine Audiobook: A Training-free MLLM Agent for Emotional and Immersive Audiobook Generation
par: Rong, Yan, et autres
Publié: (2025)
par: Rong, Yan, et autres
Publié: (2025)
ISDrama: Immersive Spatial Drama Generation through Multimodal Prompting
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation
par: Niizumi, Daisuke, et autres
Publié: (2024)
par: Niizumi, Daisuke, et autres
Publié: (2024)
Multimodal Emotion Coupling via Speech-to-Facial and Bodily Gestures in Dyadic Interaction
par: Herbuela, Von Ralph Dane Marquez, et autres
Publié: (2025)
par: Herbuela, Von Ralph Dane Marquez, et autres
Publié: (2025)
MATER: Multi-level Acoustic and Textual Emotion Representation for Interpretable Speech Emotion Recognition
par: Jon, Hyo Jin, et autres
Publié: (2025)
par: Jon, Hyo Jin, et autres
Publié: (2025)
Addressing Emotion Bias in Music Emotion Recognition and Generation with Frechet Audio Distance
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
MusFlow: Multimodal Music Generation via Conditional Flow Matching
par: Song, Jiahao, et autres
Publié: (2025)
par: Song, Jiahao, et autres
Publié: (2025)
FastAST: Accelerating Audio Spectrogram Transformer via Token Merging and Cross-Model Knowledge Distillation
par: Behera, Swarup Ranjan, et autres
Publié: (2024)
par: Behera, Swarup Ranjan, et autres
Publié: (2024)
Revise, Reason, and Recognize: LLM-Based Emotion Recognition via Emotion-Specific Prompts and ASR Error Correction
par: Li, Yuanchao, et autres
Publié: (2024)
par: Li, Yuanchao, et autres
Publié: (2024)
Efficient Feature Extraction and Late Fusion Strategy for Audiovisual Emotional Mimicry Intensity Estimation
par: Yu, Jun, et autres
Publié: (2024)
par: Yu, Jun, et autres
Publié: (2024)
Text2midi-InferAlign: Improving Symbolic Music Generation with Inference-Time Alignment
par: Roy, Abhinaba, et autres
Publié: (2025)
par: Roy, Abhinaba, et autres
Publié: (2025)
A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction
par: Cheripally, Sowmya
Publié: (2024)
par: Cheripally, Sowmya
Publié: (2024)
Sync-TVA: A Graph-Attention Framework for Multimodal Emotion Recognition with Cross-Modal Fusion
par: Deng, Zeyu, et autres
Publié: (2025)
par: Deng, Zeyu, et autres
Publié: (2025)
CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection
par: Zang, Yongyi, et autres
Publié: (2024)
par: Zang, Yongyi, et autres
Publié: (2024)
Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model
par: Ren, Yong, et autres
Publié: (2025)
par: Ren, Yong, et autres
Publié: (2025)
Audio-Visual Speaker Tracking: Progress, Challenges, and Future Directions
par: Zhao, Jinzheng, et autres
Publié: (2023)
par: Zhao, Jinzheng, et autres
Publié: (2023)
MusER: Musical Element-Based Regularization for Generating Symbolic Music with Emotion
par: Ji, Shulei, et autres
Publié: (2023)
par: Ji, Shulei, et autres
Publié: (2023)
Quality Over Quantity? LLM-Based Curation for a Data-Efficient Audio-Video Foundation Model
par: Vosoughi, Ali, et autres
Publié: (2025)
par: Vosoughi, Ali, et autres
Publié: (2025)
Early Joint Learning of Emotion Information Makes MultiModal Model Understand You Better
par: Ge, Mengying, et autres
Publié: (2024)
par: Ge, Mengying, et autres
Publié: (2024)
MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction
par: He, Jiajun, et autres
Publié: (2024)
par: He, Jiajun, et autres
Publié: (2024)
A Survey on Cross-Modal Interaction Between Music and Multimodal Data
par: Li, Sifei, et autres
Publié: (2025)
par: Li, Sifei, et autres
Publié: (2025)
AI-based Drone Assisted Human Rescue in Disaster Environments: Challenges and Opportunities
par: Papyan, Narek, et autres
Publié: (2024)
par: Papyan, Narek, et autres
Publié: (2024)
Improving Speech Enhancement by Integrating Inter-Channel and Band Features with Dual-branch Conformer
par: Li, Jizhen, et autres
Publié: (2024)
par: Li, Jizhen, et autres
Publié: (2024)
Stimulus Modality Matters: Impact of Perceptual Evaluations from Different Modalities on Speech Emotion Recognition System Performance
par: Chou, Huang-Cheng, et autres
Publié: (2024)
par: Chou, Huang-Cheng, et autres
Publié: (2024)
MART: Learning Hierarchical Music Audio Representations with Part-Whole Transformer
par: Yao, Dong, et autres
Publié: (2023)
par: Yao, Dong, et autres
Publié: (2023)
MSAC: Multiple Speech Attribute Control Method for Reliable Speech Emotion Recognition
par: Pan, Yu, et autres
Publié: (2023)
par: Pan, Yu, et autres
Publié: (2023)
Emotion-Aware Speech Generation with Character-Specific Voices for Comics
par: Qian, Zhiwen, et autres
Publié: (2025)
par: Qian, Zhiwen, et autres
Publié: (2025)
Personality-Enhanced Multimodal Depression Detection in the Elderly
par: Wang, Honghong, et autres
Publié: (2025)
par: Wang, Honghong, et autres
Publié: (2025)
Multimodal Fish Feeding Intensity Assessment in Aquaculture
par: Cui, Meng, et autres
Publié: (2023)
par: Cui, Meng, et autres
Publié: (2023)
SZTU-CMU at MER2024: Improving Emotion-LLaMA with Conv-Attention for Multimodal Emotion Recognition
par: Cheng, Zebang, et autres
Publié: (2024)
par: Cheng, Zebang, et autres
Publié: (2024)
SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation
par: Shimada, Kazuki, et autres
Publié: (2024)
par: Shimada, Kazuki, et autres
Publié: (2024)
MusicAOG: an Energy-Based Model for Learning and Sampling a Hierarchical Representation of Symbolic Music
par: Qian, Yikai, et autres
Publié: (2024)
par: Qian, Yikai, et autres
Publié: (2024)
Documents similaires
-
A Survey on Multimodal Music Emotion Recognition
par: Liyanarachchi, Rashini, et autres
Publié: (2025) -
Multimodal Emotion Recognition from Raw Audio with Sinc-convolution
par: Zhang, Xiaohui, et autres
Publié: (2024) -
SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering
par: Melechovsky, Jan, et autres
Publié: (2025) -
Rethinking Masking Strategies for Masked Prediction-based Audio Self-supervised Learning
par: Niizumi, Daisuke, et autres
Publié: (2026) -
Coarse-to-Fine Proposal Refinement Framework for Audio Temporal Forgery Detection and Localization
par: Wu, Junyan, et autres
Publié: (2024)