Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Han, Meng, Zixiang, Luo, Meng, Han, Hong, Liao, Lizi, Cambria, Erik, Fei, Hao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EmpathyEar: An Open-source Avatar Multimodal Empathetic Chatbot
par: Fei, Hao, et autres
Publié: (2024)
par: Fei, Hao, et autres
Publié: (2024)
Towards Multimodal Emotional Support Conversation Systems
par: Chu, Yuqi, et autres
Publié: (2024)
par: Chu, Yuqi, et autres
Publié: (2024)
To Fuse or to Drop? Dual-Path Learning for Resolving Modality Conflicts in Multimodal Emotion Recognition
par: Yu, Yangchen, et autres
Publié: (2026)
par: Yu, Yangchen, et autres
Publié: (2026)
SpeechEE: A Novel Benchmark for Speech Event Extraction
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation
par: Wang, Yongqi, et autres
Publié: (2025)
par: Wang, Yongqi, et autres
Publié: (2025)
Virbo: Multimodal Multilingual Avatar Video Generation in Digital Marketing
par: Zhang, Juan, et autres
Publié: (2024)
par: Zhang, Juan, et autres
Publié: (2024)
SVLA: A Unified Speech-Vision-Language Assistant with Multimodal Reasoning and Speech Generation
par: Huynh, Ngoc Dung, et autres
Publié: (2025)
par: Huynh, Ngoc Dung, et autres
Publié: (2025)
SemEval-2024 Task 3: Multimodal Emotion Cause Analysis in Conversations
par: Wang, Fanfan, et autres
Publié: (2024)
par: Wang, Fanfan, et autres
Publié: (2024)
CoreMark: Toward Robust and Universal Text Watermarking Technique
par: Meng, Jiale, et autres
Publié: (2025)
par: Meng, Jiale, et autres
Publié: (2025)
ProtT3: Protein-to-Text Generation for Text-based Protein Understanding
par: Liu, Zhiyuan, et autres
Publié: (2024)
par: Liu, Zhiyuan, et autres
Publié: (2024)
TbExplain: A Text-based Explanation Method for Scene Classification Models with the Statistical Prediction Correction
par: Aminimehr, Amirhossein, et autres
Publié: (2023)
par: Aminimehr, Amirhossein, et autres
Publié: (2023)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
par: Chu, Meng, et autres
Publié: (2023)
par: Chu, Meng, et autres
Publié: (2023)
Differentially Processed Optimized Collaborative Rich Text Editor
par: Jatana, Nishtha, et autres
Publié: (2024)
par: Jatana, Nishtha, et autres
Publié: (2024)
Has Multimodal Learning Delivered Universal Intelligence in Healthcare? A Comprehensive Survey
par: Lin, Qika, et autres
Publié: (2024)
par: Lin, Qika, et autres
Publié: (2024)
Recognizing Everything from All Modalities at Once: Grounded Multimodal Universal Information Extraction
par: Zhang, Meishan, et autres
Publié: (2024)
par: Zhang, Meishan, et autres
Publié: (2024)
StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion
par: Li, Fengjin, et autres
Publié: (2025)
par: Li, Fengjin, et autres
Publié: (2025)
ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Capability for Large Vision-Language Models
par: Liu, Shuo, et autres
Publié: (2024)
par: Liu, Shuo, et autres
Publié: (2024)
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
Mitigating Shared-Private Branch Imbalance via Dual-Branch Rebalancing for Multimodal Sentiment Analysis
par: Meng, Chunlei, et autres
Publié: (2026)
par: Meng, Chunlei, et autres
Publié: (2026)
Exploring Transferability of Multimodal Adversarial Samples for Vision-Language Pre-training Models with Contrastive Learning
par: Wang, Youze, et autres
Publié: (2023)
par: Wang, Youze, et autres
Publié: (2023)
Towards Better Text-to-Image Generation Alignment via Attention Modulation
par: Wu, Yihang, et autres
Publié: (2024)
par: Wu, Yihang, et autres
Publié: (2024)
EmotionTalk: An Interactive Chinese Multimodal Emotion Dataset With Rich Annotations
par: Sun, Haoqin, et autres
Publié: (2025)
par: Sun, Haoqin, et autres
Publié: (2025)
UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts
par: Cheng, Zhi-Qi, et autres
Publié: (2024)
par: Cheng, Zhi-Qi, et autres
Publié: (2024)
GAIA: Zero-shot Talking Avatar Generation
par: He, Tianyu, et autres
Publié: (2023)
par: He, Tianyu, et autres
Publié: (2023)
Traits Run Deep: Enhancing Personality Assessment via Psychology-Guided LLM Representations and Multimodal Apparent Behaviors
par: Li, Jia, et autres
Publié: (2025)
par: Li, Jia, et autres
Publié: (2025)
STAR: Skeleton-aware Text-based 4D Avatar Generation with In-Network Motion Retargeting
par: Chai, Zenghao, et autres
Publié: (2024)
par: Chai, Zenghao, et autres
Publié: (2024)
VSpeechLM: A Visual Speech Language Model for Visual Text-to-Speech Task
par: Wang, Yuyue, et autres
Publié: (2025)
par: Wang, Yuyue, et autres
Publié: (2025)
Look, Compare and Draw: Differential Query Transformer for Automatic Oil Painting
par: Liu, Lingyu, et autres
Publié: (2026)
par: Liu, Lingyu, et autres
Publié: (2026)
Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
par: Zhang, Peng-Fei, et autres
Publié: (2026)
par: Zhang, Peng-Fei, et autres
Publié: (2026)
Grounding is All You Need? Dual Temporal Grounding for Video Dialog
par: Qin, You, et autres
Publié: (2024)
par: Qin, You, et autres
Publié: (2024)
Tri-Subspaces Disentanglement for Multimodal Sentiment Analysis
par: Meng, Chunlei, et autres
Publié: (2026)
par: Meng, Chunlei, et autres
Publié: (2026)
LungCURE: Benchmarking Multimodal Real-World Clinical Reasoning for Precision Lung Cancer Diagnosis and Treatment
par: Hao, Fangyu, et autres
Publié: (2026)
par: Hao, Fangyu, et autres
Publié: (2026)
Hyperbolic Multimodal Generative Representation Learning for Generalized Zero-Shot Multimodal Information Extraction
par: Zhou, Baohang, et autres
Publié: (2026)
par: Zhou, Baohang, et autres
Publié: (2026)
Multi-source Knowledge Enhanced Graph Attention Networks for Multimodal Fact Verification
par: Cao, Han, et autres
Publié: (2024)
par: Cao, Han, et autres
Publié: (2024)
HOP: Heterogeneous Topology-based Multimodal Entanglement for Co-Speech Gesture Generation
par: Cheng, Hongye, et autres
Publié: (2025)
par: Cheng, Hongye, et autres
Publié: (2025)
UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning
par: Bai, Hayes, et autres
Publié: (2026)
par: Bai, Hayes, et autres
Publié: (2026)
E3RG: Building Explicit Emotion-driven Empathetic Response Generation System with Multimodal Large Language Model
par: Lin, Ronghao, et autres
Publié: (2025)
par: Lin, Ronghao, et autres
Publié: (2025)
Mixture of Disentangled Experts with Missing Modalities for Robust Multimodal Sentiment Analysis
par: Li, Xiang, et autres
Publié: (2026)
par: Li, Xiang, et autres
Publié: (2026)
FastTalker: Jointly Generating Speech and Conversational Gestures from Text
par: Guo, Zixin, et autres
Publié: (2024)
par: Guo, Zixin, et autres
Publié: (2024)
Listening to the Unspoken: Exploring "365" Aspects of Multimodal Interview Performance Assessment
par: Li, Jia, et autres
Publié: (2025)
par: Li, Jia, et autres
Publié: (2025)
Documents similaires
-
EmpathyEar: An Open-source Avatar Multimodal Empathetic Chatbot
par: Fei, Hao, et autres
Publié: (2024) -
Towards Multimodal Emotional Support Conversation Systems
par: Chu, Yuqi, et autres
Publié: (2024) -
To Fuse or to Drop? Dual-Path Learning for Resolving Modality Conflicts in Multimodal Emotion Recognition
par: Yu, Yangchen, et autres
Publié: (2026) -
SpeechEE: A Novel Benchmark for Speech Event Extraction
par: Wang, Bin, et autres
Publié: (2024) -
Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation
par: Wang, Yongqi, et autres
Publié: (2025)