MicroEmo: Time-Sensitive Multimodal Emotion Recognition with Micro-Expression Dynamics in Video Dialogues
Fuente:
arXiv
Gespeichert in:
| 1. Verfasser: | Zhang, Liyun |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Dynamic Multimodal Fusion via Meta-Learning Towards Micro-Video Recommendation
von: Liu, Han, et al.
Veröffentlicht: (2025)
von: Liu, Han, et al.
Veröffentlicht: (2025)
MEGC2026: Micro-Expression Grand Challenge on Visual Question Answering
von: Fan, Xinqi, et al.
Veröffentlicht: (2026)
von: Fan, Xinqi, et al.
Veröffentlicht: (2026)
MEGC2025: Micro-Expression Grand Challenge on Spot Then Recognize and Visual Question Answering
von: Fan, Xinqi, et al.
Veröffentlicht: (2025)
von: Fan, Xinqi, et al.
Veröffentlicht: (2025)
Dynamic Resolution Guidance for Facial Expression Recognition
von: Wang, Songpan, et al.
Veröffentlicht: (2024)
von: Wang, Songpan, et al.
Veröffentlicht: (2024)
EditEmoTalk: Controllable Speech-Driven 3D Facial Animation with Continuous Expression Editing
von: Jiang, Diqiong, et al.
Veröffentlicht: (2026)
von: Jiang, Diqiong, et al.
Veröffentlicht: (2026)
MCIHN: A Hybrid Network Model Based on Multi-path Cross-modal Interaction for Multimodal Emotion Recognition
von: Zhang, Haoyang, et al.
Veröffentlicht: (2025)
von: Zhang, Haoyang, et al.
Veröffentlicht: (2025)
MEDTalk: Multimodal Controlled 3D Facial Animation with Dynamic Emotions by Disentangled Embedding
von: Liu, Chang, et al.
Veröffentlicht: (2025)
von: Liu, Chang, et al.
Veröffentlicht: (2025)
Optimized Learned Image Compression for Facial Expression Recognition
von: Li, Xiumei, et al.
Veröffentlicht: (2025)
von: Li, Xiumei, et al.
Veröffentlicht: (2025)
GPT-4V with Emotion: A Zero-shot Benchmark for Generalized Emotion Recognition
von: Lian, Zheng, et al.
Veröffentlicht: (2023)
von: Lian, Zheng, et al.
Veröffentlicht: (2023)
Calibrating Multimodal Consensus for Emotion Recognition
von: Zhong, Guowei, et al.
Veröffentlicht: (2025)
von: Zhong, Guowei, et al.
Veröffentlicht: (2025)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
von: Qu, Mengxue, et al.
Veröffentlicht: (2024)
von: Qu, Mengxue, et al.
Veröffentlicht: (2024)
ExpLLM: Towards Chain of Thought for Facial Expression Recognition
von: Lan, Xing, et al.
Veröffentlicht: (2024)
von: Lan, Xing, et al.
Veröffentlicht: (2024)
GANonymization: A GAN-based Face Anonymization Framework for Preserving Emotional Expressions
von: Hellmann, Fabio, et al.
Veröffentlicht: (2023)
von: Hellmann, Fabio, et al.
Veröffentlicht: (2023)
Towards Robust and Realible Multimodal Misinformation Recognition with Incomplete Modality
von: Zhou, Hengyang, et al.
Veröffentlicht: (2025)
von: Zhou, Hengyang, et al.
Veröffentlicht: (2025)
Anchoring Emotions in Text: Robust Multimodal Fusion for Mimicry Intensity Estimation
von: Zhu, Lingsi, et al.
Veröffentlicht: (2026)
von: Zhu, Lingsi, et al.
Veröffentlicht: (2026)
XEmoGPT: An Explainable Multimodal Emotion Recognition Framework with Cue-Level Perception and Reasoning
von: Zhang, Hanwen, et al.
Veröffentlicht: (2026)
von: Zhang, Hanwen, et al.
Veröffentlicht: (2026)
Learning Video Context as Interleaved Multimodal Sequences
von: Lin, Kevin Qinghong, et al.
Veröffentlicht: (2024)
von: Lin, Kevin Qinghong, et al.
Veröffentlicht: (2024)
Multi-modal Speech Emotion Recognition via Feature Distribution Adaptation Network
von: Li, Shaokai, et al.
Veröffentlicht: (2024)
von: Li, Shaokai, et al.
Veröffentlicht: (2024)
Hierarchical Action Recognition: A Contrastive Video-Language Approach with Hierarchical Interactions
von: Zhang, Rui, et al.
Veröffentlicht: (2024)
von: Zhang, Rui, et al.
Veröffentlicht: (2024)
Make Graph-based Referring Expression Comprehension Great Again through Expression-guided Dynamic Gating and Regression
von: Ke, Jingcheng, et al.
Veröffentlicht: (2024)
von: Ke, Jingcheng, et al.
Veröffentlicht: (2024)
MTCAE-DFER: Multi-Task Cascaded Autoencoder for Dynamic Facial Expression Recognition
von: Xiang, Peihao, et al.
Veröffentlicht: (2024)
von: Xiang, Peihao, et al.
Veröffentlicht: (2024)
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
von: Zhang, Pingping, et al.
Veröffentlicht: (2024)
von: Zhang, Pingping, et al.
Veröffentlicht: (2024)
LipGen: Viseme-Guided Lip Video Generation for Enhancing Visual Speech Recognition
von: Hao, Bowen, et al.
Veröffentlicht: (2025)
von: Hao, Bowen, et al.
Veröffentlicht: (2025)
MLLM-VADStory: Domain Knowledge-Driven Multimodal LLMs for Video Ad Storyline Insights
von: Yang, Jasmine, et al.
Veröffentlicht: (2026)
von: Yang, Jasmine, et al.
Veröffentlicht: (2026)
Enhancing Modal Fusion by Alignment and Label Matching for Multimodal Emotion Recognition
von: Li, Qifei, et al.
Veröffentlicht: (2024)
von: Li, Qifei, et al.
Veröffentlicht: (2024)
Enrich and Detect: Video Temporal Grounding with Multimodal LLMs
von: Pramanick, Shraman, et al.
Veröffentlicht: (2025)
von: Pramanick, Shraman, et al.
Veröffentlicht: (2025)
Multimodal Engagement Analysis from Facial Videos in the Classroom
von: Sümer, Ömer, et al.
Veröffentlicht: (2021)
von: Sümer, Ömer, et al.
Veröffentlicht: (2021)
Towards Emotion Analysis in Short-form Videos: A Large-Scale Dataset and Baseline
von: Wu, Xuecheng, et al.
Veröffentlicht: (2023)
von: Wu, Xuecheng, et al.
Veröffentlicht: (2023)
BioVL-QR: Egocentric Biochemical Vision-and-Language Dataset Using Micro QR Codes
von: Nishimoto, Tomohiro, et al.
Veröffentlicht: (2024)
von: Nishimoto, Tomohiro, et al.
Veröffentlicht: (2024)
VCoME: Verbal Video Composition with Multimodal Editing Effects
von: Gong, Weibo, et al.
Veröffentlicht: (2024)
von: Gong, Weibo, et al.
Veröffentlicht: (2024)
Multimodal Fake News Video Explanation: Dataset, Analysis and Evaluation
von: Chen, Lizhi, et al.
Veröffentlicht: (2025)
von: Chen, Lizhi, et al.
Veröffentlicht: (2025)
MSRS: Training Multimodal Speech Recognition Models from Scratch with Sparse Mask Optimization
von: Fernandez-Lopez, Adriana, et al.
Veröffentlicht: (2024)
von: Fernandez-Lopez, Adriana, et al.
Veröffentlicht: (2024)
A Tri-Dynamic Preprocessing Framework for UGC Video Compression
von: Zhao, Fei, et al.
Veröffentlicht: (2025)
von: Zhao, Fei, et al.
Veröffentlicht: (2025)
TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos
von: Kong, Fanheng, et al.
Veröffentlicht: (2025)
von: Kong, Fanheng, et al.
Veröffentlicht: (2025)
Towards Robust Multimodal Emotion Recognition under Missing Modalities and Distribution Shifts
von: Zhong, Guowei, et al.
Veröffentlicht: (2025)
von: Zhong, Guowei, et al.
Veröffentlicht: (2025)
Extending Visual Dynamics for Video-to-Music Generation
von: Liu, Xiaohao, et al.
Veröffentlicht: (2025)
von: Liu, Xiaohao, et al.
Veröffentlicht: (2025)
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
von: Zhao, Pengcheng, et al.
Veröffentlicht: (2024)
von: Zhao, Pengcheng, et al.
Veröffentlicht: (2024)
MIPS at SemEval-2024 Task 3: Multimodal Emotion-Cause Pair Extraction in Conversations with Multimodal Language Models
von: Cheng, Zebang, et al.
Veröffentlicht: (2024)
von: Cheng, Zebang, et al.
Veröffentlicht: (2024)
Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding
von: Wang, Shaoguang, et al.
Veröffentlicht: (2026)
von: Wang, Shaoguang, et al.
Veröffentlicht: (2026)
JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation
von: Chao, Jianghan, et al.
Veröffentlicht: (2025)
von: Chao, Jianghan, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Dynamic Multimodal Fusion via Meta-Learning Towards Micro-Video Recommendation
von: Liu, Han, et al.
Veröffentlicht: (2025) -
MEGC2026: Micro-Expression Grand Challenge on Visual Question Answering
von: Fan, Xinqi, et al.
Veröffentlicht: (2026) -
MEGC2025: Micro-Expression Grand Challenge on Spot Then Recognize and Visual Question Answering
von: Fan, Xinqi, et al.
Veröffentlicht: (2025) -
Dynamic Resolution Guidance for Facial Expression Recognition
von: Wang, Songpan, et al.
Veröffentlicht: (2024) -
EditEmoTalk: Controllable Speech-Driven 3D Facial Animation with Continuous Expression Editing
von: Jiang, Diqiong, et al.
Veröffentlicht: (2026)