MELLM: A Flow-Guided Large Language Model for Micro-Expression Understanding
Fuente:
arXiv
Saved in:
| Main Authors: | Zhao, Sirui, Zhang, Zhengye, Liu, Shifeng, Mao, Xinglong, Yin, Shukang, Fu, Chaoyou, Xu, Tong, Chen, Enhong |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning
by: Liu, Shifeng, et al.
Published: (2026)
by: Liu, Shifeng, et al.
Published: (2026)
A Survey on Multimodal Large Language Models
by: Yin, Shukang, et al.
Published: (2023)
by: Yin, Shukang, et al.
Published: (2023)
Tango: Taming Visual Signals for Efficient Video Large Language Models
by: Yin, Shukang, et al.
Published: (2026)
by: Yin, Shukang, et al.
Published: (2026)
DFME: A New Benchmark for Dynamic Facial Micro-expression Recognition
by: Zhao, Sirui, et al.
Published: (2023)
by: Zhao, Sirui, et al.
Published: (2023)
Woodpecker: Hallucination Correction for Multimodal Large Language Models
by: Yin, Shukang, et al.
Published: (2023)
by: Yin, Shukang, et al.
Published: (2023)
Sparrow: Data-Efficient Video-LLM with Text-to-Image Augmentation
by: Yin, Shukang, et al.
Published: (2024)
by: Yin, Shukang, et al.
Published: (2024)
MER-CLIP: AU-Guided Vision-Language Alignment for Micro-Expression Recognition
by: Liu, Shifeng, et al.
Published: (2025)
by: Liu, Shifeng, et al.
Published: (2025)
AULLM++: Structural Reasoning with Large Language Models for Micro-Expression Recognition
by: Liu, Zhishu, et al.
Published: (2026)
by: Liu, Zhishu, et al.
Published: (2026)
Bind-Your-Avatar: Multi-Talking-Character Video Generation with Dynamic 3D-mask-based Embedding Router
by: Huang, Yubo, et al.
Published: (2025)
by: Huang, Yubo, et al.
Published: (2025)
MERba: Multi-Receptive Field MambaVision for Micro-Expression Recognition
by: Mao, Xinglong, et al.
Published: (2025)
by: Mao, Xinglong, et al.
Published: (2025)
LIHE: Linguistic Instance-Split Hyperbolic-Euclidean Framework for Generalized Weakly-Supervised Referring Expression Comprehension
by: Shi, Xianglong, et al.
Published: (2025)
by: Shi, Xianglong, et al.
Published: (2025)
Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models
by: Tong, Yujun, et al.
Published: (2026)
by: Tong, Yujun, et al.
Published: (2026)
MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs
by: Fu, Chaoyou, et al.
Published: (2024)
by: Fu, Chaoyou, et al.
Published: (2024)
QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension
by: Luo, Yongdong, et al.
Published: (2025)
by: Luo, Yongdong, et al.
Published: (2025)
VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding
by: Yang, Ruoliu, et al.
Published: (2026)
by: Yang, Ruoliu, et al.
Published: (2026)
Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
by: Luo, Yongdong, et al.
Published: (2024)
by: Luo, Yongdong, et al.
Published: (2024)
Context-aware Video Anomaly Detection in Long-Term Datasets
by: Yang, Zhengye, et al.
Published: (2024)
by: Yang, Zhengye, et al.
Published: (2024)
Understanding Multi-Agent Reasoning with Large Language Models for Cartoon VQA
by: Wu, Tong, et al.
Published: (2026)
by: Wu, Tong, et al.
Published: (2026)
An Interpretable Multi-Plane Fusion Framework With Kolmogorov-Arnold Network Guided Attention Enhancement for Alzheimer's Disease Diagnosis
by: Yang, Xiaoxiao, et al.
Published: (2025)
by: Yang, Xiaoxiao, et al.
Published: (2025)
EarthGPT: A Universal Multi-modal Large Language Model for Multi-sensor Image Comprehension in Remote Sensing Domain
by: Zhang, Wei, et al.
Published: (2024)
by: Zhang, Wei, et al.
Published: (2024)
EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing
by: Zhang, Wei, et al.
Published: (2024)
by: Zhang, Wei, et al.
Published: (2024)
EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video Large Language Models
by: Xu, Wenhao, et al.
Published: (2025)
by: Xu, Wenhao, et al.
Published: (2025)
Improving Large Vision-Language Models' Understanding for Flow Field Data
by: Zhang, Xiaomei, et al.
Published: (2025)
by: Zhang, Xiaomei, et al.
Published: (2025)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
by: Fu, Chaoyou, et al.
Published: (2023)
by: Fu, Chaoyou, et al.
Published: (2023)
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
by: Zhang, Yi-Fan, et al.
Published: (2024)
by: Zhang, Yi-Fan, et al.
Published: (2024)
A Novel Combined Optical Flow Approach for Comprehensive Micro-Expression Recognition
by: Khuong, Vu Tram Anh, et al.
Published: (2025)
by: Khuong, Vu Tram Anh, et al.
Published: (2025)
Boosting Micro-Expression Analysis via Prior-Guided Video-Level Regression
by: Guo, Zizheng, et al.
Published: (2025)
by: Guo, Zizheng, et al.
Published: (2025)
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
by: Xie, Wulin, et al.
Published: (2025)
by: Xie, Wulin, et al.
Published: (2025)
Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length
by: Huang, Yubo, et al.
Published: (2025)
by: Huang, Yubo, et al.
Published: (2025)
GLOV: Guided Large Language Models as Implicit Optimizers for Vision Language Models
by: Mirza, M. Jehanzeb, et al.
Published: (2024)
by: Mirza, M. Jehanzeb, et al.
Published: (2024)
MMME: A Spontaneous Multi-Modal Micro-Expression Dataset Enabling Visual-Physiological Fusion
by: Ma, Chuang, et al.
Published: (2025)
by: Ma, Chuang, et al.
Published: (2025)
BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding
by: Liu, Shuming, et al.
Published: (2025)
by: Liu, Shuming, et al.
Published: (2025)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
by: Zhou, Chenyu, et al.
Published: (2024)
by: Zhou, Chenyu, et al.
Published: (2024)
MPFNet: A Multi-Prior Fusion Network with a Progressive Training Strategy for Micro-Expression Recognition
by: Ma, Chuang, et al.
Published: (2025)
by: Ma, Chuang, et al.
Published: (2025)
Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion
by: Li, Lijiang, et al.
Published: (2026)
by: Li, Lijiang, et al.
Published: (2026)
Fine-Grained 3D Facial Reconstruction for Micro-Expressions
by: Sun, Che, et al.
Published: (2026)
by: Sun, Che, et al.
Published: (2026)
AU-LLM: Micro-Expression Action Unit Detection via Enhanced LLM-Based Feature Fusion
by: Liu, Zhishu, et al.
Published: (2025)
by: Liu, Zhishu, et al.
Published: (2025)
MOL: Joint Estimation of Micro-Expression, Optical Flow, and Landmark via Transformer-Graph-Style Convolution
by: Shao, Zhiwen, et al.
Published: (2025)
by: Shao, Zhiwen, et al.
Published: (2025)
GLAD: Generalizable Tuning for Vision-Language Models
by: Peng, Yuqi, et al.
Published: (2025)
by: Peng, Yuqi, et al.
Published: (2025)
FlowLearn: Evaluating Large Vision-Language Models on Flowchart Understanding
by: Pan, Huitong, et al.
Published: (2024)
by: Pan, Huitong, et al.
Published: (2024)
Similar Items
-
ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning
by: Liu, Shifeng, et al.
Published: (2026) -
A Survey on Multimodal Large Language Models
by: Yin, Shukang, et al.
Published: (2023) -
Tango: Taming Visual Signals for Efficient Video Large Language Models
by: Yin, Shukang, et al.
Published: (2026) -
DFME: A New Benchmark for Dynamic Facial Micro-expression Recognition
by: Zhao, Sirui, et al.
Published: (2023) -
Woodpecker: Hallucination Correction for Multimodal Large Language Models
by: Yin, Shukang, et al.
Published: (2023)