Contextual Emotion Recognition using Large Vision Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Etesam, Yasaman, Yalçın, Özge Nilay, Zhang, Chuxuan, Lim, Angelica |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Emotional Theory of Mind: Bridging Fast Visual Processing with Slow Linguistic Reasoning
by: Etesam, Yasaman, et al.
Published: (2023)
by: Etesam, Yasaman, et al.
Published: (2023)
Your Robot Will Feel You Now: Empathy in Robots and Embodied Agents
by: Lim, Angelica, et al.
Published: (2026)
by: Lim, Angelica, et al.
Published: (2026)
React to This (RTT): A Nonverbal Turing Test for Embodied AI
by: Zhang, Chuxuan, et al.
Published: (2025)
by: Zhang, Chuxuan, et al.
Published: (2025)
Gender Bias in Emotion Recognition by Large Language Models
by: Herbert, Maureen, et al.
Published: (2025)
by: Herbert, Maureen, et al.
Published: (2025)
Evaluating Vision-Language Models for Emotion Recognition
by: Bhattacharyya, Sree, et al.
Published: (2025)
by: Bhattacharyya, Sree, et al.
Published: (2025)
ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models
by: Li, Zhaoyang, et al.
Published: (2025)
by: Li, Zhaoyang, et al.
Published: (2025)
Shape and Texture Recognition in Large Vision-Language Models
by: Eppel, Sagi, et al.
Published: (2025)
by: Eppel, Sagi, et al.
Published: (2025)
Exploring Vision Language Models for Facial Attribute Recognition: Emotion, Race, Gender, and Age
by: AlDahoul, Nouar, et al.
Published: (2024)
by: AlDahoul, Nouar, et al.
Published: (2024)
Enhancing HOI Detection with Contextual Cues from Large Vision-Language Models
by: Zhan, Yu-Wei, et al.
Published: (2023)
by: Zhan, Yu-Wei, et al.
Published: (2023)
AI-based Wearable Vision Assistance System for the Visually Impaired: Integrating Real-Time Object Recognition and Contextual Understanding Using Large Vision-Language Models
by: Baig, Mirza Samad Ahmed, et al.
Published: (2024)
by: Baig, Mirza Samad Ahmed, et al.
Published: (2024)
Vocabulary-free Fine-grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model
by: Demidov, Dmitry, et al.
Published: (2025)
by: Demidov, Dmitry, et al.
Published: (2025)
Contextualized Visual Personalization in Vision-Language Models
by: Oh, Yeongtak, et al.
Published: (2026)
by: Oh, Yeongtak, et al.
Published: (2026)
Sign Spotting Disambiguation using Large Language Models
by: Low, JianHe, et al.
Published: (2025)
by: Low, JianHe, et al.
Published: (2025)
Video Emotion Open-vocabulary Recognition Based on Multimodal Large Language Model
by: Ge, Mengying, et al.
Published: (2024)
by: Ge, Mengying, et al.
Published: (2024)
Salsa as a Nonverbal Embodied Language -- The CoMPAS3D Dataset and Benchmarks
by: Burkanova, Bermet, et al.
Published: (2025)
by: Burkanova, Bermet, et al.
Published: (2025)
Large Vision-Language Models as Emotion Recognizers in Context Awareness
by: Lei, Yuxuan, et al.
Published: (2024)
by: Lei, Yuxuan, et al.
Published: (2024)
MPCAR: Multi-Perspective Contextual Augmentation for Enhanced Visual Reasoning in Large Vision-Language Models
by: Rahman, Amirul, et al.
Published: (2025)
by: Rahman, Amirul, et al.
Published: (2025)
Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models
by: Souza, Rafael, et al.
Published: (2024)
by: Souza, Rafael, et al.
Published: (2024)
IIR-VLM: In-Context Instance-level Recognition for Large Vision-Language Models
by: Shi, Liang, et al.
Published: (2026)
by: Shi, Liang, et al.
Published: (2026)
Emotion Recognition Using Transformers with Masked Learning
by: Min, Seongjae, et al.
Published: (2024)
by: Min, Seongjae, et al.
Published: (2024)
Mitigating Dialogue Hallucination for Large Vision Language Models via Adversarial Instruction Tuning
by: Park, Dongmin, et al.
Published: (2024)
by: Park, Dongmin, et al.
Published: (2024)
Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
by: Li, Ling, et al.
Published: (2025)
by: Li, Ling, et al.
Published: (2025)
Leveraging Vision-Language Large Models for Interpretable Video Action Recognition with Semantic Tokenization
by: Peng, Jingwei, et al.
Published: (2025)
by: Peng, Jingwei, et al.
Published: (2025)
Training A Small Emotional Vision Language Model for Visual Art Comprehension
by: Zhang, Jing, et al.
Published: (2024)
by: Zhang, Jing, et al.
Published: (2024)
Anatomy of a Feeling: Narrating Embodied Emotions via Large Vision-Language Models
by: Saim, Mohammad, et al.
Published: (2025)
by: Saim, Mohammad, et al.
Published: (2025)
SkelVIT: Consensus of Vision Transformers for a Lightweight Skeleton-Based Action Recognition System
by: Karadag, Ozge Oztimur
Published: (2023)
by: Karadag, Ozge Oztimur
Published: (2023)
Multimodal Emotion Recognition via Bi-directional Cross-Attention and Temporal Modeling
by: Byeon, Junhyeong, et al.
Published: (2026)
by: Byeon, Junhyeong, et al.
Published: (2026)
LLDif: Diffusion Models for Low-light Emotion Recognition
by: Wang, Zhifeng, et al.
Published: (2024)
by: Wang, Zhifeng, et al.
Published: (2024)
Compound Expression Recognition via Large Vision-Language Models
by: Yu, Jun, et al.
Published: (2025)
by: Yu, Jun, et al.
Published: (2025)
Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models
by: Ranasinghe, Yasiru, et al.
Published: (2025)
by: Ranasinghe, Yasiru, et al.
Published: (2025)
InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output
by: Zhang, Pan, et al.
Published: (2024)
by: Zhang, Pan, et al.
Published: (2024)
Open-Set Recognition in the Age of Vision-Language Models
by: Miller, Dimity, et al.
Published: (2024)
by: Miller, Dimity, et al.
Published: (2024)
Multimodal Emotion Recognition with Vision-language Prompting and Modality Dropout
by: QI, Anbin, et al.
Published: (2024)
by: QI, Anbin, et al.
Published: (2024)
Evaluating Open-Source Vision Language Models for Facial Emotion Recognition against Traditional Deep Learning Models
by: Mulukutla, Vamsi Krishna, et al.
Published: (2025)
by: Mulukutla, Vamsi Krishna, et al.
Published: (2025)
LRDif: Diffusion Models for Under-Display Camera Emotion Recognition
by: Wang, Zhifeng, et al.
Published: (2024)
by: Wang, Zhifeng, et al.
Published: (2024)
Video-LevelGauge: Investigating Contextual Positional Bias in Large Video Language Models
by: Xia, Hou, et al.
Published: (2025)
by: Xia, Hou, et al.
Published: (2025)
Facial Emotion Recognition using Convolutional Neural Networks
by: Saravanan, Akash, et al.
Published: (2019)
by: Saravanan, Akash, et al.
Published: (2019)
Artwork Interpretation with Vision Language Models: A Case Study on Emotions and Emotion Symbols
by: Padó, Sebastian, et al.
Published: (2025)
by: Padó, Sebastian, et al.
Published: (2025)
Facial Emotion Learning with Text-Guided Multiview Fusion via Vision-Language Model for 3D/4D Facial Expression Recognition
by: Behzad, Muzammil
Published: (2025)
by: Behzad, Muzammil
Published: (2025)
EmotionHallucer: Evaluating Emotion Hallucinations in Multimodal Large Language Models
by: Xing, Bohao, et al.
Published: (2025)
by: Xing, Bohao, et al.
Published: (2025)
Similar Items
-
Emotional Theory of Mind: Bridging Fast Visual Processing with Slow Linguistic Reasoning
by: Etesam, Yasaman, et al.
Published: (2023) -
Your Robot Will Feel You Now: Empathy in Robots and Embodied Agents
by: Lim, Angelica, et al.
Published: (2026) -
React to This (RTT): A Nonverbal Turing Test for Embodied AI
by: Zhang, Chuxuan, et al.
Published: (2025) -
Gender Bias in Emotion Recognition by Large Language Models
by: Herbert, Maureen, et al.
Published: (2025) -
Evaluating Vision-Language Models for Emotion Recognition
by: Bhattacharyya, Sree, et al.
Published: (2025)