Anatomy of a Feeling: Narrating Embodied Emotions via Large Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Saim, Mohammad, Duong, Phan Anh, Luong, Cat, Bhanderi, Aniket, Jiang, Tianyu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CHEER-Ekman: Fine-grained Embodied Emotion Classification
par: Duong, Phan Anh, et autres
Publié: (2025)
par: Duong, Phan Anh, et autres
Publié: (2025)
Do Emotions Influence Moral Judgment in Large Language Models?
par: Saim, Mohammad, et autres
Publié: (2026)
par: Saim, Mohammad, et autres
Publié: (2026)
Hierarchical Document Parsing via Large Margin Feature Matching and Heuristics
par: Kiet, Duong Anh
Publié: (2025)
par: Kiet, Duong Anh
Publié: (2025)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
par: Yang, Rui, et autres
Publié: (2025)
par: Yang, Rui, et autres
Publié: (2025)
Evaluating Vision-Language Models for Emotion Recognition
par: Bhattacharyya, Sree, et autres
Publié: (2025)
par: Bhattacharyya, Sree, et autres
Publié: (2025)
EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
par: Du, Yiyang, et autres
Publié: (2026)
par: Du, Yiyang, et autres
Publié: (2026)
Artwork Interpretation with Vision Language Models: A Case Study on Emotions and Emotion Symbols
par: Padó, Sebastian, et autres
Publié: (2025)
par: Padó, Sebastian, et autres
Publié: (2025)
EmotionHallucer: Evaluating Emotion Hallucinations in Multimodal Large Language Models
par: Xing, Bohao, et autres
Publié: (2025)
par: Xing, Bohao, et autres
Publié: (2025)
Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization
par: Diao, Xingjian, et autres
Publié: (2026)
par: Diao, Xingjian, et autres
Publié: (2026)
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
par: You, Haoxuan, et autres
Publié: (2023)
par: You, Haoxuan, et autres
Publié: (2023)
EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
par: Du, Mengfei, et autres
Publié: (2024)
par: Du, Mengfei, et autres
Publié: (2024)
EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents
par: Cheng, Zhili, et autres
Publié: (2025)
par: Cheng, Zhili, et autres
Publié: (2025)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
par: Jiang, Lei, et autres
Publié: (2025)
par: Jiang, Lei, et autres
Publié: (2025)
HomeSafeBench: A Benchmark for Embodied Vision-Language Models in Free-Exploration Home Safety Inspection
par: Gao, Siyuan, et autres
Publié: (2025)
par: Gao, Siyuan, et autres
Publié: (2025)
Intriguing Properties of Large Language and Vision Models
par: Lee, Young-Jun, et autres
Publié: (2024)
par: Lee, Young-Jun, et autres
Publié: (2024)
VisuCraft: Enhancing Large Vision-Language Models for Complex Visual-Guided Creative Content Generation via Structured Information Extraction
par: Jiang, Rongxin, et autres
Publié: (2025)
par: Jiang, Rongxin, et autres
Publié: (2025)
VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering
par: Wang, Zihu, et autres
Publié: (2025)
par: Wang, Zihu, et autres
Publié: (2025)
Instruction-Following Evaluation of Large Vision-Language Models
par: Shiono, Daiki, et autres
Publié: (2025)
par: Shiono, Daiki, et autres
Publié: (2025)
Vision-centric Token Compression in Large Language Model
par: Xing, Ling, et autres
Publié: (2025)
par: Xing, Ling, et autres
Publié: (2025)
Visual In-Context Learning for Large Vision-Language Models
par: Zhou, Yucheng, et autres
Publié: (2024)
par: Zhou, Yucheng, et autres
Publié: (2024)
Polaris: Open-ended Interactive Robotic Manipulation via Syn2Real Visual Grounding and Large Language Models
par: Wang, Tianyu, et autres
Publié: (2024)
par: Wang, Tianyu, et autres
Publié: (2024)
Building Cooperative Embodied Agents Modularly with Large Language Models
par: Zhang, Hongxin, et autres
Publié: (2023)
par: Zhang, Hongxin, et autres
Publié: (2023)
Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration
par: Fazli, Mehrdad, et autres
Publié: (2025)
par: Fazli, Mehrdad, et autres
Publié: (2025)
ROVER: Recursive Reasoning Over Videos with Vision-Language Models for Embodied Tasks
par: Schroeder, Philip, et autres
Publié: (2025)
par: Schroeder, Philip, et autres
Publié: (2025)
Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models
par: Zhu, Yingjie, et autres
Publié: (2025)
par: Zhu, Yingjie, et autres
Publié: (2025)
Diving into Mitigating Hallucinations from a Vision Perspective for Large Vision-Language Models
par: Wang, Weihang, et autres
Publié: (2025)
par: Wang, Weihang, et autres
Publié: (2025)
EvolveNav: Empowering LLM-Based Vision-Language Navigation via Self-Improving Embodied Reasoning
par: Lin, Bingqian, et autres
Publié: (2025)
par: Lin, Bingqian, et autres
Publié: (2025)
PUMGPT: A Large Vision-Language Model for Product Understanding
par: Xue, Wei, et autres
Publié: (2023)
par: Xue, Wei, et autres
Publié: (2023)
Toward Interactive Regional Understanding in Vision-Large Language Models
par: Lee, Jungbeom, et autres
Publié: (2024)
par: Lee, Jungbeom, et autres
Publié: (2024)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
par: Wang, Xinyu, et autres
Publié: (2025)
par: Wang, Xinyu, et autres
Publié: (2025)
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
par: Lu, Jiaying, et autres
Publié: (2023)
par: Lu, Jiaying, et autres
Publié: (2023)
Centurio: On Drivers of Multilingual Ability of Large Vision-Language Model
par: Geigle, Gregor, et autres
Publié: (2025)
par: Geigle, Gregor, et autres
Publié: (2025)
An Explainable Biomedical Foundation Model via Large-Scale Concept-Enhanced Vision-Language Pre-training
par: Nie, Yuxiang, et autres
Publié: (2025)
par: Nie, Yuxiang, et autres
Publié: (2025)
Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking
par: Li, Jingru, et autres
Publié: (2026)
par: Li, Jingru, et autres
Publié: (2026)
PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
par: Xing, Long, et autres
Publié: (2024)
par: Xing, Long, et autres
Publié: (2024)
The Abstraction Gap in Vision-Language Causal Reasoning
par: Hoang, Chinh, et autres
Publié: (2026)
par: Hoang, Chinh, et autres
Publié: (2026)
NPHardEval4V: Dynamic Evaluation of Large Vision-Language Models with Effects of Vision
par: Li, Xiang, et autres
Publié: (2024)
par: Li, Xiang, et autres
Publié: (2024)
Correctable Landmark Discovery via Large Models for Vision-Language Navigation
par: Lin, Bingqian, et autres
Publié: (2024)
par: Lin, Bingqian, et autres
Publié: (2024)
Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models
par: Shao, Zhenwei, et autres
Publié: (2025)
par: Shao, Zhenwei, et autres
Publié: (2025)
Large Vision-Language Models for Remote Sensing Visual Question Answering
par: Siripong, Surasakdi, et autres
Publié: (2024)
par: Siripong, Surasakdi, et autres
Publié: (2024)
Documents similaires
-
CHEER-Ekman: Fine-grained Embodied Emotion Classification
par: Duong, Phan Anh, et autres
Publié: (2025) -
Do Emotions Influence Moral Judgment in Large Language Models?
par: Saim, Mohammad, et autres
Publié: (2026) -
Hierarchical Document Parsing via Large Margin Feature Matching and Heuristics
par: Kiet, Duong Anh
Publié: (2025) -
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
par: Yang, Rui, et autres
Publié: (2025) -
Evaluating Vision-Language Models for Emotion Recognition
par: Bhattacharyya, Sree, et autres
Publié: (2025)