Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Imam, Mohamed Fazli, Lyu, Chenyang, Aji, Alham Fikri |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CLIP meets DINO for Tuning Zero-Shot Classifier using Unlabeled Image Collections
par: Imam, Mohamed Fazli, et autres
Publié: (2024)
par: Imam, Mohamed Fazli, et autres
Publié: (2024)
LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation
par: Irawan, Patrick Amadeus, et autres
Publié: (2026)
par: Irawan, Patrick Amadeus, et autres
Publié: (2026)
Vision Language Models are Confused Tourists
par: Irawan, Patrick Amadeus, et autres
Publié: (2025)
par: Irawan, Patrick Amadeus, et autres
Publié: (2025)
Beyond Probabilities: Unveiling the Misalignment in Evaluating Large Language Models
par: Lyu, Chenyang, et autres
Publié: (2024)
par: Lyu, Chenyang, et autres
Publié: (2024)
Rethinking the Mixture of Vision Encoders Paradigm for Enhanced Visual Understanding in Multimodal LLMs
par: Azadani, Mozhgan Nasr, et autres
Publié: (2025)
par: Azadani, Mozhgan Nasr, et autres
Publié: (2025)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
par: Jiang, Houcheng, et autres
Publié: (2026)
par: Jiang, Houcheng, et autres
Publié: (2026)
Maya: An Instruction Finetuned Multilingual Multimodal Model
par: Alam, Nahid, et autres
Publié: (2024)
par: Alam, Nahid, et autres
Publié: (2024)
LLMs Can Compensate for Deficiencies in Visual Representations
par: Takishita, Sho, et autres
Publié: (2025)
par: Takishita, Sho, et autres
Publié: (2025)
Multimodal LLMs Can Reason about Aesthetics in Zero-Shot
par: Jiang, Ruixiang, et autres
Publié: (2025)
par: Jiang, Ruixiang, et autres
Publié: (2025)
TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
par: Shangguan, Ziyao, et autres
Publié: (2024)
par: Shangguan, Ziyao, et autres
Publié: (2024)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
par: Wang, Xinyu, et autres
Publié: (2025)
par: Wang, Xinyu, et autres
Publié: (2025)
Understanding Alignment in Multimodal LLMs: A Comprehensive Study
par: Amirloo, Elmira, et autres
Publié: (2024)
par: Amirloo, Elmira, et autres
Publié: (2024)
Reinforcing Multimodal Reasoning Against Visual Degradation
par: Liu, Rui, et autres
Publié: (2026)
par: Liu, Rui, et autres
Publié: (2026)
Textual Steering Vectors Can Improve Visual Understanding in Multimodal Large Language Models
par: Gan, Woody Haosheng, et autres
Publié: (2025)
par: Gan, Woody Haosheng, et autres
Publié: (2025)
DaMO: A Data-Efficient Multimodal Orchestrator for Temporal Reasoning with Video LLMs
par: Chiu, Bo-Cheng, et autres
Publié: (2025)
par: Chiu, Bo-Cheng, et autres
Publié: (2025)
Can Multimodal LLMs See Materials Clearly? A Multimodal Benchmark on Materials Characterization
par: Lai, Zhengzhao, et autres
Publié: (2025)
par: Lai, Zhengzhao, et autres
Publié: (2025)
Selective Vision is the Challenge for Visual Reasoning: A Benchmark for Visual Argument Understanding
par: Chung, Jiwan, et autres
Publié: (2024)
par: Chung, Jiwan, et autres
Publié: (2024)
VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding
par: Li, Chaoyu, et autres
Publié: (2024)
par: Li, Chaoyu, et autres
Publié: (2024)
Hierarchical Multimodal Pre-training for Visually Rich Webpage Understanding
par: Xu, Hongshen, et autres
Publié: (2024)
par: Xu, Hongshen, et autres
Publié: (2024)
The Percept-V Challenge: Can Multimodal LLMs Crack Simple Perception Problems?
par: Ghosh, Samrajnee, et autres
Publié: (2025)
par: Ghosh, Samrajnee, et autres
Publié: (2025)
CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs
par: Wang, Zirui, et autres
Publié: (2024)
par: Wang, Zirui, et autres
Publié: (2024)
Hanfu-Bench: A Multimodal Benchmark on Cross-Temporal Cultural Understanding and Transcreation
par: Zhou, Li, et autres
Publié: (2025)
par: Zhou, Li, et autres
Publié: (2025)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
par: Wang, Weiyun, et autres
Publié: (2025)
par: Wang, Weiyun, et autres
Publié: (2025)
LoraxBench: A Multitask, Multilingual Benchmark Suite for 20 Indonesian Languages
par: Aji, Alham Fikri, et autres
Publié: (2025)
par: Aji, Alham Fikri, et autres
Publié: (2025)
Towards Perceiving Small Visual Details in Zero-shot Visual Question Answering with Multimodal LLMs
par: Zhang, Jiarui, et autres
Publié: (2023)
par: Zhang, Jiarui, et autres
Publié: (2023)
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
par: Cheng, Zihui, et autres
Publié: (2025)
par: Cheng, Zihui, et autres
Publié: (2025)
RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
par: Li, Jiaang, et autres
Publié: (2025)
par: Li, Jiaang, et autres
Publié: (2025)
Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding
par: Wang, Zhaokai, et autres
Publié: (2025)
par: Wang, Zhaokai, et autres
Publié: (2025)
Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding
par: Li, Yun, et autres
Publié: (2025)
par: Li, Yun, et autres
Publié: (2025)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
par: Zhang, Huanyu, et autres
Publié: (2025)
par: Zhang, Huanyu, et autres
Publié: (2025)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
par: Shi, Weikang, et autres
Publié: (2025)
par: Shi, Weikang, et autres
Publié: (2025)
v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
par: Chung, Jiwan, et autres
Publié: (2025)
par: Chung, Jiwan, et autres
Publié: (2025)
M4U: Evaluating Multilingual Understanding and Reasoning for Large Multimodal Models
par: Wang, Hongyu, et autres
Publié: (2024)
par: Wang, Hongyu, et autres
Publié: (2024)
MME-Finance: A Multimodal Finance Benchmark for Expert-level Understanding and Reasoning
par: Gan, Ziliang, et autres
Publié: (2024)
par: Gan, Ziliang, et autres
Publié: (2024)
ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction
par: Guo, Zichun, et autres
Publié: (2026)
par: Guo, Zichun, et autres
Publié: (2026)
Can Vision Language Models Learn from Visual Demonstrations of Ambiguous Spatial Reasoning?
par: Zhao, Bowen, et autres
Publié: (2024)
par: Zhao, Bowen, et autres
Publié: (2024)
VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
par: Cheng, Zesen, et autres
Publié: (2024)
par: Cheng, Zesen, et autres
Publié: (2024)
Edited Media Understanding Frames: Reasoning About the Intent and Implications of Visual Misinformation
par: Da, Jeff, et autres
Publié: (2020)
par: Da, Jeff, et autres
Publié: (2020)
TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity
par: Yang, Zheyuan, et autres
Publié: (2026)
par: Yang, Zheyuan, et autres
Publié: (2026)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
par: Ma, David, et autres
Publié: (2025)
par: Ma, David, et autres
Publié: (2025)
Documents similaires
-
CLIP meets DINO for Tuning Zero-Shot Classifier using Unlabeled Image Collections
par: Imam, Mohamed Fazli, et autres
Publié: (2024) -
LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation
par: Irawan, Patrick Amadeus, et autres
Publié: (2026) -
Vision Language Models are Confused Tourists
par: Irawan, Patrick Amadeus, et autres
Publié: (2025) -
Beyond Probabilities: Unveiling the Misalignment in Evaluating Large Language Models
par: Lyu, Chenyang, et autres
Publié: (2024) -
Rethinking the Mixture of Vision Encoders Paradigm for Enhanced Visual Understanding in Multimodal LLMs
par: Azadani, Mozhgan Nasr, et autres
Publié: (2025)