On the Cultural Anachronism and Temporal Reasoning in Vision Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Ranjan, Mukul, Jha, Prince, Kumari, Khushboo, Shen, Zhiqiang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Time Blindness: Why Video-Language Models Can't See What Humans Can?
von: Upadhyay, Ujjwal, et al.
Veröffentlicht: (2025)
von: Upadhyay, Ujjwal, et al.
Veröffentlicht: (2025)
Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning
von: Yu, Haorui, et al.
Veröffentlicht: (2025)
von: Yu, Haorui, et al.
Veröffentlicht: (2025)
Object Detection with Multimodal Large Vision-Language Models: An In-depth Review
von: Sapkota, Ranjan, et al.
Veröffentlicht: (2025)
von: Sapkota, Ranjan, et al.
Veröffentlicht: (2025)
Benchmarking Vision Language Models for Cultural Understanding
von: Nayak, Shravan, et al.
Veröffentlicht: (2024)
von: Nayak, Shravan, et al.
Veröffentlicht: (2024)
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
von: Li, Hongxing, et al.
Veröffentlicht: (2025)
von: Li, Hongxing, et al.
Veröffentlicht: (2025)
Cross-Cultural Value Awareness in Large Vision-Language Models
von: Howard, Phillip, et al.
Veröffentlicht: (2026)
von: Howard, Phillip, et al.
Veröffentlicht: (2026)
Reward Design for Physical Reasoning in Vision-Language Models
von: Lilienthal, Derek, et al.
Veröffentlicht: (2026)
von: Lilienthal, Derek, et al.
Veröffentlicht: (2026)
CultureVLM: Characterizing and Improving Cultural Understanding of Vision-Language Models for over 100 Countries
von: Liu, Shudong, et al.
Veröffentlicht: (2025)
von: Liu, Shudong, et al.
Veröffentlicht: (2025)
Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
von: Xiao, Wenyi, et al.
Veröffentlicht: (2025)
von: Xiao, Wenyi, et al.
Veröffentlicht: (2025)
Vision-Language Models under Cultural and Inclusive Considerations
von: Karamolegkou, Antonia, et al.
Veröffentlicht: (2024)
von: Karamolegkou, Antonia, et al.
Veröffentlicht: (2024)
Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning
von: Zhao, Bingchen, et al.
Veröffentlicht: (2024)
von: Zhao, Bingchen, et al.
Veröffentlicht: (2024)
VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning
von: Xiao, Wenyi, et al.
Veröffentlicht: (2026)
von: Xiao, Wenyi, et al.
Veröffentlicht: (2026)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
von: Jia, Mengdi, et al.
Veröffentlicht: (2025)
von: Jia, Mengdi, et al.
Veröffentlicht: (2025)
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
von: Wang, Ye, et al.
Veröffentlicht: (2025)
von: Wang, Ye, et al.
Veröffentlicht: (2025)
Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models
von: Qu, Kevin, et al.
Veröffentlicht: (2026)
von: Qu, Kevin, et al.
Veröffentlicht: (2026)
How Culturally Aware are Vision-Language Models?
von: Burda-Lassen, Olena, et al.
Veröffentlicht: (2024)
von: Burda-Lassen, Olena, et al.
Veröffentlicht: (2024)
Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models
von: Xiong, Guangzhi, et al.
Veröffentlicht: (2026)
von: Xiong, Guangzhi, et al.
Veröffentlicht: (2026)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
von: Chen, Qiguang, et al.
Veröffentlicht: (2026)
von: Chen, Qiguang, et al.
Veröffentlicht: (2026)
CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting
von: Pothiraj, Atin, et al.
Veröffentlicht: (2025)
von: Pothiraj, Atin, et al.
Veröffentlicht: (2025)
A Cognitive Evaluation Benchmark of Image Reasoning and Description for Large Vision-Language Models
von: Song, Xiujie, et al.
Veröffentlicht: (2024)
von: Song, Xiujie, et al.
Veröffentlicht: (2024)
Beyond Translation: Cross-Cultural Meme Transcreation with Vision-Language Models
von: Zhao, Yuming, et al.
Veröffentlicht: (2026)
von: Zhao, Yuming, et al.
Veröffentlicht: (2026)
Cultural Awareness in Vision-Language Models: A Cross-Country Exploration
von: Madasu, Avinash, et al.
Veröffentlicht: (2025)
von: Madasu, Avinash, et al.
Veröffentlicht: (2025)
Cross-Modal Safety Mechanism Transfer in Large Vision-Language Models
von: Xu, Shicheng, et al.
Veröffentlicht: (2024)
von: Xu, Shicheng, et al.
Veröffentlicht: (2024)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
von: Zhang, Beichen, et al.
Veröffentlicht: (2025)
von: Zhang, Beichen, et al.
Veröffentlicht: (2025)
Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly
von: Chetan, Aditya, et al.
Veröffentlicht: (2026)
von: Chetan, Aditya, et al.
Veröffentlicht: (2026)
A Hybrid Defense Strategy for Boosting Adversarial Robustness in Vision-Language Models
von: Liang, Yuhan, et al.
Veröffentlicht: (2024)
von: Liang, Yuhan, et al.
Veröffentlicht: (2024)
DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
von: Zou, Chengke, et al.
Veröffentlicht: (2024)
von: Zou, Chengke, et al.
Veröffentlicht: (2024)
How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning
von: Yang, Luyu, et al.
Veröffentlicht: (2026)
von: Yang, Luyu, et al.
Veröffentlicht: (2026)
G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
von: Hu, Wenbo, et al.
Veröffentlicht: (2025)
von: Hu, Wenbo, et al.
Veröffentlicht: (2025)
CityRiSE: Reasoning Urban Socio-Economic Status in Vision-Language Models via Reinforcement Learning
von: Liu, Tianhui, et al.
Veröffentlicht: (2025)
von: Liu, Tianhui, et al.
Veröffentlicht: (2025)
TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
von: Shangguan, Ziyao, et al.
Veröffentlicht: (2024)
von: Shangguan, Ziyao, et al.
Veröffentlicht: (2024)
SegSub: Evaluating Robustness to Knowledge Conflicts and Hallucinations in Vision-Language Models
von: Carragher, Peter, et al.
Veröffentlicht: (2025)
von: Carragher, Peter, et al.
Veröffentlicht: (2025)
HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning
von: Wang, Shenzhi, et al.
Veröffentlicht: (2026)
von: Wang, Shenzhi, et al.
Veröffentlicht: (2026)
MC-GPT: Empowering Vision-and-Language Navigation with Memory Map and Reasoning Chains
von: Zhan, Zhaohuan, et al.
Veröffentlicht: (2024)
von: Zhan, Zhaohuan, et al.
Veröffentlicht: (2024)
ROVER: Recursive Reasoning Over Videos with Vision-Language Models for Embodied Tasks
von: Schroeder, Philip, et al.
Veröffentlicht: (2025)
von: Schroeder, Philip, et al.
Veröffentlicht: (2025)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
von: Zhou, Chenyu, et al.
Veröffentlicht: (2024)
von: Zhou, Chenyu, et al.
Veröffentlicht: (2024)
NTSEBENCH: Cognitive Reasoning Benchmark for Vision Language Models
von: Pandya, Pranshu, et al.
Veröffentlicht: (2024)
von: Pandya, Pranshu, et al.
Veröffentlicht: (2024)
Understanding the Effects of Distractors on Reasoning Vision-Language Models
von: Bae, Jiyun, et al.
Veröffentlicht: (2025)
von: Bae, Jiyun, et al.
Veröffentlicht: (2025)
Survey on Vision-Language-Action Models
von: Adilkhanov, Adilzhan, et al.
Veröffentlicht: (2025)
von: Adilkhanov, Adilzhan, et al.
Veröffentlicht: (2025)
Revisiting the Role of Language Priors in Vision-Language Models
von: Lin, Zhiqiu, et al.
Veröffentlicht: (2023)
von: Lin, Zhiqiu, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Time Blindness: Why Video-Language Models Can't See What Humans Can?
von: Upadhyay, Ujjwal, et al.
Veröffentlicht: (2025) -
Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning
von: Yu, Haorui, et al.
Veröffentlicht: (2025) -
Object Detection with Multimodal Large Vision-Language Models: An In-depth Review
von: Sapkota, Ranjan, et al.
Veröffentlicht: (2025) -
Benchmarking Vision Language Models for Cultural Understanding
von: Nayak, Shravan, et al.
Veröffentlicht: (2024) -
SpatialLadder: Progressive Training for Spatial Reasoning in Vision-Language Models
von: Li, Hongxing, et al.
Veröffentlicht: (2025)