GTR-Bench: Evaluating Geo-Temporal Reasoning in Vision-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Xie, Qinghongbing, Xia, Zhaoyuan, Zhu, Feng, Gong, Lijun, Li, Ziyue, Zhao, Rui, Zeng, Long |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DSM: Constructing a Diverse Semantic Map for 3D Visual Grounding
von: Xie, Qinghongbing, et al.
Veröffentlicht: (2025)
von: Xie, Qinghongbing, et al.
Veröffentlicht: (2025)
TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
von: Zhang, Junyi, et al.
Veröffentlicht: (2025)
von: Zhang, Junyi, et al.
Veröffentlicht: (2025)
Imaginarium: Vision-guided High-Quality 3D Scene Layout Generation
von: Zhu, Xiaoming, et al.
Veröffentlicht: (2025)
von: Zhu, Xiaoming, et al.
Veröffentlicht: (2025)
Language-Instructed Reasoning for Group Activity Detection via Multimodal Large Language Model
von: Peng, Jihua, et al.
Veröffentlicht: (2025)
von: Peng, Jihua, et al.
Veröffentlicht: (2025)
GeoArena: Evaluating Open-World Geographic Reasoning in Large Vision-Language Models
von: Jia, Pengyue, et al.
Veröffentlicht: (2025)
von: Jia, Pengyue, et al.
Veröffentlicht: (2025)
SimLabel: Consistency-Guided OOD Detection with Pretrained Vision-Language Models
von: Zou, Shu, et al.
Veröffentlicht: (2025)
von: Zou, Shu, et al.
Veröffentlicht: (2025)
LocateBench: Evaluating the Locating Ability of Vision Language Models
von: Chiang, Ting-Rui, et al.
Veröffentlicht: (2024)
von: Chiang, Ting-Rui, et al.
Veröffentlicht: (2024)
Identifying and Mitigating Position Bias of Multi-image Vision-Language Models
von: Tian, Xinyu, et al.
Veröffentlicht: (2025)
von: Tian, Xinyu, et al.
Veröffentlicht: (2025)
ArGue: Attribute-Guided Prompt Tuning for Vision-Language Models
von: Tian, Xinyu, et al.
Veröffentlicht: (2023)
von: Tian, Xinyu, et al.
Veröffentlicht: (2023)
Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models
von: Shi, Enyi, et al.
Veröffentlicht: (2026)
von: Shi, Enyi, et al.
Veröffentlicht: (2026)
Med-StepBench: A Hierarchical Reasoning Framework for Evaluating Hallucinations in Medical Vision-Language Models
von: Nguyen, Minh Khoi, et al.
Veröffentlicht: (2026)
von: Nguyen, Minh Khoi, et al.
Veröffentlicht: (2026)
GeoR-Bench: Evaluating Geoscience Visual Reasoning
von: Zheng, Yushuo, et al.
Veröffentlicht: (2026)
von: Zheng, Yushuo, et al.
Veröffentlicht: (2026)
SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models
von: Xie, Yuechen, et al.
Veröffentlicht: (2026)
von: Xie, Yuechen, et al.
Veröffentlicht: (2026)
Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models
von: Chen, Yan, et al.
Veröffentlicht: (2025)
von: Chen, Yan, et al.
Veröffentlicht: (2025)
Temporal Contrastive Learning for Video Temporal Reasoning in Large Vision-Language Models
von: Souza, Rafael, et al.
Veröffentlicht: (2024)
von: Souza, Rafael, et al.
Veröffentlicht: (2024)
PathReasoner-R1: Instilling Structured Reasoning into Pathology Vision-Language Model via Knowledge-Guided Policy Optimization
von: Jiang, Songhan, et al.
Veröffentlicht: (2026)
von: Jiang, Songhan, et al.
Veröffentlicht: (2026)
GeoReasoner: Geo-localization with Reasoning in Street Views using a Large Vision-Language Model
von: Li, Ling, et al.
Veröffentlicht: (2024)
von: Li, Ling, et al.
Veröffentlicht: (2024)
More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models
von: Tian, Xinyu, et al.
Veröffentlicht: (2025)
von: Tian, Xinyu, et al.
Veröffentlicht: (2025)
ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models
von: Xue, Kaiwen, et al.
Veröffentlicht: (2026)
von: Xue, Kaiwen, et al.
Veröffentlicht: (2026)
DrVD-Bench: Do Vision-Language Models Reason Like Human Doctors in Medical Image Diagnosis?
von: Zhou, Tianhong, et al.
Veröffentlicht: (2025)
von: Zhou, Tianhong, et al.
Veröffentlicht: (2025)
VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models
von: Ren, Yufan, et al.
Veröffentlicht: (2025)
von: Ren, Yufan, et al.
Veröffentlicht: (2025)
GeoBench: Rethinking Multimodal Geometric Problem-Solving via Hierarchical Evaluation
von: Feng, Yuan, et al.
Veröffentlicht: (2025)
von: Feng, Yuan, et al.
Veröffentlicht: (2025)
CoSpace: Benchmarking Continuous Space Perception Ability for Vision-Language Models
von: Zhu, Yiqi, et al.
Veröffentlicht: (2025)
von: Zhu, Yiqi, et al.
Veröffentlicht: (2025)
All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models
von: Tian, Xinyu, et al.
Veröffentlicht: (2026)
von: Tian, Xinyu, et al.
Veröffentlicht: (2026)
IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering
von: Liu, Parker, et al.
Veröffentlicht: (2025)
von: Liu, Parker, et al.
Veröffentlicht: (2025)
Re-Aligning Language to Visual Objects with an Agentic Workflow
von: Chen, Yuming, et al.
Veröffentlicht: (2025)
von: Chen, Yuming, et al.
Veröffentlicht: (2025)
UKnow: A Unified Knowledge Protocol with Multimodal Knowledge Graph Datasets for Reasoning and Vision-Language Pre-Training
von: Gong, Biao, et al.
Veröffentlicht: (2023)
von: Gong, Biao, et al.
Veröffentlicht: (2023)
CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
von: Cai, Jie, et al.
Veröffentlicht: (2025)
von: Cai, Jie, et al.
Veröffentlicht: (2025)
Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery
von: Tsujimoto, Mai, et al.
Veröffentlicht: (2025)
von: Tsujimoto, Mai, et al.
Veröffentlicht: (2025)
AgroBench: Vision-Language Model Benchmark in Agriculture
von: Shinoda, Risa, et al.
Veröffentlicht: (2025)
von: Shinoda, Risa, et al.
Veröffentlicht: (2025)
VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?
von: Liu, Qing'an, et al.
Veröffentlicht: (2026)
von: Liu, Qing'an, et al.
Veröffentlicht: (2026)
GTR: Improving Large 3D Reconstruction Models through Geometry and Texture Refinement
von: Zhuang, Peiye, et al.
Veröffentlicht: (2024)
von: Zhuang, Peiye, et al.
Veröffentlicht: (2024)
TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models
von: Chen, Junzhe, et al.
Veröffentlicht: (2026)
von: Chen, Junzhe, et al.
Veröffentlicht: (2026)
ST-VLM: Kinematic Instruction Tuning for Spatio-Temporal Reasoning in Vision-Language Models
von: Ko, Dohwan, et al.
Veröffentlicht: (2025)
von: Ko, Dohwan, et al.
Veröffentlicht: (2025)
NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples
von: Li, Baiqi, et al.
Veröffentlicht: (2024)
von: Li, Baiqi, et al.
Veröffentlicht: (2024)
Heron-Bench: A Benchmark for Evaluating Vision Language Models in Japanese
von: Inoue, Yuichi, et al.
Veröffentlicht: (2024)
von: Inoue, Yuichi, et al.
Veröffentlicht: (2024)
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
von: Yasunaga, Michihiro, et al.
Veröffentlicht: (2025)
von: Yasunaga, Michihiro, et al.
Veröffentlicht: (2025)
FinChart-Bench: Benchmarking Financial Chart Comprehension in Vision-Language Models
von: Shu, Dong, et al.
Veröffentlicht: (2025)
von: Shu, Dong, et al.
Veröffentlicht: (2025)
ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models
von: Liu, Hongbo, et al.
Veröffentlicht: (2025)
von: Liu, Hongbo, et al.
Veröffentlicht: (2025)
Structured Video-Language Modeling with Temporal Grouping and Spatial Grounding
von: Xiong, Yuanhao, et al.
Veröffentlicht: (2023)
von: Xiong, Yuanhao, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
DSM: Constructing a Diverse Semantic Map for 3D Visual Grounding
von: Xie, Qinghongbing, et al.
Veröffentlicht: (2025) -
TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models
von: Zhang, Junyi, et al.
Veröffentlicht: (2025) -
Imaginarium: Vision-guided High-Quality 3D Scene Layout Generation
von: Zhu, Xiaoming, et al.
Veröffentlicht: (2025) -
Language-Instructed Reasoning for Group Activity Detection via Multimodal Large Language Model
von: Peng, Jihua, et al.
Veröffentlicht: (2025) -
GeoArena: Evaluating Open-World Geographic Reasoning in Large Vision-Language Models
von: Jia, Pengyue, et al.
Veröffentlicht: (2025)