Gespeichert in:
| Hauptverfasser: | Wang, Kangkang, Jiang, Qinting, Zhang, Wanping, Ren, Bowen, Wen, Shengzhao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2605.03485 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning
von: Zhao, Bingchen, et al.
Veröffentlicht: (2024)
von: Zhao, Bingchen, et al.
Veröffentlicht: (2024)
Prompting Large Vision-Language Models for Compositional Reasoning
von: Ossowski, Timothy, et al.
Veröffentlicht: (2024)
von: Ossowski, Timothy, et al.
Veröffentlicht: (2024)
MoETTA: Test-Time Adaptation Under Mixed Distribution Shifts with MoE-LayerNorm
von: Fan, Xiao, et al.
Veröffentlicht: (2025)
von: Fan, Xiao, et al.
Veröffentlicht: (2025)
IDEATOR: Jailbreaking and Benchmarking Large Vision-Language Models Using Themselves
von: Wang, Ruofan, et al.
Veröffentlicht: (2024)
von: Wang, Ruofan, et al.
Veröffentlicht: (2024)
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
von: Wang, Sibo, et al.
Veröffentlicht: (2024)
von: Wang, Sibo, et al.
Veröffentlicht: (2024)
Multimodal Causal Reasoning Benchmark: Challenging Vision Large Language Models to Discern Causal Links Across Modalities
von: Li, Zhiyuan, et al.
Veröffentlicht: (2024)
von: Li, Zhiyuan, et al.
Veröffentlicht: (2024)
Perception Before Reasoning: Two-Stage Reinforcement Learning for Visual Reasoning in Vision-Language Models
von: Chen, Yan, et al.
Veröffentlicht: (2025)
von: Chen, Yan, et al.
Veröffentlicht: (2025)
A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
von: Jiang, Siyang, et al.
Veröffentlicht: (2025)
von: Jiang, Siyang, et al.
Veröffentlicht: (2025)
Aligning Vision Models with Human Aesthetics in Retrieval: Benchmarks and Algorithms
von: Zhang, Miaosen, et al.
Veröffentlicht: (2024)
von: Zhang, Miaosen, et al.
Veröffentlicht: (2024)
MIRAGE: A Multi-modal Benchmark for Spatial Perception, Reasoning, and Intelligence
von: Liu, Chonghan, et al.
Veröffentlicht: (2025)
von: Liu, Chonghan, et al.
Veröffentlicht: (2025)
GranViT: A Fine-Grained Vision Model With Autoregressive Perception For MLLMs
von: Zheng, Guanghao, et al.
Veröffentlicht: (2025)
von: Zheng, Guanghao, et al.
Veröffentlicht: (2025)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
von: Tian, Kexin, et al.
Veröffentlicht: (2025)
von: Tian, Kexin, et al.
Veröffentlicht: (2025)
ReasonEdit: Editing Vision-Language Models using Human Reasoning
von: Qiu, Jiaxing, et al.
Veröffentlicht: (2026)
von: Qiu, Jiaxing, et al.
Veröffentlicht: (2026)
The Illusion of Clinical Reasoning: A Benchmark Reveals the Pervasive Gap in Vision-Language Models for Clinical Competency
von: Wang, Dingyu, et al.
Veröffentlicht: (2025)
von: Wang, Dingyu, et al.
Veröffentlicht: (2025)
VLAgeBench: Benchmarking Large Vision-Language Models for Zero-Shot Human Age Estimation
von: Sajib, Rakib Hossain, et al.
Veröffentlicht: (2026)
von: Sajib, Rakib Hossain, et al.
Veröffentlicht: (2026)
Bad Seeing or Bad Thinking? Rewarding Perception for Vision-Language Reasoning
von: Wang, Haozhe, et al.
Veröffentlicht: (2026)
von: Wang, Haozhe, et al.
Veröffentlicht: (2026)
MVP-Bench: Can Large Vision--Language Models Conduct Multi-level Visual Perception Like Humans?
von: Li, Guanzhen, et al.
Veröffentlicht: (2024)
von: Li, Guanzhen, et al.
Veröffentlicht: (2024)
A Cognitive Evaluation Benchmark of Image Reasoning and Description for Large Vision-Language Models
von: Song, Xiujie, et al.
Veröffentlicht: (2024)
von: Song, Xiujie, et al.
Veröffentlicht: (2024)
SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models
von: Zhong, Chen, et al.
Veröffentlicht: (2026)
von: Zhong, Chen, et al.
Veröffentlicht: (2026)
SUREON: A Benchmark and Vision-Language-Model for Surgical Reasoning
von: Perez, Alejandra, et al.
Veröffentlicht: (2026)
von: Perez, Alejandra, et al.
Veröffentlicht: (2026)
VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing
von: Luo, Zhiming, et al.
Veröffentlicht: (2026)
von: Luo, Zhiming, et al.
Veröffentlicht: (2026)
AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?
von: Bao, Han, et al.
Veröffentlicht: (2024)
von: Bao, Han, et al.
Veröffentlicht: (2024)
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
von: Yuan, Botai, et al.
Veröffentlicht: (2025)
von: Yuan, Botai, et al.
Veröffentlicht: (2025)
Feature-Based Instance Neighbor Discovery: Advanced Stable Test-Time Adaptation in Dynamic World
von: Jiang, Qinting, et al.
Veröffentlicht: (2025)
von: Jiang, Qinting, et al.
Veröffentlicht: (2025)
Beyond Static Artifacts: A Forensic Benchmark for Video Deepfake Reasoning in Vision Language Models
von: Gu, Zheyuan, et al.
Veröffentlicht: (2026)
von: Gu, Zheyuan, et al.
Veröffentlicht: (2026)
VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting
von: Lee, Daeun, et al.
Veröffentlicht: (2026)
von: Lee, Daeun, et al.
Veröffentlicht: (2026)
Discover Your Neighbors: Advanced Stable Test-Time Adaptation in Dynamic World
von: Jiang, Qinting, et al.
Veröffentlicht: (2024)
von: Jiang, Qinting, et al.
Veröffentlicht: (2024)
CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models
von: Li, Jingyao, et al.
Veröffentlicht: (2025)
von: Li, Jingyao, et al.
Veröffentlicht: (2025)
Benchmarking and Mitigating Sycophancy in Medical Vision Language Models
von: Xu, Juangui, et al.
Veröffentlicht: (2025)
von: Xu, Juangui, et al.
Veröffentlicht: (2025)
FRIEDA: Benchmarking Multi-Step Cartographic Reasoning in Vision-Language Models
von: Pyo, Jiyoon, et al.
Veröffentlicht: (2025)
von: Pyo, Jiyoon, et al.
Veröffentlicht: (2025)
Explaining Multi-modal Large Language Models by Analyzing their Vision Perception
von: Giulivi, Loris, et al.
Veröffentlicht: (2024)
von: Giulivi, Loris, et al.
Veröffentlicht: (2024)
Improve Vision Language Model Chain-of-thought Reasoning
von: Zhang, Ruohong, et al.
Veröffentlicht: (2024)
von: Zhang, Ruohong, et al.
Veröffentlicht: (2024)
Measuring the Measurers: Quality Evaluation of Hallucination Benchmarks for Large Vision-Language Models
von: Yan, Bei, et al.
Veröffentlicht: (2024)
von: Yan, Bei, et al.
Veröffentlicht: (2024)
MM-IQ: Benchmarking Human-Like Abstraction and Reasoning in Multimodal Models
von: Cai, Huanqia, et al.
Veröffentlicht: (2025)
von: Cai, Huanqia, et al.
Veröffentlicht: (2025)
Do Vision-Language Models See Urban Scenes as People Do? An Urban Perception Benchmark
von: Mushkani, Rashid
Veröffentlicht: (2025)
von: Mushkani, Rashid
Veröffentlicht: (2025)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
von: Jia, Mengdi, et al.
Veröffentlicht: (2025)
von: Jia, Mengdi, et al.
Veröffentlicht: (2025)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
von: Chen, Qiguang, et al.
Veröffentlicht: (2026)
von: Chen, Qiguang, et al.
Veröffentlicht: (2026)
DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models
von: Pan, Chenbin, et al.
Veröffentlicht: (2025)
von: Pan, Chenbin, et al.
Veröffentlicht: (2025)
CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
von: Cai, Jie, et al.
Veröffentlicht: (2025)
von: Cai, Jie, et al.
Veröffentlicht: (2025)
COSMIC: Clique-Oriented Semantic Multi-space Integration for Robust CLIP Test-Time Adaptation
von: Huang, Fanding, et al.
Veröffentlicht: (2025)
von: Huang, Fanding, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning
von: Zhao, Bingchen, et al.
Veröffentlicht: (2024) -
Prompting Large Vision-Language Models for Compositional Reasoning
von: Ossowski, Timothy, et al.
Veröffentlicht: (2024) -
MoETTA: Test-Time Adaptation Under Mixed Distribution Shifts with MoE-LayerNorm
von: Fan, Xiao, et al.
Veröffentlicht: (2025) -
IDEATOR: Jailbreaking and Benchmarking Large Vision-Language Models Using Themselves
von: Wang, Ruofan, et al.
Veröffentlicht: (2024) -
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
von: Wang, Sibo, et al.
Veröffentlicht: (2024)