RGB-Th-Bench: A Dense benchmark for Visual-Thermal Understanding of Vision Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Moshtaghi, Mehdi, Khajavi, Siavash H., Pajarinen, Joni |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ReadBench: Measuring the Dense Text Visual Reading Ability of Vision-Language Models
di: Clavié, Benjamin, et al.
Pubblicazione: (2025)
di: Clavié, Benjamin, et al.
Pubblicazione: (2025)
Object-Centric Vision Token Pruning for Vision Language Models
di: Li, Guangyuan, et al.
Pubblicazione: (2025)
di: Li, Guangyuan, et al.
Pubblicazione: (2025)
Rethinking Temporal Consistency in Video Object-Centric Learning: From Prediction to Correspondence
di: Li, Zhiyuan, et al.
Pubblicazione: (2026)
di: Li, Zhiyuan, et al.
Pubblicazione: (2026)
UniBench: Visual Reasoning Requires Rethinking Vision-Language Beyond Scaling
di: Al-Tahan, Haider, et al.
Pubblicazione: (2024)
di: Al-Tahan, Haider, et al.
Pubblicazione: (2024)
AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models
di: Mai, Zheda, et al.
Pubblicazione: (2025)
di: Mai, Zheda, et al.
Pubblicazione: (2025)
IndicVisionBench: Benchmarking Cultural and Multilingual Understanding in VLMs
di: Faraz, Ali, et al.
Pubblicazione: (2025)
di: Faraz, Ali, et al.
Pubblicazione: (2025)
BenchReAD: A systematic benchmark for retinal anomaly detection
di: Lian, Chenyu, et al.
Pubblicazione: (2025)
di: Lian, Chenyu, et al.
Pubblicazione: (2025)
DAVE: Diagnostic benchmark for Audio Visual Evaluation
di: Radevski, Gorjan, et al.
Pubblicazione: (2025)
di: Radevski, Gorjan, et al.
Pubblicazione: (2025)
PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding
di: Chow, Wei, et al.
Pubblicazione: (2025)
di: Chow, Wei, et al.
Pubblicazione: (2025)
ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
di: Lee, Jewon, et al.
Pubblicazione: (2025)
di: Lee, Jewon, et al.
Pubblicazione: (2025)
Jailbreaking Vision-Language Models Through the Visual Modality
di: Azulay, Aharon, et al.
Pubblicazione: (2026)
di: Azulay, Aharon, et al.
Pubblicazione: (2026)
Understanding Retrieval-Augmented Task Adaptation for Vision-Language Models
di: Ming, Yifei, et al.
Pubblicazione: (2024)
di: Ming, Yifei, et al.
Pubblicazione: (2024)
DistortBench: Benchmarking Vision Language Models on Image Distortion Identification
di: Goyal, Divyanshu, et al.
Pubblicazione: (2026)
di: Goyal, Divyanshu, et al.
Pubblicazione: (2026)
Patronus: Interpretable Diffusion Models with Prototypes
di: Weng, Nina, et al.
Pubblicazione: (2025)
di: Weng, Nina, et al.
Pubblicazione: (2025)
Composition Vision-Language Understanding via Segment and Depth Anything Model
di: Huo, Mingxiao, et al.
Pubblicazione: (2024)
di: Huo, Mingxiao, et al.
Pubblicazione: (2024)
NeuroVLM-Bench: Evaluation of Vision-Enabled Large Language Models for Clinical Reasoning in Neurological Disorders
di: Dineva, Katarina Trojachanec, et al.
Pubblicazione: (2026)
di: Dineva, Katarina Trojachanec, et al.
Pubblicazione: (2026)
Synthetic imagery for fuzzy object detection: A comparative study
di: Khajavi, Siavash H., et al.
Pubblicazione: (2024)
di: Khajavi, Siavash H., et al.
Pubblicazione: (2024)
Scaling Laws for Robust Comparison of Open Foundation Language-Vision Models and Datasets
di: Nezhurina, Marianna, et al.
Pubblicazione: (2025)
di: Nezhurina, Marianna, et al.
Pubblicazione: (2025)
Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking
di: Yang, Jingcheng, et al.
Pubblicazione: (2026)
di: Yang, Jingcheng, et al.
Pubblicazione: (2026)
ThermEval: A Structured Benchmark for Evaluation of Vision-Language Models on Thermal Imagery
di: Shrivastava, Ayush, et al.
Pubblicazione: (2026)
di: Shrivastava, Ayush, et al.
Pubblicazione: (2026)
Break the Visual Perception: Adversarial Attacks Targeting Encoded Visual Tokens of Large Vision-Language Models
di: Wang, Yubo, et al.
Pubblicazione: (2024)
di: Wang, Yubo, et al.
Pubblicazione: (2024)
Understanding Visual Concepts Across Models
di: Trabucco, Brandon, et al.
Pubblicazione: (2024)
di: Trabucco, Brandon, et al.
Pubblicazione: (2024)
VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes
di: Gavrikov, Paul, et al.
Pubblicazione: (2025)
di: Gavrikov, Paul, et al.
Pubblicazione: (2025)
Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models
di: Ghosh, Dhruba, et al.
Pubblicazione: (2026)
di: Ghosh, Dhruba, et al.
Pubblicazione: (2026)
BiPrompt: Bilateral Prompt Optimization for Visual and Textual Debiasing in Vision-Language Models
di: Gupta, Sunny, et al.
Pubblicazione: (2026)
di: Gupta, Sunny, et al.
Pubblicazione: (2026)
Retrieval Visual Contrastive Decoding to Mitigate Object Hallucinations in Large Vision-Language Models
di: Lee, Jihoon, et al.
Pubblicazione: (2025)
di: Lee, Jihoon, et al.
Pubblicazione: (2025)
Visual Modality Prompt for Adapting Vision-Language Object Detectors
di: Medeiros, Heitor R., et al.
Pubblicazione: (2024)
di: Medeiros, Heitor R., et al.
Pubblicazione: (2024)
The Underappreciated Power of Vision Models for Graph Structural Understanding
di: Zhao, Xinjian, et al.
Pubblicazione: (2025)
di: Zhao, Xinjian, et al.
Pubblicazione: (2025)
Understanding the Effects of Distractors on Reasoning Vision-Language Models
di: Bae, Jiyun, et al.
Pubblicazione: (2025)
di: Bae, Jiyun, et al.
Pubblicazione: (2025)
CaTS-Bench: Can Language Models Describe Time Series?
di: Zhou, Luca, et al.
Pubblicazione: (2025)
di: Zhou, Luca, et al.
Pubblicazione: (2025)
The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design
di: Liu, Anjie, et al.
Pubblicazione: (2026)
di: Liu, Anjie, et al.
Pubblicazione: (2026)
Toward an Artificial General Teacher: Procedural Geometry Data Generation and Visual Grounding with Vision-Language Models
di: Nguyen-Truong, Hai, et al.
Pubblicazione: (2026)
di: Nguyen-Truong, Hai, et al.
Pubblicazione: (2026)
The Hidden Life of Tokens: Reducing Hallucination of Large Vision-Language Models via Visual Information Steering
di: Li, Zhuowei, et al.
Pubblicazione: (2025)
di: Li, Zhuowei, et al.
Pubblicazione: (2025)
TopoPerception: A Shortcut-Free Evaluation of Global Visual Perception in Large Vision-Language Models
di: Zhou, Wenhao, et al.
Pubblicazione: (2025)
di: Zhou, Wenhao, et al.
Pubblicazione: (2025)
Application of Vision-Language Model to Pedestrians Behavior and Scene Understanding in Autonomous Driving
di: Gao, Haoxiang, et al.
Pubblicazione: (2025)
di: Gao, Haoxiang, et al.
Pubblicazione: (2025)
Decoupling Amplitude and Phase Attention in Frequency Domain for RGB-Event based Visual Object Tracking
di: Wang, Shiao, et al.
Pubblicazione: (2026)
di: Wang, Shiao, et al.
Pubblicazione: (2026)
DetectiumFire: A Comprehensive Multi-modal Dataset Bridging Vision and Language for Fire Understanding
di: Liu, Zixuan, et al.
Pubblicazione: (2025)
di: Liu, Zixuan, et al.
Pubblicazione: (2025)
PlantVillageVQA: A Visual Question Answering Dataset for Benchmarking Vision-Language Models in Plant Science
di: Sakib, Syed Nazmus, et al.
Pubblicazione: (2025)
di: Sakib, Syed Nazmus, et al.
Pubblicazione: (2025)
Jodi: Unification of Visual Generation and Understanding via Joint Modeling
di: Xu, Yifeng, et al.
Pubblicazione: (2025)
di: Xu, Yifeng, et al.
Pubblicazione: (2025)
Do Language Models Understand Time?
di: Ding, Xi, et al.
Pubblicazione: (2024)
di: Ding, Xi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ReadBench: Measuring the Dense Text Visual Reading Ability of Vision-Language Models
di: Clavié, Benjamin, et al.
Pubblicazione: (2025) -
Object-Centric Vision Token Pruning for Vision Language Models
di: Li, Guangyuan, et al.
Pubblicazione: (2025) -
Rethinking Temporal Consistency in Video Object-Centric Learning: From Prediction to Correspondence
di: Li, Zhiyuan, et al.
Pubblicazione: (2026) -
UniBench: Visual Reasoning Requires Rethinking Vision-Language Beyond Scaling
di: Al-Tahan, Haider, et al.
Pubblicazione: (2024) -
AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models
di: Mai, Zheda, et al.
Pubblicazione: (2025)