Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Xuan, Weihao, Zeng, Qingcheng, Qi, Heli, Wang, Junjue, Yokoya, Naoto |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery
por: Tsujimoto, Mai, et al.
Publicado: (2025)
por: Tsujimoto, Mai, et al.
Publicado: (2025)
DynamicVL: Benchmarking Multimodal Large Language Models for Dynamic City Understanding
por: Xuan, Weihao, et al.
Publicado: (2025)
por: Xuan, Weihao, et al.
Publicado: (2025)
Direction-aware 3D Large Multimodal Models
por: Liu, Quan, et al.
Publicado: (2026)
por: Liu, Quan, et al.
Publicado: (2026)
Foundation Models for Remote Sensing and Earth Observation: A Survey
por: Xiao, Aoran, et al.
Publicado: (2024)
por: Xiao, Aoran, et al.
Publicado: (2024)
DisasterM3: A Remote Sensing Vision-Language Dataset for Disaster Damage Assessment and Response
por: Wang, Junjue, et al.
Publicado: (2025)
por: Wang, Junjue, et al.
Publicado: (2025)
Segment Anything with Multiple Modalities
por: Xiao, Aoran, et al.
Publicado: (2024)
por: Xiao, Aoran, et al.
Publicado: (2024)
The Confidence Dichotomy: Analyzing and Mitigating Miscalibration in Tool-Use Agents
por: Xuan, Weihao, et al.
Publicado: (2026)
por: Xuan, Weihao, et al.
Publicado: (2026)
Experience-Driven Multi-Agent Systems Are Training-free Context-aware Earth Observers
por: Dai, Pengyu, et al.
Publicado: (2026)
por: Dai, Pengyu, et al.
Publicado: (2026)
SynRS3D: A Synthetic Dataset for Global 3D Semantic Understanding from Monocular Remote Sensing Imagery
por: Song, Jian, et al.
Publicado: (2024)
por: Song, Jian, et al.
Publicado: (2024)
Seeing is Believing? Enhancing Vision-Language Navigation using Visual Perturbations
por: Zhang, Xuesong, et al.
Publicado: (2024)
por: Zhang, Xuesong, et al.
Publicado: (2024)
Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models
por: Khan, Mohammed Safi Ur Rahman, et al.
Publicado: (2026)
por: Khan, Mohammed Safi Ur Rahman, et al.
Publicado: (2026)
Seeing is not Believing: An Identity Hider for Human Vision Privacy Protection
por: Wang, Tao, et al.
Publicado: (2023)
por: Wang, Tao, et al.
Publicado: (2023)
Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models
por: He, Zhentao, et al.
Publicado: (2025)
por: He, Zhentao, et al.
Publicado: (2025)
FrameOracle: Learning What to See and How Much to See in Videos
por: Li, Chaoyu, et al.
Publicado: (2025)
por: Li, Chaoyu, et al.
Publicado: (2025)
Seeing is Believing (and Predicting): Context-Aware Multi-Human Behavior Prediction with Vision Language Models
por: Panchal, Utsav, et al.
Publicado: (2025)
por: Panchal, Utsav, et al.
Publicado: (2025)
OpenEarth-Agent: From Tool Calling to Tool Creation for Open-Environment Earth Observation
por: Zhao, Sijie, et al.
Publicado: (2026)
por: Zhao, Sijie, et al.
Publicado: (2026)
SARLANG-1M: A Benchmark for Vision-Language Modeling in SAR Image Understanding
por: Wei, Yimin, et al.
Publicado: (2025)
por: Wei, Yimin, et al.
Publicado: (2025)
Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies
por: Hou, Wenjin, et al.
Publicado: (2026)
por: Hou, Wenjin, et al.
Publicado: (2026)
Object-Level Verbalized Confidence Calibration in Vision-Language Models via Semantic Perturbation
por: Zhao, Yunpu, et al.
Publicado: (2025)
por: Zhao, Yunpu, et al.
Publicado: (2025)
How Well Can Vision Language Models See Image Details?
por: Gou, Chenhui, et al.
Publicado: (2024)
por: Gou, Chenhui, et al.
Publicado: (2024)
Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding
por: Deng, Ailin, et al.
Publicado: (2024)
por: Deng, Ailin, et al.
Publicado: (2024)
Seeing is Believing: Robust Vision-Guided Cross-Modal Prompt Learning under Label Noise
por: Geng, Zibin, et al.
Publicado: (2026)
por: Geng, Zibin, et al.
Publicado: (2026)
CAT-SAM: Conditional Tuning for Few-Shot Adaptation of Segment Anything Model
por: Xiao, Aoran, et al.
Publicado: (2024)
por: Xiao, Aoran, et al.
Publicado: (2024)
Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs
por: Liu, Zhining, et al.
Publicado: (2025)
por: Liu, Zhining, et al.
Publicado: (2025)
Robust Self-Supervised Cross-Modal Super-Resolution against Real-World Misaligned Observations
por: Dong, Xiaoyu, et al.
Publicado: (2026)
por: Dong, Xiaoyu, et al.
Publicado: (2026)
MP-HSIR: A Multi-Prompt Framework for Universal Hyperspectral Image Restoration
por: Wu, Zhehui, et al.
Publicado: (2025)
por: Wu, Zhehui, et al.
Publicado: (2025)
Enhancing 3D LiDAR Segmentation by Shaping Dense and Accurate 2D Semantic Predictions
por: Dong, Xiaoyu, et al.
Publicado: (2026)
por: Dong, Xiaoyu, et al.
Publicado: (2026)
Believing is Seeing: Unobserved Object Detection using Generative Models
por: Bhattacharjee, Subhransu S., et al.
Publicado: (2024)
por: Bhattacharjee, Subhransu S., et al.
Publicado: (2024)
EmoCaliber: Advancing Reliable Visual Emotion Comprehension via Confidence Verbalization and Calibration
por: Wu, Daiqing, et al.
Publicado: (2025)
por: Wu, Daiqing, et al.
Publicado: (2025)
Seeing Isn't Always Believing: Analysis of Grad-CAM Faithfulness and Localization Reliability in Lung Cancer CT Classification
por: Panboonyuen, Teerapong
Publicado: (2026)
por: Panboonyuen, Teerapong
Publicado: (2026)
Unsupervised Domain Adaptation Architecture Search with Self-Training for Land Cover Mapping
por: Broni-Bediako, Clifford, et al.
Publicado: (2024)
por: Broni-Bediako, Clifford, et al.
Publicado: (2024)
Vision-Language Models Can't See the Obvious
por: Dahou, Yasser, et al.
Publicado: (2025)
por: Dahou, Yasser, et al.
Publicado: (2025)
Enhancing Monocular Height Estimation via Sparse LiDAR-Guided Correction
por: Song, Jian, et al.
Publicado: (2025)
por: Song, Jian, et al.
Publicado: (2025)
BRIGHT: A globally distributed multimodal building damage assessment dataset with very-high-resolution for all-weather disaster response
por: Chen, Hongruixuan, et al.
Publicado: (2025)
por: Chen, Hongruixuan, et al.
Publicado: (2025)
VLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes
por: Ling, Chen, et al.
Publicado: (2026)
por: Ling, Chen, et al.
Publicado: (2026)
Reading Is Believing: Revisiting Language Bottleneck Models for Image Classification
por: Udo, Honori, et al.
Publicado: (2024)
por: Udo, Honori, et al.
Publicado: (2024)
Local-to-Global Cross-Modal Attention-Aware Fusion for HSI-X Semantic Segmentation
por: Zhang, Xuming, et al.
Publicado: (2024)
por: Zhang, Xuming, et al.
Publicado: (2024)
V4d: voxel for 4d novel view synthesis
por: Gan, Wanshui, et al.
Publicado: (2022)
por: Gan, Wanshui, et al.
Publicado: (2022)
MM-OVSeg:Multimodal Optical-SAR Fusion for Open-Vocabulary Segmentation in Remote Sensing
por: Wei, Yimin, et al.
Publicado: (2026)
por: Wei, Yimin, et al.
Publicado: (2026)
Ejemplares similares
-
Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery
por: Tsujimoto, Mai, et al.
Publicado: (2025) -
DynamicVL: Benchmarking Multimodal Large Language Models for Dynamic City Understanding
por: Xuan, Weihao, et al.
Publicado: (2025) -
Direction-aware 3D Large Multimodal Models
por: Liu, Quan, et al.
Publicado: (2026) -
Foundation Models for Remote Sensing and Earth Observation: A Survey
por: Xiao, Aoran, et al.
Publicado: (2024) -
DisasterM3: A Remote Sensing Vision-Language Dataset for Disaster Damage Assessment and Response
por: Wang, Junjue, et al.
Publicado: (2025)