Benchmarking Visual LLMs Resilience to Unanswerable Questions on Visually Rich Documents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Napolitano, Davide, Cagliero, Luca, Battiloro, Fabrizio |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VISREAS: Complex Visual Reasoning with Unanswerable Questions
par: Akter, Syeda Nahida, et autres
Publié: (2024)
par: Akter, Syeda Nahida, et autres
Publié: (2024)
MoHoBench: Assessing Honesty of Multimodal Large Language Models via Unanswerable Visual Questions
par: Zhu, Yanxu, et autres
Publié: (2025)
par: Zhu, Yanxu, et autres
Publié: (2025)
AD4AD: Benchmarking Visual Anomaly Detection Models for Safer Autonomous Driving
par: Genilotti, Fabrizio, et autres
Publié: (2026)
par: Genilotti, Fabrizio, et autres
Publié: (2026)
VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding
par: Ding, Yihao, et autres
Publié: (2025)
par: Ding, Yihao, et autres
Publié: (2025)
Hallucination Benchmark in Medical Visual Question Answering
par: Wu, Jinge, et autres
Publié: (2024)
par: Wu, Jinge, et autres
Publié: (2024)
VisionTrap: Unanswerable Questions On Visual Data
par: Saadat, Asir, et autres
Publié: (2025)
par: Saadat, Asir, et autres
Publié: (2025)
Wasserstein Equilibrium Decoding for Reliable Medical Visual Question Answering
par: Hagen, Luca, et autres
Publié: (2026)
par: Hagen, Luca, et autres
Publié: (2026)
VERSE: Visual Embedding Reduction and Space Exploration. Clustering-Guided Insights for Training Data Enhancement in Visually-Rich Document Understanding
par: de Rodrigo, Ignacio, et autres
Publié: (2026)
par: de Rodrigo, Ignacio, et autres
Publié: (2026)
Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI
par: Georgenthum, Hugo, et autres
Publié: (2025)
par: Georgenthum, Hugo, et autres
Publié: (2025)
Privacy-Aware Document Visual Question Answering
par: Tito, Rubèn, et autres
Publié: (2023)
par: Tito, Rubèn, et autres
Publié: (2023)
Automatic Layout Planning for Visually-Rich Documents with Instruction-Following Models
par: Zhu, Wanrong, et autres
Publié: (2024)
par: Zhu, Wanrong, et autres
Publié: (2024)
A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends
par: Ding, Yihao, et autres
Publié: (2025)
par: Ding, Yihao, et autres
Publié: (2025)
Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat
par: Xu, Pusheng, et autres
Publié: (2025)
par: Xu, Pusheng, et autres
Publié: (2025)
TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table Domains
par: Kim, Yoonsik, et autres
Publié: (2024)
par: Kim, Yoonsik, et autres
Publié: (2024)
Continual Visual Anomaly Detection on the Edge: Benchmark and Efficient Solutions
par: Barusco, Manuel, et autres
Publié: (2026)
par: Barusco, Manuel, et autres
Publié: (2026)
3MVRD: Multimodal Multi-task Multi-teacher Visually-Rich Form Document Understanding
par: Ding, Yihao, et autres
Publié: (2024)
par: Ding, Yihao, et autres
Publié: (2024)
DistilDoc: Knowledge Distillation for Visually-Rich Document Applications
par: Van Landeghem, Jordy, et autres
Publié: (2024)
par: Van Landeghem, Jordy, et autres
Publié: (2024)
WikiVQABench: A Knowledge-Grounded Visual Question Answering Benchmark from Wikipedia and Wikidata
par: Shbita, Basel, et autres
Publié: (2026)
par: Shbita, Basel, et autres
Publié: (2026)
VAD4Space: Visual Anomaly Detection for Planetary Surface Imagery
par: Genilotti, Fabrizio, et autres
Publié: (2026)
par: Genilotti, Fabrizio, et autres
Publié: (2026)
Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs
par: Sinha, Rohit, et autres
Publié: (2026)
par: Sinha, Rohit, et autres
Publié: (2026)
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
par: Xi, Suyang, et autres
Publié: (2026)
par: Xi, Suyang, et autres
Publié: (2026)
Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering
par: Ahir, Param, et autres
Publié: (2023)
par: Ahir, Param, et autres
Publié: (2023)
MedErr-CT: A Visual Question Answering Benchmark for Identifying and Correcting Errors in CT Reports
par: Kyung, Sunggu, et autres
Publié: (2025)
par: Kyung, Sunggu, et autres
Publié: (2025)
M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering
par: Ma, Jiatong, et autres
Publié: (2026)
par: Ma, Jiatong, et autres
Publié: (2026)
VoQA: Visual-only Question Answering
par: An, Jianing, et autres
Publié: (2025)
par: An, Jianing, et autres
Publié: (2025)
Object Attribute Matters in Visual Question Answering
par: Li, Peize, et autres
Publié: (2023)
par: Li, Peize, et autres
Publié: (2023)
BONES: a Benchmark fOr Neural Estimation of Shapley values
par: Napolitano, Davide, et autres
Publié: (2024)
par: Napolitano, Davide, et autres
Publié: (2024)
Enhancing Visual Question Answering through Question-Driven Image Captions as Prompts
par: Özdemir, Övgü, et autres
Publié: (2024)
par: Özdemir, Övgü, et autres
Publié: (2024)
TM-PATHVQA:90000+ Textless Multilingual Questions for Medical Visual Question Answering
par: Rajkhowa, Tonmoy, et autres
Publié: (2024)
par: Rajkhowa, Tonmoy, et autres
Publié: (2024)
V-REX: Benchmarking Exploratory Visual Reasoning via Chain-of-Questions
par: Fan, Chenrui, et autres
Publié: (2025)
par: Fan, Chenrui, et autres
Publié: (2025)
Saliency Guided Longitudinal Medical Visual Question Answering
par: Wu, Jialin, et autres
Publié: (2025)
par: Wu, Jialin, et autres
Publié: (2025)
Multi-Sourced Compositional Generalization in Visual Question Answering
par: Li, Chuanhao, et autres
Publié: (2025)
par: Li, Chuanhao, et autres
Publié: (2025)
Free Form Medical Visual Question Answering in Radiology
par: Narayanan, Abhishek, et autres
Publié: (2024)
par: Narayanan, Abhishek, et autres
Publié: (2024)
CHARTOM: A Visual Theory-of-Mind Benchmark for LLMs on Misleading Charts
par: Bharti, Shubham, et autres
Publié: (2024)
par: Bharti, Shubham, et autres
Publié: (2024)
VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes
par: Chen, Jingru, et autres
Publié: (2026)
par: Chen, Jingru, et autres
Publié: (2026)
Ask and Remember: A Questions-Only Replay Strategy for Continual Visual Question Answering
par: Marouf, Imad Eddine, et autres
Publié: (2025)
par: Marouf, Imad Eddine, et autres
Publié: (2025)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
par: Zhu, Fengbin, et autres
Publié: (2024)
par: Zhu, Fengbin, et autres
Publié: (2024)
VDocRAG: Retrieval-Augmented Generation over Visually-Rich Documents
par: Tanaka, Ryota, et autres
Publié: (2025)
par: Tanaka, Ryota, et autres
Publié: (2025)
CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark
par: Romero, David, et autres
Publié: (2024)
par: Romero, David, et autres
Publié: (2024)
DermaBench: A Clinician-Annotated Benchmark Dataset for Dermatology Visual Question Answering and Reasoning
par: Yilmaz, Abdurrahim, et autres
Publié: (2026)
par: Yilmaz, Abdurrahim, et autres
Publié: (2026)
Documents similaires
-
VISREAS: Complex Visual Reasoning with Unanswerable Questions
par: Akter, Syeda Nahida, et autres
Publié: (2024) -
MoHoBench: Assessing Honesty of Multimodal Large Language Models via Unanswerable Visual Questions
par: Zhu, Yanxu, et autres
Publié: (2025) -
AD4AD: Benchmarking Visual Anomaly Detection Models for Safer Autonomous Driving
par: Genilotti, Fabrizio, et autres
Publié: (2026) -
VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding
par: Ding, Yihao, et autres
Publié: (2025) -
Hallucination Benchmark in Medical Visual Question Answering
par: Wu, Jinge, et autres
Publié: (2024)