Illusory VQA: Benchmarking and Enhancing Multimodal Models on Visual Illusions
Fuente:
arXiv
Salvato in:
| Autori principali: | Rostamkhani, Mohammadmostafa, Ansari, Baktash, Sabzevari, Hoorieh, Rahmani, Farzan, Eetemadi, Sauleh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
eagerlearners at SemEval2024 Task 5: The Legal Argument Reasoning Task in Civil Procedure
di: Sabzevari, Hoorieh, et al.
Pubblicazione: (2024)
di: Sabzevari, Hoorieh, et al.
Pubblicazione: (2024)
BAMO at SemEval-2024 Task 9: BRAINTEASER: A Novel Task Defying Common Sense
di: Ansari, Baktash, et al.
Pubblicazione: (2024)
di: Ansari, Baktash, et al.
Pubblicazione: (2024)
Word2winners at SemEval-2025 Task 7: Multilingual and Crosslingual Fact-Checked Claim Retrieval
di: Azadi, Amirmohammad, et al.
Pubblicazione: (2025)
di: Azadi, Amirmohammad, et al.
Pubblicazione: (2025)
StackOverflowVQA: Stack Overflow Visual Question Answering Dataset
di: Mirzaei, Motahhare, et al.
Pubblicazione: (2024)
di: Mirzaei, Motahhare, et al.
Pubblicazione: (2024)
IllusionVQA: A Challenging Optical Illusion Dataset for Vision Language Models
di: Shahgir, Haz Sameen, et al.
Pubblicazione: (2024)
di: Shahgir, Haz Sameen, et al.
Pubblicazione: (2024)
Bilingual Sexism Classification: Fine-Tuned XLM-RoBERTa and GPT-3.5 Few-Shot Learning
di: Azadi, AmirMohammad, et al.
Pubblicazione: (2024)
di: Azadi, AmirMohammad, et al.
Pubblicazione: (2024)
VaseVQA: Multimodal Agent and Benchmark for Ancient Greek Pottery
di: Ge, Jinchao, et al.
Pubblicazione: (2025)
di: Ge, Jinchao, et al.
Pubblicazione: (2025)
VQA-MHUG: A Gaze Dataset to Study Multimodal Neural Attention in Visual Question Answering
di: Sood, Ekta, et al.
Pubblicazione: (2021)
di: Sood, Ekta, et al.
Pubblicazione: (2021)
MangaVQA and MangaLMM: A Benchmark and Specialized Model for Multimodal Manga Understanding
di: Baek, Jeonghun, et al.
Pubblicazione: (2025)
di: Baek, Jeonghun, et al.
Pubblicazione: (2025)
KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts
di: Hwang, Taebaek, et al.
Pubblicazione: (2025)
di: Hwang, Taebaek, et al.
Pubblicazione: (2025)
CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence
di: Ma, Dongsheng, et al.
Pubblicazione: (2026)
di: Ma, Dongsheng, et al.
Pubblicazione: (2026)
CommVQA: Situating Visual Question Answering in Communicative Contexts
di: Naik, Nandita Shankar, et al.
Pubblicazione: (2024)
di: Naik, Nandita Shankar, et al.
Pubblicazione: (2024)
BRI3L: A Brightness Illusion Image Dataset for Identification and Localization of Regions of Illusory Perception
di: Roy, Aniket, et al.
Pubblicazione: (2024)
di: Roy, Aniket, et al.
Pubblicazione: (2024)
The Illusion-Illusion: Vision Language Models See Illusions Where There are None
di: Ullman, Tomer
Pubblicazione: (2024)
di: Ullman, Tomer
Pubblicazione: (2024)
Memory-Augmented Multimodal LLMs for Surgical VQA via Self-Contained Inquiry
di: Hou, Wenjun, et al.
Pubblicazione: (2024)
di: Hou, Wenjun, et al.
Pubblicazione: (2024)
Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination
di: Shi, Chufan, et al.
Pubblicazione: (2026)
di: Shi, Chufan, et al.
Pubblicazione: (2026)
Multimodal LLM With Hierarchical Mixture-of-Experts for VQA on 3D Brain MRI
di: Vepa, Arvind Murari, et al.
Pubblicazione: (2025)
di: Vepa, Arvind Murari, et al.
Pubblicazione: (2025)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
di: Luo, Fuwen, et al.
Pubblicazione: (2024)
Muffin or Chihuahua? Challenging Multimodal Large Language Models with Multipanel VQA
di: Fan, Yue, et al.
Pubblicazione: (2024)
di: Fan, Yue, et al.
Pubblicazione: (2024)
Multimodal Retrieval-Augmented Generation with Large Language Models for Medical VQA
di: Karim, A H M Rezaul, et al.
Pubblicazione: (2025)
di: Karim, A H M Rezaul, et al.
Pubblicazione: (2025)
SK-VQA: Synthetic Knowledge Generation at Scale for Training Context-Augmented Multimodal LLMs
di: Su, Xin, et al.
Pubblicazione: (2024)
di: Su, Xin, et al.
Pubblicazione: (2024)
MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning
di: Yu, Suhao, et al.
Pubblicazione: (2025)
di: Yu, Suhao, et al.
Pubblicazione: (2025)
HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models
di: Guan, Tianrui, et al.
Pubblicazione: (2023)
di: Guan, Tianrui, et al.
Pubblicazione: (2023)
UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents
di: Ji, Yifan, et al.
Pubblicazione: (2026)
di: Ji, Yifan, et al.
Pubblicazione: (2026)
FlowVQA: Mapping Multimodal Logic in Visual Question Answering with Flowcharts
di: Singh, Shubhankar, et al.
Pubblicazione: (2024)
di: Singh, Shubhankar, et al.
Pubblicazione: (2024)
Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies
di: Hou, Wenjin, et al.
Pubblicazione: (2026)
di: Hou, Wenjin, et al.
Pubblicazione: (2026)
Visual Grounding Methods for VQA are Working for the Wrong Reasons!
di: Shrestha, Robik, et al.
Pubblicazione: (2020)
di: Shrestha, Robik, et al.
Pubblicazione: (2020)
SemVink: Advancing VLMs' Semantic Understanding of Optical Illusions via Visual Global Thinking
di: Li, Sifan, et al.
Pubblicazione: (2025)
di: Li, Sifan, et al.
Pubblicazione: (2025)
RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
di: Li, Jiaang, et al.
Pubblicazione: (2025)
di: Li, Jiaang, et al.
Pubblicazione: (2025)
VCode: a Multimodal Coding Benchmark with SVG as Symbolic Visual Representation
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2025)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2025)
TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity
di: Yang, Zheyuan, et al.
Pubblicazione: (2026)
di: Yang, Zheyuan, et al.
Pubblicazione: (2026)
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
GRAM: Global Reasoning for Multi-Page VQA
di: Blau, Tsachi, et al.
Pubblicazione: (2024)
di: Blau, Tsachi, et al.
Pubblicazione: (2024)
Visual Robustness Benchmark for Visual Question Answering (VQA)
di: Ishmam, Md Farhan, et al.
Pubblicazione: (2024)
di: Ishmam, Md Farhan, et al.
Pubblicazione: (2024)
KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language
di: Kim, Yoonshik, et al.
Pubblicazione: (2025)
di: Kim, Yoonshik, et al.
Pubblicazione: (2025)
Towards Efficient and Robust VQA-NLE Data Generation with Large Vision-Language Models
di: Irawan, Patrick Amadeus, et al.
Pubblicazione: (2024)
di: Irawan, Patrick Amadeus, et al.
Pubblicazione: (2024)
KBE-DME: Dynamic Multimodal Evaluation via Knowledge Enhanced Benchmark Evolution
di: Zhang, Junzhe, et al.
Pubblicazione: (2025)
di: Zhang, Junzhe, et al.
Pubblicazione: (2025)
IllusionBench+: A Large-scale and Comprehensive Benchmark for Visual Illusion Understanding in Vision-Language Models
di: Zhang, Yiming, et al.
Pubblicazione: (2025)
di: Zhang, Yiming, et al.
Pubblicazione: (2025)
Text2Vis: A Challenging and Diverse Benchmark for Generating Multimodal Visualizations from Text
di: Rahman, Mizanur, et al.
Pubblicazione: (2025)
di: Rahman, Mizanur, et al.
Pubblicazione: (2025)
Do Large Vision-Language Models Distinguish between the Actual and Apparent Features of Illusions?
di: Shinozaki, Taiga, et al.
Pubblicazione: (2025)
di: Shinozaki, Taiga, et al.
Pubblicazione: (2025)
Documenti analoghi
-
eagerlearners at SemEval2024 Task 5: The Legal Argument Reasoning Task in Civil Procedure
di: Sabzevari, Hoorieh, et al.
Pubblicazione: (2024) -
BAMO at SemEval-2024 Task 9: BRAINTEASER: A Novel Task Defying Common Sense
di: Ansari, Baktash, et al.
Pubblicazione: (2024) -
Word2winners at SemEval-2025 Task 7: Multilingual and Crosslingual Fact-Checked Claim Retrieval
di: Azadi, Amirmohammad, et al.
Pubblicazione: (2025) -
StackOverflowVQA: Stack Overflow Visual Question Answering Dataset
di: Mirzaei, Motahhare, et al.
Pubblicazione: (2024) -
IllusionVQA: A Challenging Optical Illusion Dataset for Vision Language Models
di: Shahgir, Haz Sameen, et al.
Pubblicazione: (2024)