Unexplored flaws in multiple-choice VQA evaluations
Fuente:
arXiv
Salvato in:
| Autori principali: | Rosenthal, Fabio, Schmidt, Sebastian, Graf, Thorsten, Bagodonat, Thorsten, Günnemann, Stephan, Schwinn, Leo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Joint Out-of-Distribution Filtering and Data Discovery Active Learning
di: Schmidt, Sebastian, et al.
Pubblicazione: (2025)
di: Schmidt, Sebastian, et al.
Pubblicazione: (2025)
A Unified Approach Towards Active Learning and Out-of-Distribution Detection
di: Schmidt, Sebastian, et al.
Pubblicazione: (2024)
di: Schmidt, Sebastian, et al.
Pubblicazione: (2024)
Assessing Robustness via Score-Based Adversarial Image Generation
di: Kollovieh, Marcel, et al.
Pubblicazione: (2023)
di: Kollovieh, Marcel, et al.
Pubblicazione: (2023)
Amplified Patch-Level Differential Privacy for Free via Random Cropping
di: Durmaz, Kaan, et al.
Pubblicazione: (2026)
di: Durmaz, Kaan, et al.
Pubblicazione: (2026)
FOCUS: Internal MLLM Representations for Efficient Fine-Grained Visual Question Answering
di: Zhong, Liangyu, et al.
Pubblicazione: (2025)
di: Zhong, Liangyu, et al.
Pubblicazione: (2025)
Localized Randomized Smoothing for Collective Robustness Certification
di: Schuchardt, Jan, et al.
Pubblicazione: (2022)
di: Schuchardt, Jan, et al.
Pubblicazione: (2022)
Structurally Prune Anything: Any Architecture, Any Framework, Any Time
di: Wang, Xun, et al.
Pubblicazione: (2024)
di: Wang, Xun, et al.
Pubblicazione: (2024)
LipShiFT: A Certifiably Robust Shift-based Vision Transformer
di: Menon, Rohan, et al.
Pubblicazione: (2025)
di: Menon, Rohan, et al.
Pubblicazione: (2025)
A Machine Learning Perspective on Automated Driving Corner Cases
di: Schmidt, Sebastian, et al.
Pubblicazione: (2025)
di: Schmidt, Sebastian, et al.
Pubblicazione: (2025)
Masked Autoencoders for Ultrasound Signals: Robust Representation Learning for Downstream Applications
di: Roßteutscher, Immanuel, et al.
Pubblicazione: (2025)
di: Roßteutscher, Immanuel, et al.
Pubblicazione: (2025)
Global Offshore Wind Infrastructure: Deployment and Operational Dynamics from Dense Sentinel-1 Time Series
di: Hoeser, Thorsten, et al.
Pubblicazione: (2026)
di: Hoeser, Thorsten, et al.
Pubblicazione: (2026)
SURE-VQA: Systematic Understanding of Robustness Evaluation in Medical VQA Tasks
di: Kahl, Kim-Celine, et al.
Pubblicazione: (2024)
di: Kahl, Kim-Celine, et al.
Pubblicazione: (2024)
Hierarchical Randomized Smoothing
di: Scholten, Yan, et al.
Pubblicazione: (2023)
di: Scholten, Yan, et al.
Pubblicazione: (2023)
Wear Classification of Abrasive Flap Wheels using a Hierarchical Deep Learning Approach
di: Kähler, Falko, et al.
Pubblicazione: (2026)
di: Kähler, Falko, et al.
Pubblicazione: (2026)
WildFireVQA: A Large-Scale Radiometric Thermal VQA Benchmark for Aerial Wildfire Monitoring
di: Habibpour, Mobin, et al.
Pubblicazione: (2026)
di: Habibpour, Mobin, et al.
Pubblicazione: (2026)
BERT-VQA: Visual Question Answering on Plots
di: Vu, Tai, et al.
Pubblicazione: (2025)
di: Vu, Tai, et al.
Pubblicazione: (2025)
Disentanglement-Based Equivariant Learning for Compositional VQA
di: Du, Zhou, et al.
Pubblicazione: (2026)
di: Du, Zhou, et al.
Pubblicazione: (2026)
Scalable Object Detection in the Car Interior With Vision Foundation Models
di: Schmidt, Sebastian, et al.
Pubblicazione: (2025)
di: Schmidt, Sebastian, et al.
Pubblicazione: (2025)
VQA-Levels: A Hierarchical Approach for Classifying Questions in VQA
di: Madaka, Madhuri Latha, et al.
Pubblicazione: (2025)
di: Madaka, Madhuri Latha, et al.
Pubblicazione: (2025)
Multi-Task Learning for Visually Grounded Reasoning in Gastrointestinal VQA
di: Safwan, Itbaan, et al.
Pubblicazione: (2025)
di: Safwan, Itbaan, et al.
Pubblicazione: (2025)
Improving Medical VQA through Trajectory-Aware Process Supervision
di: Gulluk, Halil Ibrahim, et al.
Pubblicazione: (2026)
di: Gulluk, Halil Ibrahim, et al.
Pubblicazione: (2026)
Overconfidence and Calibration in Medical VQA: Empirical Findings and Hallucination-Aware Mitigation
di: Byun, Ji Young, et al.
Pubblicazione: (2026)
di: Byun, Ji Young, et al.
Pubblicazione: (2026)
HAMMR: HierArchical MultiModal React agents for generic VQA
di: Castrejon, Lluis, et al.
Pubblicazione: (2024)
di: Castrejon, Lluis, et al.
Pubblicazione: (2024)
Attribute Diversity Determines the Systematicity Gap in VQA
di: Berlot-Attwell, Ian, et al.
Pubblicazione: (2023)
di: Berlot-Attwell, Ian, et al.
Pubblicazione: (2023)
Tilt your Head: Activating the Hidden Spatial-Invariance of Classifiers
di: Schmidt, Johann, et al.
Pubblicazione: (2024)
di: Schmidt, Johann, et al.
Pubblicazione: (2024)
Enhancing Vietnamese VQA through Curriculum Learning on Raw and Augmented Text Representations
di: Nguyen, Khoi Anh, et al.
Pubblicazione: (2025)
di: Nguyen, Khoi Anh, et al.
Pubblicazione: (2025)
WorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Models
di: Zhou, Runjie, et al.
Pubblicazione: (2026)
di: Zhou, Runjie, et al.
Pubblicazione: (2026)
BloomVQA: Assessing Hierarchical Multi-modal Comprehension
di: Gong, Yunye, et al.
Pubblicazione: (2023)
di: Gong, Yunye, et al.
Pubblicazione: (2023)
Bridging the Semantic Gaps: Improving Medical VQA Consistency with LLM-Augmented Question Sets
di: Ma, Yongpei, et al.
Pubblicazione: (2025)
di: Ma, Yongpei, et al.
Pubblicazione: (2025)
ViInfographicVQA: A Benchmark for Single and Multi-image Visual Question Answering on Vietnamese Infographics
di: Van-Dinh, Tue-Thu, et al.
Pubblicazione: (2025)
di: Van-Dinh, Tue-Thu, et al.
Pubblicazione: (2025)
Functional Localization Enforced Deep Anomaly Detection Using Fundus Images
di: Ruhland, Jan Benedikt, et al.
Pubblicazione: (2025)
di: Ruhland, Jan Benedikt, et al.
Pubblicazione: (2025)
The GOOSE Dataset for Perception in Unstructured Environments
di: Mortimer, Peter, et al.
Pubblicazione: (2023)
di: Mortimer, Peter, et al.
Pubblicazione: (2023)
Taking Shortcuts for Categorical VQA Using Super Neurons
di: Musacchio, Pierre, et al.
Pubblicazione: (2026)
di: Musacchio, Pierre, et al.
Pubblicazione: (2026)
Pix2Fact: When Vision Is Not Enough -- Benchmarking Fine-Grained VQA with Web Verification on High-Resolution Real-World Scenes
di: Jiang, Yifan, et al.
Pubblicazione: (2026)
di: Jiang, Yifan, et al.
Pubblicazione: (2026)
Open-ended VQA benchmarking of Vision-Language models by exploiting Classification datasets and their semantic hierarchy
di: Ging, Simon, et al.
Pubblicazione: (2024)
di: Ging, Simon, et al.
Pubblicazione: (2024)
Refine and Align: Confidence Calibration through Multi-Agent Interaction in VQA
di: Pandey, Ayush, et al.
Pubblicazione: (2025)
di: Pandey, Ayush, et al.
Pubblicazione: (2025)
Extracting Unlearned Information from LLMs with Activation Steering
di: Seyitoğlu, Atakan, et al.
Pubblicazione: (2024)
di: Seyitoğlu, Atakan, et al.
Pubblicazione: (2024)
Prior2Former -- Evidential Modeling of Mask Transformers for Assumption-Free Open-World Panoptic Segmentation
di: Schmidt, Sebastian, et al.
Pubblicazione: (2025)
di: Schmidt, Sebastian, et al.
Pubblicazione: (2025)
A Probabilistic Perspective on Unlearning and Alignment for Large Language Models
di: Scholten, Yan, et al.
Pubblicazione: (2024)
di: Scholten, Yan, et al.
Pubblicazione: (2024)
VQArt-Bench: A semantically rich VQA Benchmark for Art and Cultural Heritage
di: Alfarano, A., et al.
Pubblicazione: (2025)
di: Alfarano, A., et al.
Pubblicazione: (2025)
Documenti analoghi
-
Joint Out-of-Distribution Filtering and Data Discovery Active Learning
di: Schmidt, Sebastian, et al.
Pubblicazione: (2025) -
A Unified Approach Towards Active Learning and Out-of-Distribution Detection
di: Schmidt, Sebastian, et al.
Pubblicazione: (2024) -
Assessing Robustness via Score-Based Adversarial Image Generation
di: Kollovieh, Marcel, et al.
Pubblicazione: (2023) -
Amplified Patch-Level Differential Privacy for Free via Random Cropping
di: Durmaz, Kaan, et al.
Pubblicazione: (2026) -
FOCUS: Internal MLLM Representations for Efficient Fine-Grained Visual Question Answering
di: Zhong, Liangyu, et al.
Pubblicazione: (2025)