Uncovering the Full Potential of Visual Grounding Methods in VQA
Fuente:
arXiv
Salvato in:
| Autori principali: | Reich, Daniel, Schultz, Tanja |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On the Role of Visual Grounding in VQA
di: Reich, Daniel, et al.
Pubblicazione: (2024)
di: Reich, Daniel, et al.
Pubblicazione: (2024)
Measuring Faithful and Plausible Visual Grounding in VQA
di: Reich, Daniel, et al.
Pubblicazione: (2023)
di: Reich, Daniel, et al.
Pubblicazione: (2023)
Visual Grounding Methods for VQA are Working for the Wrong Reasons!
di: Shrestha, Robik, et al.
Pubblicazione: (2020)
di: Shrestha, Robik, et al.
Pubblicazione: (2020)
Multi-Task Learning for Visually Grounded Reasoning in Gastrointestinal VQA
di: Safwan, Itbaan, et al.
Pubblicazione: (2025)
di: Safwan, Itbaan, et al.
Pubblicazione: (2025)
AutoVQA-G: Self-Improving Agentic Framework for Automated Visual Question Answering and Grounding Annotation
di: Hu, Rongsheng, et al.
Pubblicazione: (2026)
di: Hu, Rongsheng, et al.
Pubblicazione: (2026)
Visual Robustness Benchmark for Visual Question Answering (VQA)
di: Ishmam, Md Farhan, et al.
Pubblicazione: (2024)
di: Ishmam, Md Farhan, et al.
Pubblicazione: (2024)
A Modular Pipeline for 3D Object Tracking Using RGB Cameras
di: Bredereke, Lars, et al.
Pubblicazione: (2025)
di: Bredereke, Lars, et al.
Pubblicazione: (2025)
CoTBox-TTT: Grounding Medical VQA with Visual Chain-of-Thought Boxes During Test-time Training
di: Qian, Jiahe, et al.
Pubblicazione: (2025)
di: Qian, Jiahe, et al.
Pubblicazione: (2025)
GPT-4V-AD: Exploring Grounding Potential of VQA-oriented GPT-4V for Zero-shot Anomaly Detection
di: Zhang, Jiangning, et al.
Pubblicazione: (2023)
di: Zhang, Jiangning, et al.
Pubblicazione: (2023)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
di: Zhang, Xiaoman, et al.
Pubblicazione: (2023)
di: Zhang, Xiaoman, et al.
Pubblicazione: (2023)
CC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answering
di: Hong, Yuyang, et al.
Pubblicazione: (2026)
di: Hong, Yuyang, et al.
Pubblicazione: (2026)
Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark
di: Nguyen, Hieu Minh, et al.
Pubblicazione: (2025)
di: Nguyen, Hieu Minh, et al.
Pubblicazione: (2025)
SurgViVQA: Temporally-Grounded Video Question Answering for Surgical Scene Understanding
di: Drago, Mauro Orazio, et al.
Pubblicazione: (2025)
di: Drago, Mauro Orazio, et al.
Pubblicazione: (2025)
StackOverflowVQA: Stack Overflow Visual Question Answering Dataset
di: Mirzaei, Motahhare, et al.
Pubblicazione: (2024)
di: Mirzaei, Motahhare, et al.
Pubblicazione: (2024)
BERT-VQA: Visual Question Answering on Plots
di: Vu, Tai, et al.
Pubblicazione: (2025)
di: Vu, Tai, et al.
Pubblicazione: (2025)
Illusory VQA: Benchmarking and Enhancing Multimodal Models on Visual Illusions
di: Rostamkhani, Mohammadmostafa, et al.
Pubblicazione: (2024)
di: Rostamkhani, Mohammadmostafa, et al.
Pubblicazione: (2024)
CommVQA: Situating Visual Question Answering in Communicative Contexts
di: Naik, Nandita Shankar, et al.
Pubblicazione: (2024)
di: Naik, Nandita Shankar, et al.
Pubblicazione: (2024)
DisasterVQA: A Visual Question Answering Benchmark Dataset for Disaster Scenes
di: Al-Mohannadi, Aisha, et al.
Pubblicazione: (2026)
di: Al-Mohannadi, Aisha, et al.
Pubblicazione: (2026)
QG-VTC: Question-Guided Visual Token Compression in MLLMs for Efficient VQA
di: Li, Shuai, et al.
Pubblicazione: (2025)
di: Li, Shuai, et al.
Pubblicazione: (2025)
MedXplain-VQA: Multi-Component Explainable Medical Visual Question Answering
di: Nguyen, Hai-Dang, et al.
Pubblicazione: (2025)
di: Nguyen, Hai-Dang, et al.
Pubblicazione: (2025)
PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns
di: Chia, Yew Ken, et al.
Pubblicazione: (2024)
di: Chia, Yew Ken, et al.
Pubblicazione: (2024)
Head-Aware Visual Cropping: Enhancing Fine-Grained VQA with Attention-Guided Subimage
di: Xie, Junfei, et al.
Pubblicazione: (2026)
di: Xie, Junfei, et al.
Pubblicazione: (2026)
Towards Clinically Interpretable Ophthalmic VQA via Spatially-Grounded Lesion Evidence
di: Wang, Xingyue, et al.
Pubblicazione: (2026)
di: Wang, Xingyue, et al.
Pubblicazione: (2026)
PitVQA: Image-grounded Text Embedding LLM for Visual Question Answering in Pituitary Surgery
di: He, Runlong, et al.
Pubblicazione: (2024)
di: He, Runlong, et al.
Pubblicazione: (2024)
Help Me Identify: Is an LLM+VQA System All We Need to Identify Visual Concepts?
di: Sampat, Shailaja Keyur, et al.
Pubblicazione: (2024)
di: Sampat, Shailaja Keyur, et al.
Pubblicazione: (2024)
Detect2Interact: Localizing Object Key Field in Visual Question Answering (VQA) with LLMs
di: Wang, Jialou, et al.
Pubblicazione: (2024)
di: Wang, Jialou, et al.
Pubblicazione: (2024)
ReasonVQA: A Multi-hop Reasoning Benchmark with Structural Knowledge for Visual Question Answering
di: Tran, Duong T., et al.
Pubblicazione: (2025)
di: Tran, Duong T., et al.
Pubblicazione: (2025)
MacVQA: Adaptive Memory Allocation and Global Noise Filtering for Continual Visual Question Answering
di: Li, Zhifei, et al.
Pubblicazione: (2026)
di: Li, Zhifei, et al.
Pubblicazione: (2026)
RailVQA: A Benchmark and Framework for Efficient Interpretable Visual Cognition in Automatic Train Operation
di: Zhang, Sen, et al.
Pubblicazione: (2026)
di: Zhang, Sen, et al.
Pubblicazione: (2026)
RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering
di: Zhang, Chengyi, et al.
Pubblicazione: (2026)
di: Zhang, Chengyi, et al.
Pubblicazione: (2026)
VQA$^2$: Visual Question Answering for Video Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2024)
di: Jia, Ziheng, et al.
Pubblicazione: (2024)
RoadSceneVQA: Benchmarking Visual Question Answering in Roadside Perception Systems for Intelligent Transportation System
di: Guan, Runwei, et al.
Pubblicazione: (2025)
di: Guan, Runwei, et al.
Pubblicazione: (2025)
Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring
di: Vu, Sinh Trong, et al.
Pubblicazione: (2025)
di: Vu, Sinh Trong, et al.
Pubblicazione: (2025)
VQA-Diff: Exploiting VQA and Diffusion for Zero-Shot Image-to-3D Vehicle Asset Generation in Autonomous Driving
di: Liu, Yibo, et al.
Pubblicazione: (2024)
di: Liu, Yibo, et al.
Pubblicazione: (2024)
VQA-MHUG: A Gaze Dataset to Study Multimodal Neural Attention in Visual Question Answering
di: Sood, Ekta, et al.
Pubblicazione: (2021)
di: Sood, Ekta, et al.
Pubblicazione: (2021)
Knowledge Condensation and Reasoning for Knowledge-based VQA
di: Hao, Dongze, et al.
Pubblicazione: (2024)
di: Hao, Dongze, et al.
Pubblicazione: (2024)
Exploring OCR-augmented Generation for Bilingual VQA
di: Lee, JoonHo, et al.
Pubblicazione: (2025)
di: Lee, JoonHo, et al.
Pubblicazione: (2025)
EgoAdapt: A Multi-Scene Egocentric Adaptation Method for CVPR 2026 HD-EPIC VQA Challenge
di: Chen, Zhiwei, et al.
Pubblicazione: (2026)
di: Chen, Zhiwei, et al.
Pubblicazione: (2026)
LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA
di: Huang, Jing, et al.
Pubblicazione: (2025)
di: Huang, Jing, et al.
Pubblicazione: (2025)
SURE-VQA: Systematic Understanding of Robustness Evaluation in Medical VQA Tasks
di: Kahl, Kim-Celine, et al.
Pubblicazione: (2024)
di: Kahl, Kim-Celine, et al.
Pubblicazione: (2024)
Documenti analoghi
-
On the Role of Visual Grounding in VQA
di: Reich, Daniel, et al.
Pubblicazione: (2024) -
Measuring Faithful and Plausible Visual Grounding in VQA
di: Reich, Daniel, et al.
Pubblicazione: (2023) -
Visual Grounding Methods for VQA are Working for the Wrong Reasons!
di: Shrestha, Robik, et al.
Pubblicazione: (2020) -
Multi-Task Learning for Visually Grounded Reasoning in Gastrointestinal VQA
di: Safwan, Itbaan, et al.
Pubblicazione: (2025) -
AutoVQA-G: Self-Improving Agentic Framework for Automated Visual Question Answering and Grounding Annotation
di: Hu, Rongsheng, et al.
Pubblicazione: (2026)