Uncovering the Full Potential of Visual Grounding Methods in VQA
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Reich, Daniel, Schultz, Tanja |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
On the Role of Visual Grounding in VQA
par: Reich, Daniel, et autres
Publié: (2024)
par: Reich, Daniel, et autres
Publié: (2024)
Measuring Faithful and Plausible Visual Grounding in VQA
par: Reich, Daniel, et autres
Publié: (2023)
par: Reich, Daniel, et autres
Publié: (2023)
Visual Grounding Methods for VQA are Working for the Wrong Reasons!
par: Shrestha, Robik, et autres
Publié: (2020)
par: Shrestha, Robik, et autres
Publié: (2020)
Multi-Task Learning for Visually Grounded Reasoning in Gastrointestinal VQA
par: Safwan, Itbaan, et autres
Publié: (2025)
par: Safwan, Itbaan, et autres
Publié: (2025)
AutoVQA-G: Self-Improving Agentic Framework for Automated Visual Question Answering and Grounding Annotation
par: Hu, Rongsheng, et autres
Publié: (2026)
par: Hu, Rongsheng, et autres
Publié: (2026)
Visual Robustness Benchmark for Visual Question Answering (VQA)
par: Ishmam, Md Farhan, et autres
Publié: (2024)
par: Ishmam, Md Farhan, et autres
Publié: (2024)
A Modular Pipeline for 3D Object Tracking Using RGB Cameras
par: Bredereke, Lars, et autres
Publié: (2025)
par: Bredereke, Lars, et autres
Publié: (2025)
CoTBox-TTT: Grounding Medical VQA with Visual Chain-of-Thought Boxes During Test-time Training
par: Qian, Jiahe, et autres
Publié: (2025)
par: Qian, Jiahe, et autres
Publié: (2025)
GPT-4V-AD: Exploring Grounding Potential of VQA-oriented GPT-4V for Zero-shot Anomaly Detection
par: Zhang, Jiangning, et autres
Publié: (2023)
par: Zhang, Jiangning, et autres
Publié: (2023)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
par: Zhang, Xiaoman, et autres
Publié: (2023)
par: Zhang, Xiaoman, et autres
Publié: (2023)
CC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answering
par: Hong, Yuyang, et autres
Publié: (2026)
par: Hong, Yuyang, et autres
Publié: (2026)
Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark
par: Nguyen, Hieu Minh, et autres
Publié: (2025)
par: Nguyen, Hieu Minh, et autres
Publié: (2025)
SurgViVQA: Temporally-Grounded Video Question Answering for Surgical Scene Understanding
par: Drago, Mauro Orazio, et autres
Publié: (2025)
par: Drago, Mauro Orazio, et autres
Publié: (2025)
StackOverflowVQA: Stack Overflow Visual Question Answering Dataset
par: Mirzaei, Motahhare, et autres
Publié: (2024)
par: Mirzaei, Motahhare, et autres
Publié: (2024)
BERT-VQA: Visual Question Answering on Plots
par: Vu, Tai, et autres
Publié: (2025)
par: Vu, Tai, et autres
Publié: (2025)
Illusory VQA: Benchmarking and Enhancing Multimodal Models on Visual Illusions
par: Rostamkhani, Mohammadmostafa, et autres
Publié: (2024)
par: Rostamkhani, Mohammadmostafa, et autres
Publié: (2024)
CommVQA: Situating Visual Question Answering in Communicative Contexts
par: Naik, Nandita Shankar, et autres
Publié: (2024)
par: Naik, Nandita Shankar, et autres
Publié: (2024)
DisasterVQA: A Visual Question Answering Benchmark Dataset for Disaster Scenes
par: Al-Mohannadi, Aisha, et autres
Publié: (2026)
par: Al-Mohannadi, Aisha, et autres
Publié: (2026)
QG-VTC: Question-Guided Visual Token Compression in MLLMs for Efficient VQA
par: Li, Shuai, et autres
Publié: (2025)
par: Li, Shuai, et autres
Publié: (2025)
MedXplain-VQA: Multi-Component Explainable Medical Visual Question Answering
par: Nguyen, Hai-Dang, et autres
Publié: (2025)
par: Nguyen, Hai-Dang, et autres
Publié: (2025)
PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns
par: Chia, Yew Ken, et autres
Publié: (2024)
par: Chia, Yew Ken, et autres
Publié: (2024)
Head-Aware Visual Cropping: Enhancing Fine-Grained VQA with Attention-Guided Subimage
par: Xie, Junfei, et autres
Publié: (2026)
par: Xie, Junfei, et autres
Publié: (2026)
Towards Clinically Interpretable Ophthalmic VQA via Spatially-Grounded Lesion Evidence
par: Wang, Xingyue, et autres
Publié: (2026)
par: Wang, Xingyue, et autres
Publié: (2026)
PitVQA: Image-grounded Text Embedding LLM for Visual Question Answering in Pituitary Surgery
par: He, Runlong, et autres
Publié: (2024)
par: He, Runlong, et autres
Publié: (2024)
Help Me Identify: Is an LLM+VQA System All We Need to Identify Visual Concepts?
par: Sampat, Shailaja Keyur, et autres
Publié: (2024)
par: Sampat, Shailaja Keyur, et autres
Publié: (2024)
Detect2Interact: Localizing Object Key Field in Visual Question Answering (VQA) with LLMs
par: Wang, Jialou, et autres
Publié: (2024)
par: Wang, Jialou, et autres
Publié: (2024)
ReasonVQA: A Multi-hop Reasoning Benchmark with Structural Knowledge for Visual Question Answering
par: Tran, Duong T., et autres
Publié: (2025)
par: Tran, Duong T., et autres
Publié: (2025)
MacVQA: Adaptive Memory Allocation and Global Noise Filtering for Continual Visual Question Answering
par: Li, Zhifei, et autres
Publié: (2026)
par: Li, Zhifei, et autres
Publié: (2026)
RailVQA: A Benchmark and Framework for Efficient Interpretable Visual Cognition in Automatic Train Operation
par: Zhang, Sen, et autres
Publié: (2026)
par: Zhang, Sen, et autres
Publié: (2026)
RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering
par: Zhang, Chengyi, et autres
Publié: (2026)
par: Zhang, Chengyi, et autres
Publié: (2026)
VQA$^2$: Visual Question Answering for Video Quality Assessment
par: Jia, Ziheng, et autres
Publié: (2024)
par: Jia, Ziheng, et autres
Publié: (2024)
RoadSceneVQA: Benchmarking Visual Question Answering in Roadside Perception Systems for Intelligent Transportation System
par: Guan, Runwei, et autres
Publié: (2025)
par: Guan, Runwei, et autres
Publié: (2025)
Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring
par: Vu, Sinh Trong, et autres
Publié: (2025)
par: Vu, Sinh Trong, et autres
Publié: (2025)
VQA-Diff: Exploiting VQA and Diffusion for Zero-Shot Image-to-3D Vehicle Asset Generation in Autonomous Driving
par: Liu, Yibo, et autres
Publié: (2024)
par: Liu, Yibo, et autres
Publié: (2024)
VQA-MHUG: A Gaze Dataset to Study Multimodal Neural Attention in Visual Question Answering
par: Sood, Ekta, et autres
Publié: (2021)
par: Sood, Ekta, et autres
Publié: (2021)
Knowledge Condensation and Reasoning for Knowledge-based VQA
par: Hao, Dongze, et autres
Publié: (2024)
par: Hao, Dongze, et autres
Publié: (2024)
Exploring OCR-augmented Generation for Bilingual VQA
par: Lee, JoonHo, et autres
Publié: (2025)
par: Lee, JoonHo, et autres
Publié: (2025)
EgoAdapt: A Multi-Scene Egocentric Adaptation Method for CVPR 2026 HD-EPIC VQA Challenge
par: Chen, Zhiwei, et autres
Publié: (2026)
par: Chen, Zhiwei, et autres
Publié: (2026)
LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA
par: Huang, Jing, et autres
Publié: (2025)
par: Huang, Jing, et autres
Publié: (2025)
SURE-VQA: Systematic Understanding of Robustness Evaluation in Medical VQA Tasks
par: Kahl, Kim-Celine, et autres
Publié: (2024)
par: Kahl, Kim-Celine, et autres
Publié: (2024)
Documents similaires
-
On the Role of Visual Grounding in VQA
par: Reich, Daniel, et autres
Publié: (2024) -
Measuring Faithful and Plausible Visual Grounding in VQA
par: Reich, Daniel, et autres
Publié: (2023) -
Visual Grounding Methods for VQA are Working for the Wrong Reasons!
par: Shrestha, Robik, et autres
Publié: (2020) -
Multi-Task Learning for Visually Grounded Reasoning in Gastrointestinal VQA
par: Safwan, Itbaan, et autres
Publié: (2025) -
AutoVQA-G: Self-Improving Agentic Framework for Automated Visual Question Answering and Grounding Annotation
par: Hu, Rongsheng, et autres
Publié: (2026)