ProtoVQA: An Adaptable Prototypical Framework for Explainable Fine-Grained Visual Question Answering
Fuente:
arXiv
Salvato in:
| Autori principali: | Diao, Xingjian, Wu, Weiyi, Kong, Keyi, Qing, Peijun, Xu, Xinwen, Cheng, Ming, Vosoughi, Soroush, Gui, Jiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
di: You, Wenhao, et al.
Pubblicazione: (2025)
di: You, Wenhao, et al.
Pubblicazione: (2025)
SoundMind: RL-Incentivized Logic Reasoning for Audio-Language Models
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
Temporal Working Memory: Query-Guided Segment Refinement for Enhanced Multimodal Understanding
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
Learning Sparsity for Effective and Efficient Music Performance Question Answering
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization
di: Diao, Xingjian, et al.
Pubblicazione: (2026)
di: Diao, Xingjian, et al.
Pubblicazione: (2026)
Learning Musical Representations for Music Performance Question Answering
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
di: Diao, Xingjian, et al.
Pubblicazione: (2025)
AlphaLoRA: Assigning LoRA Experts Based on Layer Training Quality
di: Qing, Peijun, et al.
Pubblicazione: (2024)
di: Qing, Peijun, et al.
Pubblicazione: (2024)
Exploiting Label-Independent Regularization from Spatial Dependencies for Whole Slide Image Analysis
di: Wu, Weiyi, et al.
Pubblicazione: (2026)
di: Wu, Weiyi, et al.
Pubblicazione: (2026)
MedXplain-VQA: Multi-Component Explainable Medical Visual Question Answering
di: Nguyen, Hai-Dang, et al.
Pubblicazione: (2025)
di: Nguyen, Hai-Dang, et al.
Pubblicazione: (2025)
Learning Spatial-Preserving Hierarchical Representations for Digital Pathology
di: Wu, Weiyi, et al.
Pubblicazione: (2024)
di: Wu, Weiyi, et al.
Pubblicazione: (2024)
BERT-VQA: Visual Question Answering on Plots
di: Vu, Tai, et al.
Pubblicazione: (2025)
di: Vu, Tai, et al.
Pubblicazione: (2025)
Visual Robustness Benchmark for Visual Question Answering (VQA)
di: Ishmam, Md Farhan, et al.
Pubblicazione: (2024)
di: Ishmam, Md Farhan, et al.
Pubblicazione: (2024)
Judging the Judges: A Systematic Study of Position Bias in LLM-as-a-Judge
di: Shi, Lin, et al.
Pubblicazione: (2024)
di: Shi, Lin, et al.
Pubblicazione: (2024)
Assessing and Mitigating Medical Knowledge Drift and Conflicts in Large Language Models
di: Wu, Weiyi, et al.
Pubblicazione: (2025)
di: Wu, Weiyi, et al.
Pubblicazione: (2025)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
di: Zhang, Xiaoman, et al.
Pubblicazione: (2023)
di: Zhang, Xiaoman, et al.
Pubblicazione: (2023)
CommVQA: Situating Visual Question Answering in Communicative Contexts
di: Naik, Nandita Shankar, et al.
Pubblicazione: (2024)
di: Naik, Nandita Shankar, et al.
Pubblicazione: (2024)
VQA$^2$: Visual Question Answering for Video Quality Assessment
di: Jia, Ziheng, et al.
Pubblicazione: (2024)
di: Jia, Ziheng, et al.
Pubblicazione: (2024)
MaS-VQA: A Mask-and-Select Framework for Knowledge-Based Visual Question Answering
di: Mao, Xianwei, et al.
Pubblicazione: (2026)
di: Mao, Xianwei, et al.
Pubblicazione: (2026)
Fine-Grained Knowledge Structuring and Retrieval for Visual Question Answering
di: Zhang, Zhengxuan, et al.
Pubblicazione: (2025)
di: Zhang, Zhengxuan, et al.
Pubblicazione: (2025)
FRAMES-VQA: Benchmarking Fine-Tuning Robustness across Multi-Modal Shifts in Visual Question Answering
di: Huang, Chengyue, et al.
Pubblicazione: (2025)
di: Huang, Chengyue, et al.
Pubblicazione: (2025)
ProtoQuant: Quantization of Prototypical Parts For General and Fine-Grained Image Classification
di: Janusz, Mikołaj, et al.
Pubblicazione: (2026)
di: Janusz, Mikołaj, et al.
Pubblicazione: (2026)
What Makes a Good Curriculum? Disentangling the Effects of Data Ordering on LLM Mathematical Reasoning
di: Jia, Yaning, et al.
Pubblicazione: (2025)
di: Jia, Yaning, et al.
Pubblicazione: (2025)
StackOverflowVQA: Stack Overflow Visual Question Answering Dataset
di: Mirzaei, Motahhare, et al.
Pubblicazione: (2024)
di: Mirzaei, Motahhare, et al.
Pubblicazione: (2024)
FlowVQA: Mapping Multimodal Logic in Visual Question Answering with Flowcharts
di: Singh, Shubhankar, et al.
Pubblicazione: (2024)
di: Singh, Shubhankar, et al.
Pubblicazione: (2024)
Exploring the Application of Visual Question Answering (VQA) for Classroom Activity Monitoring
di: Vu, Sinh Trong, et al.
Pubblicazione: (2025)
di: Vu, Sinh Trong, et al.
Pubblicazione: (2025)
AdaDocVQA: Adaptive Framework for Long Document Visual Question Answering in Low-Resource Settings
di: Li, Haoxuan, et al.
Pubblicazione: (2025)
di: Li, Haoxuan, et al.
Pubblicazione: (2025)
AutoVQA-G: Self-Improving Agentic Framework for Automated Visual Question Answering and Grounding Annotation
di: Hu, Rongsheng, et al.
Pubblicazione: (2026)
di: Hu, Rongsheng, et al.
Pubblicazione: (2026)
MAGIC-VQA: Multimodal And Grounded Inference with Commonsense Knowledge for Visual Question Answering
di: Yang, Shuo, et al.
Pubblicazione: (2025)
di: Yang, Shuo, et al.
Pubblicazione: (2025)
DisasterVQA: A Visual Question Answering Benchmark Dataset for Disaster Scenes
di: Al-Mohannadi, Aisha, et al.
Pubblicazione: (2026)
di: Al-Mohannadi, Aisha, et al.
Pubblicazione: (2026)
WSI-VQA: Interpreting Whole Slide Images by Generative Visual Question Answering
di: Chen, Pingyi, et al.
Pubblicazione: (2024)
di: Chen, Pingyi, et al.
Pubblicazione: (2024)
Multimodal Rationales for Explainable Visual Question Answering
di: Li, Kun, et al.
Pubblicazione: (2024)
di: Li, Kun, et al.
Pubblicazione: (2024)
ProtoP-OD: Explainable Object Detection with Prototypical Parts
di: Rath-Manakidis, Pavlos, et al.
Pubblicazione: (2024)
di: Rath-Manakidis, Pavlos, et al.
Pubblicazione: (2024)
Towards Fine-Grained Video Question Answering
di: Dai, Wei, et al.
Pubblicazione: (2025)
di: Dai, Wei, et al.
Pubblicazione: (2025)
FOCUS: Internal MLLM Representations for Efficient Fine-Grained Visual Question Answering
di: Zhong, Liangyu, et al.
Pubblicazione: (2025)
di: Zhong, Liangyu, et al.
Pubblicazione: (2025)
Disordered-DABS: A Benchmark for Dynamic Aspect-Based Summarization in Disordered Texts
di: Guo, Xiaobo, et al.
Pubblicazione: (2024)
di: Guo, Xiaobo, et al.
Pubblicazione: (2024)
MODABS: Multi-Objective Learning for Dynamic Aspect-Based Summarization
di: Guo, Xiaobo, et al.
Pubblicazione: (2024)
di: Guo, Xiaobo, et al.
Pubblicazione: (2024)
Serial Position Effects of Large Language Models
di: Guo, Xiaobo, et al.
Pubblicazione: (2024)
di: Guo, Xiaobo, et al.
Pubblicazione: (2024)
VinDr-CXR-VQA: A Visual Question Answering Dataset for Explainable Chest X-Ray Analysis with Multi-Task Learning
di: Nguyen, Dang H., et al.
Pubblicazione: (2025)
di: Nguyen, Dang H., et al.
Pubblicazione: (2025)
Tri-VQA: Triangular Reasoning Medical Visual Question Answering for Multi-Attribute Analysis
di: Fan, Lin, et al.
Pubblicazione: (2024)
di: Fan, Lin, et al.
Pubblicazione: (2024)
TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table Domains
di: Kim, Yoonsik, et al.
Pubblicazione: (2024)
di: Kim, Yoonsik, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Music Audio-Visual Question Answering Requires Specialized Multimodal Designs
di: You, Wenhao, et al.
Pubblicazione: (2025) -
SoundMind: RL-Incentivized Logic Reasoning for Audio-Language Models
di: Diao, Xingjian, et al.
Pubblicazione: (2025) -
Temporal Working Memory: Query-Guided Segment Refinement for Enhanced Multimodal Understanding
di: Diao, Xingjian, et al.
Pubblicazione: (2025) -
Learning Sparsity for Effective and Efficient Music Performance Question Answering
di: Diao, Xingjian, et al.
Pubblicazione: (2025) -
Addressing Overthinking in Large Vision-Language Models via Gated Perception-Reasoning Optimization
di: Diao, Xingjian, et al.
Pubblicazione: (2026)