SEA: Evaluating Sketch Abstraction Efficiency via Element-level Commonsense Visual Question Answering
Fuente:
arXiv
Salvato in:
| Autori principali: | Park, Jiho, Choi, Sieun, Seo, Jaeyoon, Sohn, Minho, Kim, Yeana, Kim, Jihie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
StableSketcher: Enhancing Diffusion Model for Pixel-based Sketch Generation via Visual Question Answering Feedback
di: Park, Jiho, et al.
Pubblicazione: (2025)
di: Park, Jiho, et al.
Pubblicazione: (2025)
Evaluating Demographic Misrepresentation in Image-to-Image Portrait Editing
di: Seo, Huichan, et al.
Pubblicazione: (2026)
di: Seo, Huichan, et al.
Pubblicazione: (2026)
Contour-Guided Query-Based Feature Fusion for Boundary-Aware and Generalizable Cardiac Ultrasound Segmentation
di: Ullah, Zahid, et al.
Pubblicazione: (2026)
di: Ullah, Zahid, et al.
Pubblicazione: (2026)
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
di: Lee, Dosung, et al.
Pubblicazione: (2025)
di: Lee, Dosung, et al.
Pubblicazione: (2025)
CANVAS: Commonsense-Aware Navigation System for Intuitive Human-Robot Interaction
di: Choi, Suhwan, et al.
Pubblicazione: (2024)
di: Choi, Suhwan, et al.
Pubblicazione: (2024)
MambaEye: A Size-Agnostic Visual Encoder with Causal Sequential Processing
di: Choi, Changho, et al.
Pubblicazione: (2025)
di: Choi, Changho, et al.
Pubblicazione: (2025)
MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering
di: Song, Seokwon, et al.
Pubblicazione: (2025)
di: Song, Seokwon, et al.
Pubblicazione: (2025)
DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning
di: Choi, Joonmyung, et al.
Pubblicazione: (2026)
di: Choi, Joonmyung, et al.
Pubblicazione: (2026)
MedErr-CT: A Visual Question Answering Benchmark for Identifying and Correcting Errors in CT Reports
di: Kyung, Sunggu, et al.
Pubblicazione: (2025)
di: Kyung, Sunggu, et al.
Pubblicazione: (2025)
VL-OrdinalFormer: Vision Language Guided Ordinal Transformers for Interpretable Knee Osteoarthritis Grading
di: Ullah, Zahid, et al.
Pubblicazione: (2025)
di: Ullah, Zahid, et al.
Pubblicazione: (2025)
Exploring Kolmogorov-Arnold Network Expansions in Vision Transformers for Mitigating Catastrophic Forgetting in Continual Learning
di: Ullah, Zahid, et al.
Pubblicazione: (2025)
di: Ullah, Zahid, et al.
Pubblicazione: (2025)
Hierarchical Deep Feature Fusion and Ensemble Learning for Enhanced Brain Tumor MRI Classification
di: Ullah, Zahid, et al.
Pubblicazione: (2025)
di: Ullah, Zahid, et al.
Pubblicazione: (2025)
DAM-Seg: Anatomically accurate cardiac segmentation using Dense Associative Networks
di: Ullah, Zahid, et al.
Pubblicazione: (2025)
di: Ullah, Zahid, et al.
Pubblicazione: (2025)
Towards Test-time Efficient Visual Place Recognition via Asymmetric Query Processing
di: Kim, Jaeyoon, et al.
Pubblicazione: (2025)
di: Kim, Jaeyoon, et al.
Pubblicazione: (2025)
Enhancing Visual Re-ranking through Denoising Nearest Neighbor Graph via Continuous CRF
di: Kim, Jaeyoon, et al.
Pubblicazione: (2024)
di: Kim, Jaeyoon, et al.
Pubblicazione: (2024)
Exposing Blindspots: Cultural Bias Evaluation in Generative Image Models
di: Seo, Huichan, et al.
Pubblicazione: (2025)
di: Seo, Huichan, et al.
Pubblicazione: (2025)
Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering
di: Lim, Su Hyeon, et al.
Pubblicazione: (2024)
di: Lim, Su Hyeon, et al.
Pubblicazione: (2024)
Before We Trust Them: Decision-Making Failures in Navigation of Foundation Models
di: Han, Jua, et al.
Pubblicazione: (2026)
di: Han, Jua, et al.
Pubblicazione: (2026)
Question-Aware Gaussian Experts for Audio-Visual Question Answering
di: Kim, Hongyeob, et al.
Pubblicazione: (2025)
di: Kim, Hongyeob, et al.
Pubblicazione: (2025)
VisDoT : Enhancing Visual Reasoning through Human-Like Interpretation Grounding and Decomposition of Thought
di: Lee, Eunsoo, et al.
Pubblicazione: (2026)
di: Lee, Eunsoo, et al.
Pubblicazione: (2026)
Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality
di: Park, Kyu Ri, et al.
Pubblicazione: (2024)
di: Park, Kyu Ri, et al.
Pubblicazione: (2024)
KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language
di: Kim, Yoonshik, et al.
Pubblicazione: (2025)
di: Kim, Yoonshik, et al.
Pubblicazione: (2025)
Evaluating Variance in Visual Question Answering Benchmarks
di: SR, Nikitha
Pubblicazione: (2025)
di: SR, Nikitha
Pubblicazione: (2025)
Hallucination Benchmark in Medical Visual Question Answering
di: Wu, Jinge, et al.
Pubblicazione: (2024)
di: Wu, Jinge, et al.
Pubblicazione: (2024)
CIC: A Framework for Culturally-Aware Image Captioning
di: Yun, Youngsik, et al.
Pubblicazione: (2024)
di: Yun, Youngsik, et al.
Pubblicazione: (2024)
Culture-TRIP: Culturally-Aware Text-to-Image Generation with Iterative Prompt Refinement
di: Jeong, Suchae, et al.
Pubblicazione: (2025)
di: Jeong, Suchae, et al.
Pubblicazione: (2025)
How to Handle Sketch-Abstraction in Sketch-Based Image Retrieval?
di: Koley, Subhadeep, et al.
Pubblicazione: (2024)
di: Koley, Subhadeep, et al.
Pubblicazione: (2024)
Recovering Dynamic 3D Sketches from Videos
di: Lee, Jaeah, et al.
Pubblicazione: (2025)
di: Lee, Jaeah, et al.
Pubblicazione: (2025)
3Doodle: Compact Abstraction of Objects with 3D Strokes
di: Choi, Changwoon, et al.
Pubblicazione: (2024)
di: Choi, Changwoon, et al.
Pubblicazione: (2024)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
di: Liu, Huabin, et al.
Pubblicazione: (2025)
di: Liu, Huabin, et al.
Pubblicazione: (2025)
When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models
di: Choi, Jiho, et al.
Pubblicazione: (2026)
di: Choi, Jiho, et al.
Pubblicazione: (2026)
Hybrid Ensemble Approaches: Optimal Deep Feature Fusion and Hyperparameter-Tuned Classifier Ensembling for Enhanced Brain Tumor Classification
di: Ullah, Zahid, et al.
Pubblicazione: (2025)
di: Ullah, Zahid, et al.
Pubblicazione: (2025)
Questions beyond Pixels: Integrating Commonsense Knowledge in Visual Question Generation for Remote Sensing
di: Li, Siran, et al.
Pubblicazione: (2026)
di: Li, Siran, et al.
Pubblicazione: (2026)
SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials
di: Kim, Wonjoong, et al.
Pubblicazione: (2024)
di: Kim, Wonjoong, et al.
Pubblicazione: (2024)
Generative Visual Commonsense Answering and Explaining with Generative Scene Graph Constructing
di: Yuan, Fan, et al.
Pubblicazione: (2025)
di: Yuan, Fan, et al.
Pubblicazione: (2025)
Towards Flexible Evaluation for Generative Visual Question Answering
di: Ji, Huishan, et al.
Pubblicazione: (2024)
di: Ji, Huishan, et al.
Pubblicazione: (2024)
Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question Answering
di: Kim, Jongha, et al.
Pubblicazione: (2026)
di: Kim, Jongha, et al.
Pubblicazione: (2026)
Evaluating Consistencies in LLM responses through a Semantic Clustering of Question Answering
di: Lee, Yanggyu, et al.
Pubblicazione: (2024)
di: Lee, Yanggyu, et al.
Pubblicazione: (2024)
Advancing Medical Image Segmentation: Morphology-Driven Learning with Diffusion Transformer
di: Kang, Sungmin, et al.
Pubblicazione: (2024)
di: Kang, Sungmin, et al.
Pubblicazione: (2024)
Questioning the Stability of Visual Question Answering
di: Rosenfeld, Amir, et al.
Pubblicazione: (2025)
di: Rosenfeld, Amir, et al.
Pubblicazione: (2025)
Documenti analoghi
-
StableSketcher: Enhancing Diffusion Model for Pixel-based Sketch Generation via Visual Question Answering Feedback
di: Park, Jiho, et al.
Pubblicazione: (2025) -
Evaluating Demographic Misrepresentation in Image-to-Image Portrait Editing
di: Seo, Huichan, et al.
Pubblicazione: (2026) -
Contour-Guided Query-Based Feature Fusion for Boundary-Aware and Generalizable Cardiac Ultrasound Segmentation
di: Ullah, Zahid, et al.
Pubblicazione: (2026) -
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
di: Lee, Dosung, et al.
Pubblicazione: (2025) -
CANVAS: Commonsense-Aware Navigation System for Intuitive Human-Robot Interaction
di: Choi, Suhwan, et al.
Pubblicazione: (2024)