Enregistré dans:
| Auteurs principaux: | Song, Seokwon, Park, Minsu, Kim, Gunhee |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2511.12142 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials
par: Kim, Wonjoong, et autres
Publié: (2024)
par: Kim, Wonjoong, et autres
Publié: (2024)
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
par: Lee, Dosung, et autres
Publié: (2025)
par: Lee, Dosung, et autres
Publié: (2025)
MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine
par: Zhang, Renrui, et autres
Publié: (2024)
par: Zhang, Renrui, et autres
Publié: (2024)
Object Attribute Matters in Visual Question Answering
par: Li, Peize, et autres
Publié: (2023)
par: Li, Peize, et autres
Publié: (2023)
Hallucination Benchmark in Medical Visual Question Answering
par: Wu, Jinge, et autres
Publié: (2024)
par: Wu, Jinge, et autres
Publié: (2024)
TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table Domains
par: Kim, Yoonsik, et autres
Publié: (2024)
par: Kim, Yoonsik, et autres
Publié: (2024)
Visual Robustness Benchmark for Visual Question Answering (VQA)
par: Ishmam, Md Farhan, et autres
Publié: (2024)
par: Ishmam, Md Farhan, et autres
Publié: (2024)
Multimodal Rationales for Explainable Visual Question Answering
par: Li, Kun, et autres
Publié: (2024)
par: Li, Kun, et autres
Publié: (2024)
Evaluating Variance in Visual Question Answering Benchmarks
par: SR, Nikitha
Publié: (2025)
par: SR, Nikitha
Publié: (2025)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
par: Zhang, Hongjie, et autres
Publié: (2023)
par: Zhang, Hongjie, et autres
Publié: (2023)
Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering
par: Ahir, Param, et autres
Publié: (2023)
par: Ahir, Param, et autres
Publié: (2023)
RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering
par: Zhang, Chengyi, et autres
Publié: (2026)
par: Zhang, Chengyi, et autres
Publié: (2026)
MedErr-CT: A Visual Question Answering Benchmark for Identifying and Correcting Errors in CT Reports
par: Kyung, Sunggu, et autres
Publié: (2025)
par: Kyung, Sunggu, et autres
Publié: (2025)
HalLoc: Token-level Localization of Hallucinations for Vision Language Models
par: Park, Eunkyu, et autres
Publié: (2025)
par: Park, Eunkyu, et autres
Publié: (2025)
Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering
par: Xue, Junxiao, et autres
Publié: (2024)
par: Xue, Junxiao, et autres
Publié: (2024)
Can Language Models Laugh at YouTube Short-form Videos?
par: Ko, Dayoon, et autres
Publié: (2023)
par: Ko, Dayoon, et autres
Publié: (2023)
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
par: Tang, Jingqun, et autres
Publié: (2024)
par: Tang, Jingqun, et autres
Publié: (2024)
Question-Aware Gaussian Experts for Audio-Visual Question Answering
par: Kim, Hongyeob, et autres
Publié: (2025)
par: Kim, Hongyeob, et autres
Publié: (2025)
Multi-Sourced Compositional Generalization in Visual Question Answering
par: Li, Chuanhao, et autres
Publié: (2025)
par: Li, Chuanhao, et autres
Publié: (2025)
Dataset and Benchmark for Urdu Natural Scenes Text Detection, Recognition and Visual Question Answering
par: Maryam, Hiba, et autres
Publié: (2024)
par: Maryam, Hiba, et autres
Publié: (2024)
Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat
par: Xu, Pusheng, et autres
Publié: (2025)
par: Xu, Pusheng, et autres
Publié: (2025)
MonoSAOD: Monocular 3D Object Detection with Sparsely Annotated Label
par: Jung, Junyoung, et autres
Publié: (2026)
par: Jung, Junyoung, et autres
Publié: (2026)
SEA: Evaluating Sketch Abstraction Efficiency via Element-level Commonsense Visual Question Answering
par: Park, Jiho, et autres
Publié: (2026)
par: Park, Jiho, et autres
Publié: (2026)
Multimodal Integration of Human-Like Attention in Visual Question Answering
par: Sood, Ekta, et autres
Publié: (2021)
par: Sood, Ekta, et autres
Publié: (2021)
DisasterVQA: A Visual Question Answering Benchmark Dataset for Disaster Scenes
par: Al-Mohannadi, Aisha, et autres
Publié: (2026)
par: Al-Mohannadi, Aisha, et autres
Publié: (2026)
Towards More Practical Group Activity Detection: A New Benchmark and Model
par: Kim, Dongkeun, et autres
Publié: (2023)
par: Kim, Dongkeun, et autres
Publié: (2023)
MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering
par: Peng, Jingwei, et autres
Publié: (2025)
par: Peng, Jingwei, et autres
Publié: (2025)
Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering
par: Lim, Su Hyeon, et autres
Publié: (2024)
par: Lim, Su Hyeon, et autres
Publié: (2024)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
par: Song, Enxin, et autres
Publié: (2024)
par: Song, Enxin, et autres
Publié: (2024)
M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering
par: Ma, Jiatong, et autres
Publié: (2026)
par: Ma, Jiatong, et autres
Publié: (2026)
Encoding and Controlling Global Semantics for Long-form Video Question Answering
par: Nguyen, Thong Thanh, et autres
Publié: (2024)
par: Nguyen, Thong Thanh, et autres
Publié: (2024)
MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark
par: Shaar, Shaden, et autres
Publié: (2026)
par: Shaar, Shaden, et autres
Publié: (2026)
LIVE-GS: Online LiDAR-Inertial-Visual State Estimation and Globally Consistent Mapping with 3D Gaussian Splatting
par: Park, Jaeseok, et autres
Publié: (2025)
par: Park, Jaeseok, et autres
Publié: (2025)
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
par: Chen, Guo, et autres
Publié: (2024)
par: Chen, Guo, et autres
Publié: (2024)
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
par: Su, Tongkun, et autres
Publié: (2024)
par: Su, Tongkun, et autres
Publié: (2024)
Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality
par: Park, Kyu Ri, et autres
Publié: (2024)
par: Park, Kyu Ri, et autres
Publié: (2024)
RoadscapesQA: A Multitask, Multimodal Dataset for Visual Question Answering on Indian Roads
par: Iyer, Vijayasri, et autres
Publié: (2026)
par: Iyer, Vijayasri, et autres
Publié: (2026)
Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling
par: Movva, Prahitha, et autres
Publié: (2025)
par: Movva, Prahitha, et autres
Publié: (2025)
Selectively Answering Visual Questions
par: Eisenschlos, Julian Martin, et autres
Publié: (2024)
par: Eisenschlos, Julian Martin, et autres
Publié: (2024)
Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation
par: Xu, Quanxing, et autres
Publié: (2026)
par: Xu, Quanxing, et autres
Publié: (2026)
Documents similaires
-
SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials
par: Kim, Wonjoong, et autres
Publié: (2024) -
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
par: Lee, Dosung, et autres
Publié: (2025) -
MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine
par: Zhang, Renrui, et autres
Publié: (2024) -
Object Attribute Matters in Visual Question Answering
par: Li, Peize, et autres
Publié: (2023) -
Hallucination Benchmark in Medical Visual Question Answering
par: Wu, Jinge, et autres
Publié: (2024)