MAVIS: A Benchmark for Multimodal Source Attribution in Long-form Visual Question Answering
Fuente:
arXiv
Salvato in:
| Autori principali: | Song, Seokwon, Park, Minsu, Kim, Gunhee |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials
di: Kim, Wonjoong, et al.
Pubblicazione: (2024)
di: Kim, Wonjoong, et al.
Pubblicazione: (2024)
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
di: Lee, Dosung, et al.
Pubblicazione: (2025)
di: Lee, Dosung, et al.
Pubblicazione: (2025)
MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine
di: Zhang, Renrui, et al.
Pubblicazione: (2024)
di: Zhang, Renrui, et al.
Pubblicazione: (2024)
Visual Robustness Benchmark for Visual Question Answering (VQA)
di: Ishmam, Md Farhan, et al.
Pubblicazione: (2024)
di: Ishmam, Md Farhan, et al.
Pubblicazione: (2024)
Object Attribute Matters in Visual Question Answering
di: Li, Peize, et al.
Pubblicazione: (2023)
di: Li, Peize, et al.
Pubblicazione: (2023)
Multimodal Rationales for Explainable Visual Question Answering
di: Li, Kun, et al.
Pubblicazione: (2024)
di: Li, Kun, et al.
Pubblicazione: (2024)
Evaluating Variance in Visual Question Answering Benchmarks
di: SR, Nikitha
Pubblicazione: (2025)
di: SR, Nikitha
Pubblicazione: (2025)
Hallucination Benchmark in Medical Visual Question Answering
di: Wu, Jinge, et al.
Pubblicazione: (2024)
di: Wu, Jinge, et al.
Pubblicazione: (2024)
LvBench: A Benchmark for Long-form Video Understanding with Versatile Multi-modal Question Answering
di: Zhang, Hongjie, et al.
Pubblicazione: (2023)
di: Zhang, Hongjie, et al.
Pubblicazione: (2023)
TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table Domains
di: Kim, Yoonsik, et al.
Pubblicazione: (2024)
di: Kim, Yoonsik, et al.
Pubblicazione: (2024)
RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering
di: Zhang, Chengyi, et al.
Pubblicazione: (2026)
di: Zhang, Chengyi, et al.
Pubblicazione: (2026)
Knowledge Detection by Relevant Question and Image Attributes in Visual Question Answering
di: Ahir, Param, et al.
Pubblicazione: (2023)
di: Ahir, Param, et al.
Pubblicazione: (2023)
MedErr-CT: A Visual Question Answering Benchmark for Identifying and Correcting Errors in CT Reports
di: Kyung, Sunggu, et al.
Pubblicazione: (2025)
di: Kyung, Sunggu, et al.
Pubblicazione: (2025)
Enhanced Multimodal RAG-LLM for Accurate Visual Question Answering
di: Xue, Junxiao, et al.
Pubblicazione: (2024)
di: Xue, Junxiao, et al.
Pubblicazione: (2024)
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
di: Tang, Jingqun, et al.
Pubblicazione: (2024)
di: Tang, Jingqun, et al.
Pubblicazione: (2024)
Dataset and Benchmark for Urdu Natural Scenes Text Detection, Recognition and Visual Question Answering
di: Maryam, Hiba, et al.
Pubblicazione: (2024)
di: Maryam, Hiba, et al.
Pubblicazione: (2024)
Question-Aware Gaussian Experts for Audio-Visual Question Answering
di: Kim, Hongyeob, et al.
Pubblicazione: (2025)
di: Kim, Hongyeob, et al.
Pubblicazione: (2025)
Benchmarking Large Multimodal Models for Ophthalmic Visual Question Answering with OphthalWeChat
di: Xu, Pusheng, et al.
Pubblicazione: (2025)
di: Xu, Pusheng, et al.
Pubblicazione: (2025)
Multi-Sourced Compositional Generalization in Visual Question Answering
di: Li, Chuanhao, et al.
Pubblicazione: (2025)
di: Li, Chuanhao, et al.
Pubblicazione: (2025)
SEA: Evaluating Sketch Abstraction Efficiency via Element-level Commonsense Visual Question Answering
di: Park, Jiho, et al.
Pubblicazione: (2026)
di: Park, Jiho, et al.
Pubblicazione: (2026)
DisasterVQA: A Visual Question Answering Benchmark Dataset for Disaster Scenes
di: Al-Mohannadi, Aisha, et al.
Pubblicazione: (2026)
di: Al-Mohannadi, Aisha, et al.
Pubblicazione: (2026)
HalLoc: Token-level Localization of Hallucinations for Vision Language Models
di: Park, Eunkyu, et al.
Pubblicazione: (2025)
di: Park, Eunkyu, et al.
Pubblicazione: (2025)
MV-CoRe: Multimodal Visual-Conceptual Reasoning for Complex Visual Question Answering
di: Peng, Jingwei, et al.
Pubblicazione: (2025)
di: Peng, Jingwei, et al.
Pubblicazione: (2025)
Multimodal Integration of Human-Like Attention in Visual Question Answering
di: Sood, Ekta, et al.
Pubblicazione: (2021)
di: Sood, Ekta, et al.
Pubblicazione: (2021)
Retrieval-Augmented Natural Language Reasoning for Explainable Visual Question Answering
di: Lim, Su Hyeon, et al.
Pubblicazione: (2024)
di: Lim, Su Hyeon, et al.
Pubblicazione: (2024)
MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark
di: Shaar, Shaden, et al.
Pubblicazione: (2026)
di: Shaar, Shaden, et al.
Pubblicazione: (2026)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
di: Song, Enxin, et al.
Pubblicazione: (2024)
di: Song, Enxin, et al.
Pubblicazione: (2024)
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
di: Chen, Guo, et al.
Pubblicazione: (2024)
di: Chen, Guo, et al.
Pubblicazione: (2024)
Can Language Models Laugh at YouTube Short-form Videos?
di: Ko, Dayoon, et al.
Pubblicazione: (2023)
di: Ko, Dayoon, et al.
Pubblicazione: (2023)
M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering
di: Ma, Jiatong, et al.
Pubblicazione: (2026)
di: Ma, Jiatong, et al.
Pubblicazione: (2026)
RoadscapesQA: A Multitask, Multimodal Dataset for Visual Question Answering on Indian Roads
di: Iyer, Vijayasri, et al.
Pubblicazione: (2026)
di: Iyer, Vijayasri, et al.
Pubblicazione: (2026)
Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling
di: Movva, Prahitha, et al.
Pubblicazione: (2025)
di: Movva, Prahitha, et al.
Pubblicazione: (2025)
Enhancing Visual Question Answering with Multimodal LLMs via Chain-of-Question Guided Retrieval-Augmented Generation
di: Xu, Quanxing, et al.
Pubblicazione: (2026)
di: Xu, Quanxing, et al.
Pubblicazione: (2026)
MonoSAOD: Monocular 3D Object Detection with Sparsely Annotated Label
di: Jung, Junyoung, et al.
Pubblicazione: (2026)
di: Jung, Junyoung, et al.
Pubblicazione: (2026)
Encoding and Controlling Global Semantics for Long-form Video Question Answering
di: Nguyen, Thong Thanh, et al.
Pubblicazione: (2024)
di: Nguyen, Thong Thanh, et al.
Pubblicazione: (2024)
Design as Desired: Utilizing Visual Question Answering for Multimodal Pre-training
di: Su, Tongkun, et al.
Pubblicazione: (2024)
di: Su, Tongkun, et al.
Pubblicazione: (2024)
Towards More Practical Group Activity Detection: A New Benchmark and Model
di: Kim, Dongkeun, et al.
Pubblicazione: (2023)
di: Kim, Dongkeun, et al.
Pubblicazione: (2023)
Selectively Answering Visual Questions
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
ReasonVQA: A Multi-hop Reasoning Benchmark with Structural Knowledge for Visual Question Answering
di: Tran, Duong T., et al.
Pubblicazione: (2025)
di: Tran, Duong T., et al.
Pubblicazione: (2025)
Visual Question Answering Instruction: Unlocking Multimodal Large Language Model To Domain-Specific Visual Multitasks
di: Lee, Jusung, et al.
Pubblicazione: (2024)
di: Lee, Jusung, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials
di: Kim, Wonjoong, et al.
Pubblicazione: (2024) -
Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering
di: Lee, Dosung, et al.
Pubblicazione: (2025) -
MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine
di: Zhang, Renrui, et al.
Pubblicazione: (2024) -
Visual Robustness Benchmark for Visual Question Answering (VQA)
di: Ishmam, Md Farhan, et al.
Pubblicazione: (2024) -
Object Attribute Matters in Visual Question Answering
di: Li, Peize, et al.
Pubblicazione: (2023)