Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Yilun, Wang, Chengye, Li, Chuhan, Cohan, Arman |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SciMDR: Advancing Scientific Multimodal Document Reasoning
par: Chen, Ziyu, et autres
Publié: (2026)
par: Chen, Ziyu, et autres
Publié: (2026)
TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
par: Shangguan, Ziyao, et autres
Publié: (2024)
par: Shangguan, Ziyao, et autres
Publié: (2024)
SciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification
par: Wang, Chengye, et autres
Publié: (2025)
par: Wang, Chengye, et autres
Publié: (2025)
M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
par: Li, Chuhan, et autres
Publié: (2024)
par: Li, Chuhan, et autres
Publié: (2024)
Can LLMs Identify Critical Limitations within Scientific Research? A Systematic Evaluation on AI Research Papers
par: Xu, Zhijian, et autres
Publié: (2025)
par: Xu, Zhijian, et autres
Publié: (2025)
MMVU: Measuring Expert-Level Multi-Discipline Video Understanding
par: Zhao, Yilun, et autres
Publié: (2025)
par: Zhao, Yilun, et autres
Publié: (2025)
Can DeepSeek Reason Like a Surgeon? An Empirical Evaluation for Vision-Language Understanding in Robotic-Assisted Surgery
par: Ma, Boyi, et autres
Publié: (2025)
par: Ma, Boyi, et autres
Publié: (2025)
SciDQA: A Deep Reading Comprehension Dataset over Scientific Papers
par: Singh, Shruti, et autres
Publié: (2024)
par: Singh, Shruti, et autres
Publié: (2024)
AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research
par: Zhao, Yilun, et autres
Publié: (2025)
par: Zhao, Yilun, et autres
Publié: (2025)
Intern-S1: A Scientific Multimodal Foundation Model
par: Bai, Lei, et autres
Publié: (2025)
par: Bai, Lei, et autres
Publié: (2025)
Can Large Vision-Language Models Understand Multimodal Sarcasm?
par: Wang, Xinyu, et autres
Publié: (2025)
par: Wang, Xinyu, et autres
Publié: (2025)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
par: Wang, Yanling, et autres
Publié: (2025)
par: Wang, Yanling, et autres
Publié: (2025)
Intern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scale
par: Zou, Yicheng, et autres
Publié: (2026)
par: Zou, Yicheng, et autres
Publié: (2026)
OmniSch: A Multimodal PCB Schematic Benchmark For Structured Diagram Visual Reasoning
par: Lu, Taiting, et autres
Publié: (2026)
par: Lu, Taiting, et autres
Publié: (2026)
SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers
par: Pramanick, Shraman, et autres
Publié: (2024)
par: Pramanick, Shraman, et autres
Publié: (2024)
DIAGRAMS: A Review Framework for Reasoning-Level Attribution in Diagram QA
par: Iyengar, Anirudh Iyengar Kaniyar Narayana, et autres
Publié: (2026)
par: Iyengar, Anirudh Iyengar Kaniyar Narayana, et autres
Publié: (2026)
DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding
par: Wu, Zhiyu, et autres
Publié: (2024)
par: Wu, Zhiyu, et autres
Publié: (2024)
MSG-Chart: Multimodal Scene Graph for ChartQA
par: Dai, Yue, et autres
Publié: (2024)
par: Dai, Yue, et autres
Publié: (2024)
MimeQA: Towards Socially-Intelligent Nonverbal Foundation Models
par: Li, Hengzhi, et autres
Publié: (2025)
par: Li, Hengzhi, et autres
Publié: (2025)
Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!
par: Imam, Mohamed Fazli, et autres
Publié: (2025)
par: Imam, Mohamed Fazli, et autres
Publié: (2025)
WeatherQA: Can Multimodal Language Models Reason about Severe Weather?
par: Ma, Chengqian, et autres
Publié: (2024)
par: Ma, Chengqian, et autres
Publié: (2024)
Paper2Poster: Towards Multimodal Poster Automation from Scientific Papers
par: Pang, Wei, et autres
Publié: (2025)
par: Pang, Wei, et autres
Publié: (2025)
Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning
par: LASA Team, et autres
Publié: (2025)
par: LASA Team, et autres
Publié: (2025)
Can CLIP Count Stars? An Empirical Study on Quantity Bias in CLIP
par: Zhang, Zeliang, et autres
Publié: (2024)
par: Zhang, Zeliang, et autres
Publié: (2024)
ProMQA-Assembly: Multimodal Procedural QA Dataset on Assembly
par: Hasegawa, Kimihiro, et autres
Publié: (2025)
par: Hasegawa, Kimihiro, et autres
Publié: (2025)
Personalized Scientific Figure Caption Generation: An Empirical Study on Author-Specific Writing Style Transfer
par: Kim, Jaeyoung, et autres
Publié: (2025)
par: Kim, Jaeyoung, et autres
Publié: (2025)
Investigating Structural Pruning and Recovery Techniques for Compressing Multimodal Large Language Models: An Empirical Study
par: Huang, Yiran, et autres
Publié: (2025)
par: Huang, Yiran, et autres
Publié: (2025)
Toward Robust Multimodal Learning using Multimodal Foundational Models
par: Zhao, Xianbing, et autres
Publié: (2024)
par: Zhao, Xianbing, et autres
Publié: (2024)
Learning How To Ask: Cycle-Consistency Refines Prompts in Multimodal Foundation Models
par: Diesendruck, Maurice, et autres
Publié: (2024)
par: Diesendruck, Maurice, et autres
Publié: (2024)
Visual-TableQA: Open-Domain Benchmark for Reasoning over Table Images
par: Lompo, Boammani Aser, et autres
Publié: (2025)
par: Lompo, Boammani Aser, et autres
Publié: (2025)
CartoMapQA: A Fundamental Benchmark Dataset Evaluating Vision-Language Models on Cartographic Map Understanding
par: Ung, Huy Quang, et autres
Publié: (2025)
par: Ung, Huy Quang, et autres
Publié: (2025)
Understanding Alignment in Multimodal LLMs: A Comprehensive Study
par: Amirloo, Elmira, et autres
Publié: (2024)
par: Amirloo, Elmira, et autres
Publié: (2024)
AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
par: Suglia, Alessandro, et autres
Publié: (2024)
par: Suglia, Alessandro, et autres
Publié: (2024)
Textual Steering Vectors Can Improve Visual Understanding in Multimodal Large Language Models
par: Gan, Woody Haosheng, et autres
Publié: (2025)
par: Gan, Woody Haosheng, et autres
Publié: (2025)
SciRAG: Adaptive, Citation-Aware, and Outline-Guided Retrieval and Synthesis for Scientific Literature
par: Ding, Hang, et autres
Publié: (2025)
par: Ding, Hang, et autres
Publié: (2025)
MMSci: A Dataset for Graduate-Level Multi-Discipline Multimodal Scientific Understanding
par: Li, Zekun, et autres
Publié: (2024)
par: Li, Zekun, et autres
Publié: (2024)
VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos
par: Song, Tingyu, et autres
Publié: (2025)
par: Song, Tingyu, et autres
Publié: (2025)
ChemVA: Advancing Large Language Models on Chemical Reaction Diagrams Understanding
par: Rao, Mingyang, et autres
Publié: (2026)
par: Rao, Mingyang, et autres
Publié: (2026)
MCTS-RAG: Enhancing Retrieval-Augmented Generation with Monte Carlo Tree Search
par: Hu, Yunhai, et autres
Publié: (2025)
par: Hu, Yunhai, et autres
Publié: (2025)
Docopilot: Improving Multimodal Models for Document-Level Understanding
par: Duan, Yuchen, et autres
Publié: (2025)
par: Duan, Yuchen, et autres
Publié: (2025)
Documents similaires
-
SciMDR: Advancing Scientific Multimodal Document Reasoning
par: Chen, Ziyu, et autres
Publié: (2026) -
TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
par: Shangguan, Ziyao, et autres
Publié: (2024) -
SciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification
par: Wang, Chengye, et autres
Publié: (2025) -
M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
par: Li, Chuhan, et autres
Publié: (2024) -
Can LLMs Identify Critical Limitations within Scientific Research? A Systematic Evaluation on AI Research Papers
par: Xu, Zhijian, et autres
Publié: (2025)