SciMDR: Advancing Scientific Multimodal Document Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Ziyu, Zhao, Yilun, Wang, Chengye, Han, Rilyn, Patwardhan, Manasi, Cohan, Arman |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers
von: Zhao, Yilun, et al.
Veröffentlicht: (2025)
von: Zhao, Yilun, et al.
Veröffentlicht: (2025)
TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
von: Shangguan, Ziyao, et al.
Veröffentlicht: (2024)
von: Shangguan, Ziyao, et al.
Veröffentlicht: (2024)
AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research
von: Zhao, Yilun, et al.
Veröffentlicht: (2025)
von: Zhao, Yilun, et al.
Veröffentlicht: (2025)
SciRAG: Adaptive, Citation-Aware, and Outline-Guided Retrieval and Synthesis for Scientific Literature
von: Ding, Hang, et al.
Veröffentlicht: (2025)
von: Ding, Hang, et al.
Veröffentlicht: (2025)
SciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification
von: Wang, Chengye, et al.
Veröffentlicht: (2025)
von: Wang, Chengye, et al.
Veröffentlicht: (2025)
IRIS: Interactive Research Ideation System for Accelerating Scientific Discovery
von: Garikaparthi, Aniketh, et al.
Veröffentlicht: (2025)
von: Garikaparthi, Aniketh, et al.
Veröffentlicht: (2025)
SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problems
von: Guo, Ziyu, et al.
Veröffentlicht: (2025)
von: Guo, Ziyu, et al.
Veröffentlicht: (2025)
Can LLMs Identify Critical Limitations within Scientific Research? A Systematic Evaluation on AI Research Papers
von: Xu, Zhijian, et al.
Veröffentlicht: (2025)
von: Xu, Zhijian, et al.
Veröffentlicht: (2025)
Thought-For-Food: Reasoning Chain Induced Food Visual Question Answering
von: Jain, Riddhi, et al.
Veröffentlicht: (2025)
von: Jain, Riddhi, et al.
Veröffentlicht: (2025)
MMVU: Measuring Expert-Level Multi-Discipline Video Understanding
von: Zhao, Yilun, et al.
Veröffentlicht: (2025)
von: Zhao, Yilun, et al.
Veröffentlicht: (2025)
Scientific Reasoning: Assessment of Multimodal Generative LLMs
von: Dreyer, Florian, et al.
Veröffentlicht: (2025)
von: Dreyer, Florian, et al.
Veröffentlicht: (2025)
MIR: Methodology Inspiration Retrieval for Scientific Research Problems
von: Garikaparthi, Aniketh, et al.
Veröffentlicht: (2025)
von: Garikaparthi, Aniketh, et al.
Veröffentlicht: (2025)
Do Large Multimodal Models Solve Caption Generation for Scientific Figures? Lessons Learned from SciCap Challenge 2023
von: Hsu, Ting-Yao E., et al.
Veröffentlicht: (2025)
von: Hsu, Ting-Yao E., et al.
Veröffentlicht: (2025)
VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos
von: Song, Tingyu, et al.
Veröffentlicht: (2025)
von: Song, Tingyu, et al.
Veröffentlicht: (2025)
SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models
von: Deng, Andong, et al.
Veröffentlicht: (2025)
von: Deng, Andong, et al.
Veröffentlicht: (2025)
RbtAct: Rebuttal as Supervision for Actionable Review Feedback Generation
von: Wu, Sihong, et al.
Veröffentlicht: (2026)
von: Wu, Sihong, et al.
Veröffentlicht: (2026)
VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning
von: Yuan, Ruifeng, et al.
Veröffentlicht: (2025)
von: Yuan, Ruifeng, et al.
Veröffentlicht: (2025)
M3SciQA: A Multi-Modal Multi-Document Scientific QA Benchmark for Evaluating Foundation Models
von: Li, Chuhan, et al.
Veröffentlicht: (2024)
von: Li, Chuhan, et al.
Veröffentlicht: (2024)
AiSciVision: A Framework for Specializing Large Multimodal Models in Scientific Image Classification
von: Hogan, Brendan, et al.
Veröffentlicht: (2024)
von: Hogan, Brendan, et al.
Veröffentlicht: (2024)
ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both
von: Guo, Ziyu, et al.
Veröffentlicht: (2026)
von: Guo, Ziyu, et al.
Veröffentlicht: (2026)
Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space
von: Wang, Zihang, et al.
Veröffentlicht: (2026)
von: Wang, Zihang, et al.
Veröffentlicht: (2026)
Multimodal Fact-Level Attribution for Verifiable Reasoning
von: Wan, David, et al.
Veröffentlicht: (2026)
von: Wan, David, et al.
Veröffentlicht: (2026)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
von: Wang, Yuqing, et al.
Veröffentlicht: (2023)
von: Wang, Yuqing, et al.
Veröffentlicht: (2023)
Advancing Conversational Diagnostic AI with Multimodal Reasoning
von: Saab, Khaled, et al.
Veröffentlicht: (2025)
von: Saab, Khaled, et al.
Veröffentlicht: (2025)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
von: Jiang, Dongzhi, et al.
Veröffentlicht: (2025)
von: Jiang, Dongzhi, et al.
Veröffentlicht: (2025)
SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation
von: Guo, Longteng, et al.
Veröffentlicht: (2026)
von: Guo, Longteng, et al.
Veröffentlicht: (2026)
Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start
von: Wei, Lai, et al.
Veröffentlicht: (2025)
von: Wei, Lai, et al.
Veröffentlicht: (2025)
Multimodal Chain-of-Thought Reasoning in Language Models
von: Zhang, Zhuosheng, et al.
Veröffentlicht: (2023)
von: Zhang, Zhuosheng, et al.
Veröffentlicht: (2023)
Can AI Be a Good Peer Reviewer? A Survey of Peer Review Process, Evaluation, and the Future
von: Wu, Sihong, et al.
Veröffentlicht: (2026)
von: Wu, Sihong, et al.
Veröffentlicht: (2026)
Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
von: Chen, Shuang, et al.
Veröffentlicht: (2025)
Talk Less, Interact Better: Evaluating In-context Conversational Adaptation in Multimodal LLMs
von: Hua, Yilun, et al.
Veröffentlicht: (2024)
von: Hua, Yilun, et al.
Veröffentlicht: (2024)
DentalGPT: Incentivizing Multimodal Complex Reasoning in Dentistry
von: Cai, Zhenyang, et al.
Veröffentlicht: (2025)
von: Cai, Zhenyang, et al.
Veröffentlicht: (2025)
TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity
von: Yang, Zheyuan, et al.
Veröffentlicht: (2026)
von: Yang, Zheyuan, et al.
Veröffentlicht: (2026)
PosterSum: A Multimodal Benchmark for Scientific Poster Summarization
von: Saxena, Rohit, et al.
Veröffentlicht: (2025)
von: Saxena, Rohit, et al.
Veröffentlicht: (2025)
SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers
von: Pramanick, Shraman, et al.
Veröffentlicht: (2024)
von: Pramanick, Shraman, et al.
Veröffentlicht: (2024)
Privacy Preserving Ordinal-Meta Learning with VLMs for Fine-Grained Fruit Quality Prediction
von: Jain, Riddhi, et al.
Veröffentlicht: (2025)
von: Jain, Riddhi, et al.
Veröffentlicht: (2025)
ScImage: How Good Are Multimodal Large Language Models at Scientific Text-to-Image Generation?
von: Zhang, Leixin, et al.
Veröffentlicht: (2024)
von: Zhang, Leixin, et al.
Veröffentlicht: (2024)
MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments
von: Wang, Han, et al.
Veröffentlicht: (2026)
von: Wang, Han, et al.
Veröffentlicht: (2026)
Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR
von: Zhong, Yufeng, et al.
Veröffentlicht: (2025)
von: Zhong, Yufeng, et al.
Veröffentlicht: (2025)
ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoning
von: Liao, Huanxuan, et al.
Veröffentlicht: (2026)
von: Liao, Huanxuan, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers
von: Zhao, Yilun, et al.
Veröffentlicht: (2025) -
TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models
von: Shangguan, Ziyao, et al.
Veröffentlicht: (2024) -
AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research
von: Zhao, Yilun, et al.
Veröffentlicht: (2025) -
SciRAG: Adaptive, Citation-Aware, and Outline-Guided Retrieval and Synthesis for Scientific Literature
von: Ding, Hang, et al.
Veröffentlicht: (2025) -
SciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification
von: Wang, Chengye, et al.
Veröffentlicht: (2025)