SceMQA: A Scientific College Entrance Level Multimodal Question Answering Benchmark
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liang, Zhenwen, Guo, Kehan, Liu, Gang, Guo, Taicheng, Zhou, Yujun, Yang, Tianyu, Jiao, Jiajun, Pi, Renjie, Zhang, Jipeng, Zhang, Xiangliang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ScholarChemQA: Unveiling the Power of Language Models in Chemical Research Question Answering
von: Chen, Xiuying, et al.
Veröffentlicht: (2024)
von: Chen, Xiuying, et al.
Veröffentlicht: (2024)
Dissecting Logical Reasoning in LLMs: A Fine-Grained Evaluation and Supervision Study
von: Zhou, Yujun, et al.
Veröffentlicht: (2025)
von: Zhou, Yujun, et al.
Veröffentlicht: (2025)
SaSR-Net: Source-Aware Semantic Representation Network for Enhancing Audio-Visual Question Answering
von: Yang, Tianyu, et al.
Veröffentlicht: (2024)
von: Yang, Tianyu, et al.
Veröffentlicht: (2024)
Defending Jailbreak Prompts via In-Context Adversarial Game
von: Zhou, Yujun, et al.
Veröffentlicht: (2024)
von: Zhou, Yujun, et al.
Veröffentlicht: (2024)
ProMQA: Question Answering Dataset for Multimodal Procedural Activity Understanding
von: Hasegawa, Kimihiro, et al.
Veröffentlicht: (2024)
von: Hasegawa, Kimihiro, et al.
Veröffentlicht: (2024)
PediatricsMQA: a Multi-modal Pediatrics Question Answering Benchmark
von: Bahaj, Adil, et al.
Veröffentlicht: (2025)
von: Bahaj, Adil, et al.
Veröffentlicht: (2025)
Exploring Multi-Temperature Strategies for Token- and Rollout-Level Control in RLVR
von: Zhuang, Haomin, et al.
Veröffentlicht: (2025)
von: Zhuang, Haomin, et al.
Veröffentlicht: (2025)
MemeMQA: Multimodal Question Answering for Memes via Rationale-Based Inferencing
von: Agarwal, Siddhant, et al.
Veröffentlicht: (2024)
von: Agarwal, Siddhant, et al.
Veröffentlicht: (2024)
Rethinking Scientific Summarization Evaluation: Grounding Explainable Metrics on Facet-aware Benchmark
von: Chen, Xiuying, et al.
Veröffentlicht: (2024)
von: Chen, Xiuying, et al.
Veröffentlicht: (2024)
LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs
von: Zhou, Yujun, et al.
Veröffentlicht: (2024)
von: Zhou, Yujun, et al.
Veröffentlicht: (2024)
AutoLLMResearch: Training Research Agents for Automating LLM Experiment Configuration - Learning from Cheap, Optimizing Expensive
von: Guo, Taicheng, et al.
Veröffentlicht: (2026)
von: Guo, Taicheng, et al.
Veröffentlicht: (2026)
PokeMQA: Programmable knowledge editing for Multi-hop Question Answering
von: Gu, Hengrui, et al.
Veröffentlicht: (2023)
von: Gu, Hengrui, et al.
Veröffentlicht: (2023)
MuISQA: Multi-Intent Retrieval-Augmented Generation for Scientific Question Answering
von: Li, Zhiyuan, et al.
Veröffentlicht: (2025)
von: Li, Zhiyuan, et al.
Veröffentlicht: (2025)
Time-MQA: Time Series Multi-Task Question Answering with Context Enhancement
von: Kong, Yaxuan, et al.
Veröffentlicht: (2025)
von: Kong, Yaxuan, et al.
Veröffentlicht: (2025)
Causally-Enhanced Reinforcement Policy Optimization
von: Wang, Xiangqi, et al.
Veröffentlicht: (2025)
von: Wang, Xiangqi, et al.
Veröffentlicht: (2025)
Beyond Single-Value Metrics: Evaluating and Enhancing LLM Unlearning with Cognitive Diagnosis
von: Lang, Yicheng, et al.
Veröffentlicht: (2025)
von: Lang, Yicheng, et al.
Veröffentlicht: (2025)
MQA-KEAL: Multi-hop Question Answering under Knowledge Editing for Arabic Language
von: Ali, Muhammad Asif, et al.
Veröffentlicht: (2024)
von: Ali, Muhammad Asif, et al.
Veröffentlicht: (2024)
ReactionTeam: Teaming Experts for Divergent Thinking Beyond Typical Reaction Patterns
von: Guo, Taicheng, et al.
Veröffentlicht: (2023)
von: Guo, Taicheng, et al.
Veröffentlicht: (2023)
Effective Bilevel Optimization via Minimax Reformulation
von: Wang, Xiaoyu, et al.
Veröffentlicht: (2023)
von: Wang, Xiaoyu, et al.
Veröffentlicht: (2023)
AdaReasoner: Adaptive Reasoning Enables More Flexible Thinking in Large Language Models
von: Wang, Xiangqi, et al.
Veröffentlicht: (2025)
von: Wang, Xiangqi, et al.
Veröffentlicht: (2025)
Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data
von: Liang, Zhenwen, et al.
Veröffentlicht: (2026)
von: Liang, Zhenwen, et al.
Veröffentlicht: (2026)
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
von: Pi, Renjie, et al.
Veröffentlicht: (2024)
von: Pi, Renjie, et al.
Veröffentlicht: (2024)
PipeNet: Question Answering with Semantic Pruning over Knowledge Graphs
von: Su, Ying, et al.
Veröffentlicht: (2024)
von: Su, Ying, et al.
Veröffentlicht: (2024)
Capability-Oriented Training Induced Alignment Risk
von: Zhou, Yujun, et al.
Veröffentlicht: (2026)
von: Zhou, Yujun, et al.
Veröffentlicht: (2026)
Reliable Control-Point Selection for Steering Reasoning in Large Language Models
von: Zhuang, Haomin, et al.
Veröffentlicht: (2026)
von: Zhuang, Haomin, et al.
Veröffentlicht: (2026)
Dual Optimal: Make Your LLM Peer-like with Dignity
von: Wang, Xiangqi, et al.
Veröffentlicht: (2026)
von: Wang, Xiangqi, et al.
Veröffentlicht: (2026)
Pointing to a Llama and Call it a Camel: On the Sycophancy of Multimodal Large Language Models
von: Pi, Renjie, et al.
Veröffentlicht: (2025)
von: Pi, Renjie, et al.
Veröffentlicht: (2025)
Prioritization First, Principles Second: An Adaptive Interpretation of Helpful, Honest, and Harmless Principles
von: Huang, Yue, et al.
Veröffentlicht: (2025)
von: Huang, Yue, et al.
Veröffentlicht: (2025)
BioMol-MQA: A Multi-Modal Question Answering Dataset For LLM Reasoning Over Bio-Molecular Interactions
von: Sengupta, Saptarshi, et al.
Veröffentlicht: (2025)
von: Sengupta, Saptarshi, et al.
Veröffentlicht: (2025)
TCM-Ladder: A Benchmark for Multimodal Question Answering on Traditional Chinese Medicine
von: Xie, Jiacheng, et al.
Veröffentlicht: (2025)
von: Xie, Jiacheng, et al.
Veröffentlicht: (2025)
Personalized Visual Instruction Tuning
von: Pi, Renjie, et al.
Veröffentlicht: (2024)
von: Pi, Renjie, et al.
Veröffentlicht: (2024)
Image Textualization: An Automatic Framework for Creating Accurate and Detailed Image Descriptions
von: Pi, Renjie, et al.
Veröffentlicht: (2024)
von: Pi, Renjie, et al.
Veröffentlicht: (2024)
TAGCOS: Task-agnostic Gradient Clustered Coreset Selection for Instruction Tuning Data
von: Zhang, Jipeng, et al.
Veröffentlicht: (2024)
von: Zhang, Jipeng, et al.
Veröffentlicht: (2024)
A Survey of Multimodal Mathematical Reasoning: From Perception, Alignment to Reasoning
von: Yang, Tianyu, et al.
Veröffentlicht: (2026)
von: Yang, Tianyu, et al.
Veröffentlicht: (2026)
SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers
von: Pramanick, Shraman, et al.
Veröffentlicht: (2024)
von: Pramanick, Shraman, et al.
Veröffentlicht: (2024)
MathChat: Benchmarking Mathematical Reasoning and Instruction Following in Multi-Turn Interactions
von: Liang, Zhenwen, et al.
Veröffentlicht: (2024)
von: Liang, Zhenwen, et al.
Veröffentlicht: (2024)
ProMQA-Assembly: Multimodal Procedural QA Dataset on Assembly
von: Hasegawa, Kimihiro, et al.
Veröffentlicht: (2025)
von: Hasegawa, Kimihiro, et al.
Veröffentlicht: (2025)
IRPAPERS: A Visual Document Benchmark for Scientific Retrieval and Question Answering
von: Shorten, Connor, et al.
Veröffentlicht: (2026)
von: Shorten, Connor, et al.
Veröffentlicht: (2026)
MTSQL-R1: Towards Long-Horizon Multi-Turn Text-to-SQL via Agentic Training
von: Guo, Taicheng, et al.
Veröffentlicht: (2025)
von: Guo, Taicheng, et al.
Veröffentlicht: (2025)
NuScenes-QA: A Multi-modal Visual Question Answering Benchmark for Autonomous Driving Scenario
von: Qian, Tianwen, et al.
Veröffentlicht: (2023)
von: Qian, Tianwen, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
ScholarChemQA: Unveiling the Power of Language Models in Chemical Research Question Answering
von: Chen, Xiuying, et al.
Veröffentlicht: (2024) -
Dissecting Logical Reasoning in LLMs: A Fine-Grained Evaluation and Supervision Study
von: Zhou, Yujun, et al.
Veröffentlicht: (2025) -
SaSR-Net: Source-Aware Semantic Representation Network for Enhancing Audio-Visual Question Answering
von: Yang, Tianyu, et al.
Veröffentlicht: (2024) -
Defending Jailbreak Prompts via In-Context Adversarial Game
von: Zhou, Yujun, et al.
Veröffentlicht: (2024) -
ProMQA: Question Answering Dataset for Multimodal Procedural Activity Understanding
von: Hasegawa, Kimihiro, et al.
Veröffentlicht: (2024)