MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Suhao, Wang, Haojin, Wu, Juncheng, Luo, Luyang, Wang, Jingshen, Xie, Cihang, Rajpurkar, Pranav, Yang, Carl, Yang, Yang, Wang, Kang, Yu, Yannan, Zhou, Yuyin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ReXSonoVQA: A Video QA Benchmark for Procedure-Centric Ultrasound Understanding
par: Wang, Xucheng, et autres
Publié: (2026)
par: Wang, Xucheng, et autres
Publié: (2026)
MedAutoCorrect: Image-Conditioned Autocorrection in Medical Reporting
par: Asiimwe, Arnold Caleb, et autres
Publié: (2024)
par: Asiimwe, Arnold Caleb, et autres
Publié: (2024)
MedVLThinker: Simple Baselines for Multimodal Medical Reasoning
par: Huang, Xiaoke, et autres
Publié: (2025)
par: Huang, Xiaoke, et autres
Publié: (2025)
ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning
par: Wu, Juncheng, et autres
Publié: (2026)
par: Wu, Juncheng, et autres
Publié: (2026)
ReX-MLE: The Autonomous Agent Benchmark for Medical Imaging Challenges
par: Kenia, Roshan, et autres
Publié: (2025)
par: Kenia, Roshan, et autres
Publié: (2025)
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
par: Zuo, Yuxin, et autres
Publié: (2025)
par: Zuo, Yuxin, et autres
Publié: (2025)
MedSegFactory: Text-Guided Generation of Medical Image-Mask Pairs
par: Mao, Jiawei, et autres
Publié: (2025)
par: Mao, Jiawei, et autres
Publié: (2025)
MedVersa: A Generalist Foundation Model for Medical Image Interpretation
par: Zhou, Hong-Yu, et autres
Publié: (2024)
par: Zhou, Hong-Yu, et autres
Publié: (2024)
MedQA-CS: Objective Structured Clinical Examination (OSCE)-Style Benchmark for Evaluating LLM Clinical Skills
par: Yao, Zonghai, et autres
Publié: (2024)
par: Yao, Zonghai, et autres
Publié: (2024)
ReasVQA: Advancing VideoQA with Imperfect Reasoning Process
par: Liang, Jianxin, et autres
Publié: (2025)
par: Liang, Jianxin, et autres
Publié: (2025)
Knowledge or Reasoning? A Close Look at How LLMs Think Across Domains
par: Wu, Juncheng, et autres
Publié: (2025)
par: Wu, Juncheng, et autres
Publié: (2025)
MedConceptsQA: Open Source Medical Concepts QA Benchmark
par: Shoham, Ofir Ben, et autres
Publié: (2024)
par: Shoham, Ofir Ben, et autres
Publié: (2024)
MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation
par: Shang, Fangxin, et autres
Publié: (2025)
par: Shang, Fangxin, et autres
Publié: (2025)
MultiMedEdit: A Scenario-Aware Benchmark for Evaluating Knowledge Editing in Medical VQA
par: Wen, Shengtao, et autres
Publié: (2025)
par: Wen, Shengtao, et autres
Publié: (2025)
Beyond MedQA: Towards Real-world Clinical Decision Making in the Era of LLMs
par: Xiao, Yunpeng, et autres
Publié: (2025)
par: Xiao, Yunpeng, et autres
Publié: (2025)
3DReasonKnee: Advancing Grounded Reasoning in Medical Vision Language Models
par: Sambara, Sraavya, et autres
Publié: (2025)
par: Sambara, Sraavya, et autres
Publié: (2025)
MedAdapter: Efficient Test-Time Adaptation of Large Language Models towards Medical Reasoning
par: Shi, Wenqi, et autres
Publié: (2024)
par: Shi, Wenqi, et autres
Publié: (2024)
MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs
par: Wei, Jianhui, et autres
Publié: (2025)
par: Wei, Jianhui, et autres
Publié: (2025)
OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM
par: Hu, Yutao, et autres
Publié: (2024)
par: Hu, Yutao, et autres
Publié: (2024)
MedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for Medicine
par: Xie, Yunfei, et autres
Publié: (2024)
par: Xie, Yunfei, et autres
Publié: (2024)
AQA-Bench: An Interactive Benchmark for Evaluating LLMs' Sequential Reasoning Ability
par: Yang, Siwei, et autres
Publié: (2024)
par: Yang, Siwei, et autres
Publié: (2024)
MedReason: Eliciting Factual Medical Reasoning Steps in LLMs via Knowledge Graphs
par: Wu, Juncheng, et autres
Publié: (2025)
par: Wu, Juncheng, et autres
Publié: (2025)
MedExQA: Medical Question Answering Benchmark with Multiple Explanations
par: Kim, Yunsoo, et autres
Publié: (2024)
par: Kim, Yunsoo, et autres
Publié: (2024)
Evaluating Contextual Intelligence in Recyclability: A Comprehensive Study of Image-Based Reasoning Systems
par: Park, Eliot, et autres
Publié: (2025)
par: Park, Eliot, et autres
Publié: (2025)
$\texttt{Complex-Edit}$: CoT-Like Instruction Generation for Complexity-Controllable Image Editing Benchmark
par: Yang, Siwei, et autres
Publié: (2025)
par: Yang, Siwei, et autres
Publié: (2025)
From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
par: Wu, Juncheng, et autres
Publié: (2026)
par: Wu, Juncheng, et autres
Publié: (2026)
m1: Unleash the Potential of Test-Time Scaling for Medical Reasoning with Large Language Models
par: Huang, Xiaoke, et autres
Publié: (2025)
par: Huang, Xiaoke, et autres
Publié: (2025)
RJUA-MedDQA: A Multimodal Benchmark for Medical Document Question Answering and Clinical Reasoning
par: Jin, Congyun, et autres
Publié: (2024)
par: Jin, Congyun, et autres
Publié: (2024)
MedSeg-R: Reasoning Segmentation in Medical Images with Multimodal Large Language Models
par: Huang, Yu, et autres
Publié: (2025)
par: Huang, Yu, et autres
Publié: (2025)
MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
par: Li, Yingyun, et autres
Publié: (2026)
par: Li, Yingyun, et autres
Publié: (2026)
MedCare: Advancing Medical LLMs through Decoupling Clinical Alignment and Knowledge Aggregation
par: Liao, Yusheng, et autres
Publié: (2024)
par: Liao, Yusheng, et autres
Publié: (2024)
MedExpQA: Multilingual Benchmarking of Large Language Models for Medical Question Answering
par: Alonso, Iñigo, et autres
Publié: (2024)
par: Alonso, Iñigo, et autres
Publié: (2024)
DDR: Exploiting Deep Degradation Response as Flexible Image Descriptor
par: Wu, Juncheng, et autres
Publié: (2024)
par: Wu, Juncheng, et autres
Publié: (2024)
CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence
par: Ma, Dongsheng, et autres
Publié: (2026)
par: Ma, Dongsheng, et autres
Publié: (2026)
MedRECT: A Medical Reasoning Benchmark for Error Correction in Clinical Texts
par: Iwase, Naoto, et autres
Publié: (2025)
par: Iwase, Naoto, et autres
Publié: (2025)
Scaling White-Box Transformers for Vision
par: Yang, Jinrui, et autres
Publié: (2024)
par: Yang, Jinrui, et autres
Publié: (2024)
ARFlow: Autoregressive Flow with Hybrid Linear Attention
par: Hui, Mude, et autres
Publié: (2025)
par: Hui, Mude, et autres
Publié: (2025)
GPT-IMAGE-EDIT-1.5M: A Million-Scale, GPT-Generated Image Dataset
par: Wang, Yuhan, et autres
Publié: (2025)
par: Wang, Yuhan, et autres
Publié: (2025)
LLM-MedQA: Enhancing Medical Question Answering through Case Studies in Large Language Models
par: Yang, Hang, et autres
Publié: (2024)
par: Yang, Hang, et autres
Publié: (2024)
MedPRMBench: A Fine-grained Benchmark for Process Reward Models in Medical Reasoning
par: Wu, Lingyan, et autres
Publié: (2026)
par: Wu, Lingyan, et autres
Publié: (2026)
Documents similaires
-
ReXSonoVQA: A Video QA Benchmark for Procedure-Centric Ultrasound Understanding
par: Wang, Xucheng, et autres
Publié: (2026) -
MedAutoCorrect: Image-Conditioned Autocorrection in Medical Reporting
par: Asiimwe, Arnold Caleb, et autres
Publié: (2024) -
MedVLThinker: Simple Baselines for Multimodal Medical Reasoning
par: Huang, Xiaoke, et autres
Publié: (2025) -
ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning
par: Wu, Juncheng, et autres
Publié: (2026) -
ReX-MLE: The Autonomous Agent Benchmark for Medical Imaging Challenges
par: Kenia, Roshan, et autres
Publié: (2025)