MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shang, Fangxin, Xia, Yuan, Yang, Dalu, Wang, Yahui, Yang, Binglin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
par: Ding, Meidan, et autres
Publié: (2025)
par: Ding, Meidan, et autres
Publié: (2025)
MedHallTune: An Instruction-Tuning Benchmark for Mitigating Medical Hallucination in Vision-Language Models
par: Yan, Qiao, et autres
Publié: (2025)
par: Yan, Qiao, et autres
Publié: (2025)
MedXIAOHE: A Comprehensive Recipe for Building Medical MLLMs
par: Shi, Baorong, et autres
Publié: (2026)
par: Shi, Baorong, et autres
Publié: (2026)
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
par: Zuo, Yuxin, et autres
Publié: (2025)
par: Zuo, Yuxin, et autres
Publié: (2025)
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
par: Yang, Rui, et autres
Publié: (2025)
par: Yang, Rui, et autres
Publié: (2025)
MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding
par: Wang, Fei, et autres
Publié: (2024)
par: Wang, Fei, et autres
Publié: (2024)
Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing
par: Yang, Minglai, et autres
Publié: (2026)
par: Yang, Minglai, et autres
Publié: (2026)
MedGemma Technical Report
par: Sellergren, Andrew, et autres
Publié: (2025)
par: Sellergren, Andrew, et autres
Publié: (2025)
MindBench: A Comprehensive Benchmark for Mind Map Structure Recognition and Analysis
par: Chen, Lei, et autres
Publié: (2024)
par: Chen, Lei, et autres
Publié: (2024)
Face-Human-Bench: A Comprehensive Benchmark of Face and Human Understanding for Multi-modal Assistants
par: Qin, Lixiong, et autres
Publié: (2025)
par: Qin, Lixiong, et autres
Publié: (2025)
VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects
par: Gao, Xiangbo, et autres
Publié: (2026)
par: Gao, Xiangbo, et autres
Publié: (2026)
KorMedMCQA-V: A Multimodal Benchmark for Evaluating Vision-Language Models on the Korean Medical Licensing Examination
par: Choi, Byungjin, et autres
Publié: (2026)
par: Choi, Byungjin, et autres
Publié: (2026)
TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation
par: Feng, Weixi, et autres
Publié: (2024)
par: Feng, Weixi, et autres
Publié: (2024)
AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation
par: Zhou, Ziwei, et autres
Publié: (2026)
par: Zhou, Ziwei, et autres
Publié: (2026)
FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications
par: Yang, Yehui, et autres
Publié: (2026)
par: Yang, Yehui, et autres
Publié: (2026)
MedObvious: Exposing the Medical Moravec's Paradox in VLMs via Clinical Triage
par: Khan, Ufaq, et autres
Publié: (2026)
par: Khan, Ufaq, et autres
Publié: (2026)
CAMEL-Bench: A Comprehensive Arabic LMM Benchmark
par: Ghaboura, Sara, et autres
Publié: (2024)
par: Ghaboura, Sara, et autres
Publié: (2024)
MLLM-CompBench: A Comparative Reasoning Benchmark for Multimodal LLMs
par: Kil, Jihyung, et autres
Publié: (2024)
par: Kil, Jihyung, et autres
Publié: (2024)
Med-UniC: Unifying Cross-Lingual Medical Vision-Language Pre-Training by Diminishing Bias
par: Wan, Zhongwei, et autres
Publié: (2023)
par: Wan, Zhongwei, et autres
Publié: (2023)
II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
par: Liu, Ziqiang, et autres
Publié: (2024)
par: Liu, Ziqiang, et autres
Publié: (2024)
VinaBench: Benchmark for Faithful and Consistent Visual Narratives
par: Gao, Silin, et autres
Publié: (2025)
par: Gao, Silin, et autres
Publié: (2025)
SeriesBench: A Benchmark for Narrative-Driven Drama Series Understanding
par: Zhang, Chenkai, et autres
Publié: (2025)
par: Zhang, Chenkai, et autres
Publié: (2025)
SegICL: A Multimodal In-context Learning Framework for Enhanced Segmentation in Medical Imaging
par: Shen, Lingdong, et autres
Publié: (2024)
par: Shen, Lingdong, et autres
Publié: (2024)
Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs
par: Anand, Dhruv, et autres
Publié: (2025)
par: Anand, Dhruv, et autres
Publié: (2025)
VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning
par: Qi, Yukun, et autres
Publié: (2025)
par: Qi, Yukun, et autres
Publié: (2025)
EchoBench: Benchmarking Sycophancy in Medical Large Vision-Language Models
par: Yuan, Botai, et autres
Publié: (2025)
par: Yuan, Botai, et autres
Publié: (2025)
UniSAFE: A Comprehensive Benchmark for Safety Evaluation of Unified Multimodal Models
par: Lee, Segyu, et autres
Publié: (2026)
par: Lee, Segyu, et autres
Publié: (2026)
SOK-Bench: A Situated Video Reasoning Benchmark with Aligned Open-World Knowledge
par: Wang, Andong, et autres
Publié: (2024)
par: Wang, Andong, et autres
Publié: (2024)
MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents
par: Li, Shilong, et autres
Publié: (2025)
par: Li, Shilong, et autres
Publié: (2025)
TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models
par: Cai, Mu, et autres
Publié: (2024)
par: Cai, Mu, et autres
Publié: (2024)
VLR-Bench: Multilingual Benchmark Dataset for Vision-Language Retrieval Augmented Generation
par: Lim, Hyeonseok, et autres
Publié: (2024)
par: Lim, Hyeonseok, et autres
Publié: (2024)
Hallucination Benchmark in Medical Visual Question Answering
par: Wu, Jinge, et autres
Publié: (2024)
par: Wu, Jinge, et autres
Publié: (2024)
ComfyBench: Benchmarking LLM-based Agents in ComfyUI for Autonomously Designing Collaborative AI Systems
par: Xue, Xiangyuan, et autres
Publié: (2024)
par: Xue, Xiangyuan, et autres
Publié: (2024)
OmniBench: Towards The Future of Universal Omni-Language Models
par: Li, Yizhi, et autres
Publié: (2024)
par: Li, Yizhi, et autres
Publié: (2024)
LVLM-Compress-Bench: Benchmarking the Broader Impact of Large Vision-Language Model Compression
par: Kundu, Souvik, et autres
Publié: (2025)
par: Kundu, Souvik, et autres
Publié: (2025)
OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
par: Jia, Mengdi, et autres
Publié: (2025)
par: Jia, Mengdi, et autres
Publié: (2025)
MileBench: Benchmarking MLLMs in Long Context
par: Song, Dingjie, et autres
Publié: (2024)
par: Song, Dingjie, et autres
Publié: (2024)
FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding
par: Faure, Gueter Josmy, et autres
Publié: (2026)
par: Faure, Gueter Josmy, et autres
Publié: (2026)
DermaBench: A Clinician-Annotated Benchmark Dataset for Dermatology Visual Question Answering and Reasoning
par: Yilmaz, Abdurrahim, et autres
Publié: (2026)
par: Yilmaz, Abdurrahim, et autres
Publié: (2026)
Boosting Medical Image-based Cancer Detection via Text-guided Supervision from Reports
par: Guo, Guangyu, et autres
Publié: (2024)
par: Guo, Guangyu, et autres
Publié: (2024)
Documents similaires
-
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
par: Ding, Meidan, et autres
Publié: (2025) -
MedHallTune: An Instruction-Tuning Benchmark for Mitigating Medical Hallucination in Vision-Language Models
par: Yan, Qiao, et autres
Publié: (2025) -
MedXIAOHE: A Comprehensive Recipe for Building Medical MLLMs
par: Shi, Baorong, et autres
Publié: (2026) -
MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding
par: Zuo, Yuxin, et autres
Publié: (2025) -
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
par: Yang, Rui, et autres
Publié: (2025)