MedProbeBench: Systematic Benchmarking at Deep Evidence Integration for Expert-level Medical Guideline
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Jiyao, Shen, Jianghan, Song, Sida, Li, Tianbin, Liu, Xiaojia, Li, Rongbin, Huang, Ziyan, Lin, Jiashi, Ning, Junzhi, Ji, Changkai, Luo, Siqi, Li, Wenjie, Ma, Chenglong, Hu, Ming, Xiong, Jing, Ye, Jin, Fu, Bin, Xu, Ningsheng, Chen, Yirong, Jin, Lei, Chen, Hong, He, Junjun |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MedQ-Deg: A Multidimensional Benchmark for Evaluating MLLMs Across Medical Image Quality Degradations
by: Liu, Jiyao, et al.
Published: (2026)
by: Liu, Jiyao, et al.
Published: (2026)
MedQ-Engine: A Closed-Loop Data Engine for Evolving MLLMs in Medical Image Quality Assessment
by: Liu, Jiyao, et al.
Published: (2026)
by: Liu, Jiyao, et al.
Published: (2026)
MedQ-UNI: Toward Unified Medical Image Quality Assessment and Restoration via Vision-Language Modeling
by: Liu, Jiyao, et al.
Published: (2026)
by: Liu, Jiyao, et al.
Published: (2026)
MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark
by: Ning, Junzhi, et al.
Published: (2026)
by: Ning, Junzhi, et al.
Published: (2026)
CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG
by: Shen, Jianghan, et al.
Published: (2026)
by: Shen, Jianghan, et al.
Published: (2026)
MedQ-Bench: Evaluating and Exploring Medical Image Quality Assessment Abilities in MLLMs
by: Liu, Jiyao, et al.
Published: (2025)
by: Liu, Jiyao, et al.
Published: (2025)
S2-UniSeg: Fast Universal Agglomerative Pooling for Scalable Segment Anything without Supervision
by: Xu, Huihui, et al.
Published: (2025)
by: Xu, Huihui, et al.
Published: (2025)
Open World MRI Reconstruction with Bias-Calibrated Adaptation
by: Liu, Jiyao, et al.
Published: (2026)
by: Liu, Jiyao, et al.
Published: (2026)
SAM-Med3D-MoE: Towards a Non-Forgetting Segment Anything Model via Mixture of Experts for 3D Medical Image Segmentation
by: Wang, Guoan, et al.
Published: (2024)
by: Wang, Guoan, et al.
Published: (2024)
Unified Medical Image Tokenizer for Autoregressive Synthesis and Understanding
by: Ma, Chenglong, et al.
Published: (2025)
by: Ma, Chenglong, et al.
Published: (2025)
MedGround-R1: Advancing Medical Image Grounding via Spatial-Semantic Rewarded Group Relative Policy Optimization
by: Xu, Huihui, et al.
Published: (2025)
by: Xu, Huihui, et al.
Published: (2025)
Towards Interpretable Counterfactual Generation via Multimodal Autoregression
by: Ma, Chenglong, et al.
Published: (2025)
by: Ma, Chenglong, et al.
Published: (2025)
SAM-Med3D: Towards General-purpose Segmentation Models for Volumetric Medical Images
by: Wang, Haoyu, et al.
Published: (2023)
by: Wang, Haoyu, et al.
Published: (2023)
RetinaLogos: Fine-Grained Synthesis of High-Resolution Retinal Images Through Captions
by: Ning, Junzhi, et al.
Published: (2025)
by: Ning, Junzhi, et al.
Published: (2025)
GMAI-VL-R1: Harnessing Reinforcement Learning for Multimodal Medical Reasoning
by: Su, Yanzhou, et al.
Published: (2025)
by: Su, Yanzhou, et al.
Published: (2025)
Multi-modal MRI Translation via Evidential Regression and Distribution Calibration
by: Liu, Jiyao, et al.
Published: (2024)
by: Liu, Jiyao, et al.
Published: (2024)
OmniMedVQA: A New Large-Scale Comprehensive Evaluation Benchmark for Medical LVLM
by: Hu, Yutao, et al.
Published: (2024)
by: Hu, Yutao, et al.
Published: (2024)
First-Order Geometry, Spectral Compression, and Structural Compatibility under Bounded Computation
by: Li, Changkai
Published: (2026)
by: Li, Changkai
Published: (2026)
THE-Tree: Can Tracing Historical Evolution Enhance Scientific Verification and Reasoning?
by: Wang, Xin, et al.
Published: (2025)
by: Wang, Xin, et al.
Published: (2025)
MedAide: Information Fusion and Anatomy of Medical Intents via LLM-based Agent Collaboration
by: Yang, Dingkang, et al.
Published: (2024)
by: Yang, Dingkang, et al.
Published: (2024)
GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI
by: Li, Tianbin, et al.
Published: (2024)
by: Li, Tianbin, et al.
Published: (2024)
QuantMoE-Bench: Examining Post-Training Quantization for Mixture-of-Experts
by: Li, Pingzhi, et al.
Published: (2024)
by: Li, Pingzhi, et al.
Published: (2024)
Med-MoE: Mixture of Domain-Specific Experts for Lightweight Medical Vision-Language Models
by: Jiang, Songtao, et al.
Published: (2024)
by: Jiang, Songtao, et al.
Published: (2024)
SegBook: A Simple Baseline and Cookbook for Volumetric Medical Image Segmentation
by: Ye, Jin, et al.
Published: (2024)
by: Ye, Jin, et al.
Published: (2024)
LAER-MoE: Load-Adaptive Expert Re-layout for Efficient Mixture-of-Experts Training
by: Liu, Xinyi, et al.
Published: (2026)
by: Liu, Xinyi, et al.
Published: (2026)
Subject Disentanglement Neural Network for Speech Envelope Reconstruction from EEG
by: Zhang, Li, et al.
Published: (2025)
by: Zhang, Li, et al.
Published: (2025)
Sparse-Dense Mixture of Experts Adapter for Multi-Modal Tracking
by: Zhu, Yabin, et al.
Published: (2026)
by: Zhu, Yabin, et al.
Published: (2026)
SlideChat: A Large Vision-Language Assistant for Whole-Slide Pathology Image Understanding
by: Chen, Ying, et al.
Published: (2024)
by: Chen, Ying, et al.
Published: (2024)
Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models
by: Luo, Siqi, et al.
Published: (2026)
by: Luo, Siqi, et al.
Published: (2026)
Learning, Reasoning, Refinement: A Framework for Kahneman's Dual-System Intelligence in GUI Agents
by: Wei, Jinjie, et al.
Published: (2025)
by: Wei, Jinjie, et al.
Published: (2025)
MedSG-Bench: A Benchmark for Medical Image Sequences Grounding
by: Yue, Jingkun, et al.
Published: (2025)
by: Yue, Jingkun, et al.
Published: (2025)
MedOpenClaw and MedFlowBench: Auditing Medical Agents in Full-Study Workflows
by: Shen, Weixiang, et al.
Published: (2026)
by: Shen, Weixiang, et al.
Published: (2026)
ProBench: Judging Multimodal Foundation Models on Open-ended Multi-domain Expert Tasks
by: Yang, Yan, et al.
Published: (2025)
by: Yang, Yan, et al.
Published: (2025)
Radiation fluxes of gravitational, electromagnetic, and scalar perturbations in type-D black holes: an exact approach
by: Chen, Changkai, et al.
Published: (2023)
by: Chen, Changkai, et al.
Published: (2023)
Gravitational wave fluxes on generic orbits in near-extreme Kerr spacetime: higher spin and large eccentricity
by: Chen, Changkai, et al.
Published: (2023)
by: Chen, Changkai, et al.
Published: (2023)
ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models
by: Liu, Hongbo, et al.
Published: (2025)
by: Liu, Hongbo, et al.
Published: (2025)
KnowMe-Bench: Benchmarking Person Understanding for Lifelong Digital Companions
by: Wu, Tingyu, et al.
Published: (2026)
by: Wu, Tingyu, et al.
Published: (2026)
Unlocking the Black Box: A Five-Dimensional Framework for Evaluating Explainable AI in Credit Risk
by: Ye, Rongbin, et al.
Published: (2025)
by: Ye, Rongbin, et al.
Published: (2025)
Network Threat Detection: Addressing Class Imbalanced Data with Deep Forest
by: Chen, Jiaqi, et al.
Published: (2025)
by: Chen, Jiaqi, et al.
Published: (2025)
Strengthened upper bound on the third eigenvalue of graphs
by: Li, Sida
Published: (2025)
by: Li, Sida
Published: (2025)
Similar Items
-
MedQ-Deg: A Multidimensional Benchmark for Evaluating MLLMs Across Medical Image Quality Degradations
by: Liu, Jiyao, et al.
Published: (2026) -
MedQ-Engine: A Closed-Loop Data Engine for Evolving MLLMs in Medical Image Quality Assessment
by: Liu, Jiyao, et al.
Published: (2026) -
MedQ-UNI: Toward Unified Medical Image Quality Assessment and Restoration via Vision-Language Modeling
by: Liu, Jiyao, et al.
Published: (2026) -
MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark
by: Ning, Junzhi, et al.
Published: (2026) -
CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG
by: Shen, Jianghan, et al.
Published: (2026)