MedOpenClaw and MedFlowBench: Auditing Medical Agents in Full-Study Workflows
Fuente:
arXiv
Saved in:
| Main Authors: | Shen, Weixiang, Shen, Chengzhi, Hu, Yanzhu, Liu, Che, Wu, Junde, Zhu, Jiayuan, Han, Xiao, Li, Zongyue, Wu, Jingpei, Xu, Min, Xu, Daguang, Jin, Yueming, Wiestler, Benedikt, Rueckert, Daniel, Pan, Jiazhen |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MedUHIP: Towards Human-In-the-Loop Medical Segmentation
by: Zhu, Jiayuan, et al.
Published: (2024)
by: Zhu, Jiayuan, et al.
Published: (2024)
MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning
by: Pan, Jiazhen, et al.
Published: (2025)
by: Pan, Jiazhen, et al.
Published: (2025)
Evo-MedAgent: Beyond One-Shot Diagnosis with Agents That Remember, Reflect, and Improve
by: Shen, Weixiang, et al.
Published: (2026)
by: Shen, Weixiang, et al.
Published: (2026)
SWE Context Bench: A Benchmark for Context Learning in Coding
by: Zhu, Jiayuan, et al.
Published: (2026)
by: Zhu, Jiayuan, et al.
Published: (2026)
MedAgent-Pro: Towards Evidence-based Multi-modal Medical Diagnosis via Reasoning Agentic Workflow
by: Wang, Ziyue, et al.
Published: (2025)
by: Wang, Ziyue, et al.
Published: (2025)
BioMedArena: An Open-source Toolkit for Building and Evaluating Biomedical Deep Research Agents
by: Wu, Jinge, et al.
Published: (2026)
by: Wu, Jinge, et al.
Published: (2026)
One-Prompt to Segment All Medical Images
by: Wu, Junde, et al.
Published: (2023)
by: Wu, Junde, et al.
Published: (2023)
Not just Birds and Cars: Generic, Scalable and Explainable Models for Professional Visual Recognition
by: Wu, Junde, et al.
Published: (2024)
by: Wu, Junde, et al.
Published: (2024)
Git Context Controller: Manage the Context of LLM-based Agents like Git
by: Wu, Junde, et al.
Published: (2025)
by: Wu, Junde, et al.
Published: (2025)
How Far Have Medical Vision-Language Models Come? A Comprehensive Benchmarking Study
by: Liu, Che, et al.
Published: (2025)
by: Liu, Che, et al.
Published: (2025)
Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools
by: Wu, Junde, et al.
Published: (2025)
by: Wu, Junde, et al.
Published: (2025)
DDX-TRACE: A Benchmark for Medical Diagnostic Trajectories in VLMs
by: Pan, Jiazhen, et al.
Published: (2026)
by: Pan, Jiazhen, et al.
Published: (2026)
Mamba? Catch The Hype Or Rethink What Really Helps for Image Registration
by: Jian, Bailiang, et al.
Published: (2024)
by: Jian, Bailiang, et al.
Published: (2024)
MedVAR: Towards Scalable and Efficient Medical Image Generation via Next-scale Autoregressive Prediction
by: He, Zhicheng, et al.
Published: (2026)
by: He, Zhicheng, et al.
Published: (2026)
MedConsultBench: A Full-Cycle, Fine-Grained, Process-Aware Benchmark for Medical Consultation Agents
by: Qiao, Chuhan, et al.
Published: (2026)
by: Qiao, Chuhan, et al.
Published: (2026)
MedEdit: Counterfactual Diffusion-based Image Editing on Brain MRI
by: Alaya, Malek Ben, et al.
Published: (2024)
by: Alaya, Malek Ben, et al.
Published: (2024)
Ask Patients with Patience: Enabling LLMs for Human-Centric Medical Dialogue with Grounded Reasoning
by: Zhu, Jiayuan, et al.
Published: (2025)
by: Zhu, Jiayuan, et al.
Published: (2025)
Medical SAM 2: Segment medical images as video via Segment Anything Model 2
by: Zhu, Jiayuan, et al.
Published: (2024)
by: Zhu, Jiayuan, et al.
Published: (2024)
Beyond Classification Accuracy: Neural-MedBench and the Need for Deeper Reasoning Benchmarks
by: Jing, Miao, et al.
Published: (2025)
by: Jing, Miao, et al.
Published: (2025)
RealICU: Do LLM Agents Understand Long-Context ICU Data? A Benchmark Beyond Behavior Imitation
by: Shen, Chengzhi, et al.
Published: (2026)
by: Shen, Chengzhi, et al.
Published: (2026)
AutoMedBench: Towards Medical AutoResearch with Agentic AI Models
by: Liu, Junqi, et al.
Published: (2026)
by: Liu, Junqi, et al.
Published: (2026)
Agentic Large Language Models for Training-Free Neuro-Radiological Image Analysis
by: Erdur, Ayhan Can, et al.
Published: (2026)
by: Erdur, Ayhan Can, et al.
Published: (2026)
Evo: Autoregressive-Diffusion Large Language Models with Evolving Balance
by: Wu, Junde, et al.
Published: (2026)
by: Wu, Junde, et al.
Published: (2026)
MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models
by: Mao, Kangkun, et al.
Published: (2025)
by: Mao, Kangkun, et al.
Published: (2025)
MedDCR: Learning to Design Agentic Workflows for Medical Coding
by: Zheng, Jiyang, et al.
Published: (2025)
by: Zheng, Jiyang, et al.
Published: (2025)
MGI: Multimodal Contrastive pre-training of Genomic and Medical Imaging
by: Zhou, Jiaying, et al.
Published: (2024)
by: Zhou, Jiaying, et al.
Published: (2024)
MedSegFactory: Text-Guided Generation of Medical Image-Mask Pairs
by: Mao, Jiawei, et al.
Published: (2025)
by: Mao, Jiawei, et al.
Published: (2025)
TimeFlow: Temporal Conditioning for Longitudinal Brain MRI Registration and Aging Analysis
by: Jian, Bailiang, et al.
Published: (2025)
by: Jian, Bailiang, et al.
Published: (2025)
MultiMAE for Brain MRIs: Robustness to Missing Inputs Using Multi-Modal Masked Autoencoder
by: Erdur, Ayhan Can, et al.
Published: (2025)
by: Erdur, Ayhan Can, et al.
Published: (2025)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
by: Ding, Meidan, et al.
Published: (2025)
by: Ding, Meidan, et al.
Published: (2025)
Towards Universal Unsupervised Anomaly Detection in Medical Imaging
by: Bercea, Cosmin I., et al.
Published: (2024)
by: Bercea, Cosmin I., et al.
Published: (2024)
Diffusion Models with Implicit Guidance for Medical Anomaly Detection
by: Bercea, Cosmin I., et al.
Published: (2024)
by: Bercea, Cosmin I., et al.
Published: (2024)
Disentangling Progress in Medical Image Registration: Beyond Trend-Driven Architectures towards Domain-Specific Strategies
by: Jian, Bailiang, et al.
Published: (2025)
by: Jian, Bailiang, et al.
Published: (2025)
MedSG-Bench: A Benchmark for Medical Image Sequences Grounding
by: Yue, Jingkun, et al.
Published: (2025)
by: Yue, Jingkun, et al.
Published: (2025)
MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare
by: Wang, Yihao, et al.
Published: (2026)
by: Wang, Yihao, et al.
Published: (2026)
MedFactEval and MedAgentBrief: A Framework and Workflow for Generating and Evaluating Factual Clinical Summaries
by: Grolleau, François, et al.
Published: (2025)
by: Grolleau, François, et al.
Published: (2025)
StatsClaw: An AI-Collaborative Workflow for Statistical Software Development
by: Qin, Tianzhu, et al.
Published: (2026)
by: Qin, Tianzhu, et al.
Published: (2026)
Beyond Benchmarks: Dynamic, Automatic And Systematic Red-Teaming Agents For Trustworthy Medical Language Models
by: Pan, Jiazhen, et al.
Published: (2025)
by: Pan, Jiazhen, et al.
Published: (2025)
MedDialBench: Benchmarking LLM Diagnostic Robustness under Parametric Adversarial Patient Behaviors
by: Luo, Xiaotian, et al.
Published: (2026)
by: Luo, Xiaotian, et al.
Published: (2026)
Inpainting physics: self-supervised learning for context-driven fluid simulation
by: Weidner, Jonas, et al.
Published: (2026)
by: Weidner, Jonas, et al.
Published: (2026)
Similar Items
-
MedUHIP: Towards Human-In-the-Loop Medical Segmentation
by: Zhu, Jiayuan, et al.
Published: (2024) -
MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning
by: Pan, Jiazhen, et al.
Published: (2025) -
Evo-MedAgent: Beyond One-Shot Diagnosis with Agents That Remember, Reflect, and Improve
by: Shen, Weixiang, et al.
Published: (2026) -
SWE Context Bench: A Benchmark for Context Learning in Coding
by: Zhu, Jiayuan, et al.
Published: (2026) -
MedAgent-Pro: Towards Evidence-based Multi-modal Medical Diagnosis via Reasoning Agentic Workflow
by: Wang, Ziyue, et al.
Published: (2025)