BioMedArena: An Open-source Toolkit for Building and Evaluating Biomedical Deep Research Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Wu, Jinge, Zhou, Hongjian, Zeng, Mingde, Zhu, Jiayuan, Wu, Junde, Pan, Jiazhen, Wu, Sean, Wu, Honghan, Liu, Fenglin, Clifton, David A. |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RiskAgent: Synergizing Language Models with Validated Tools for Evidence-Based Risk Prediction
by: Liu, Fenglin, et al.
Published: (2025)
by: Liu, Fenglin, et al.
Published: (2025)
Ask Patients with Patience: Enabling LLMs for Human-Centric Medical Dialogue with Grounded Reasoning
by: Zhu, Jiayuan, et al.
Published: (2025)
by: Zhu, Jiayuan, et al.
Published: (2025)
MedUHIP: Towards Human-In-the-Loop Medical Segmentation
by: Zhu, Jiayuan, et al.
Published: (2024)
by: Zhu, Jiayuan, et al.
Published: (2024)
MedExQA: Medical Question Answering Benchmark with Multiple Explanations
by: Kim, Yunsoo, et al.
Published: (2024)
by: Kim, Yunsoo, et al.
Published: (2024)
MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning
by: Pan, Jiazhen, et al.
Published: (2025)
by: Pan, Jiazhen, et al.
Published: (2025)
RadBARTsum: Domain Specific Adaption of Denoising Sequence-to-Sequence Models for Abstractive Radiology Report Summarization
by: Wu, Jinge, et al.
Published: (2024)
by: Wu, Jinge, et al.
Published: (2024)
RadEyeVideo: Enhancing general-domain Large Vision Language Model for chest X-ray analysis with video representations of eye gaze
by: Kim, Yunsoo, et al.
Published: (2025)
by: Kim, Yunsoo, et al.
Published: (2025)
Hallucination Benchmark in Medical Visual Question Answering
by: Wu, Jinge, et al.
Published: (2024)
by: Wu, Jinge, et al.
Published: (2024)
MedOpenClaw and MedFlowBench: Auditing Medical Agents in Full-Study Workflows
by: Shen, Weixiang, et al.
Published: (2026)
by: Shen, Weixiang, et al.
Published: (2026)
SLaVA-CXR: Small Language and Vision Assistant for Chest X-ray Report Automation
by: Wu, Jinge, et al.
Published: (2024)
by: Wu, Jinge, et al.
Published: (2024)
BioHopR: A Benchmark for Multi-Hop, Multi-Answer Reasoning in Biomedical Domain
by: Kim, Yunsoo, et al.
Published: (2025)
by: Kim, Yunsoo, et al.
Published: (2025)
Git Context Controller: Manage the Context of LLM-based Agents like Git
by: Wu, Junde, et al.
Published: (2025)
by: Wu, Junde, et al.
Published: (2025)
Clinical-R1: Empowering Large Language Models for Faithful and Comprehensive Reasoning with Clinical Objective Relative Policy Optimization
by: Gu, Boyang, et al.
Published: (2025)
by: Gu, Boyang, et al.
Published: (2025)
Enhancing Human-Computer Interaction in Chest X-ray Analysis using Vision and Language Model with Eye Gaze Patterns
by: Kim, Yunsoo, et al.
Published: (2024)
by: Kim, Yunsoo, et al.
Published: (2024)
MedicalOS: An LLM Agent based Operating System for Digital Healthcare
by: Zhu, Jared, et al.
Published: (2025)
by: Zhu, Jared, et al.
Published: (2025)
Look & Mark: Leveraging Radiologist Eye Fixations and Bounding boxes in Multimodal Large Language Models for Chest X-ray Report Generation
by: Kim, Yunsoo, et al.
Published: (2025)
by: Kim, Yunsoo, et al.
Published: (2025)
One-Prompt to Segment All Medical Images
by: Wu, Junde, et al.
Published: (2023)
by: Wu, Junde, et al.
Published: (2023)
Not just Birds and Cars: Generic, Scalable and Explainable Models for Professional Visual Recognition
by: Wu, Junde, et al.
Published: (2024)
by: Wu, Junde, et al.
Published: (2024)
SWE Context Bench: A Benchmark for Context Learning in Coding
by: Zhu, Jiayuan, et al.
Published: (2026)
by: Zhu, Jiayuan, et al.
Published: (2026)
Graph-based LLM over Semi-Structured Population Data for Dynamic Policy Response
by: Shi, Daqian, et al.
Published: (2025)
by: Shi, Daqian, et al.
Published: (2025)
Chain-of-Though (CoT) prompting strategies for medical error detection and correction
by: Wu, Zhaolong, et al.
Published: (2024)
by: Wu, Zhaolong, et al.
Published: (2024)
MedVH: Toward Systematic Evaluation of Hallucination for Large Vision Language Models in the Medical Context
by: Zishan Gu, et al.
Published: (2025)
by: Zishan Gu, et al.
Published: (2025)
From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding
by: Liu, Yuyuan, et al.
Published: (2026)
by: Liu, Yuyuan, et al.
Published: (2026)
Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools
by: Wu, Junde, et al.
Published: (2025)
by: Wu, Junde, et al.
Published: (2025)
Medical SAM 2: Segment medical images as video via Segment Anything Model 2
by: Zhu, Jiayuan, et al.
Published: (2024)
by: Zhu, Jiayuan, et al.
Published: (2024)
OPEN-THEATRE: An Open-Source Toolkit for LLM-based Interactive Drama
by: Xu, Tianyang, et al.
Published: (2025)
by: Xu, Tianyang, et al.
Published: (2025)
The Quadratic State Cost of Classical Simulation of One-Way Quantum Finite Automata
by: Chen, Zeyu, et al.
Published: (2026)
by: Chen, Zeyu, et al.
Published: (2026)
Exact Separation of Words via Trace Geometry
by: Chen, Zeyu, et al.
Published: (2026)
by: Chen, Zeyu, et al.
Published: (2026)
Rational-Valued Affine Verifiers in Arthur--Merlin Proof Systems
by: Chen, Zeyu, et al.
Published: (2025)
by: Chen, Zeyu, et al.
Published: (2025)
On the Simulation Cost of Quantum Finite Automata
by: Chen, Zeyu, et al.
Published: (2026)
by: Chen, Zeyu, et al.
Published: (2026)
Evo: Autoregressive-Diffusion Large Language Models with Evolving Balance
by: Wu, Junde, et al.
Published: (2026)
by: Wu, Junde, et al.
Published: (2026)
MedAgent-Pro: Towards Evidence-based Multi-modal Medical Diagnosis via Reasoning Agentic Workflow
by: Wang, Ziyue, et al.
Published: (2025)
by: Wang, Ziyue, et al.
Published: (2025)
Error Correction in Radiology Reports: A Knowledge Distillation-Based Multi-Stage Framework
by: Wu, Jinge, et al.
Published: (2024)
by: Wu, Jinge, et al.
Published: (2024)
SPA: Efficient User-Preference Alignment against Uncertainty in Medical Image Segmentation
by: Zhu, Jiayuan, et al.
Published: (2024)
by: Zhu, Jiayuan, et al.
Published: (2024)
MedArena: Comparing LLMs for Medicine-in-the-Wild Clinician Preferences
by: Wu, Eric, et al.
Published: (2026)
by: Wu, Eric, et al.
Published: (2026)
Matrix encoding method in variational algorithm of calculating eigenvalues and generalized eigenvalues
by: Zenchuk, Alexander I., et al.
Published: (2026)
by: Zenchuk, Alexander I., et al.
Published: (2026)
A Survey of Large Language Models in Medicine: Progress, Application, and Challenge
by: Zhou, Hongjian, et al.
Published: (2023)
by: Zhou, Hongjian, et al.
Published: (2023)
GLiNER-BioMed: A Suite of Efficient Models for Open Biomedical Named Entity Recognition
by: Yazdani, Anthony, et al.
Published: (2025)
by: Yazdani, Anthony, et al.
Published: (2025)
MGI: Multimodal Contrastive pre-training of Genomic and Medical Imaging
by: Zhou, Jiaying, et al.
Published: (2024)
by: Zhou, Jiaying, et al.
Published: (2024)
Beyond Benchmarks: Dynamic, Automatic And Systematic Red-Teaming Agents For Trustworthy Medical Language Models
by: Pan, Jiazhen, et al.
Published: (2025)
by: Pan, Jiazhen, et al.
Published: (2025)
Similar Items
-
RiskAgent: Synergizing Language Models with Validated Tools for Evidence-Based Risk Prediction
by: Liu, Fenglin, et al.
Published: (2025) -
Ask Patients with Patience: Enabling LLMs for Human-Centric Medical Dialogue with Grounded Reasoning
by: Zhu, Jiayuan, et al.
Published: (2025) -
MedUHIP: Towards Human-In-the-Loop Medical Segmentation
by: Zhu, Jiayuan, et al.
Published: (2024) -
MedExQA: Medical Question Answering Benchmark with Multiple Explanations
by: Kim, Yunsoo, et al.
Published: (2024) -
MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning
by: Pan, Jiazhen, et al.
Published: (2025)