CP-Env: Evaluating Large Language Models on Clinical Pathways in a Controllable Hospital Environment
Fuente:
arXiv
Saved in:
| Main Authors: | Zhu, Yakun, Huang, Zhongzhen, Feng, Qianhan, Mu, Linjie, Gu, Yannian, Zhang, Shaoting, Dou, Qi, Zhang, Xiaofan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MedCEG: Reinforcing Verifiable Medical Reasoning with Critical Evidence Graph
by: Mu, Linjie, et al.
Published: (2025)
by: Mu, Linjie, et al.
Published: (2025)
CURE: A Multimodal Benchmark for Clinical Understanding and Retrieval Evaluation
by: Gu, Yannian, et al.
Published: (2026)
by: Gu, Yannian, et al.
Published: (2026)
EHRWorld: A Patient-Centric Medical World Model for Long-Horizon Clinical Trajectories
by: Mu, Linjie, et al.
Published: (2026)
by: Mu, Linjie, et al.
Published: (2026)
MedExpMem: Adapting Experience Memory for Differential Diagnosis
by: Feng, Qianhan, et al.
Published: (2026)
by: Feng, Qianhan, et al.
Published: (2026)
UCAgents: Unidirectional Convergence for Visual Evidence Anchored Multi-Agent Medical Decision-Making
by: Feng, Qianhan, et al.
Published: (2025)
by: Feng, Qianhan, et al.
Published: (2025)
CT-Flow: Orchestrating CT Interpretation Workflow with Model Context Protocol Servers
by: Gu, Yannian, et al.
Published: (2026)
by: Gu, Yannian, et al.
Published: (2026)
Elicit and Enhance: Advancing Multimodal Reasoning in Medical Scenarios
by: Huang, Zhongzhen, et al.
Published: (2025)
by: Huang, Zhongzhen, et al.
Published: (2025)
MMXU: A Multi-Modal and Multi-X-ray Understanding Dataset for Disease Progression
by: Mu, Linjie, et al.
Published: (2025)
by: Mu, Linjie, et al.
Published: (2025)
DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models
by: Zhu, Yakun, et al.
Published: (2025)
by: Zhu, Yakun, et al.
Published: (2025)
Radiologist Copilot: An Agentic Framework Orchestrating Specialized Tools for Reliable Radiology Reporting
by: Yu, Yongrui, et al.
Published: (2025)
by: Yu, Yongrui, et al.
Published: (2025)
MedMCP-Calc: Benchmarking LLMs for Realistic Medical Calculator Scenarios via MCP Integration
by: Zhu, Yakun, et al.
Published: (2026)
by: Zhu, Yakun, et al.
Published: (2026)
Tool Calling: Enhancing Medication Consultation via Retrieval-Augmented Large Language Models
by: Huang, Zhongzhen, et al.
Published: (2024)
by: Huang, Zhongzhen, et al.
Published: (2024)
MedDiff-FM: A Diffusion-based Foundation Model for Versatile Medical Image Applications
by: Yu, Yongrui, et al.
Published: (2024)
by: Yu, Yongrui, et al.
Published: (2024)
Human-AI Co-reasoning for Clinical Diagnosis with Evidence-Integrated Language Agent
by: Huang, Zhongzhen, et al.
Published: (2026)
by: Huang, Zhongzhen, et al.
Published: (2026)
Surgical Action Planning with Large Language Models
by: Xu, Mengya, et al.
Published: (2025)
by: Xu, Mengya, et al.
Published: (2025)
Modality-Aware and Shift Mixer for Multi-modal Brain Tumor Segmentation
by: Huang, Zhongzhen, et al.
Published: (2024)
by: Huang, Zhongzhen, et al.
Published: (2024)
Interactive Segmentation and Report Generation for CT Images
by: Gu, Yannian, et al.
Published: (2025)
by: Gu, Yannian, et al.
Published: (2025)
ZePT: Zero-Shot Pan-Tumor Segmentation via Query-Disentangling and Self-Prompting
by: Jiang, Yankai, et al.
Published: (2023)
by: Jiang, Yankai, et al.
Published: (2023)
CAT: Coordinating Anatomical-Textual Prompts for Multi-Organ and Tumor Segmentation
by: Huang, Zhongzhen, et al.
Published: (2024)
by: Huang, Zhongzhen, et al.
Published: (2024)
SAP-Bench: Benchmarking Multimodal Large Language Models in Surgical Action Planning
by: Xu, Mengya, et al.
Published: (2025)
by: Xu, Mengya, et al.
Published: (2025)
MeNTi: Bridging Medical Calculator and LLM Agent with Nested Tool Calling
by: Zhu, Yakun, et al.
Published: (2024)
by: Zhu, Yakun, et al.
Published: (2024)
O1 Replication Journey -- Part 3: Inference-time Scaling for Medical Reasoning
by: Huang, Zhongzhen, et al.
Published: (2025)
by: Huang, Zhongzhen, et al.
Published: (2025)
Aligning Large Language Models with Healthcare Stakeholders: A Pathway to Trustworthy AI Integration
by: Ding, Kexin, et al.
Published: (2025)
by: Ding, Kexin, et al.
Published: (2025)
World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training
by: Xiao, Junjin, et al.
Published: (2025)
by: Xiao, Junjin, et al.
Published: (2025)
Foundation Model for Endoscopy Video Analysis via Large-scale Self-supervised Pre-train
by: Wang, Zhao, et al.
Published: (2023)
by: Wang, Zhao, et al.
Published: (2023)
EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation
by: Liu, Yi, et al.
Published: (2026)
by: Liu, Yi, et al.
Published: (2026)
EnvScaler: Scaling Tool-Interactive Environments for LLM Agent via Programmatic Synthesis
by: Song, Xiaoshuai, et al.
Published: (2026)
by: Song, Xiaoshuai, et al.
Published: (2026)
Grounded Knowledge-Enhanced Medical Vision-Language Pre-training for Chest X-Ray
by: Deng, Qiao, et al.
Published: (2024)
by: Deng, Qiao, et al.
Published: (2024)
Unleashing the Potential of Vision-Language Pre-Training for 3D Zero-Shot Lesion Segmentation via Mask-Attribute Alignment
by: Jiang, Yankai, et al.
Published: (2024)
by: Jiang, Yankai, et al.
Published: (2024)
A Synthetic Data-Driven Radiology Foundation Model for Pan-tumor Clinical Diagnosis
by: Lei, Wenhui, et al.
Published: (2025)
by: Lei, Wenhui, et al.
Published: (2025)
AutoEnv: Automated Environments for Measuring Cross-Environment Agent Learning
by: Zhang, Jiayi, et al.
Published: (2025)
by: Zhang, Jiayi, et al.
Published: (2025)
Incorporating Clinical Guidelines through Adapting Multi-modal Large Language Model for Prostate Cancer PI-RADS Scoring
by: Zhang, Tiantian, et al.
Published: (2024)
by: Zhang, Tiantian, et al.
Published: (2024)
LogicEnvGen: Task-Logic Driven Generation of Diverse Simulated Environments for Embodied AI
by: Wang, Jianan, et al.
Published: (2026)
by: Wang, Jianan, et al.
Published: (2026)
daVinci-Env: Open SWE Environment Synthesis at Scale
by: Fu, Dayuan, et al.
Published: (2026)
by: Fu, Dayuan, et al.
Published: (2026)
Concepts from Representations: Post-hoc Concept Bottleneck Models via Sparse Decomposition of Visual Representations
by: Gong, Shizhan, et al.
Published: (2026)
by: Gong, Shizhan, et al.
Published: (2026)
DeReStainer: H&E to IHC Pathological Image Translation via Decoupled Staining Channels
by: Wei, Linda, et al.
Published: (2024)
by: Wei, Linda, et al.
Published: (2024)
CoEnv: Driving Embodied Multi-Agent Collaboration via Compositional Environment
by: Kang, Li, et al.
Published: (2026)
by: Kang, Li, et al.
Published: (2026)
ScaleEnv: Scaling Environment Synthesis from Scratch for Generalist Interactive Tool-Use Agent Training
by: Tu, Dunwei, et al.
Published: (2026)
by: Tu, Dunwei, et al.
Published: (2026)
EnvPoser: Environment-aware Realistic Human Motion Estimation from Sparse Observations with Uncertainty Modeling
by: Xia, Songpengcheng, et al.
Published: (2024)
by: Xia, Songpengcheng, et al.
Published: (2024)
MedOdyssey: A Medical Domain Benchmark for Long Context Evaluation Up to 200K Tokens
by: Fan, Yongqi, et al.
Published: (2024)
by: Fan, Yongqi, et al.
Published: (2024)
Similar Items
-
MedCEG: Reinforcing Verifiable Medical Reasoning with Critical Evidence Graph
by: Mu, Linjie, et al.
Published: (2025) -
CURE: A Multimodal Benchmark for Clinical Understanding and Retrieval Evaluation
by: Gu, Yannian, et al.
Published: (2026) -
EHRWorld: A Patient-Centric Medical World Model for Long-Horizon Clinical Trajectories
by: Mu, Linjie, et al.
Published: (2026) -
MedExpMem: Adapting Experience Memory for Differential Diagnosis
by: Feng, Qianhan, et al.
Published: (2026) -
UCAgents: Unidirectional Convergence for Visual Evidence Anchored Multi-Agent Medical Decision-Making
by: Feng, Qianhan, et al.
Published: (2025)