ART: Action-based Reasoning Task Benchmarking for Medical AI Agents
Fuente:
arXiv
Saved in:
| Main Authors: | Mantravadi, Ananya, Dalmia, Shivali, Mukherji, Abhishek |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Systematic Evaluation of Large Language Models for Post-Discharge Clinical Action Extraction
by: Dalmia, Shivali, et al.
Published: (2026)
by: Dalmia, Shivali, et al.
Published: (2026)
LegalWiz: A Multi-Agent Generation Framework for Contradiction Detection in Legal Documents
by: Mantravadi, Ananya, et al.
Published: (2025)
by: Mantravadi, Ananya, et al.
Published: (2025)
Measuring What Matters: Benchmarking Generative, Multimodal, and Agentic AI in Healthcare
by: Desikan, Prasanna, et al.
Published: (2026)
by: Desikan, Prasanna, et al.
Published: (2026)
Human + AI for Accelerating Ad Localization Evaluation
by: Rajgarhia, Harshit, et al.
Published: (2025)
by: Rajgarhia, Harshit, et al.
Published: (2025)
Scalable multilingual PII annotation for responsible AI in LLMs
by: Meena, Bharti, et al.
Published: (2025)
by: Meena, Bharti, et al.
Published: (2025)
MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio
by: Rajgarhia, Harshit, et al.
Published: (2026)
by: Rajgarhia, Harshit, et al.
Published: (2026)
Adaptive Reasoning and Acting in Medical Language Agents
by: Dutta, Abhishek, et al.
Published: (2024)
by: Dutta, Abhishek, et al.
Published: (2024)
Constrained Process Maps for Multi-Agent Generative AI Workflows
by: Joshi, Ananya, et al.
Published: (2026)
by: Joshi, Ananya, et al.
Published: (2026)
Temporal Reasoning in AI systems
by: Sharma, Abhishek
Published: (2025)
by: Sharma, Abhishek
Published: (2025)
SMH-Bench: Benchmarking LLM Agents for Environment-Grounded Reasoning and Action in Smart Homes
by: Li, Kuan, et al.
Published: (2026)
by: Li, Kuan, et al.
Published: (2026)
MedAgentsBench: Benchmarking Thinking Models and Agent Frameworks for Complex Medical Reasoning
by: Tang, Xiangru, et al.
Published: (2025)
by: Tang, Xiangru, et al.
Published: (2025)
Haibu Mathematical-Medical Intelligent Agent:Enhancing Large Language Model Reliability in Medical Tasks via Verifiable Reasoning Chains
by: Zhang, Yilun, et al.
Published: (2025)
by: Zhang, Yilun, et al.
Published: (2025)
Enhancing Guardrails for Safe and Secure Healthcare AI
by: Gangavarapu, Ananya
Published: (2024)
by: Gangavarapu, Ananya
Published: (2024)
LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks
by: Chandwani, Abhishek, et al.
Published: (2026)
by: Chandwani, Abhishek, et al.
Published: (2026)
GAZE:Governance-Aware pre-annotation for Zero-shot World Model Environments
by: Krishna, Leela, et al.
Published: (2025)
by: Krishna, Leela, et al.
Published: (2025)
Benchmarking the Medical Understanding and Reasoning of Large Language Models in Arabic Healthcare Tasks
by: AlDahoul, Nouar, et al.
Published: (2025)
by: AlDahoul, Nouar, et al.
Published: (2025)
The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks
by: Cuadron, Alejandro, et al.
Published: (2025)
by: Cuadron, Alejandro, et al.
Published: (2025)
Efficient Benchmarking of AI Agents
by: Ndzomga, Franck
Published: (2026)
by: Ndzomga, Franck
Published: (2026)
Large Language Model Benchmarks in Medical Tasks
by: Yan, Lawrence K. Q., et al.
Published: (2024)
by: Yan, Lawrence K. Q., et al.
Published: (2024)
Parameterized Argumentation-based Reasoning Tasks for Benchmarking Generative Language Models
by: Steging, Cor, et al.
Published: (2025)
by: Steging, Cor, et al.
Published: (2025)
Agentic JWT: A Secure Delegation Protocol for Autonomous AI Agents
by: Goswami, Abhishek
Published: (2025)
by: Goswami, Abhishek
Published: (2025)
MMLU-Reason: Benchmarking Multi-Task Multi-modal Language Understanding and Reasoning
by: Tie, Guiyao, et al.
Published: (2025)
by: Tie, Guiyao, et al.
Published: (2025)
ART: Adaptive Reasoning Trees for Explainable Claim Verification
by: Wadhwa, Sahil, et al.
Published: (2026)
by: Wadhwa, Sahil, et al.
Published: (2026)
Agent models: Internalizing Chain-of-Action Generation into Reasoning models
by: Zhang, Yuxiang, et al.
Published: (2025)
by: Zhang, Yuxiang, et al.
Published: (2025)
AgentDrive: An Open Benchmark Dataset for Agentic AI Reasoning with LLM-Generated Scenarios in Autonomous Systems
by: Ferrag, Mohamed Amine, et al.
Published: (2026)
by: Ferrag, Mohamed Amine, et al.
Published: (2026)
MedAgentBoard: Benchmarking Multi-Agent Collaboration with Conventional Methods for Diverse Medical Tasks
by: Zhu, Yinghao, et al.
Published: (2025)
by: Zhu, Yinghao, et al.
Published: (2025)
Automated Extraction of Material Properties using LLM-based AI Agents
by: Ghosh, Subham, et al.
Published: (2025)
by: Ghosh, Subham, et al.
Published: (2025)
Towards Autonomous Agents: Adaptive-planning, Reasoning, and Acting in Language Models
by: Dutta, Abhishek, et al.
Published: (2024)
by: Dutta, Abhishek, et al.
Published: (2024)
TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks
by: Chu, Zhaoyang, et al.
Published: (2026)
by: Chu, Zhaoyang, et al.
Published: (2026)
TPTU: Large Language Model-based AI Agents for Task Planning and Tool Usage
by: Ruan, Jingqing, et al.
Published: (2023)
by: Ruan, Jingqing, et al.
Published: (2023)
Not Just RLHF: Why Alignment Alone Won't Fix Multi-Agent Sycophancy
by: Kumarappan, Adarsh, et al.
Published: (2026)
by: Kumarappan, Adarsh, et al.
Published: (2026)
Empowering Locally Deployable Medical Agent via State Enhanced Logical Skills for FHIR-based Clinical Tasks
by: Yang, Wanrong, et al.
Published: (2026)
by: Yang, Wanrong, et al.
Published: (2026)
AssetOpsBench: Benchmarking AI Agents for Task Automation in Industrial Asset Operations and Maintenance
by: Patel, Dhaval, et al.
Published: (2025)
by: Patel, Dhaval, et al.
Published: (2025)
AgentRx: A Benchmark Study of LLM Agents for Multimodal Clinical Prediction Tasks
by: Jorf, Baraa Al, et al.
Published: (2026)
by: Jorf, Baraa Al, et al.
Published: (2026)
MDGYM: Benchmarking AI Agents on Molecular Simulations
by: Kumar, Vinay, et al.
Published: (2026)
by: Kumar, Vinay, et al.
Published: (2026)
Agent Drift: Quantifying Behavioral Degradation in Multi-Agent LLM Systems Over Extended Interactions
by: Rath, Abhishek
Published: (2026)
by: Rath, Abhishek
Published: (2026)
Causal-Enhanced AI Agents for Medical Research Screening
by: Ngo, Duc, et al.
Published: (2026)
by: Ngo, Duc, et al.
Published: (2026)
Reliable Self-Harm Risk Screening via Adaptive Multi-Agent LLM Systems
by: Karnam, Meghana, et al.
Published: (2026)
by: Karnam, Meghana, et al.
Published: (2026)
Healthcare AI GYM for Medical Agents
by: Jeong, Minbyul
Published: (2026)
by: Jeong, Minbyul
Published: (2026)
An Evaluation Study of Hybrid Methods for Multilingual PII Detection
by: Rajgarhia, Harshit, et al.
Published: (2025)
by: Rajgarhia, Harshit, et al.
Published: (2025)
Similar Items
-
Systematic Evaluation of Large Language Models for Post-Discharge Clinical Action Extraction
by: Dalmia, Shivali, et al.
Published: (2026) -
LegalWiz: A Multi-Agent Generation Framework for Contradiction Detection in Legal Documents
by: Mantravadi, Ananya, et al.
Published: (2025) -
Measuring What Matters: Benchmarking Generative, Multimodal, and Agentic AI in Healthcare
by: Desikan, Prasanna, et al.
Published: (2026) -
Human + AI for Accelerating Ad Localization Evaluation
by: Rajgarhia, Harshit, et al.
Published: (2025) -
Scalable multilingual PII annotation for responsible AI in LLMs
by: Meena, Bharti, et al.
Published: (2025)