Measuring What Matters: Benchmarking Generative, Multimodal, and Agentic AI in Healthcare
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Desikan, Prasanna, Rajgarhia, Harshit, Dalmia, Shivali, Mantravadi, Ananya |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Systematic Evaluation of Large Language Models for Post-Discharge Clinical Action Extraction
par: Dalmia, Shivali, et autres
Publié: (2026)
par: Dalmia, Shivali, et autres
Publié: (2026)
ART: Action-based Reasoning Task Benchmarking for Medical AI Agents
par: Mantravadi, Ananya, et autres
Publié: (2026)
par: Mantravadi, Ananya, et autres
Publié: (2026)
Human + AI for Accelerating Ad Localization Evaluation
par: Rajgarhia, Harshit, et autres
Publié: (2025)
par: Rajgarhia, Harshit, et autres
Publié: (2025)
LegalWiz: A Multi-Agent Generation Framework for Contradiction Detection in Legal Documents
par: Mantravadi, Ananya, et autres
Publié: (2025)
par: Mantravadi, Ananya, et autres
Publié: (2025)
Scalable multilingual PII annotation for responsible AI in LLMs
par: Meena, Bharti, et autres
Publié: (2025)
par: Meena, Bharti, et autres
Publié: (2025)
MedMosaic: A Challenging Large Scale Benchmark of Diverse Medical Audio
par: Rajgarhia, Harshit, et autres
Publié: (2026)
par: Rajgarhia, Harshit, et autres
Publié: (2026)
Automated Auditing of Hospital Discharge Summaries for Care Transitions
par: Dasula, Akshat, et autres
Publié: (2026)
par: Dasula, Akshat, et autres
Publié: (2026)
Enhancing Guardrails for Safe and Secure Healthcare AI
par: Gangavarapu, Ananya
Publié: (2024)
par: Gangavarapu, Ananya
Publié: (2024)
GAZE:Governance-Aware pre-annotation for Zero-shot World Model Environments
par: Krishna, Leela, et autres
Publié: (2025)
par: Krishna, Leela, et autres
Publié: (2025)
IMAS: A Comprehensive Agentic Approach to Rural Healthcare Delivery
par: Gangavarapu, Agasthya, et autres
Publié: (2024)
par: Gangavarapu, Agasthya, et autres
Publié: (2024)
Human-Guided Agentic AI for Multimodal Clinical Prediction: Lessons from the AgentDS Healthcare Benchmark
par: Pulavarthy, Lalitha Pranathi, et autres
Publié: (2026)
par: Pulavarthy, Lalitha Pranathi, et autres
Publié: (2026)
Measuring What Matters: The AI Pluralism Index
par: Mushkani, Rashid
Publié: (2025)
par: Mushkani, Rashid
Publié: (2025)
AI Safeguards, Generative AI and the Pandora Box: AI Safety Measures to Protect Businesses and Personal Reputation
par: Kumar, Prasanna
Publié: (2026)
par: Kumar, Prasanna
Publié: (2026)
Agentic AI Scientists Are Not Built For Autonomous Scientific Discovery
par: Bisht, Harshit, et autres
Publié: (2026)
par: Bisht, Harshit, et autres
Publié: (2026)
Detecting Silent Failures in Multi-Agentic AI Trajectories
par: Pathak, Divya, et autres
Publié: (2025)
par: Pathak, Divya, et autres
Publié: (2025)
Agentic Temporal Graph of Reasoning with Multimodal Language Models: A Potential AI Aid to Healthcare
par: Mitra, Susanta
Publié: (2025)
par: Mitra, Susanta
Publié: (2025)
Agentic AI Governance and Lifecycle Management in Healthcare
par: Prakash, Chandra, et autres
Publié: (2026)
par: Prakash, Chandra, et autres
Publié: (2026)
An Evaluation Study of Hybrid Methods for Multilingual PII Detection
par: Rajgarhia, Harshit, et autres
Publié: (2025)
par: Rajgarhia, Harshit, et autres
Publié: (2025)
Agentic AI for Self-Driving Laboratories in Soft Matter: Taxonomy, Benchmarks,and Open Challenges
par: Chen, Xuanzhou, et autres
Publié: (2026)
par: Chen, Xuanzhou, et autres
Publié: (2026)
Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?
par: Wei, Qianshan, et autres
Publié: (2026)
par: Wei, Qianshan, et autres
Publié: (2026)
Measuring What Matters Beyond Text: Evaluating Multimodal Summaries by Quality, Alignment, and Diversity
par: Ali, Abid, et autres
Publié: (2026)
par: Ali, Abid, et autres
Publié: (2026)
Constrained Process Maps for Multi-Agent Generative AI Workflows
par: Joshi, Ananya, et autres
Publié: (2026)
par: Joshi, Ananya, et autres
Publié: (2026)
Benchmarking Edge AI Platforms for High-Performance ML Inference
par: Jayanth, Rakshith, et autres
Publié: (2024)
par: Jayanth, Rakshith, et autres
Publié: (2024)
Notation Matters: A Benchmark Study of Token-Optimized Formats in Agentic AI Systems
par: Kutschka, Lorenz, et autres
Publié: (2026)
par: Kutschka, Lorenz, et autres
Publié: (2026)
Grounded by Experience: Generative Healthcare Prediction Augmented with Hierarchical Agentic Retrieval
par: Zhao, Chuang, et autres
Publié: (2025)
par: Zhao, Chuang, et autres
Publié: (2025)
SWEnergy: An Empirical Study on Energy Efficiency in Agentic Issue Resolution Frameworks with SLMs
par: Tripathy, Arihant, et autres
Publié: (2025)
par: Tripathy, Arihant, et autres
Publié: (2025)
Agentic AI Needs a Systems Theory
par: Miehling, Erik, et autres
Publié: (2025)
par: Miehling, Erik, et autres
Publié: (2025)
AEC-Bench: A Multimodal Benchmark for Agentic Systems in Architecture, Engineering, and Construction
par: Mankodiya, Harsh, et autres
Publié: (2026)
par: Mankodiya, Harsh, et autres
Publié: (2026)
AgentDrive: An Open Benchmark Dataset for Agentic AI Reasoning with LLM-Generated Scenarios in Autonomous Systems
par: Ferrag, Mohamed Amine, et autres
Publié: (2026)
par: Ferrag, Mohamed Amine, et autres
Publié: (2026)
Towards a HIPAA Compliant Agentic AI System in Healthcare
par: Neupane, Subash, et autres
Publié: (2025)
par: Neupane, Subash, et autres
Publié: (2025)
Generative AI for Healthcare: Fundamentals, Challenges, and Perspectives
par: Chen, Gang, et autres
Publié: (2025)
par: Chen, Gang, et autres
Publié: (2025)
PRiSM: An Agentic Multimodal Benchmark for Scientific Reasoning via Python-Grounded Evaluation
par: Imani, Shima, et autres
Publié: (2025)
par: Imani, Shima, et autres
Publié: (2025)
Generative to Agentic AI: Survey, Conceptualization, and Challenges
par: Schneider, Johannes
Publié: (2025)
par: Schneider, Johannes
Publié: (2025)
UAVBench: An Open Benchmark Dataset for Autonomous and Agentic AI UAV Systems via LLM-Generated Flight Scenarios
par: Ferrag, Mohamed Amine, et autres
Publié: (2025)
par: Ferrag, Mohamed Amine, et autres
Publié: (2025)
What Matters in Data Curation for Multimodal Reasoning? Insights from the DCVLR Challenge
par: Shin, Yosub, et autres
Publié: (2026)
par: Shin, Yosub, et autres
Publié: (2026)
Are LLMs Ready for Neural-integrated Mechanistic Modeling? A Benchmark and Agentic Framework
par: Guan, Zihan, et autres
Publié: (2026)
par: Guan, Zihan, et autres
Publié: (2026)
Measuring What Matters: Connecting AI Ethics Evaluations to System Attributes, Hazards, and Harms
par: Rismani, Shalaleh, et autres
Publié: (2025)
par: Rismani, Shalaleh, et autres
Publié: (2025)
Med-MMFL: A Multimodal Federated Learning Benchmark in Healthcare
par: Chhetri, Aavash, et autres
Publié: (2026)
par: Chhetri, Aavash, et autres
Publié: (2026)
OSUniverse: Benchmark for Multimodal GUI-navigation AI Agents
par: Davydova, Mariya, et autres
Publié: (2025)
par: Davydova, Mariya, et autres
Publié: (2025)
StarBench: A Turn-Based RPG Benchmark for Agentic Multimodal Decision-Making and Information Seeking
par: Zhang, Haoran, et autres
Publié: (2025)
par: Zhang, Haoran, et autres
Publié: (2025)
Documents similaires
-
Systematic Evaluation of Large Language Models for Post-Discharge Clinical Action Extraction
par: Dalmia, Shivali, et autres
Publié: (2026) -
ART: Action-based Reasoning Task Benchmarking for Medical AI Agents
par: Mantravadi, Ananya, et autres
Publié: (2026) -
Human + AI for Accelerating Ad Localization Evaluation
par: Rajgarhia, Harshit, et autres
Publié: (2025) -
LegalWiz: A Multi-Agent Generation Framework for Contradiction Detection in Legal Documents
par: Mantravadi, Ananya, et autres
Publié: (2025) -
Scalable multilingual PII annotation for responsible AI in LLMs
par: Meena, Bharti, et autres
Publié: (2025)