AgentsEval: Clinically Faithful Evaluation of Medical Imaging Reports via Multi-Agent Reasoning
Fuente:
arXiv
Saved in:
| Main Authors: | Fu, Suzhong, Dong, Jingqi, Ding, Xuan, Sun, Rui, Yang, Yiming, Cui, Shuguang, Li, Zhen |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
VesSAM: Efficient Multi-Prompting for Segmenting Complex Vessel
by: Fu, Suzhong, et al.
Published: (2025)
by: Fu, Suzhong, et al.
Published: (2025)
FASTopoWM: Fast-Slow Lane Segment Topology Reasoning with Latent World Models
by: Yang, Yiming, et al.
Published: (2025)
by: Yang, Yiming, et al.
Published: (2025)
TopoStreamer: Temporal Lane Segment Topology Reasoning in Autonomous Driving
by: Yang, Yiming, et al.
Published: (2025)
by: Yang, Yiming, et al.
Published: (2025)
DIANOIA: Diagnostic Decomposition and Joint Optimization for Multi-Agent Reasoning
by: Yang, Yiming, et al.
Published: (2026)
by: Yang, Yiming, et al.
Published: (2026)
Tree-of-Reasoning: Towards Complex Medical Diagnosis via Multi-Agent Reasoning with Evidence Tree
by: Peng, Qi, et al.
Published: (2025)
by: Peng, Qi, et al.
Published: (2025)
ClinicalAgent: Clinical Trial Multi-Agent System with Large Language Model-based Reasoning
by: Yue, Ling, et al.
Published: (2024)
by: Yue, Ling, et al.
Published: (2024)
RelTopo: Multi-Level Relational Modeling for Driving Scene Topology Reasoning
by: Luo, Yueru, et al.
Published: (2025)
by: Luo, Yueru, et al.
Published: (2025)
CollabEval: Enhancing LLM-as-a-Judge via Multi-Agent Collaboration
by: Qian, Yiyue, et al.
Published: (2026)
by: Qian, Yiyue, et al.
Published: (2026)
Faithful or Just Plausible? Evaluating the Faithfulness of Closed-Source LLMs in Medical Reasoning
by: Afolabi, Halimat, et al.
Published: (2026)
by: Afolabi, Halimat, et al.
Published: (2026)
EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents
by: Cheng, Zhili, et al.
Published: (2025)
by: Cheng, Zhili, et al.
Published: (2025)
HaluEval-Wild: Evaluating Hallucinations of Language Models in the Wild
by: Zhu, Zhiying, et al.
Published: (2024)
by: Zhu, Zhiying, et al.
Published: (2024)
HiCrew: Hierarchical Reasoning for Long-Form Video Understanding via Question-Aware Multi-Agent Collaboration
by: Zhu, Yuehan, et al.
Published: (2026)
by: Zhu, Yuehan, et al.
Published: (2026)
AlphaEval: Evaluating Agents in Production
by: Lu, Pengrui, et al.
Published: (2026)
by: Lu, Pengrui, et al.
Published: (2026)
Architecting Clinical Collaboration: Multi-Agent Reasoning Systems for Multimodal Medical VQA
by: Thakrar, Karishma, et al.
Published: (2025)
by: Thakrar, Karishma, et al.
Published: (2025)
MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
by: Xia, Peng, et al.
Published: (2025)
by: Xia, Peng, et al.
Published: (2025)
Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents
by: Ye, Bowen, et al.
Published: (2026)
by: Ye, Bowen, et al.
Published: (2026)
ReAgent: Reversible Multi-Agent Reasoning for Knowledge-Enhanced Multi-Hop QA
by: Zhao, Xinjie, et al.
Published: (2025)
by: Zhao, Xinjie, et al.
Published: (2025)
VideoGen-Eval: Agent-based System for Video Generation Evaluation
by: Yang, Yuhang, et al.
Published: (2025)
by: Yang, Yuhang, et al.
Published: (2025)
DipSVD: Dual-importance Protected SVD for Efficient LLM Compression
by: Ding, Xuan, et al.
Published: (2025)
by: Ding, Xuan, et al.
Published: (2025)
Towards CausalGPT: A Multi-Agent Approach for Faithful Knowledge Reasoning via Promoting Causal Consistency in LLMs
by: Tang, Ziyi, et al.
Published: (2023)
by: Tang, Ziyi, et al.
Published: (2023)
CharacterEval: A Chinese Benchmark for Role-Playing Conversational Agent Evaluation
by: Tu, Quan, et al.
Published: (2024)
by: Tu, Quan, et al.
Published: (2024)
AutoEval: A Practical Framework for Autonomous Evaluation of Mobile Agents
by: Sun, Jiahui, et al.
Published: (2025)
by: Sun, Jiahui, et al.
Published: (2025)
MARCH: Multi-Agent Radiology Clinical Hierarchy for CT Report Generation
by: Lin, Yi, et al.
Published: (2026)
by: Lin, Yi, et al.
Published: (2026)
FRAME: Feedback-Refined Agent Methodology for Enhancing Medical Research Insights
by: Yu, Chengzhang, et al.
Published: (2025)
by: Yu, Chengzhang, et al.
Published: (2025)
Faithful, Unfaithful or Ambiguous? Multi-Agent Debate with Initial Stance for Summary Evaluation
by: Koupaee, Mahnaz, et al.
Published: (2025)
by: Koupaee, Mahnaz, et al.
Published: (2025)
MMedAgent: Learning to Use Medical Tools with Multi-modal Agent
by: Li, Binxu, et al.
Published: (2024)
by: Li, Binxu, et al.
Published: (2024)
FaithEval: Can Your Language Model Stay Faithful to Context, Even If "The Moon is Made of Marshmallows"
by: Ming, Yifei, et al.
Published: (2024)
by: Ming, Yifei, et al.
Published: (2024)
PixelCraft: A Multi-Agent System for High-Fidelity Visual Reasoning on Structured Images
by: Zhang, Shuoshuo, et al.
Published: (2025)
by: Zhang, Shuoshuo, et al.
Published: (2025)
DV-3DLane: End-to-end Multi-modal 3D Lane Detection with Dual-view Representation
by: Luo, Yueru, et al.
Published: (2024)
by: Luo, Yueru, et al.
Published: (2024)
MedAtlas: Evaluating LLMs for Multi-Round, Multi-Task Medical Reasoning Across Diverse Imaging Modalities and Clinical Text
by: Xu, Ronghao, et al.
Published: (2025)
by: Xu, Ronghao, et al.
Published: (2025)
Topologically Faithful Multi-class Segmentation in Medical Images
by: Berger, Alexander H., et al.
Published: (2024)
by: Berger, Alexander H., et al.
Published: (2024)
EvalSVA: Multi-Agent Evaluators for Next-Gen Software Vulnerability Assessment
by: Wen, Xin-Cheng, et al.
Published: (2024)
by: Wen, Xin-Cheng, et al.
Published: (2024)
AntEval: Evaluation of Social Interaction Competencies in LLM-Driven Agents
by: Liang, Yuanzhi, et al.
Published: (2024)
by: Liang, Yuanzhi, et al.
Published: (2024)
ReEvalMed: Rethinking Medical Report Evaluation by Aligning Metrics with Real-World Clinical Judgment
by: Li, Ruochen, et al.
Published: (2025)
by: Li, Ruochen, et al.
Published: (2025)
AgentArcEval: An Architecture Evaluation Method for Foundation Model based Agents
by: Lu, Qinghua, et al.
Published: (2025)
by: Lu, Qinghua, et al.
Published: (2025)
RAS-Eval: A Comprehensive Benchmark for Security Evaluation of LLM Agents in Real-World Environments
by: Fu, Yuchuan, et al.
Published: (2025)
by: Fu, Yuchuan, et al.
Published: (2025)
DoubleTake: Contrastive Reasoning for Faithful Decision-Making in Medical Imaging
by: Patel, Daivik, et al.
Published: (2026)
by: Patel, Daivik, et al.
Published: (2026)
STMA: A Spatio-Temporal Memory Agent for Long-Horizon Embodied Task Planning
by: Lei, Mingcong, et al.
Published: (2025)
by: Lei, Mingcong, et al.
Published: (2025)
CLEA: Closed-Loop Embodied Agent for Enhancing Task Execution in Dynamic Environments
by: Lei, Mingcong, et al.
Published: (2025)
by: Lei, Mingcong, et al.
Published: (2025)
When the Specification Emerges: Benchmarking Faithfulness Loss in Long-Horizon Coding Agents
by: Yan, Lu, et al.
Published: (2026)
by: Yan, Lu, et al.
Published: (2026)
Similar Items
-
VesSAM: Efficient Multi-Prompting for Segmenting Complex Vessel
by: Fu, Suzhong, et al.
Published: (2025) -
FASTopoWM: Fast-Slow Lane Segment Topology Reasoning with Latent World Models
by: Yang, Yiming, et al.
Published: (2025) -
TopoStreamer: Temporal Lane Segment Topology Reasoning in Autonomous Driving
by: Yang, Yiming, et al.
Published: (2025) -
DIANOIA: Diagnostic Decomposition and Joint Optimization for Multi-Agent Reasoning
by: Yang, Yiming, et al.
Published: (2026) -
Tree-of-Reasoning: Towards Complex Medical Diagnosis via Multi-Agent Reasoning with Evidence Tree
by: Peng, Qi, et al.
Published: (2025)