Med-R$^2$: Crafting Trustworthy LLM Physicians via Retrieval and Reasoning of Evidence-Based Medicine
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lu, Keer, Liang, Zheng, Pan, Da, Zhang, Shusen, Dong, Guosheng, Wu, Zhonghai, Leng, Huang, Cui, Bin, Zhang, Wentao |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Med-R$^3$: Enhancing Medical Retrieval-Augmented Reasoning of LLMs via Progressive Reinforcement Learning
par: Lu, Keer, et autres
Publié: (2025)
par: Lu, Keer, et autres
Publié: (2025)
DataSculpt: Crafting Data Landscapes for Long-Context LLMs through Multi-Objective Partitioning
par: Lu, Keer, et autres
Publié: (2024)
par: Lu, Keer, et autres
Publié: (2024)
VersaTune: An Efficient Data Composition Framework for Training Multi-Capability LLMs
par: Lu, Keer, et autres
Publié: (2024)
par: Lu, Keer, et autres
Publié: (2024)
PilotRL: Training Language Model Agents via Global Planning-Guided Progressive Reinforcement Learning
par: Lu, Keer, et autres
Publié: (2025)
par: Lu, Keer, et autres
Publié: (2025)
ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding
par: Sun, Zhongxiang, et autres
Publié: (2025)
par: Sun, Zhongxiang, et autres
Publié: (2025)
PubMed Reasoner: Dynamic Reasoning-based Retrieval for Evidence-Grounded Biomedical Question Answering
par: Zhang, Yiqing, et autres
Publié: (2026)
par: Zhang, Yiqing, et autres
Publié: (2026)
Data Proportion Detection for Optimized Data Management for Large Language Models
par: Liang, Hao, et autres
Publié: (2024)
par: Liang, Hao, et autres
Publié: (2024)
MedTVT-R1: A Multimodal LLM Empowering Medical Reasoning and Diagnosis
par: Zhang, Yuting, et autres
Publié: (2025)
par: Zhang, Yuting, et autres
Publié: (2025)
MedGellan: LLM-Generated Medical Guidance to Support Physicians
par: Banerjee, Debodeep, et autres
Publié: (2025)
par: Banerjee, Debodeep, et autres
Publié: (2025)
GRATR: Zero-Shot Evidence Graph Retrieval-Augmented Trustworthiness Reasoning
par: Zhu, Ying, et autres
Publié: (2024)
par: Zhu, Ying, et autres
Publié: (2024)
FB-Bench: A Fine-Grained Multi-Task Benchmark for Evaluating LLMs' Responsiveness to Human Feedback
par: Li, Youquan, et autres
Publié: (2024)
par: Li, Youquan, et autres
Publié: (2024)
Facilitating Multi-turn Function Calling for LLMs via Compositional Instruction Tuning
par: Chen, Mingyang, et autres
Publié: (2024)
par: Chen, Mingyang, et autres
Publié: (2024)
CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence
par: Ma, Dongsheng, et autres
Publié: (2026)
par: Ma, Dongsheng, et autres
Publié: (2026)
MedCEG: Reinforcing Verifiable Medical Reasoning with Critical Evidence Graph
par: Mu, Linjie, et autres
Publié: (2025)
par: Mu, Linjie, et autres
Publié: (2025)
ArgMed-Agents: Explainable Clinical Decision Reasoning with LLM Disscusion via Argumentation Schemes
par: Hong, Shengxin, et autres
Publié: (2024)
par: Hong, Shengxin, et autres
Publié: (2024)
Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs
par: Ma, Wen, et autres
Publié: (2026)
par: Ma, Wen, et autres
Publié: (2026)
LoVR: A Benchmark for Long Video Retrieval in Multimodal Contexts
par: Cai, Qifeng, et autres
Publié: (2025)
par: Cai, Qifeng, et autres
Publié: (2025)
A Qualitative Examination of Job Satisfaction in Emergency Medicine From the Perspective of Physicians Also Working in Prehospital and Retrieval Medicine
par: J. A. Myers, et autres
Publié: (2025)
par: J. A. Myers, et autres
Publié: (2025)
MedOmni-45°: A Safety-Performance Benchmark for Reasoning-Oriented LLMs in Medicine
par: Ji, Kaiyuan, et autres
Publié: (2025)
par: Ji, Kaiyuan, et autres
Publié: (2025)
MedCite: Can Language Models Generate Verifiable Text for Medicine?
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
Towards Trustworthy Legal AI through LLM Agents and Formal Reasoning
par: Chen, Linze, et autres
Publié: (2025)
par: Chen, Linze, et autres
Publié: (2025)
MedVol-R1: Reward-Driven Evidence Grounding for Volumetric Reasoning Segmentation
par: Wang, Zichun, et autres
Publié: (2026)
par: Wang, Zichun, et autres
Publié: (2026)
MedPAIR: Measuring Physicians and AI Relevance Alignment in Medical Question Answering
par: Hao, Yuexing, et autres
Publié: (2025)
par: Hao, Yuexing, et autres
Publié: (2025)
Trustworthy Reasoning: Evaluating and Enhancing Factual Accuracy in LLM Intermediate Thought Processes
par: Jiao, Rui, et autres
Publié: (2025)
par: Jiao, Rui, et autres
Publié: (2025)
MemR$^3$: Memory Retrieval via Reflective Reasoning for LLM Agents
par: Du, Xingbo, et autres
Publié: (2025)
par: Du, Xingbo, et autres
Publié: (2025)
LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
par: Zhang, Ming, et autres
Publié: (2025)
par: Zhang, Ming, et autres
Publié: (2025)
Benchmarking Retrieval-Augmented Generation for Medicine
par: Xiong, Guangzhi, et autres
Publié: (2024)
par: Xiong, Guangzhi, et autres
Publié: (2024)
From Physician Expertise to Clinical Agents: Preserving, Standardizing, and Scaling Physicians' Medical Expertise with Lightweight LLM
par: Luo, Chanyong, et autres
Publié: (2026)
par: Luo, Chanyong, et autres
Publié: (2026)
TrustScore: Reference-Free Evaluation of LLM Response Trustworthiness
par: Zheng, Danna, et autres
Publié: (2024)
par: Zheng, Danna, et autres
Publié: (2024)
Parental Stress in Academic Emergency Medicine Physicians
par: Deborah B. Diercks, et autres
Publié: (2025)
par: Deborah B. Diercks, et autres
Publié: (2025)
Multimodal Reasoning for Science: Technical Report and 1st Place Solution to the ICML 2025 SeePhys Challenge
par: Liang, Hao, et autres
Publié: (2025)
par: Liang, Hao, et autres
Publié: (2025)
Skin-R1: Toward Trustworthy Clinical Reasoning for Dermatological Diagnosis
par: Liu, Zehao, et autres
Publié: (2025)
par: Liu, Zehao, et autres
Publié: (2025)
LongVidSearch: An Agentic Benchmark for Multi-hop Evidence Retrieval Planning in Long Videos
par: Yu, Rongyi, et autres
Publié: (2026)
par: Yu, Rongyi, et autres
Publié: (2026)
MedBLINK: Probing Basic Perception in Multimodal Language Models for Medicine
par: Bigverdi, Mahtab, et autres
Publié: (2025)
par: Bigverdi, Mahtab, et autres
Publié: (2025)
R2MED: A Benchmark for Reasoning-Driven Medical Retrieval
par: Zhang, Xiangxu, et autres
Publié: (2025)
par: Zhang, Xiangxu, et autres
Publié: (2025)
MedComm – Future Medicine
Publié: (2023)
Publié: (2023)
InfiR : Crafting Effective Small Language Models and Multimodal Small Language Models in Reasoning
par: Xie, Congkai, et autres
Publié: (2025)
par: Xie, Congkai, et autres
Publié: (2025)
Trustworthiness in Retrieval-Augmented Generation Systems: A Survey
par: Zhou, Yujia, et autres
Publié: (2024)
par: Zhou, Yujia, et autres
Publié: (2024)
DARO: Difficulty-Aware Reweighting Policy Optimization
par: Zhou, Jingyu, et autres
Publié: (2025)
par: Zhou, Jingyu, et autres
Publié: (2025)
Rethinking All Evidence: Enhancing Trustworthy Retrieval-Augmented Generation via Conflict-Driven Summarization
par: Chen, Juan, et autres
Publié: (2025)
par: Chen, Juan, et autres
Publié: (2025)
Documents similaires
-
Med-R$^3$: Enhancing Medical Retrieval-Augmented Reasoning of LLMs via Progressive Reinforcement Learning
par: Lu, Keer, et autres
Publié: (2025) -
DataSculpt: Crafting Data Landscapes for Long-Context LLMs through Multi-Objective Partitioning
par: Lu, Keer, et autres
Publié: (2024) -
VersaTune: An Efficient Data Composition Framework for Training Multi-Capability LLMs
par: Lu, Keer, et autres
Publié: (2024) -
PilotRL: Training Language Model Agents via Global Planning-Guided Progressive Reinforcement Learning
par: Lu, Keer, et autres
Publié: (2025) -
ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding
par: Sun, Zhongxiang, et autres
Publié: (2025)