Scaling Medical Reasoning Verification via Tool-Integrated Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Hang, Wang, Ruheng, Ji, Yuelyu, Kwak, Mingu, Wu, Xizhi, Li, Chenyu, Zhang, Li, Shi, Wenqi, Peng, Yifan, Wang, Yanshan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MedRAGChecker: Claim-Level Verification for Biomedical Retrieval-Augmented Generation
por: Ji, Yuelyu, et al.
Publicado: (2026)
por: Ji, Yuelyu, et al.
Publicado: (2026)
What Makes a Medical Checker Trainable? Diagnosing Signal Collapse and Reward Hacking in Checker-Guided RAG for Biomedical QA
por: Ji, Yuelyu, et al.
Publicado: (2026)
por: Ji, Yuelyu, et al.
Publicado: (2026)
Bias Evaluation and Mitigation in Retrieval-Augmented Medical Question-Answering Systems
por: Ji, Yuelyu, et al.
Publicado: (2025)
por: Ji, Yuelyu, et al.
Publicado: (2025)
Generative Foundation Model for Structured and Unstructured Electronic Health Records
por: Sivarajkumar, Sonish, et al.
Publicado: (2025)
por: Sivarajkumar, Sonish, et al.
Publicado: (2025)
DeepRAG: Integrating Hierarchical Reasoning and Process Supervision for Biomedical Multi-Hop QA
por: Ji, Yuelyu, et al.
Publicado: (2025)
por: Ji, Yuelyu, et al.
Publicado: (2025)
Assertion Detection Large Language Model In-context Learning LoRA Fine-tuning
por: Ji, Yuelyu, et al.
Publicado: (2024)
por: Ji, Yuelyu, et al.
Publicado: (2024)
Orchestrator Multi-Agent Clinical Decision Support System for Secondary Headache Diagnosis in Primary Care
por: Wu, Xizhi, et al.
Publicado: (2025)
por: Wu, Xizhi, et al.
Publicado: (2025)
Mitigating the Risk of Health Inequity Exacerbated by Large Language Models
por: Ji, Yuelyu, et al.
Publicado: (2024)
por: Ji, Yuelyu, et al.
Publicado: (2024)
A Scoping Review of LLM-as-a-Judge in Healthcare and the MedJUDGE Framework
por: Li, Chenyu, et al.
Publicado: (2026)
por: Li, Chenyu, et al.
Publicado: (2026)
Automated Extraction of Fluoropyrimidine Treatment and Treatment-Related Toxicities from Clinical Notes Using Natural Language Processing
por: Wu, Xizhi, et al.
Publicado: (2025)
por: Wu, Xizhi, et al.
Publicado: (2025)
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs
por: Lu, Meng, et al.
Publicado: (2025)
por: Lu, Meng, et al.
Publicado: (2025)
AutoTIR: Autonomous Tools Integrated Reasoning via Reinforcement Learning
por: Wei, Yifan, et al.
Publicado: (2025)
por: Wei, Yifan, et al.
Publicado: (2025)
ReasoningRank: Teaching Student Models to Rank through Reasoning-Based Knowledge Distillation
por: Ji, Yuelyu, et al.
Publicado: (2024)
por: Ji, Yuelyu, et al.
Publicado: (2024)
MEDVISTAGYM: A Scalable Training Environment for Thinking with Medical Images via Tool-Integrated Reinforcement Learning
por: Lu, Meng, et al.
Publicado: (2026)
por: Lu, Meng, et al.
Publicado: (2026)
RAG-RLRC-LaySum at BioLaySumm: Integrating Retrieval-Augmented Generation and Readability Control for Layman Summarization of Biomedical Texts
por: Ji, Yuelyu, et al.
Publicado: (2024)
por: Ji, Yuelyu, et al.
Publicado: (2024)
LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning
por: Wang, Jianing, et al.
Publicado: (2026)
por: Wang, Jianing, et al.
Publicado: (2026)
Towards Safe AI Clinicians: A Comprehensive Study on Large Language Model Jailbreaking in Healthcare
por: Zhang, Hang, et al.
Publicado: (2025)
por: Zhang, Hang, et al.
Publicado: (2025)
Curriculum Guided Reinforcement Learning for Efficient Multi Hop Retrieval Augmented Generation
por: Ji, Yuelyu, et al.
Publicado: (2025)
por: Ji, Yuelyu, et al.
Publicado: (2025)
Learning from Committee: Reasoning Distillation from a Mixture of Teachers with Peer-Review
por: Li, Zhuochun, et al.
Publicado: (2024)
por: Li, Zhuochun, et al.
Publicado: (2024)
Retrieval--Reasoning Processes for Multi-hop Question Answering: A Four-Axis Design Framework and Empirical Trends
por: Ji, Yuelyu, et al.
Publicado: (2026)
por: Ji, Yuelyu, et al.
Publicado: (2026)
DeepTool: Scaling Interleaved Deliberation in Tool-Integrated Reasoning via Process-Supervised Reinforcement Learning
por: He, Yang, et al.
Publicado: (2026)
por: He, Yang, et al.
Publicado: (2026)
PepThink-R1: LLM for Interpretable Cyclic Peptide Optimization with CoT SFT and Reinforcement Learning
por: Wang, Ruheng, et al.
Publicado: (2025)
por: Wang, Ruheng, et al.
Publicado: (2025)
When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning
por: Xu, Ruotao, et al.
Publicado: (2026)
por: Xu, Ruotao, et al.
Publicado: (2026)
VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning
por: Li, Lingxiao, et al.
Publicado: (2025)
por: Li, Lingxiao, et al.
Publicado: (2025)
Effect of Mind Mapping Combined With Behavior Rating Scale on Medical Compliance Behavior of Atrial Fibrillation Patients Underwent Radiofrequency Ablation
por: Huan Xu, et al.
Publicado: (2025)
por: Huan Xu, et al.
Publicado: (2025)
Discovery and Reinforcement of Tool-Integrated Reasoning Chains via Rollout Trees
por: Li, Kun, et al.
Publicado: (2026)
por: Li, Kun, et al.
Publicado: (2026)
StepGap: A Hybrid NLI-LLM Checker for Step-Level Evidence-Gap Detectionin Multi-Hop Question Answering
por: Ji, Yuelyu, et al.
Publicado: (2026)
por: Ji, Yuelyu, et al.
Publicado: (2026)
CharTool: Tool-Integrated Visual Reasoning for Chart Understanding
por: Zhang, Situo, et al.
Publicado: (2026)
por: Zhang, Situo, et al.
Publicado: (2026)
Tool Verification for Test-Time Reinforcement Learning
por: Liao, Ruotong, et al.
Publicado: (2026)
por: Liao, Ruotong, et al.
Publicado: (2026)
Reason2Attack: Jailbreaking Text-to-Image Models via LLM Reasoning
por: Zhang, Chenyu, et al.
Publicado: (2025)
por: Zhang, Chenyu, et al.
Publicado: (2025)
Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning
por: Wang, Li, et al.
Publicado: (2026)
por: Wang, Li, et al.
Publicado: (2026)
WorkForceAgent-R1: Incentivizing Reasoning Capability in LLM-based Web Agents via Reinforcement Learning
por: Zhuang, Yuchen, et al.
Publicado: (2025)
por: Zhuang, Yuchen, et al.
Publicado: (2025)
MedAdapter: Efficient Test-Time Adaptation of Large Language Models towards Medical Reasoning
por: Shi, Wenqi, et al.
Publicado: (2024)
por: Shi, Wenqi, et al.
Publicado: (2024)
Enhancing Large Language Models for Clinical Decision Support by Incorporating Clinical Practice Guidelines
por: Oniani, David, et al.
Publicado: (2024)
por: Oniani, David, et al.
Publicado: (2024)
Tool-Augmented Policy Optimization: Synergizing Reasoning and Adaptive Tool Use with Reinforcement Learning
por: Wu, Wenxun, et al.
Publicado: (2025)
por: Wu, Wenxun, et al.
Publicado: (2025)
SDoH-GPT: Using Large Language Models to Extract Social Determinants of Health (SDoH)
por: Consoli, Bernardo, et al.
Publicado: (2024)
por: Consoli, Bernardo, et al.
Publicado: (2024)
CamReasoner: Reinforcing Camera Movement Understanding via Structured Spatial Reasoning
por: Wu, Hang, et al.
Publicado: (2026)
por: Wu, Hang, et al.
Publicado: (2026)
Memory-Aware and Uncertainty-Guided Retrieval for Multi-Hop Question Answering
por: Ji, Yuelyu, et al.
Publicado: (2025)
por: Ji, Yuelyu, et al.
Publicado: (2025)
CoVe: Training Interactive Tool-Use Agents via Constraint-Guided Verification
por: Chen, Jinpeng, et al.
Publicado: (2026)
por: Chen, Jinpeng, et al.
Publicado: (2026)
Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning
por: Singh, Joykirat, et al.
Publicado: (2025)
por: Singh, Joykirat, et al.
Publicado: (2025)
Ejemplares similares
-
MedRAGChecker: Claim-Level Verification for Biomedical Retrieval-Augmented Generation
por: Ji, Yuelyu, et al.
Publicado: (2026) -
What Makes a Medical Checker Trainable? Diagnosing Signal Collapse and Reward Hacking in Checker-Guided RAG for Biomedical QA
por: Ji, Yuelyu, et al.
Publicado: (2026) -
Bias Evaluation and Mitigation in Retrieval-Augmented Medical Question-Answering Systems
por: Ji, Yuelyu, et al.
Publicado: (2025) -
Generative Foundation Model for Structured and Unstructured Electronic Health Records
por: Sivarajkumar, Sonish, et al.
Publicado: (2025) -
DeepRAG: Integrating Hierarchical Reasoning and Process Supervision for Biomedical Multi-Hop QA
por: Ji, Yuelyu, et al.
Publicado: (2025)