Eliciting Medical Reasoning with Knowledge-enhanced Data Synthesis: A Semi-Supervised Reinforcement Learning Approach
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Haolin, Jiang, Shuyang, Zhang, Ruipeng, Yao, Jiangchao, Zhang, Ya, Wang, Yanfeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Federated Learning with Bilateral Curation for Partially Class-Disjoint Data
por: Fan, Ziqing, et al.
Publicado: (2024)
por: Fan, Ziqing, et al.
Publicado: (2024)
Federated Learning under Partially Class-Disjoint Data via Manifold Reshaping
por: Fan, Ziqing, et al.
Publicado: (2024)
por: Fan, Ziqing, et al.
Publicado: (2024)
Domain-Inspired Sharpness-Aware Minimization Under Domain Shifts
por: Zhang, Ruipeng, et al.
Publicado: (2024)
por: Zhang, Ruipeng, et al.
Publicado: (2024)
UniChest: Conquer-and-Divide Pre-training for Multi-Source Chest X-Ray Classification
por: Dai, Tianjie, et al.
Publicado: (2023)
por: Dai, Tianjie, et al.
Publicado: (2023)
RAD: Towards Trustworthy Retrieval-Augmented Multi-modal Clinical Diagnosis
por: Li, Haolin, et al.
Publicado: (2025)
por: Li, Haolin, et al.
Publicado: (2025)
Learning to Instruct for Visual Instruction Tuning
por: Zhou, Zhihan, et al.
Publicado: (2025)
por: Zhou, Zhihan, et al.
Publicado: (2025)
NFT: Bridging Supervised Learning and Reinforcement Learning in Math Reasoning
por: Chen, Huayu, et al.
Publicado: (2025)
por: Chen, Huayu, et al.
Publicado: (2025)
SUPERNOVA: Eliciting General Reasoning in LLMs with Reinforcement Learning on Natural Instructions
por: Suvarna, Ashima, et al.
Publicado: (2026)
por: Suvarna, Ashima, et al.
Publicado: (2026)
Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model
por: Hu, Jingcheng, et al.
Publicado: (2025)
por: Hu, Jingcheng, et al.
Publicado: (2025)
Verbal Process Supervision Elicits Better Coding Agents
por: Chen, Hao-Yuan, et al.
Publicado: (2025)
por: Chen, Hao-Yuan, et al.
Publicado: (2025)
Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning
por: Ding, Fei, et al.
Publicado: (2026)
por: Ding, Fei, et al.
Publicado: (2026)
Low-Rank Knowledge Decomposition for Medical Foundation Models
por: Zhou, Yuhang, et al.
Publicado: (2024)
por: Zhou, Yuhang, et al.
Publicado: (2024)
SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning
por: Liang, Xiao, et al.
Publicado: (2025)
por: Liang, Xiao, et al.
Publicado: (2025)
MedS$^3$: Towards Medical Slow Thinking with Self-Evolved Soft Dual-sided Process Supervision
por: Jiang, Shuyang, et al.
Publicado: (2025)
por: Jiang, Shuyang, et al.
Publicado: (2025)
Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
por: Deng, Yihe, et al.
Publicado: (2025)
por: Deng, Yihe, et al.
Publicado: (2025)
A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce
por: Xiong, Wei, et al.
Publicado: (2025)
por: Xiong, Wei, et al.
Publicado: (2025)
Semi-Supervised Learning for Bilingual Lexicon Induction
por: Garnier, Paul, et al.
Publicado: (2024)
por: Garnier, Paul, et al.
Publicado: (2024)
T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling
por: Hou, Zhenyu, et al.
Publicado: (2025)
por: Hou, Zhenyu, et al.
Publicado: (2025)
Miner:Mining Intrinsic Mastery for Data-Efficient RL in Large Reasoning Models
por: Jiang, Shuyang, et al.
Publicado: (2026)
por: Jiang, Shuyang, et al.
Publicado: (2026)
Fleming-R1: Toward Expert-Level Medical Reasoning via Reinforcement Learning
por: Liu, Chi, et al.
Publicado: (2025)
por: Liu, Chi, et al.
Publicado: (2025)
Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models
por: Zhang, Zizhuo, et al.
Publicado: (2025)
por: Zhang, Zizhuo, et al.
Publicado: (2025)
Reconstructing Human Mobility Pattern: A Semi-Supervised Approach for Cross-Dataset Transfer Learning
por: Liao, Xishun, et al.
Publicado: (2024)
por: Liao, Xishun, et al.
Publicado: (2024)
Knowledge Graph Reasoning with Self-supervised Reinforcement Learning
por: Ma, Ying, et al.
Publicado: (2024)
por: Ma, Ying, et al.
Publicado: (2024)
Dual-granularity Sinkhorn Distillation for Enhanced Learning from Long-tailed Noisy Data
por: Hong, Feng, et al.
Publicado: (2025)
por: Hong, Feng, et al.
Publicado: (2025)
Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination
por: Wu, Mingqi, et al.
Publicado: (2025)
por: Wu, Mingqi, et al.
Publicado: (2025)
Improving Sample Efficiency of Reinforcement Learning with Background Knowledge from Large Language Models
por: Zhang, Fuxiang, et al.
Publicado: (2024)
por: Zhang, Fuxiang, et al.
Publicado: (2024)
Diversified Batch Selection for Training Acceleration
por: Hong, Feng, et al.
Publicado: (2024)
por: Hong, Feng, et al.
Publicado: (2024)
CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning
por: Li, Ran, et al.
Publicado: (2026)
por: Li, Ran, et al.
Publicado: (2026)
ExPO: Unlocking Hard Reasoning with Self-Explanation-Guided Reinforcement Learning
por: Zhou, Ruiyang, et al.
Publicado: (2025)
por: Zhou, Ruiyang, et al.
Publicado: (2025)
Construct, Align, and Reason: Large Ontology Models for Enterprise Knowledge Management
por: Zhang, Yao, et al.
Publicado: (2026)
por: Zhang, Yao, et al.
Publicado: (2026)
Synergy-of-Thoughts: Eliciting Efficient Reasoning in Hybrid Language Models
por: Shang, Yu, et al.
Publicado: (2024)
por: Shang, Yu, et al.
Publicado: (2024)
From Passive to Active Reasoning: Can Large Language Models Ask the Right Questions under Incomplete Information?
por: Zhou, Zhanke, et al.
Publicado: (2025)
por: Zhou, Zhanke, et al.
Publicado: (2025)
Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning
por: Liu, Haolin, et al.
Publicado: (2026)
por: Liu, Haolin, et al.
Publicado: (2026)
Multistage Collaborative Knowledge Distillation from a Large Language Model for Semi-Supervised Sequence Generation
por: Zhao, Jiachen, et al.
Publicado: (2023)
por: Zhao, Jiachen, et al.
Publicado: (2023)
Lightweight Contenders: Navigating Semi-Supervised Text Mining through Peer Collaboration and Self Transcendence
por: Mao, Qianren, et al.
Publicado: (2024)
por: Mao, Qianren, et al.
Publicado: (2024)
One Sample to Rule Them All: Extreme Data Efficiency in Multidiscipline Reasoning with Reinforcement Learning
por: Li, Yiyuan, et al.
Publicado: (2026)
por: Li, Yiyuan, et al.
Publicado: (2026)
Eliciting Behaviors in Multi-Turn Conversations
por: Huang, Jing, et al.
Publicado: (2025)
por: Huang, Jing, et al.
Publicado: (2025)
Reinforcement Learning-Guided Semi-Supervised Learning
por: Heidari, Marzi, et al.
Publicado: (2024)
por: Heidari, Marzi, et al.
Publicado: (2024)
Causal Language Modeling Can Elicit Search and Reasoning Capabilities on Logic Puzzles
por: Shah, Kulin, et al.
Publicado: (2024)
por: Shah, Kulin, et al.
Publicado: (2024)
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
por: Fu, Yuqian, et al.
Publicado: (2025)
por: Fu, Yuqian, et al.
Publicado: (2025)
Ejemplares similares
-
Federated Learning with Bilateral Curation for Partially Class-Disjoint Data
por: Fan, Ziqing, et al.
Publicado: (2024) -
Federated Learning under Partially Class-Disjoint Data via Manifold Reshaping
por: Fan, Ziqing, et al.
Publicado: (2024) -
Domain-Inspired Sharpness-Aware Minimization Under Domain Shifts
por: Zhang, Ruipeng, et al.
Publicado: (2024) -
UniChest: Conquer-and-Divide Pre-training for Multi-Source Chest X-Ray Classification
por: Dai, Tianjie, et al.
Publicado: (2023) -
RAD: Towards Trustworthy Retrieval-Augmented Multi-modal Clinical Diagnosis
por: Li, Haolin, et al.
Publicado: (2025)