Gazal-R1: Achieving State-of-the-Art Medical Reasoning with Parameter-Efficient Two-Stage Training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Adly, Ahmed M., Samy, Mostafa, Fawzy, Amr |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning
par: Chen, Liang, et autres
Publié: (2025)
par: Chen, Liang, et autres
Publié: (2025)
Guiding Giants: Lightweight Controllers for Weighted Activation Steering in LLMs
par: Hegazy, Amr, et autres
Publié: (2025)
par: Hegazy, Amr, et autres
Publié: (2025)
FastCuRL: Curriculum Reinforcement Learning with Stage-wise Context Scaling for Efficient Training R1-like Reasoning Models
par: Song, Mingyang, et autres
Publié: (2025)
par: Song, Mingyang, et autres
Publié: (2025)
A2R: An Asymmetric Two-Stage Reasoning Framework for Parallel Reasoning
par: Wang, Ziqi, et autres
Publié: (2025)
par: Wang, Ziqi, et autres
Publié: (2025)
Semantic Density Effect (SDE): Maximizing Information Per Token Improves LLM Accuracy
par: Ahmed, Amr
Publié: (2026)
par: Ahmed, Amr
Publié: (2026)
Just Pass Twice: Efficient Token Classification with LLMs for Zero-Shot NER
par: Ewais, Ahmed, et autres
Publié: (2026)
par: Ewais, Ahmed, et autres
Publié: (2026)
The Art of Efficient Reasoning: Data, Reward, and Optimization
par: Wu, Taiqiang, et autres
Publié: (2026)
par: Wu, Taiqiang, et autres
Publié: (2026)
Medical Reasoning in LLMs: An In-Depth Analysis of DeepSeek R1
par: Moell, Birger, et autres
Publié: (2025)
par: Moell, Birger, et autres
Publié: (2025)
STEP: Staged Parameter-Efficient Pre-training for Large Language Models
par: Yano, Kazuki, et autres
Publié: (2025)
par: Yano, Kazuki, et autres
Publié: (2025)
Med42 -- Evaluating Fine-Tuning Strategies for Medical LLMs: Full-Parameter vs. Parameter-Efficient Approaches
par: Christophe, Clément, et autres
Publié: (2024)
par: Christophe, Clément, et autres
Publié: (2024)
GraphDancer: Training LLMs to Explore and Reason over Graphs via Two-Stage Curriculum Post-Training
par: Bai, Yuyang, et autres
Publié: (2026)
par: Bai, Yuyang, et autres
Publié: (2026)
Training and Evaluation of Guideline-Based Medical Reasoning in LLMs
par: Staniek, Michael, et autres
Publié: (2025)
par: Staniek, Michael, et autres
Publié: (2025)
LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL
par: Peng, Yingzhe, et autres
Publié: (2025)
par: Peng, Yingzhe, et autres
Publié: (2025)
Two-Stage Reasoning-Infused Learning: Improving Classification with LLM-Generated Reasoning
par: Henrichsen, Mads, et autres
Publié: (2025)
par: Henrichsen, Mads, et autres
Publié: (2025)
Learning to Reason: Training LLMs with GPT-OSS or DeepSeek R1 Reasoning Traces
par: Shmidman, Shaltiel, et autres
Publié: (2025)
par: Shmidman, Shaltiel, et autres
Publié: (2025)
Dual Knowledge-Enhanced Two-Stage Reasoner for Multimodal Dialog Systems
par: Chen, Xiaolin, et autres
Publié: (2025)
par: Chen, Xiaolin, et autres
Publié: (2025)
Connecting Voices: LoReSpeech as a Low-Resource Speech Parallel Corpus
par: Ouzerrout, Samy
Publié: (2025)
par: Ouzerrout, Samy
Publié: (2025)
MedPlan: A Two-Stage RAG-Based System for Personalized Medical Plan Generation
par: Hsu, Hsin-Ling, et autres
Publié: (2025)
par: Hsu, Hsin-Ling, et autres
Publié: (2025)
Legal Mathematical Reasoning with LLMs: Procedural Alignment through Two-Stage Reinforcement Learning
par: Zhang, Kepu, et autres
Publié: (2025)
par: Zhang, Kepu, et autres
Publié: (2025)
Your Language Model May Think Too Rigidly: Achieving Reasoning Consistency with Symmetry-Enhanced Training
par: Yao, Yihang, et autres
Publié: (2025)
par: Yao, Yihang, et autres
Publié: (2025)
InfiMed-Foundation: Pioneering Advanced Multimodal Medical Models with Compute-Efficient Pre-Training and Multi-Stage Fine-Tuning
par: Zhu, Guanghao, et autres
Publié: (2025)
par: Zhu, Guanghao, et autres
Publié: (2025)
Understanding Fact Recall in Language Models: Why Two-Stage Training Encourages Memorization but Mixed Training Teaches Knowledge
par: Zhang, Ying, et autres
Publié: (2025)
par: Zhang, Ying, et autres
Publié: (2025)
Two-Stage Voting for Robust and Efficient Suicide Risk Detection on Social Media
par: Song, Yukai, et autres
Publié: (2025)
par: Song, Yukai, et autres
Publié: (2025)
DSPC: Dual-Stage Progressive Compression Framework for Efficient Long-Context Reasoning
par: Gao, Yaxin, et autres
Publié: (2025)
par: Gao, Yaxin, et autres
Publié: (2025)
Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data
par: Zhuang, Xinlin, et autres
Publié: (2025)
par: Zhuang, Xinlin, et autres
Publié: (2025)
VTC-R1: Vision-Text Compression for Efficient Long-Context Reasoning
par: Wang, Yibo, et autres
Publié: (2026)
par: Wang, Yibo, et autres
Publié: (2026)
Training Language Models to Reason Efficiently
par: Arora, Daman, et autres
Publié: (2025)
par: Arora, Daman, et autres
Publié: (2025)
Gamayun's Path to Multilingual Mastery: Cost-Efficient Training of a 1.5B-Parameter LLM
par: Podolskiy, Alexander, et autres
Publié: (2025)
par: Podolskiy, Alexander, et autres
Publié: (2025)
AbstRaL: Augmenting LLMs' Reasoning by Reinforcing Abstract Thinking
par: Gao, Silin, et autres
Publié: (2025)
par: Gao, Silin, et autres
Publié: (2025)
Fleming-R1: Toward Expert-Level Medical Reasoning via Reinforcement Learning
par: Liu, Chi, et autres
Publié: (2025)
par: Liu, Chi, et autres
Publié: (2025)
Not All Errors Are Created Equal: ASCoT Addresses Late-Stage Fragility in Efficient LLM Reasoning
par: Zhang, Dongxu, et autres
Publié: (2025)
par: Zhang, Dongxu, et autres
Publié: (2025)
SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models
par: Chen, Hardy, et autres
Publié: (2025)
par: Chen, Hardy, et autres
Publié: (2025)
Assessing the Portability of Parameter Matrices Trained by Parameter-Efficient Finetuning Methods
par: Sabry, Mohammed, et autres
Publié: (2024)
par: Sabry, Mohammed, et autres
Publié: (2024)
Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
par: Xi, Zhiheng, et autres
Publié: (2025)
par: Xi, Zhiheng, et autres
Publié: (2025)
A State-of-the-Art SQL Reasoning Model using RLVR
par: Ali, Alnur, et autres
Publié: (2025)
par: Ali, Alnur, et autres
Publié: (2025)
ConVerse: Benchmarking Contextual Safety in Agent-to-Agent Conversations
par: Gomaa, Amr, et autres
Publié: (2025)
par: Gomaa, Amr, et autres
Publié: (2025)
LVMed-R2: Perception and Reflection-driven Complex Reasoning for Medical Report Generation
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
ConCuR: Conciseness Makes State-of-the-Art Kernel Generation
par: Kong, Lingcheng, et autres
Publié: (2025)
par: Kong, Lingcheng, et autres
Publié: (2025)
LLM Alignment for the Arabs: A Homogenous Culture or Diverse Ones?
par: Keleg, Amr
Publié: (2025)
par: Keleg, Amr
Publié: (2025)
Can Language Models Critique Themselves? Investigating Self-Feedback for Retrieval Augmented Generation at BioASQ 2025
par: Ateia, Samy, et autres
Publié: (2025)
par: Ateia, Samy, et autres
Publié: (2025)
Documents similaires
-
Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning
par: Chen, Liang, et autres
Publié: (2025) -
Guiding Giants: Lightweight Controllers for Weighted Activation Steering in LLMs
par: Hegazy, Amr, et autres
Publié: (2025) -
FastCuRL: Curriculum Reinforcement Learning with Stage-wise Context Scaling for Efficient Training R1-like Reasoning Models
par: Song, Mingyang, et autres
Publié: (2025) -
A2R: An Asymmetric Two-Stage Reasoning Framework for Parallel Reasoning
par: Wang, Ziqi, et autres
Publié: (2025) -
Semantic Density Effect (SDE): Maximizing Information Per Token Improves LLM Accuracy
par: Ahmed, Amr
Publié: (2026)