Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond
Fuente:
arXiv
Salvato in:
| Autori principali: | Wen, Liang, Cai, Yunke, Xiao, Fenrui, He, Xin, An, Qi, Duan, Zhenyu, Du, Yimin, Liu, Junchen, Tang, Lifu, Lv, Xiaowei, Zou, Haosheng, Deng, Yongchao, Jia, Shousheng, Zhang, Xiangzheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
360-LLaMA-Factory: Plug & Play Sequence Parallelism for Long Post-Training
di: Zou, Haosheng, et al.
Pubblicazione: (2025)
di: Zou, Haosheng, et al.
Pubblicazione: (2025)
VEPO: Variable Entropy Policy Optimization for Low-Resource Language Foundation Models
di: Liu, Chonghan, et al.
Pubblicazione: (2026)
di: Liu, Chonghan, et al.
Pubblicazione: (2026)
Light-IF: Endowing LLMs with Generalizable Reasoning via Preview and Self-Checking for Complex Instruction Following
di: Wang, Chenyang, et al.
Pubblicazione: (2025)
di: Wang, Chenyang, et al.
Pubblicazione: (2025)
Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning
di: Chen, Liang, et al.
Pubblicazione: (2025)
di: Chen, Liang, et al.
Pubblicazione: (2025)
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
di: Wang, Sudong, et al.
Pubblicazione: (2026)
di: Wang, Sudong, et al.
Pubblicazione: (2026)
An Empirical Study of SFT-DPO Interaction and Parameterization in Small Language Models
di: Feng, Yuming, et al.
Pubblicazione: (2026)
di: Feng, Yuming, et al.
Pubblicazione: (2026)
Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections
di: Wang, Bo, et al.
Pubblicazione: (2025)
di: Wang, Bo, et al.
Pubblicazione: (2025)
Reg-DPO: SFT-Regularized Direct Preference Optimization with GT-Pair for Improving Video Generation
di: Du, Jie, et al.
Pubblicazione: (2025)
di: Du, Jie, et al.
Pubblicazione: (2025)
Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning
di: Zhu, Taojie, et al.
Pubblicazione: (2026)
di: Zhu, Taojie, et al.
Pubblicazione: (2026)
ARC: Active and Reflection-driven Context Management for Long-Horizon Information Seeking Agents
di: Yao, Yilun, et al.
Pubblicazione: (2026)
di: Yao, Yilun, et al.
Pubblicazione: (2026)
Reveal the Mystery of DPO: The Connection between DPO and RL Algorithms
di: Su, Xuerui, et al.
Pubblicazione: (2025)
di: Su, Xuerui, et al.
Pubblicazione: (2025)
Bridging SFT and DPO for Diffusion Model Alignment with Self-Sampling Preference Optimization
di: Zhang, Daoan, et al.
Pubblicazione: (2024)
di: Zhang, Daoan, et al.
Pubblicazione: (2024)
DeReason: A Difficulty-Aware Curriculum Improves Decoupled SFT-then-RL Training for General Reasoning
di: Hu, Hanxu, et al.
Pubblicazione: (2026)
di: Hu, Hanxu, et al.
Pubblicazione: (2026)
Efficient Training of Robust Traditional Chinese LLaMA-1B on a Single Consumer GPU: Continual Pre-training, SFT, and DPO
di: Chih, Yu-Cheng, et al.
Pubblicazione: (2025)
di: Chih, Yu-Cheng, et al.
Pubblicazione: (2025)
Improving LLM Safety and Helpfulness using SFT and DPO: A Study on OPT-350M
di: Pant, Piyush
Pubblicazione: (2025)
di: Pant, Piyush
Pubblicazione: (2025)
Chain-of-Thought Matters: Improving Long-Context Language Models with Reasoning Path Supervision
di: Zhu, Dawei, et al.
Pubblicazione: (2025)
di: Zhu, Dawei, et al.
Pubblicazione: (2025)
The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs
di: Chen, Jierun, et al.
Pubblicazione: (2025)
di: Chen, Jierun, et al.
Pubblicazione: (2025)
RL makes MLLMs see better than SFT
di: Song, Junha, et al.
Pubblicazione: (2025)
di: Song, Junha, et al.
Pubblicazione: (2025)
RL Fine-Tuning Heals OOD Forgetting in SFT
di: Jin, Hangzhan, et al.
Pubblicazione: (2025)
di: Jin, Hangzhan, et al.
Pubblicazione: (2025)
Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead
di: Kang, Feiyang, et al.
Pubblicazione: (2025)
di: Kang, Feiyang, et al.
Pubblicazione: (2025)
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
di: Deng, Yihe, et al.
Pubblicazione: (2025)
di: Deng, Yihe, et al.
Pubblicazione: (2025)
Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration
di: Zhao, Yang, et al.
Pubblicazione: (2026)
di: Zhao, Yang, et al.
Pubblicazione: (2026)
When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains
di: Jeddi, Ahmadreza, et al.
Pubblicazione: (2026)
di: Jeddi, Ahmadreza, et al.
Pubblicazione: (2026)
SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning
di: Limozin, Alexis, et al.
Pubblicazione: (2026)
di: Limozin, Alexis, et al.
Pubblicazione: (2026)
UFT: Unifying Fine-Tuning of SFT and RLHF/DPO/UNA through a Generalized Implicit Reward Function
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
di: Wang, Zhichao, et al.
Pubblicazione: (2024)
RL as Regressor: A Reinforcement Learning Approach for Function Approximation
di: Huang, Yongchao
Pubblicazione: (2025)
di: Huang, Yongchao
Pubblicazione: (2025)
COT-AD: Cotton Analysis Dataset
di: Ali, Akbar, et al.
Pubblicazione: (2025)
di: Ali, Akbar, et al.
Pubblicazione: (2025)
RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs
di: Matsutani, Kohsei, et al.
Pubblicazione: (2025)
di: Matsutani, Kohsei, et al.
Pubblicazione: (2025)
SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models
di: Chen, Hardy, et al.
Pubblicazione: (2025)
di: Chen, Hardy, et al.
Pubblicazione: (2025)
Teaching with Lies: Curriculum DPO on Synthetic Negatives for Hallucination Detection
di: Pandit, Shrey, et al.
Pubblicazione: (2025)
di: Pandit, Shrey, et al.
Pubblicazione: (2025)
RAVIMAKANI9/DE-COT: Initial Release
di: Makani Ravi, et al.
Pubblicazione: (2026)
di: Makani Ravi, et al.
Pubblicazione: (2026)
Patch the Distribution Mismatch: RL Rewriting Agent for Stable Off-Policy SFT
di: Wang, Jiacheng, et al.
Pubblicazione: (2026)
di: Wang, Jiacheng, et al.
Pubblicazione: (2026)
GAC: Noise-Aware Adaptive Mixing for Hybrid SFT-RL Post-Training
di: Hu, Yuelin, et al.
Pubblicazione: (2026)
di: Hu, Yuelin, et al.
Pubblicazione: (2026)
BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning
di: Zhang, Xuechen, et al.
Pubblicazione: (2025)
di: Zhang, Xuechen, et al.
Pubblicazione: (2025)
Metis-RISE: RL Incentivizes and SFT Enhances Multimodal Reasoning Model Learning
di: Qiu, Haibo, et al.
Pubblicazione: (2025)
di: Qiu, Haibo, et al.
Pubblicazione: (2025)
Tool Zero: Training Tool-Augmented LLMs via Pure RL from Scratch
di: Zeng, Yirong, et al.
Pubblicazione: (2025)
di: Zeng, Yirong, et al.
Pubblicazione: (2025)
Curry-DPO: Enhancing Alignment using Curriculum Learning & Ranked Preferences
di: Pattnaik, Pulkit, et al.
Pubblicazione: (2024)
di: Pattnaik, Pulkit, et al.
Pubblicazione: (2024)
From SFT to RL: Demystifying the Post-Training Pipeline for LLM-based Vulnerability Detection
di: Li, Youpeng, et al.
Pubblicazione: (2026)
di: Li, Youpeng, et al.
Pubblicazione: (2026)
Mechanistic origins of catastrophic forgetting: why RL preserves circuits better than SFT?
di: Nunez, Jeanmely Rojas, et al.
Pubblicazione: (2026)
di: Nunez, Jeanmely Rojas, et al.
Pubblicazione: (2026)
Parallel-SFT: Improving Zero-Shot Cross-Programming-Language Transfer for Code RL
di: Wu, Zhaofeng, et al.
Pubblicazione: (2026)
di: Wu, Zhaofeng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
360-LLaMA-Factory: Plug & Play Sequence Parallelism for Long Post-Training
di: Zou, Haosheng, et al.
Pubblicazione: (2025) -
VEPO: Variable Entropy Policy Optimization for Low-Resource Language Foundation Models
di: Liu, Chonghan, et al.
Pubblicazione: (2026) -
Light-IF: Endowing LLMs with Generalizable Reasoning via Preview and Self-Checking for Complex Instruction Following
di: Wang, Chenyang, et al.
Pubblicazione: (2025) -
Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning
di: Chen, Liang, et al.
Pubblicazione: (2025) -
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
di: Wang, Sudong, et al.
Pubblicazione: (2026)