Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Yang, Ouyang, Yangou, Ding, Xiao, Wang, Hepeng, Cai, Bibo, Xiong, Kai, Gao, Jinglong, Sun, Zhouhao, Du, Li, Qin, Bing, Liu, Ting |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization
di: Zhao, Yang, et al.
Pubblicazione: (2026)
di: Zhao, Yang, et al.
Pubblicazione: (2026)
Beyond Similarity: A Gradient-based Graph Method for Instruction Tuning Data Selection
di: Zhao, Yang, et al.
Pubblicazione: (2025)
di: Zhao, Yang, et al.
Pubblicazione: (2025)
Towards Generalizable and Faithful Logic Reasoning over Natural Language via Resolution Refutation
di: Sun, Zhouhao, et al.
Pubblicazione: (2024)
di: Sun, Zhouhao, et al.
Pubblicazione: (2024)
UFO-RL: Uncertainty-Focused Optimization for Efficient Reinforcement Learning Data Selection
di: Zhao, Yang, et al.
Pubblicazione: (2025)
di: Zhao, Yang, et al.
Pubblicazione: (2025)
ExpeTrans: LLMs Are Experiential Transfer Learners
di: Gao, Jinglong, et al.
Pubblicazione: (2025)
di: Gao, Jinglong, et al.
Pubblicazione: (2025)
Self-Route: Automatic Mode Switching via Capability Estimation for Efficient Reasoning
di: He, Yang, et al.
Pubblicazione: (2025)
di: He, Yang, et al.
Pubblicazione: (2025)
DeepTool: Scaling Interleaved Deliberation in Tool-Integrated Reasoning via Process-Supervised Reinforcement Learning
di: He, Yang, et al.
Pubblicazione: (2026)
di: He, Yang, et al.
Pubblicazione: (2026)
Large Language Models Are Still Misled by Simple Bias Ensembles
di: Sun, Zhouhao, et al.
Pubblicazione: (2025)
di: Sun, Zhouhao, et al.
Pubblicazione: (2025)
Self-Evolving GPT: A Lifelong Autonomous Experiential Learner
di: Gao, Jinglong, et al.
Pubblicazione: (2024)
di: Gao, Jinglong, et al.
Pubblicazione: (2024)
Deciphering the Impact of Pretraining Data on Large Language Models through Machine Unlearning
di: Zhao, Yang, et al.
Pubblicazione: (2024)
di: Zhao, Yang, et al.
Pubblicazione: (2024)
GR-Ben: A General Reasoning Benchmark for Evaluating Process Reward Models
di: Sun, Zhouhao, et al.
Pubblicazione: (2026)
di: Sun, Zhouhao, et al.
Pubblicazione: (2026)
CrossICL: Cross-Task In-Context Learning via Unsupervised Demonstration Transfer
di: Gao, Jinglong, et al.
Pubblicazione: (2025)
di: Gao, Jinglong, et al.
Pubblicazione: (2025)
When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains
di: Jeddi, Ahmadreza, et al.
Pubblicazione: (2026)
di: Jeddi, Ahmadreza, et al.
Pubblicazione: (2026)
Enhancing Complex Causality Extraction via Improved Subtask Interaction and Knowledge Fusion
di: Gao, Jinglong, et al.
Pubblicazione: (2024)
di: Gao, Jinglong, et al.
Pubblicazione: (2024)
Com$^2$: A Causal-Guided Benchmark for Exploring Complex Commonsense Reasoning in Large Language Models
di: Xiong, Kai, et al.
Pubblicazione: (2025)
di: Xiong, Kai, et al.
Pubblicazione: (2025)
Causal-Guided Active Learning for Debiasing Large Language Models
di: Du, Li, et al.
Pubblicazione: (2024)
di: Du, Li, et al.
Pubblicazione: (2024)
Information Gain-Guided Causal Intervention for Autonomous Debiasing Large Language Models
di: Sun, Zhouhao, et al.
Pubblicazione: (2025)
di: Sun, Zhouhao, et al.
Pubblicazione: (2025)
Supervised Fine-Tuning Achieve Rapid Task Adaption Via Alternating Attention Head Activation Patterns
di: Zhao, Yang, et al.
Pubblicazione: (2024)
di: Zhao, Yang, et al.
Pubblicazione: (2024)
Examining Inter-Consistency of Large Language Models Collaboration: An In-depth Analysis via Debate
di: Xiong, Kai, et al.
Pubblicazione: (2023)
di: Xiong, Kai, et al.
Pubblicazione: (2023)
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
di: Wang, Sudong, et al.
Pubblicazione: (2026)
di: Wang, Sudong, et al.
Pubblicazione: (2026)
Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning
di: Zhu, Taojie, et al.
Pubblicazione: (2026)
di: Zhu, Taojie, et al.
Pubblicazione: (2026)
Diagnosing and Remedying Knowledge Deficiencies in LLMs via Label-free Curricular Meaningful Learning
di: Xiong, Kai, et al.
Pubblicazione: (2024)
di: Xiong, Kai, et al.
Pubblicazione: (2024)
Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond
di: Wen, Liang, et al.
Pubblicazione: (2025)
di: Wen, Liang, et al.
Pubblicazione: (2025)
How Much Backtracking is Enough? Exploring the Interplay of SFT and RL in Enhancing LLM Reasoning
di: Cai, Hongyi James, et al.
Pubblicazione: (2025)
di: Cai, Hongyi James, et al.
Pubblicazione: (2025)
RL makes MLLMs see better than SFT
di: Song, Junha, et al.
Pubblicazione: (2025)
di: Song, Junha, et al.
Pubblicazione: (2025)
RL Fine-Tuning Heals OOD Forgetting in SFT
di: Jin, Hangzhan, et al.
Pubblicazione: (2025)
di: Jin, Hangzhan, et al.
Pubblicazione: (2025)
Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead
di: Kang, Feiyang, et al.
Pubblicazione: (2025)
di: Kang, Feiyang, et al.
Pubblicazione: (2025)
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
di: Deng, Yihe, et al.
Pubblicazione: (2025)
di: Deng, Yihe, et al.
Pubblicazione: (2025)
SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning
di: Limozin, Alexis, et al.
Pubblicazione: (2026)
di: Limozin, Alexis, et al.
Pubblicazione: (2026)
Science in Movements
di: Jia, Hepeng
Pubblicazione: (2021)
di: Jia, Hepeng
Pubblicazione: (2021)
Text Difficulty Study: Do machines behave the same as humans regarding text difficulty?
di: Chen, Bowen, et al.
Pubblicazione: (2022)
di: Chen, Bowen, et al.
Pubblicazione: (2022)
Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning
di: Chen, Liang, et al.
Pubblicazione: (2025)
di: Chen, Liang, et al.
Pubblicazione: (2025)
RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs
di: Matsutani, Kohsei, et al.
Pubblicazione: (2025)
di: Matsutani, Kohsei, et al.
Pubblicazione: (2025)
Tool Zero: Training Tool-Augmented LLMs via Pure RL from Scratch
di: Zeng, Yirong, et al.
Pubblicazione: (2025)
di: Zeng, Yirong, et al.
Pubblicazione: (2025)
ReCo: Reliable Causal Chain Reasoning via Structural Causal Recurrent Neural Networks
di: Xiong, Kai, et al.
Pubblicazione: (2022)
di: Xiong, Kai, et al.
Pubblicazione: (2022)
SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models
di: Chen, Hardy, et al.
Pubblicazione: (2025)
di: Chen, Hardy, et al.
Pubblicazione: (2025)
PET: Multi-agent Independent PPO-based Automatic ECN Tuning for High-Speed Data Center Networks
di: Cheng, Kai, et al.
Pubblicazione: (2024)
di: Cheng, Kai, et al.
Pubblicazione: (2024)
Patch the Distribution Mismatch: RL Rewriting Agent for Stable Off-Policy SFT
di: Wang, Jiacheng, et al.
Pubblicazione: (2026)
di: Wang, Jiacheng, et al.
Pubblicazione: (2026)
GAC: Noise-Aware Adaptive Mixing for Hybrid SFT-RL Post-Training
di: Hu, Yuelin, et al.
Pubblicazione: (2026)
di: Hu, Yuelin, et al.
Pubblicazione: (2026)
BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning
di: Zhang, Xuechen, et al.
Pubblicazione: (2025)
di: Zhang, Xuechen, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MAESTRO: Meta-learning Adaptive Estimation of Scalarization Trade-offs for Reward Optimization
di: Zhao, Yang, et al.
Pubblicazione: (2026) -
Beyond Similarity: A Gradient-based Graph Method for Instruction Tuning Data Selection
di: Zhao, Yang, et al.
Pubblicazione: (2025) -
Towards Generalizable and Faithful Logic Reasoning over Natural Language via Resolution Refutation
di: Sun, Zhouhao, et al.
Pubblicazione: (2024) -
UFO-RL: Uncertainty-Focused Optimization for Efficient Reinforcement Learning Data Selection
di: Zhao, Yang, et al.
Pubblicazione: (2025) -
ExpeTrans: LLMs Are Experiential Transfer Learners
di: Gao, Jinglong, et al.
Pubblicazione: (2025)