SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fu, Yuqian, Chen, Tinghong, Chai, Jiajun, Wang, Xihuai, Tu, Songjun, Yin, Guojun, Lin, Wei, Zhang, Qichao, Zhu, Yuanheng, Zhao, Dongbin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RLAE: Reinforcement Learning-Assisted Ensemble for LLMs
par: Fu, Yuqian, et autres
Publié: (2025)
par: Fu, Yuqian, et autres
Publié: (2025)
Are Full Rollouts Necessary for On-Policy Distillation?
par: Zhang, Yaocheng, et autres
Publié: (2026)
par: Zhang, Yaocheng, et autres
Publié: (2026)
DipLLM: Fine-Tuning LLM for Strategic Decision-making in Diplomacy
par: Xu, Kaixuan, et autres
Publié: (2025)
par: Xu, Kaixuan, et autres
Publié: (2025)
$π$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External Data
par: Zhang, Yaocheng, et autres
Publié: (2026)
par: Zhang, Yaocheng, et autres
Publié: (2026)
AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning
par: Sun, Jingbo, et autres
Publié: (2026)
par: Sun, Jingbo, et autres
Publié: (2026)
CPIG: Leveraging Consistency Policy with Intention Guidance for Multi-agent Exploration
par: Fu, Yuqian, et autres
Publié: (2024)
par: Fu, Yuqian, et autres
Publié: (2024)
Salience-Invariant Consistent Policy Learning for Generalization in Visual Reinforcement Learning
par: Sun, Jingbo, et autres
Publié: (2025)
par: Sun, Jingbo, et autres
Publié: (2025)
Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL
par: Tu, Songjun, et autres
Publié: (2025)
par: Tu, Songjun, et autres
Publié: (2025)
Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model
par: Tu, Songjun, et autres
Publié: (2024)
par: Tu, Songjun, et autres
Publié: (2024)
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
par: Tu, Songjun, et autres
Publié: (2025)
par: Tu, Songjun, et autres
Publié: (2025)
A Hierarchical Deep Reinforcement Learning Framework for 6-DOF UCAV Air-to-Air Combat
par: Chai, Jiajun, et autres
Publié: (2022)
par: Chai, Jiajun, et autres
Publié: (2022)
Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation
par: Tu, Songjun, et autres
Publié: (2025)
par: Tu, Songjun, et autres
Publié: (2025)
In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning
par: Tu, Songjun, et autres
Publié: (2024)
par: Tu, Songjun, et autres
Publié: (2024)
CriticSearch: Fine-Grained Credit Assignment for Search Agents via a Retrospective Critic
par: Zhang, Yaocheng, et autres
Publié: (2025)
par: Zhang, Yaocheng, et autres
Publié: (2025)
Saliency-Guided Representation with Consistency Policy Learning for Visual Unsupervised Reinforcement Learning
par: Sun, Jingbo, et autres
Publié: (2026)
par: Sun, Jingbo, et autres
Publié: (2026)
Discretizing Continuous Action Space with Unimodal Probability Distributions for On-Policy Reinforcement Learning
par: Zhu, Yuanyang, et autres
Publié: (2024)
par: Zhu, Yuanyang, et autres
Publié: (2024)
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
par: Fu, Yuqian, et autres
Publié: (2026)
par: Fu, Yuqian, et autres
Publié: (2026)
Dynamic Dual-Granularity Skill Bank for Agentic RL
par: Tu, Songjun, et autres
Publié: (2026)
par: Tu, Songjun, et autres
Publié: (2026)
PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review
par: Tu, Songjun, et autres
Publié: (2026)
par: Tu, Songjun, et autres
Publié: (2026)
ARAC: Adaptive Regularized Multi-Agent Soft Actor-Critic in Graph-Structured Adversarial Games
par: Shi, Ruochuan, et autres
Publié: (2025)
par: Shi, Ruochuan, et autres
Publié: (2025)
FM3Q: Factorized Multi-Agent MiniMax Q-Learning for Two-Team Zero-Sum Markov Game
par: Hu, Guangzheng, et autres
Publié: (2024)
par: Hu, Guangzheng, et autres
Publié: (2024)
R2PS: Worst-Case Robust Real-Time Pursuit Strategies under Partial Observability
par: Lu, Runyu, et autres
Publié: (2025)
par: Lu, Runyu, et autres
Publié: (2025)
Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration
par: Wang, Zili, et autres
Publié: (2026)
par: Wang, Zili, et autres
Publié: (2026)
ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning
par: Lin, Zihan, et autres
Publié: (2026)
par: Lin, Zihan, et autres
Publié: (2026)
MTIR-SQL: Multi-turn Tool-Integrated Reasoning Reinforcement Learning for Text-to-SQL
par: Xu, Zekun, et autres
Publié: (2025)
par: Xu, Zekun, et autres
Publié: (2025)
Promoting Efficient Reasoning with Verifiable Stepwise Reward
par: Yue, Chuhuai, et autres
Publié: (2025)
par: Yue, Chuhuai, et autres
Publié: (2025)
On-Policy Supervised Fine-Tuning for Efficient Reasoning
par: Zhao, Anhao, et autres
Publié: (2026)
par: Zhao, Anhao, et autres
Publié: (2026)
Data Difficulty and the Generalization--Extrapolation Tradeoff in LLM Fine-Tuning
par: Liu, Siyuan, et autres
Publié: (2026)
par: Liu, Siyuan, et autres
Publié: (2026)
AWPO: Enhancing Tool-Use of Large Language Models through Adaptive Integration of Reasoning Rewards
par: Lin, Zihan, et autres
Publié: (2025)
par: Lin, Zihan, et autres
Publié: (2025)
Meta-DT: Offline Meta-RL as Conditional Sequence Modeling with World Model Disentanglement
par: Wang, Zhi, et autres
Publié: (2024)
par: Wang, Zhi, et autres
Publié: (2024)
Equilibrium Policy Generalization: A Reinforcement Learning Framework for Cross-Graph Zero-Shot Generalization in Pursuit-Evasion Games
par: Lu, Runyu, et autres
Publié: (2025)
par: Lu, Runyu, et autres
Publié: (2025)
When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards
par: Wang, Li, et autres
Publié: (2026)
par: Wang, Li, et autres
Publié: (2026)
Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning
par: Wang, Li, et autres
Publié: (2026)
par: Wang, Li, et autres
Publié: (2026)
Model-based Multi-agent Reinforcement Learning: Recent Progress and Prospects
par: Wang, Xihuai, et autres
Publié: (2022)
par: Wang, Xihuai, et autres
Publié: (2022)
Supervised Fine-Tuning as Inverse Reinforcement Learning
par: Sun, Hao
Publié: (2024)
par: Sun, Hao
Publié: (2024)
UFT: Unifying Supervised and Reinforcement Fine-Tuning
par: Liu, Mingyang, et autres
Publié: (2025)
par: Liu, Mingyang, et autres
Publié: (2025)
A Dual‐Frequency Wideband Inverse Class‐F Power Amplifier Using SRFT Matching
par: Haitao He, et autres
Publié: (2026)
par: Haitao He, et autres
Publié: (2026)
ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy
par: Chen, Yuhui, et autres
Publié: (2025)
par: Chen, Yuhui, et autres
Publié: (2025)
Reasoning-Table: Exploring Reinforcement Learning for Table Reasoning
par: Lei, Fangyu, et autres
Publié: (2025)
par: Lei, Fangyu, et autres
Publié: (2025)
Dream to Drive with Predictive Individual World Model
par: Gao, Yinfeng, et autres
Publié: (2025)
par: Gao, Yinfeng, et autres
Publié: (2025)
Documents similaires
-
RLAE: Reinforcement Learning-Assisted Ensemble for LLMs
par: Fu, Yuqian, et autres
Publié: (2025) -
Are Full Rollouts Necessary for On-Policy Distillation?
par: Zhang, Yaocheng, et autres
Publié: (2026) -
DipLLM: Fine-Tuning LLM for Strategic Decision-making in Diplomacy
par: Xu, Kaixuan, et autres
Publié: (2025) -
$π$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External Data
par: Zhang, Yaocheng, et autres
Publié: (2026) -
AutoSearch: Adaptive Search Depth for Efficient Agentic RAG via Reinforcement Learning
par: Sun, Jingbo, et autres
Publié: (2026)