UFT: Unifying Supervised and Reinforcement Fine-Tuning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Mingyang, Farina, Gabriele, Ozdaglar, Asuman |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
LiteEFG: An Efficient Python Library for Solving Extensive-form Games
von: Liu, Mingyang, et al.
Veröffentlicht: (2024)
von: Liu, Mingyang, et al.
Veröffentlicht: (2024)
A Policy-Gradient Approach to Solving Imperfect-Information Games with Best-Iterate Convergence
von: Liu, Mingyang, et al.
Veröffentlicht: (2024)
von: Liu, Mingyang, et al.
Veröffentlicht: (2024)
Computing Equilibrium beyond Unilateral Deviation
von: Liu, Mingyang, et al.
Veröffentlicht: (2026)
von: Liu, Mingyang, et al.
Veröffentlicht: (2026)
Differentially Private Equilibrium Finding in Polymatrix Games
von: Liu, Mingyang, et al.
Veröffentlicht: (2025)
von: Liu, Mingyang, et al.
Veröffentlicht: (2025)
Online Learning and Equilibrium Computation with Ranking Feedback
von: Liu, Mingyang, et al.
Veröffentlicht: (2026)
von: Liu, Mingyang, et al.
Veröffentlicht: (2026)
UFT: Unifying Fine-Tuning of SFT and RLHF/DPO/UNA through a Generalized Implicit Reward Function
von: Wang, Zhichao, et al.
Veröffentlicht: (2024)
von: Wang, Zhichao, et al.
Veröffentlicht: (2024)
The Power of Regularization in Solving Extensive-Form Games
von: Liu, Mingyang, et al.
Veröffentlicht: (2022)
von: Liu, Mingyang, et al.
Veröffentlicht: (2022)
Supervised Fine-Tuning as Inverse Reinforcement Learning
von: Sun, Hao
Veröffentlicht: (2024)
von: Sun, Hao
Veröffentlicht: (2024)
Anchored Supervised Fine-Tuning
von: Zhu, He, et al.
Veröffentlicht: (2025)
von: Zhu, He, et al.
Veröffentlicht: (2025)
Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling
von: Huang, Zeyu, et al.
Veröffentlicht: (2025)
von: Huang, Zeyu, et al.
Veröffentlicht: (2025)
Proximal Supervised Fine-Tuning
von: Zhu, Wenhong, et al.
Veröffentlicht: (2025)
von: Zhu, Wenhong, et al.
Veröffentlicht: (2025)
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
Multi-Player Zero-Sum Markov Games with Networked Separable Interactions
von: Park, Chanwoo, et al.
Veröffentlicht: (2023)
von: Park, Chanwoo, et al.
Veröffentlicht: (2023)
Parameter Importance is Not Static: Evolving Parameter Isolation for Supervised Fine-Tuning
von: Lin, Zekai, et al.
Veröffentlicht: (2026)
von: Lin, Zekai, et al.
Veröffentlicht: (2026)
Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2026)
von: Zhang, Jiazheng, et al.
Veröffentlicht: (2026)
ChunkFT: Byte-Streamed Optimization for Memory-Efficient Full Fine-Tuning
von: Liu, Yongkang, et al.
Veröffentlicht: (2026)
von: Liu, Yongkang, et al.
Veröffentlicht: (2026)
IA2: Alignment with ICL Activations Improves Supervised Fine-Tuning
von: Mishra, Aayush, et al.
Veröffentlicht: (2025)
von: Mishra, Aayush, et al.
Veröffentlicht: (2025)
Mind the Gap: Data Rewriting for Stable Off-Policy Supervised Fine-Tuning
von: Zhao, Shiwan, et al.
Veröffentlicht: (2025)
von: Zhao, Shiwan, et al.
Veröffentlicht: (2025)
Supervised Fine-Tuning Achieve Rapid Task Adaption Via Alternating Attention Head Activation Patterns
von: Zhao, Yang, et al.
Veröffentlicht: (2024)
von: Zhao, Yang, et al.
Veröffentlicht: (2024)
RLHF from Heterogeneous Feedback via Personalization and Preference Aggregation
von: Park, Chanwoo, et al.
Veröffentlicht: (2024)
von: Park, Chanwoo, et al.
Veröffentlicht: (2024)
Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization
von: Adams, Carter, et al.
Veröffentlicht: (2026)
von: Adams, Carter, et al.
Veröffentlicht: (2026)
Pre-training LLM without Learning Rate Decay Enhances Supervised Fine-Tuning
von: Yano, Kazuki, et al.
Veröffentlicht: (2026)
von: Yano, Kazuki, et al.
Veröffentlicht: (2026)
Threshold Filtering Packing for Supervised Fine-Tuning: Training Related Samples within Packs
von: Dong, Jiancheng, et al.
Veröffentlicht: (2024)
von: Dong, Jiancheng, et al.
Veröffentlicht: (2024)
From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning
von: Wu, Haodong, et al.
Veröffentlicht: (2026)
von: Wu, Haodong, et al.
Veröffentlicht: (2026)
Trinity-RFT: A General-Purpose and Unified Framework for Reinforcement Fine-Tuning of Large Language Models
von: Pan, Xuchen, et al.
Veröffentlicht: (2025)
von: Pan, Xuchen, et al.
Veröffentlicht: (2025)
Supervised Fine-Tuning Needs to Unlock the Potential of Token Priority
von: Shen, Zhanming, et al.
Veröffentlicht: (2026)
von: Shen, Zhanming, et al.
Veröffentlicht: (2026)
FisherSFT: Data-Efficient Supervised Fine-Tuning of Language Models Using Information Gain
von: Deb, Rohan, et al.
Veröffentlicht: (2025)
von: Deb, Rohan, et al.
Veröffentlicht: (2025)
Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning
von: Feng, Weitao, et al.
Veröffentlicht: (2025)
von: Feng, Weitao, et al.
Veröffentlicht: (2025)
Do LLM Agents Have Regret? A Case Study in Online Learning and Games
von: Park, Chanwoo, et al.
Veröffentlicht: (2024)
von: Park, Chanwoo, et al.
Veröffentlicht: (2024)
Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training
von: Lai, Song, et al.
Veröffentlicht: (2025)
von: Lai, Song, et al.
Veröffentlicht: (2025)
Fine-Tuning LLMs for Report Summarization: Analysis on Supervised and Unsupervised Data
von: Rallapalli, Swati, et al.
Veröffentlicht: (2025)
von: Rallapalli, Swati, et al.
Veröffentlicht: (2025)
Stabilizing LLM Supervised Fine-Tuning via Explicit Distributional Control
von: Wang, Xinyu, et al.
Veröffentlicht: (2026)
von: Wang, Xinyu, et al.
Veröffentlicht: (2026)
Offline Reinforcement Learning via Linear-Programming with Error-Bound Induced Constraints
von: Ozdaglar, Asuman, et al.
Veröffentlicht: (2022)
von: Ozdaglar, Asuman, et al.
Veröffentlicht: (2022)
Reinforcement Learning without Human Feedback for Last Mile Fine-Tuning of Large Language Models
von: Solway, Alec
Veröffentlicht: (2024)
von: Solway, Alec
Veröffentlicht: (2024)
ARES: Alternating Reinforcement Learning and Supervised Fine-Tuning for Enhanced Multi-Modal Chain-of-Thought Reasoning Through Diverse AI Feedback
von: Byun, Ju-Seung, et al.
Veröffentlicht: (2024)
von: Byun, Ju-Seung, et al.
Veröffentlicht: (2024)
Reassessing the Role of Supervised Fine-Tuning: An Empirical Study in VLM Reasoning
von: Yu, Yongcan, et al.
Veröffentlicht: (2025)
von: Yu, Yongcan, et al.
Veröffentlicht: (2025)
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
von: Hong, Joey, et al.
Veröffentlicht: (2024)
von: Hong, Joey, et al.
Veröffentlicht: (2024)
iTool: Reinforced Fine-Tuning with Dynamic Deficiency Calibration for Advanced Tool Use
von: Zeng, Yirong, et al.
Veröffentlicht: (2025)
von: Zeng, Yirong, et al.
Veröffentlicht: (2025)
A Unified Linear Programming Framework for Offline Reward Learning from Human Demonstrations and Feedback
von: Kim, Kihyun, et al.
Veröffentlicht: (2024)
von: Kim, Kihyun, et al.
Veröffentlicht: (2024)
LIFT the Veil for the Truth: Principal Weights Emerge after Rank Reduction for Reasoning-Focused Supervised Fine-Tuning
von: Liu, Zihang, et al.
Veröffentlicht: (2025)
von: Liu, Zihang, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
LiteEFG: An Efficient Python Library for Solving Extensive-form Games
von: Liu, Mingyang, et al.
Veröffentlicht: (2024) -
A Policy-Gradient Approach to Solving Imperfect-Information Games with Best-Iterate Convergence
von: Liu, Mingyang, et al.
Veröffentlicht: (2024) -
Computing Equilibrium beyond Unilateral Deviation
von: Liu, Mingyang, et al.
Veröffentlicht: (2026) -
Differentially Private Equilibrium Finding in Polymatrix Games
von: Liu, Mingyang, et al.
Veröffentlicht: (2025) -
Online Learning and Equilibrium Computation with Ranking Feedback
von: Liu, Mingyang, et al.
Veröffentlicht: (2026)