Supervised Fine-Tuning as Inverse Reinforcement Learning
Fuente:
arXiv
Gespeichert in:
| 1. Verfasser: | Sun, Hao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling
von: Huang, Zeyu, et al.
Veröffentlicht: (2025)
von: Huang, Zeyu, et al.
Veröffentlicht: (2025)
Proximal Supervised Fine-Tuning
von: Zhu, Wenhong, et al.
Veröffentlicht: (2025)
von: Zhu, Wenhong, et al.
Veröffentlicht: (2025)
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
Stabilizing LLM Supervised Fine-Tuning via Explicit Distributional Control
von: Wang, Xinyu, et al.
Veröffentlicht: (2026)
von: Wang, Xinyu, et al.
Veröffentlicht: (2026)
Supervised Fine-Tuning Needs to Unlock the Potential of Token Priority
von: Shen, Zhanming, et al.
Veröffentlicht: (2026)
von: Shen, Zhanming, et al.
Veröffentlicht: (2026)
Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities
von: Sun, Hao, et al.
Veröffentlicht: (2025)
von: Sun, Hao, et al.
Veröffentlicht: (2025)
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
von: Hong, Joey, et al.
Veröffentlicht: (2024)
von: Hong, Joey, et al.
Veröffentlicht: (2024)
ARES: Alternating Reinforcement Learning and Supervised Fine-Tuning for Enhanced Multi-Modal Chain-of-Thought Reasoning Through Diverse AI Feedback
von: Byun, Ju-Seung, et al.
Veröffentlicht: (2024)
von: Byun, Ju-Seung, et al.
Veröffentlicht: (2024)
Fine-Tuning Language Models with Reward Learning on Policy
von: Lang, Hao, et al.
Veröffentlicht: (2024)
von: Lang, Hao, et al.
Veröffentlicht: (2024)
Efficient Differentially Private Fine-Tuning of LLMs via Reinforcement Learning
von: Khadangi, Afshin, et al.
Veröffentlicht: (2025)
von: Khadangi, Afshin, et al.
Veröffentlicht: (2025)
Fine-Tuning LLMs for Report Summarization: Analysis on Supervised and Unsupervised Data
von: Rallapalli, Swati, et al.
Veröffentlicht: (2025)
von: Rallapalli, Swati, et al.
Veröffentlicht: (2025)
IA2: Alignment with ICL Activations Improves Supervised Fine-Tuning
von: Mishra, Aayush, et al.
Veröffentlicht: (2025)
von: Mishra, Aayush, et al.
Veröffentlicht: (2025)
EMORL: Ensemble Multi-Objective Reinforcement Learning for Efficient and Flexible LLM Fine-Tuning
von: Kong, Lingxiao, et al.
Veröffentlicht: (2025)
von: Kong, Lingxiao, et al.
Veröffentlicht: (2025)
Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training
von: Lai, Song, et al.
Veröffentlicht: (2025)
von: Lai, Song, et al.
Veröffentlicht: (2025)
Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning
von: Qu, Yuxiao, et al.
Veröffentlicht: (2025)
von: Qu, Yuxiao, et al.
Veröffentlicht: (2025)
Rethinking Parameter Sharing for LLM Fine-Tuning with Multiple LoRAs
von: Ban, Hao, et al.
Veröffentlicht: (2025)
von: Ban, Hao, et al.
Veröffentlicht: (2025)
Imitating Language via Scalable Inverse Reinforcement Learning
von: Wulfmeier, Markus, et al.
Veröffentlicht: (2024)
von: Wulfmeier, Markus, et al.
Veröffentlicht: (2024)
Teaching LLMs How to Learn with Contextual Fine-Tuning
von: Choi, Younwoo, et al.
Veröffentlicht: (2025)
von: Choi, Younwoo, et al.
Veröffentlicht: (2025)
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
von: Heuillet, Maxime, et al.
Veröffentlicht: (2025)
von: Heuillet, Maxime, et al.
Veröffentlicht: (2025)
iTool: Reinforced Fine-Tuning with Dynamic Deficiency Calibration for Advanced Tool Use
von: Zeng, Yirong, et al.
Veröffentlicht: (2025)
von: Zeng, Yirong, et al.
Veröffentlicht: (2025)
Understanding the Performance and Estimating the Cost of LLM Fine-Tuning
von: Xia, Yuchen, et al.
Veröffentlicht: (2024)
von: Xia, Yuchen, et al.
Veröffentlicht: (2024)
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
von: Cheng, Ruoxi, et al.
Veröffentlicht: (2025)
von: Cheng, Ruoxi, et al.
Veröffentlicht: (2025)
Children's English Reading Story Generation via Supervised Fine-Tuning of Compact LLMs with Controllable Difficulty and Safety
von: Shen, Qian, et al.
Veröffentlicht: (2026)
von: Shen, Qian, et al.
Veröffentlicht: (2026)
LIFT the Veil for the Truth: Principal Weights Emerge after Rank Reduction for Reasoning-Focused Supervised Fine-Tuning
von: Liu, Zihang, et al.
Veröffentlicht: (2025)
von: Liu, Zihang, et al.
Veröffentlicht: (2025)
Understanding Forgetting in LLM Supervised Fine-Tuning and Preference Learning -- A Convex Optimization Perspective
von: Fernando, Heshan, et al.
Veröffentlicht: (2024)
von: Fernando, Heshan, et al.
Veröffentlicht: (2024)
Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning
von: Ding, Fei, et al.
Veröffentlicht: (2026)
von: Ding, Fei, et al.
Veröffentlicht: (2026)
Fine-Tuning is Subgraph Search: A New Lens on Learning Dynamics
von: Li, Yueyan, et al.
Veröffentlicht: (2025)
von: Li, Yueyan, et al.
Veröffentlicht: (2025)
MMICT: Boosting Multi-Modal Fine-Tuning with In-Context Examples
von: Chen, Tao, et al.
Veröffentlicht: (2023)
von: Chen, Tao, et al.
Veröffentlicht: (2023)
Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning
von: Zhai, Yuexiang, et al.
Veröffentlicht: (2024)
von: Zhai, Yuexiang, et al.
Veröffentlicht: (2024)
Order-Independence Without Fine Tuning
von: McIlroy-Young, Reid, et al.
Veröffentlicht: (2024)
von: McIlroy-Young, Reid, et al.
Veröffentlicht: (2024)
Model Editing by Standard Fine-Tuning
von: Gangadhar, Govind, et al.
Veröffentlicht: (2024)
von: Gangadhar, Govind, et al.
Veröffentlicht: (2024)
Query-Dependent Prompt Evaluation and Optimization with Offline Inverse RL
von: Sun, Hao, et al.
Veröffentlicht: (2023)
von: Sun, Hao, et al.
Veröffentlicht: (2023)
Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
von: Deng, Yihe, et al.
Veröffentlicht: (2025)
von: Deng, Yihe, et al.
Veröffentlicht: (2025)
Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards
von: Wang, Zhen, et al.
Veröffentlicht: (2025)
von: Wang, Zhen, et al.
Veröffentlicht: (2025)
Parameter-Efficient Fine-Tuning for Foundation Models
von: Zhang, Dan, et al.
Veröffentlicht: (2025)
von: Zhang, Dan, et al.
Veröffentlicht: (2025)
Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction
von: Smirnov, Alexander
Veröffentlicht: (2026)
von: Smirnov, Alexander
Veröffentlicht: (2026)
MiCA Learns More Knowledge Than LoRA and Full Fine-Tuning
von: Rüdiger, Sten, et al.
Veröffentlicht: (2026)
von: Rüdiger, Sten, et al.
Veröffentlicht: (2026)
Long Exposure: Accelerating Parameter-Efficient Fine-Tuning for LLMs under Shadowy Sparsity
von: Wang, Tuowei, et al.
Veröffentlicht: (2025)
von: Wang, Tuowei, et al.
Veröffentlicht: (2025)
LLMs Meet Finance: Fine-Tuning Foundation Models for the Open FinLLM Leaderboard
von: Rao, Varun, et al.
Veröffentlicht: (2025)
von: Rao, Varun, et al.
Veröffentlicht: (2025)
Self-Harmony: Learning to Harmonize Self-Supervision and Self-Play in Test-Time Reinforcement Learning
von: Wang, Ru, et al.
Veröffentlicht: (2025)
von: Wang, Ru, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling
von: Huang, Zeyu, et al.
Veröffentlicht: (2025) -
Proximal Supervised Fine-Tuning
von: Zhu, Wenhong, et al.
Veröffentlicht: (2025) -
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
von: Fu, Yuqian, et al.
Veröffentlicht: (2025) -
Stabilizing LLM Supervised Fine-Tuning via Explicit Distributional Control
von: Wang, Xinyu, et al.
Veröffentlicht: (2026) -
Supervised Fine-Tuning Needs to Unlock the Potential of Token Priority
von: Shen, Zhanming, et al.
Veröffentlicht: (2026)