Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Huang, Zeyu, Cheng, Tianhao, Qiu, Zihan, Wang, Zili, Xu, Yinghui, Ponti, Edoardo M., Titov, Ivan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Post-hoc Reward Calibration: A Case Study on Length Bias
von: Huang, Zeyu, et al.
Veröffentlicht: (2024)
von: Huang, Zeyu, et al.
Veröffentlicht: (2024)
Scaling Sparse Fine-Tuning to Large Language Models
von: Ansell, Alan, et al.
Veröffentlicht: (2024)
von: Ansell, Alan, et al.
Veröffentlicht: (2024)
The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits
von: Cheng, Tianhao, et al.
Veröffentlicht: (2026)
von: Cheng, Tianhao, et al.
Veröffentlicht: (2026)
Joint Localization and Activation Editing for Low-Resource Fine-Tuning
von: Lai, Wen, et al.
Veröffentlicht: (2025)
von: Lai, Wen, et al.
Veröffentlicht: (2025)
Supervised Fine-Tuning as Inverse Reinforcement Learning
von: Sun, Hao
Veröffentlicht: (2024)
von: Sun, Hao
Veröffentlicht: (2024)
Supervised Fine-Tuning Needs to Unlock the Potential of Token Priority
von: Shen, Zhanming, et al.
Veröffentlicht: (2026)
von: Shen, Zhanming, et al.
Veröffentlicht: (2026)
Proximal Supervised Fine-Tuning
von: Zhu, Wenhong, et al.
Veröffentlicht: (2025)
von: Zhu, Wenhong, et al.
Veröffentlicht: (2025)
Emergent Communication Pretraining for Few-Shot Machine Translation
von: Li, Yaoyiran, et al.
Veröffentlicht: (2020)
von: Li, Yaoyiran, et al.
Veröffentlicht: (2020)
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
What's New in My Data? Novelty Exploration via Contrastive Generation
von: Isonuma, Masaru, et al.
Veröffentlicht: (2024)
von: Isonuma, Masaru, et al.
Veröffentlicht: (2024)
Probing the Emergence of Cross-lingual Alignment during LLM Training
von: Wang, Hetong, et al.
Veröffentlicht: (2024)
von: Wang, Hetong, et al.
Veröffentlicht: (2024)
L-TUNING: Synchronized Label Tuning for Prompt and Prefix in LLMs
von: Kowsher, Md., et al.
Veröffentlicht: (2023)
von: Kowsher, Md., et al.
Veröffentlicht: (2023)
Fine-Tuning Improves Information Conveyance in Language Models
von: Cheng, Yuwei, et al.
Veröffentlicht: (2026)
von: Cheng, Yuwei, et al.
Veröffentlicht: (2026)
Aligning Large Language Models via Fine-grained Supervision
von: Xu, Dehong, et al.
Veröffentlicht: (2024)
von: Xu, Dehong, et al.
Veröffentlicht: (2024)
iTool: Reinforced Fine-Tuning with Dynamic Deficiency Calibration for Advanced Tool Use
von: Zeng, Yirong, et al.
Veröffentlicht: (2025)
von: Zeng, Yirong, et al.
Veröffentlicht: (2025)
Spectral Editing of Activations for Large Language Model Alignment
von: Qiu, Yifu, et al.
Veröffentlicht: (2024)
von: Qiu, Yifu, et al.
Veröffentlicht: (2024)
Shared Doubt: Zero-shot Cross-Lingual Confidence Estimation for Language Models
von: Kyriakou, Athina, et al.
Veröffentlicht: (2026)
von: Kyriakou, Athina, et al.
Veröffentlicht: (2026)
Fine-Tuning LLMs for Report Summarization: Analysis on Supervised and Unsupervised Data
von: Rallapalli, Swati, et al.
Veröffentlicht: (2025)
von: Rallapalli, Swati, et al.
Veröffentlicht: (2025)
Stabilizing LLM Supervised Fine-Tuning via Explicit Distributional Control
von: Wang, Xinyu, et al.
Veröffentlicht: (2026)
von: Wang, Xinyu, et al.
Veröffentlicht: (2026)
IA2: Alignment with ICL Activations Improves Supervised Fine-Tuning
von: Mishra, Aayush, et al.
Veröffentlicht: (2025)
von: Mishra, Aayush, et al.
Veröffentlicht: (2025)
Let the Expert Stick to His Last: Expert-Specialized Fine-Tuning for Sparse Architectural Large Language Models
von: Wang, Zihan, et al.
Veröffentlicht: (2024)
von: Wang, Zihan, et al.
Veröffentlicht: (2024)
Unlocking Continual Learning Abilities in Language Models
von: Du, Wenyu, et al.
Veröffentlicht: (2024)
von: Du, Wenyu, et al.
Veröffentlicht: (2024)
ARES: Alternating Reinforcement Learning and Supervised Fine-Tuning for Enhanced Multi-Modal Chain-of-Thought Reasoning Through Diverse AI Feedback
von: Byun, Ju-Seung, et al.
Veröffentlicht: (2024)
von: Byun, Ju-Seung, et al.
Veröffentlicht: (2024)
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
von: Hong, Joey, et al.
Veröffentlicht: (2024)
von: Hong, Joey, et al.
Veröffentlicht: (2024)
Self-Improving World Modelling with Latent Actions
von: Qiu, Yifu, et al.
Veröffentlicht: (2026)
von: Qiu, Yifu, et al.
Veröffentlicht: (2026)
LIFT the Veil for the Truth: Principal Weights Emerge after Rank Reduction for Reasoning-Focused Supervised Fine-Tuning
von: Liu, Zihang, et al.
Veröffentlicht: (2025)
von: Liu, Zihang, et al.
Veröffentlicht: (2025)
Mixtures of In-Context Learners
von: Hong, Giwon, et al.
Veröffentlicht: (2024)
von: Hong, Giwon, et al.
Veröffentlicht: (2024)
Reinforcement Fine-Tuning Naturally Mitigates Forgetting in Continual Post-Training
von: Lai, Song, et al.
Veröffentlicht: (2025)
von: Lai, Song, et al.
Veröffentlicht: (2025)
Efficient Differentially Private Fine-Tuning of LLMs via Reinforcement Learning
von: Khadangi, Afshin, et al.
Veröffentlicht: (2025)
von: Khadangi, Afshin, et al.
Veröffentlicht: (2025)
Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning
von: Qu, Yuxiao, et al.
Veröffentlicht: (2025)
von: Qu, Yuxiao, et al.
Veröffentlicht: (2025)
Preserving Diversity in Supervised Fine-Tuning of Large Language Models
von: Li, Ziniu, et al.
Veröffentlicht: (2024)
von: Li, Ziniu, et al.
Veröffentlicht: (2024)
Inference-Aware Fine-Tuning for Best-of-N Sampling in Large Language Models
von: Chow, Yinlam, et al.
Veröffentlicht: (2024)
von: Chow, Yinlam, et al.
Veröffentlicht: (2024)
Towards Understanding Fine-Tuning Mechanisms of LLMs via Circuit Analysis
von: Wang, Xu, et al.
Veröffentlicht: (2025)
von: Wang, Xu, et al.
Veröffentlicht: (2025)
Finding Culture-Sensitive Neurons in Vision-Language Models
von: Zhao, Xiutian, et al.
Veröffentlicht: (2025)
von: Zhao, Xiutian, et al.
Veröffentlicht: (2025)
Model Merging by Uncertainty-Based Gradient Matching
von: Daheim, Nico, et al.
Veröffentlicht: (2023)
von: Daheim, Nico, et al.
Veröffentlicht: (2023)
AutoPEFT: Automatic Configuration Search for Parameter-Efficient Fine-Tuning
von: Zhou, Han, et al.
Veröffentlicht: (2023)
von: Zhou, Han, et al.
Veröffentlicht: (2023)
AdvPrefix: An Objective for Nuanced LLM Jailbreaks
von: Zhu, Sicheng, et al.
Veröffentlicht: (2024)
von: Zhu, Sicheng, et al.
Veröffentlicht: (2024)
Towards Infinite-Long Prefix in Transformer
von: Liang, Yingyu, et al.
Veröffentlicht: (2024)
von: Liang, Yingyu, et al.
Veröffentlicht: (2024)
AFLoRA: Adaptive Freezing of Low Rank Adaptation in Parameter Efficient Fine-Tuning of Large Models
von: Liu, Zeyu, et al.
Veröffentlicht: (2024)
von: Liu, Zeyu, et al.
Veröffentlicht: (2024)
Fine-Tuning Language Models with Reward Learning on Policy
von: Lang, Hao, et al.
Veröffentlicht: (2024)
von: Lang, Hao, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Post-hoc Reward Calibration: A Case Study on Length Bias
von: Huang, Zeyu, et al.
Veröffentlicht: (2024) -
Scaling Sparse Fine-Tuning to Large Language Models
von: Ansell, Alan, et al.
Veröffentlicht: (2024) -
The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits
von: Cheng, Tianhao, et al.
Veröffentlicht: (2026) -
Joint Localization and Activation Editing for Low-Resource Fine-Tuning
von: Lai, Wen, et al.
Veröffentlicht: (2025) -
Supervised Fine-Tuning as Inverse Reinforcement Learning
von: Sun, Hao
Veröffentlicht: (2024)