Step-wise Adaptive Integration of Supervised Fine-tuning and Reinforcement Learning for Task-Specific LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Jack, Liu, Fazhong, Liu, Naruto, Luo, Yuhan, Qin, Erqu, Zheng, Harry, Dong, Tian, Zhu, Haojin, Meng, Yan, Wang, Xiao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Speculative Coreset Selection for Task-Specific Fine-tuning
por: Zhang, Xiaoyu, et al.
Publicado: (2024)
por: Zhang, Xiaoyu, et al.
Publicado: (2024)
Trojan's Whisper: Stealthy Manipulation of OpenClaw through Injected Bootstrapped Guidance
por: Liu, Fazhong, et al.
Publicado: (2026)
por: Liu, Fazhong, et al.
Publicado: (2026)
GRASS: Gradient-based Adaptive Layer-wise Importance Sampling for Memory-efficient Large Language Model Fine-tuning
por: Tian, Kaiyuan, et al.
Publicado: (2026)
por: Tian, Kaiyuan, et al.
Publicado: (2026)
Efficient Layer-wise LLM Fine-tuning for Revision Intention Prediction
por: Liu, Zhexiong, et al.
Publicado: (2025)
por: Liu, Zhexiong, et al.
Publicado: (2025)
Are LLMs Effective Backbones for Fine-tuning? An Experimental Investigation of Supervised LLMs on Chinese Short Text Matching
por: Liu, Shulin, et al.
Publicado: (2024)
por: Liu, Shulin, et al.
Publicado: (2024)
Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
por: Deng, Yihe, et al.
Publicado: (2025)
por: Deng, Yihe, et al.
Publicado: (2025)
Model Inversion in Split Learning for Personalized LLMs: New Insights from Information Bottleneck Theory
por: Shu, Yunmeng, et al.
Publicado: (2025)
por: Shu, Yunmeng, et al.
Publicado: (2025)
Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs
por: Lai, Xin, et al.
Publicado: (2024)
por: Lai, Xin, et al.
Publicado: (2024)
RobustFT: Robust Supervised Fine-tuning for Large Language Models under Noisy Response
por: Luo, Junyu, et al.
Publicado: (2024)
por: Luo, Junyu, et al.
Publicado: (2024)
LEVI: Generalizable Fine-tuning via Layer-wise Ensemble of Different Views
por: Roh, Yuji, et al.
Publicado: (2024)
por: Roh, Yuji, et al.
Publicado: (2024)
Stage-wise Fine-tuning for Graph-to-Text Generation
por: Wang, Qingyun, et al.
Publicado: (2021)
por: Wang, Qingyun, et al.
Publicado: (2021)
AIDE: Attribute-Guided MultI-Hop Data Expansion for Data Scarcity in Task-Specific Fine-tuning
por: Li, Jiayu, et al.
Publicado: (2024)
por: Li, Jiayu, et al.
Publicado: (2024)
On the Non-decoupling of Supervised Fine-tuning and Reinforcement Learning in Post-training
por: Niu, Xueyan, et al.
Publicado: (2026)
por: Niu, Xueyan, et al.
Publicado: (2026)
The Harder The Better: Maintaining Supervised Fine-tuning Generalization with Less but Harder Data
por: Shang, Zhaoyang, et al.
Publicado: (2025)
por: Shang, Zhaoyang, et al.
Publicado: (2025)
MOTIF: Modular Thinking via Reinforcement Fine-tuning in LLMs
por: Mitra, Purbesh, et al.
Publicado: (2025)
por: Mitra, Purbesh, et al.
Publicado: (2025)
Improving Low-Resource Knowledge Tracing Tasks by Supervised Pre-training and Importance Mechanism Fine-tuning
por: Zhang, Hengyuan, et al.
Publicado: (2024)
por: Zhang, Hengyuan, et al.
Publicado: (2024)
Supervised Fine-Tuning Achieve Rapid Task Adaption Via Alternating Attention Head Activation Patterns
por: Zhao, Yang, et al.
Publicado: (2024)
por: Zhao, Yang, et al.
Publicado: (2024)
Memento: Fine-tuning LLM Agents without Fine-tuning LLMs
por: Zhou, Huichi, et al.
Publicado: (2025)
por: Zhou, Huichi, et al.
Publicado: (2025)
Debiasing LLMs by Fine-tuning
por: Gao, Zhenyu, et al.
Publicado: (2026)
por: Gao, Zhenyu, et al.
Publicado: (2026)
MMRAG-RFT: Two-stage Reinforcement Fine-tuning for Explainable Multi-modal Retrieval-augmented Generation
por: Zhao, Shengwei, et al.
Publicado: (2025)
por: Zhao, Shengwei, et al.
Publicado: (2025)
Depth Gives a False Sense of Privacy: LLM Internal States Inversion
por: Dong, Tian, et al.
Publicado: (2025)
por: Dong, Tian, et al.
Publicado: (2025)
A Layer-wise Analysis of Supervised Fine-Tuning
por: Zhao, Qinghua, et al.
Publicado: (2026)
por: Zhao, Qinghua, et al.
Publicado: (2026)
SAVAA: Mitigating Hallucinations in LVLMs via Step-wise Adaptive Visual Attention Amplification
por: Zhang, Jiacheng, et al.
Publicado: (2026)
por: Zhang, Jiacheng, et al.
Publicado: (2026)
Semi-supervised Fine-tuning for Large Language Models
por: Luo, Junyu, et al.
Publicado: (2024)
por: Luo, Junyu, et al.
Publicado: (2024)
Preserving Diversity in Supervised Fine-Tuning of Large Language Models
por: Li, Ziniu, et al.
Publicado: (2024)
por: Li, Ziniu, et al.
Publicado: (2024)
HELENE: Hessian Layer-wise Clipping and Gradient Annealing for Accelerating Fine-tuning LLM with Zeroth-order Optimization
por: Zhao, Huaqin, et al.
Publicado: (2024)
por: Zhao, Huaqin, et al.
Publicado: (2024)
Towards Minimizing Feature Drift in Model Merging: Layer-wise Task Vector Fusion for Adaptive Knowledge Integration
por: Sun, Wenju, et al.
Publicado: (2025)
por: Sun, Wenju, et al.
Publicado: (2025)
Is One-Shot In-Context Learning Helpful for Data Selection in Task-Specific Fine-Tuning of Multimodal LLMs?
por: An, Xiao, et al.
Publicado: (2026)
por: An, Xiao, et al.
Publicado: (2026)
Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoning
por: Xu, Huimin, et al.
Publicado: (2025)
por: Xu, Huimin, et al.
Publicado: (2025)
UFT: Unifying Supervised and Reinforcement Fine-Tuning
por: Liu, Mingyang, et al.
Publicado: (2025)
por: Liu, Mingyang, et al.
Publicado: (2025)
ITERTL: An Iterative Framework for Fine-tuning LLMs for RTL Code Generation
por: Wu, Peiyang, et al.
Publicado: (2024)
por: Wu, Peiyang, et al.
Publicado: (2024)
Adaptive and Fine-grained Module-wise Expert Pruning for Efficient LoRA-MoE Fine-Tuning
por: Li, Weihang, et al.
Publicado: (2026)
por: Li, Weihang, et al.
Publicado: (2026)
ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy
por: Chen, Yuhui, et al.
Publicado: (2025)
por: Chen, Yuhui, et al.
Publicado: (2025)
How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data Composition
por: Dong, Guanting, et al.
Publicado: (2023)
por: Dong, Guanting, et al.
Publicado: (2023)
ViTree: Single-path Neural Tree for Step-wise Interpretable Fine-grained Visual Categorization
por: Lao, Danning, et al.
Publicado: (2024)
por: Lao, Danning, et al.
Publicado: (2024)
Democratizing Large Language Models via Personalized Parameter-Efficient Fine-tuning
por: Tan, Zhaoxuan, et al.
Publicado: (2024)
por: Tan, Zhaoxuan, et al.
Publicado: (2024)
Step-by-Step Unmasking for Parameter-Efficient Fine-tuning of Large Language Models
por: Agarwal, Aradhye, et al.
Publicado: (2024)
por: Agarwal, Aradhye, et al.
Publicado: (2024)
When MOE Meets LLMs: Parameter Efficient Fine-tuning for Multi-task Medical Applications
por: Liu, Qidong, et al.
Publicado: (2023)
por: Liu, Qidong, et al.
Publicado: (2023)
Fine-tuning for Data-enabled Predictive Control of Noisy Systems by Reinforcement Learning
por: Wang, Jinbao, et al.
Publicado: (2025)
por: Wang, Jinbao, et al.
Publicado: (2025)
Principled Fine-tuning of LLMs from User-Edits: A Medley of Preference, Supervision, and Reward
por: Misra, Dipendra, et al.
Publicado: (2026)
por: Misra, Dipendra, et al.
Publicado: (2026)
Ejemplares similares
-
Speculative Coreset Selection for Task-Specific Fine-tuning
por: Zhang, Xiaoyu, et al.
Publicado: (2024) -
Trojan's Whisper: Stealthy Manipulation of OpenClaw through Injected Bootstrapped Guidance
por: Liu, Fazhong, et al.
Publicado: (2026) -
GRASS: Gradient-based Adaptive Layer-wise Importance Sampling for Memory-efficient Large Language Model Fine-tuning
por: Tian, Kaiyuan, et al.
Publicado: (2026) -
Efficient Layer-wise LLM Fine-tuning for Revision Intention Prediction
por: Liu, Zhexiong, et al.
Publicado: (2025) -
Are LLMs Effective Backbones for Fine-tuning? An Experimental Investigation of Supervised LLMs on Chinese Short Text Matching
por: Liu, Shulin, et al.
Publicado: (2024)