One-Token Rollout: Guiding Supervised Fine-Tuning of LLMs with Policy Gradient
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ming, Rui, Wu, Haoyuan, Hu, Shoubo, He, Zhuolun, Yu, Bei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ToTRL: Unlock LLM Tree-of-Thoughts Reasoning Potential through Puzzles Solving
par: Wu, Haoyuan, et autres
Publié: (2025)
par: Wu, Haoyuan, et autres
Publié: (2025)
Divergent Thoughts toward One Goal: LLM-based Multi-Agent Collaboration System for Electronic Design Automation
par: Wu, Haoyuan, et autres
Publié: (2025)
par: Wu, Haoyuan, et autres
Publié: (2025)
Efficient OpAmp Adaptation for Zoom Attention to Golden Contexts
par: Wu, Haoyuan, et autres
Publié: (2025)
par: Wu, Haoyuan, et autres
Publié: (2025)
Architect of the Bits World: Masked Autoregressive Modeling for Circuit Generation Guided by Truth Table
par: Wu, Haoyuan, et autres
Publié: (2025)
par: Wu, Haoyuan, et autres
Publié: (2025)
On-Policy Optimization with Group Equivalent Preference for Multi-Programming Language Understanding
par: Wu, Haoyuan, et autres
Publié: (2025)
par: Wu, Haoyuan, et autres
Publié: (2025)
Customized Retrieval Augmented Generation and Benchmarking for EDA Tool Documentation QA
par: Pu, Yuan, et autres
Publié: (2024)
par: Pu, Yuan, et autres
Publié: (2024)
Rethinking Data Selection for Supervised Fine-Tuning
par: Shen, Ming
Publié: (2024)
par: Shen, Ming
Publié: (2024)
Supervised Fine-Tuning Needs to Unlock the Potential of Token Priority
par: Shen, Zhanming, et autres
Publié: (2026)
par: Shen, Zhanming, et autres
Publié: (2026)
Parameter-Efficient Sparsity Crafting from Dense to Mixture-of-Experts for Instruction Tuning on General Tasks
par: Wu, Haoyuan, et autres
Publié: (2024)
par: Wu, Haoyuan, et autres
Publié: (2024)
Token Cleaning: Fine-Grained Data Selection for LLM Supervised Fine-Tuning
par: Pang, Jinlong, et autres
Publié: (2025)
par: Pang, Jinlong, et autres
Publié: (2025)
Semantic Loss Guided Data Efficient Supervised Fine Tuning for Safe Responses in LLMs
par: Lu, Yuxiao, et autres
Publié: (2024)
par: Lu, Yuxiao, et autres
Publié: (2024)
Towards Pedagogical LLMs with Supervised Fine Tuning for Computing Education
par: Vassar, Alexandra, et autres
Publié: (2024)
par: Vassar, Alexandra, et autres
Publié: (2024)
Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients
par: Xu, Mingwei, et autres
Publié: (2026)
par: Xu, Mingwei, et autres
Publié: (2026)
Diversity or Precision? A Deep Dive into Next Token Prediction
par: Wu, Haoyuan, et autres
Publié: (2025)
par: Wu, Haoyuan, et autres
Publié: (2025)
GradPruner: Gradient-Guided Layer Pruning Enabling Efficient Fine-Tuning and Inference for LLMs
par: Huang, Wei, et autres
Publié: (2026)
par: Huang, Wei, et autres
Publié: (2026)
Anchored Supervised Fine-Tuning
par: Zhu, He, et autres
Publié: (2025)
par: Zhu, He, et autres
Publié: (2025)
Supervised Fine-Tuning LLMs to Behave as Pedagogical Agents in Programming Education
par: Ross, Emily, et autres
Publié: (2025)
par: Ross, Emily, et autres
Publié: (2025)
Proximal Supervised Fine-Tuning
par: Zhu, Wenhong, et autres
Publié: (2025)
par: Zhu, Wenhong, et autres
Publié: (2025)
Are Full Rollouts Necessary for On-Policy Distillation?
par: Zhang, Yaocheng, et autres
Publié: (2026)
par: Zhang, Yaocheng, et autres
Publié: (2026)
Mitigating Forgetting in LLM Fine-Tuning via Low-Perplexity Token Learning
par: Wu, Chao-Chung, et autres
Publié: (2025)
par: Wu, Chao-Chung, et autres
Publié: (2025)
Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts
par: Heuillet, Maxime, et autres
Publié: (2025)
par: Heuillet, Maxime, et autres
Publié: (2025)
Analyzing the Effects of Supervised Fine-Tuning on Model Knowledge from Token and Parameter Levels
par: Ye, Junjie, et autres
Publié: (2025)
par: Ye, Junjie, et autres
Publié: (2025)
Rethinking Supervised Fine-Tuning: Emphasizing Key Answer Tokens for Improved LLM Accuracy
par: Shi, Xiaofeng, et autres
Publié: (2025)
par: Shi, Xiaofeng, et autres
Publié: (2025)
Supervised Fine-Tuning or In-Context Learning? Evaluating LLMs for Clinical NER
par: Baroian, Andrei
Publié: (2025)
par: Baroian, Andrei
Publié: (2025)
Unleashing the Reasoning Potential of Pre-trained LLMs by Critique Fine-Tuning on One Problem
par: Wang, Yubo, et autres
Publié: (2025)
par: Wang, Yubo, et autres
Publié: (2025)
Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning
par: Feng, Weitao, et autres
Publié: (2025)
par: Feng, Weitao, et autres
Publié: (2025)
Fine-Tuning Discrete Diffusion Models with Policy Gradient Methods
par: Zekri, Oussama, et autres
Publié: (2025)
par: Zekri, Oussama, et autres
Publié: (2025)
FineMedLM-o1: Enhancing Medical Knowledge Reasoning Ability of LLM from Supervised Fine-Tuning to Test-Time Training
par: Yu, Hongzhou, et autres
Publié: (2025)
par: Yu, Hongzhou, et autres
Publié: (2025)
Winning the Pruning Gamble: A Unified Approach to Joint Sample and Token Pruning for Efficient Supervised Fine-Tuning
par: Wang, Shaobo, et autres
Publié: (2025)
par: Wang, Shaobo, et autres
Publié: (2025)
Mind the Gap: Data Rewriting for Stable Off-Policy Supervised Fine-Tuning
par: Zhao, Shiwan, et autres
Publié: (2025)
par: Zhao, Shiwan, et autres
Publié: (2025)
From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning
par: Wu, Haodong, et autres
Publié: (2026)
par: Wu, Haodong, et autres
Publié: (2026)
Gradient Surgery for Safe LLM Fine-Tuning
par: Yi, Biao, et autres
Publié: (2025)
par: Yi, Biao, et autres
Publié: (2025)
Fine-Tuning LLMs for Report Summarization: Analysis on Supervised and Unsupervised Data
par: Rallapalli, Swati, et autres
Publié: (2025)
par: Rallapalli, Swati, et autres
Publié: (2025)
SFT-TA: Supervised Fine-Tuned Agents in Multi-Agent LLMs for Automated Inductive Thematic Analysis
par: Yi, Seungjun, et autres
Publié: (2025)
par: Yi, Seungjun, et autres
Publié: (2025)
FocuSFT: Bilevel Optimization for Dilution-Aware Long-Context Fine-Tuning
par: Pei, Zehua, et autres
Publié: (2026)
par: Pei, Zehua, et autres
Publié: (2026)
Reassessing the Role of Supervised Fine-Tuning: An Empirical Study in VLM Reasoning
par: Yu, Yongcan, et autres
Publié: (2025)
par: Yu, Yongcan, et autres
Publié: (2025)
Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning
par: Ruan, Zhiwen, et autres
Publié: (2025)
par: Ruan, Zhiwen, et autres
Publié: (2025)
Open-Source LLMs for Text Annotation: A Practical Guide for Model Setting and Fine-Tuning
par: Alizadeh, Meysam, et autres
Publié: (2023)
par: Alizadeh, Meysam, et autres
Publié: (2023)
Supervised In-Context Fine-Tuning for Generative Sequence Labeling
par: Dukić, David, et autres
Publié: (2025)
par: Dukić, David, et autres
Publié: (2025)
ResT: Reshaping Token-Level Policy Gradients for Tool-Use Large Language Models
par: Lin, Zihan, et autres
Publié: (2025)
par: Lin, Zihan, et autres
Publié: (2025)
Documents similaires
-
ToTRL: Unlock LLM Tree-of-Thoughts Reasoning Potential through Puzzles Solving
par: Wu, Haoyuan, et autres
Publié: (2025) -
Divergent Thoughts toward One Goal: LLM-based Multi-Agent Collaboration System for Electronic Design Automation
par: Wu, Haoyuan, et autres
Publié: (2025) -
Efficient OpAmp Adaptation for Zoom Attention to Golden Contexts
par: Wu, Haoyuan, et autres
Publié: (2025) -
Architect of the Bits World: Masked Autoregressive Modeling for Circuit Generation Guided by Truth Table
par: Wu, Haoyuan, et autres
Publié: (2025) -
On-Policy Optimization with Group Equivalent Preference for Multi-Programming Language Understanding
par: Wu, Haoyuan, et autres
Publié: (2025)