On-Policy Supervised Fine-Tuning for Efficient Reasoning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhao, Anhao, Chen, Ziyang, Tong, Junlong, Fan, Yingqi, Ye, Fanghua, Li, Shuhao, Ma, Yunpu, Li, Wenjie, Shen, Xiaoyu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models
von: Fan, Yingqi, et al.
Veröffentlicht: (2026)
von: Fan, Yingqi, et al.
Veröffentlicht: (2026)
Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation
von: Zhao, Anhao, et al.
Veröffentlicht: (2026)
von: Zhao, Anhao, et al.
Veröffentlicht: (2026)
StreamingThinker: Large Language Models Can Think While Reading
von: Tong, Junlong, et al.
Veröffentlicht: (2025)
von: Tong, Junlong, et al.
Veröffentlicht: (2025)
SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling
von: Zhao, Anhao, et al.
Veröffentlicht: (2025)
von: Zhao, Anhao, et al.
Veröffentlicht: (2025)
From LLMs to LRMs: Rethinking Pruning for Reasoning-Centric Models
von: Ding, Longwei, et al.
Veröffentlicht: (2026)
von: Ding, Longwei, et al.
Veröffentlicht: (2026)
PEFT-as-an-Attack! Jailbreaking Language Models during Federated Parameter-Efficient Fine-Tuning
von: Li, Shenghui, et al.
Veröffentlicht: (2024)
von: Li, Shenghui, et al.
Veröffentlicht: (2024)
PERFT: Parameter-Efficient Routed Fine-Tuning for Mixture-of-Expert Model
von: Liu, Yilun, et al.
Veröffentlicht: (2024)
von: Liu, Yilun, et al.
Veröffentlicht: (2024)
Parameter-Efficient Routed Fine-Tuning: Mixture-of-Experts Demands Mixture of Adaptation Modules
von: Liu, Yilun, et al.
Veröffentlicht: (2025)
von: Liu, Yilun, et al.
Veröffentlicht: (2025)
Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning
von: Ke, Junlong, et al.
Veröffentlicht: (2026)
von: Ke, Junlong, et al.
Veröffentlicht: (2026)
ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention
von: Liu, Wenjie, et al.
Veröffentlicht: (2026)
von: Liu, Wenjie, et al.
Veröffentlicht: (2026)
Understanding Overadaptation in Supervised Fine-Tuning: The Role of Ensemble Methods
von: Hao, Yifan, et al.
Veröffentlicht: (2025)
von: Hao, Yifan, et al.
Veröffentlicht: (2025)
HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit
von: Wu, Hao, et al.
Veröffentlicht: (2026)
von: Wu, Hao, et al.
Veröffentlicht: (2026)
Children's English Reading Story Generation via Supervised Fine-Tuning of Compact LLMs with Controllable Difficulty and Safety
von: Shen, Qian, et al.
Veröffentlicht: (2026)
von: Shen, Qian, et al.
Veröffentlicht: (2026)
A Layer-wise Analysis of Supervised Fine-Tuning
von: Zhao, Qinghua, et al.
Veröffentlicht: (2026)
von: Zhao, Qinghua, et al.
Veröffentlicht: (2026)
Unveiling In-Context Learning: A Coordinate System to Understand Its Working Mechanism
von: Zhao, Anhao, et al.
Veröffentlicht: (2024)
von: Zhao, Anhao, et al.
Veröffentlicht: (2024)
LLM as Effective Streaming Processor: Bridging Streaming-Batch Mismatches with Group Position Encoding
von: Tong, Junlong, et al.
Veröffentlicht: (2025)
von: Tong, Junlong, et al.
Veröffentlicht: (2025)
$\mathcal{V}isi\mathcal{P}runer$: Decoding Discontinuous Cross-Modal Dynamics for Efficient Multimodal LLMs
von: Fan, Yingqi, et al.
Veröffentlicht: (2025)
von: Fan, Yingqi, et al.
Veröffentlicht: (2025)
Policy of Thoughts: Scaling LLM Reasoning via Test-time Policy Evolution
von: Jiao, Zhengbo, et al.
Veröffentlicht: (2026)
von: Jiao, Zhengbo, et al.
Veröffentlicht: (2026)
On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting
von: Zhang, Wenhao, et al.
Veröffentlicht: (2025)
von: Zhang, Wenhao, et al.
Veröffentlicht: (2025)
Rotation-Preserving Supervised Fine-Tuning
von: Jin, Hangzhan, et al.
Veröffentlicht: (2026)
von: Jin, Hangzhan, et al.
Veröffentlicht: (2026)
Supervised Fine-Tuning Needs to Unlock the Potential of Token Priority
von: Shen, Zhanming, et al.
Veröffentlicht: (2026)
von: Shen, Zhanming, et al.
Veröffentlicht: (2026)
SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
von: Fu, Yuqian, et al.
Veröffentlicht: (2025)
Analyzing the Effects of Supervised Fine-Tuning on Model Knowledge from Token and Parameter Levels
von: Ye, Junjie, et al.
Veröffentlicht: (2025)
von: Ye, Junjie, et al.
Veröffentlicht: (2025)
Data Mixing Optimization for Supervised Fine-Tuning of Large Language Models
von: Li, Yuan, et al.
Veröffentlicht: (2025)
von: Li, Yuan, et al.
Veröffentlicht: (2025)
FedNano: Toward Lightweight Federated Tuning for Pretrained Multimodal Large Language Models
von: Zhang, Yao, et al.
Veröffentlicht: (2025)
von: Zhang, Yao, et al.
Veröffentlicht: (2025)
Goal-Conditioned Supervised Learning for LLM Fine-Tuning
von: Li, Shijun, et al.
Veröffentlicht: (2026)
von: Li, Shijun, et al.
Veröffentlicht: (2026)
PolicyLong: Towards On-Policy Context Extension
von: Jia, Junlong, et al.
Veröffentlicht: (2026)
von: Jia, Junlong, et al.
Veröffentlicht: (2026)
LogReasoner: Empowering LLMs with Expert-like Coarse-to-Fine Reasoning for Automated Log Analysis
von: Ma, Lipeng, et al.
Veröffentlicht: (2025)
von: Ma, Lipeng, et al.
Veröffentlicht: (2025)
Better Supervised Fine-tuning for VQA: Integer-Only Loss
von: Qian, Baihong, et al.
Veröffentlicht: (2025)
von: Qian, Baihong, et al.
Veröffentlicht: (2025)
Preserving Diversity in Supervised Fine-Tuning of Large Language Models
von: Li, Ziniu, et al.
Veröffentlicht: (2024)
von: Li, Ziniu, et al.
Veröffentlicht: (2024)
Memory-Efficient Fine-Tuning via Low-Rank Activation Compression
von: Shi, Jiang-Xin, et al.
Veröffentlicht: (2025)
von: Shi, Jiang-Xin, et al.
Veröffentlicht: (2025)
PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment
von: Li, Jiawei, et al.
Veröffentlicht: (2024)
von: Li, Jiawei, et al.
Veröffentlicht: (2024)
A Mechanistic Investigation of Supervised Fine Tuning
von: Chopra, Ruhaan
Veröffentlicht: (2026)
von: Chopra, Ruhaan
Veröffentlicht: (2026)
Fine-Grained Sentiment Analysis of Electric Vehicle User Reviews: A Bidirectional LSTM Approach to Capturing Emotional Intensity in Chinese Text
von: Chen, Shuhao, et al.
Veröffentlicht: (2024)
von: Chen, Shuhao, et al.
Veröffentlicht: (2024)
Position-Aware Parameter Efficient Fine-Tuning Approach for Reducing Positional Bias in LLMs
von: Zhang, Zheng, et al.
Veröffentlicht: (2024)
von: Zhang, Zheng, et al.
Veröffentlicht: (2024)
RoSTE: An Efficient Quantization-Aware Supervised Fine-Tuning Approach for Large Language Models
von: Wei, Quan, et al.
Veröffentlicht: (2025)
von: Wei, Quan, et al.
Veröffentlicht: (2025)
Efficient Inference Using Large Language Models with Limited Human Data: Fine-Tuning then Rectification
von: Wang, Lei, et al.
Veröffentlicht: (2025)
von: Wang, Lei, et al.
Veröffentlicht: (2025)
Proximal Supervised Fine-Tuning
von: Zhu, Wenhong, et al.
Veröffentlicht: (2025)
von: Zhu, Wenhong, et al.
Veröffentlicht: (2025)
Explaining Fine Tuned LLMs via Counterfactuals A Knowledge Graph Driven Framework
von: Wang, Yucheng, et al.
Veröffentlicht: (2025)
von: Wang, Yucheng, et al.
Veröffentlicht: (2025)
DPI: Exploiting Parameter Heterogeneity for Interference-Free Fine-Tuning
von: Liu, Xiaoyu, et al.
Veröffentlicht: (2026)
von: Liu, Xiaoyu, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models
von: Fan, Yingqi, et al.
Veröffentlicht: (2026) -
Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation
von: Zhao, Anhao, et al.
Veröffentlicht: (2026) -
StreamingThinker: Large Language Models Can Think While Reading
von: Tong, Junlong, et al.
Veröffentlicht: (2025) -
SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling
von: Zhao, Anhao, et al.
Veröffentlicht: (2025) -
From LLMs to LRMs: Rethinking Pruning for Reasoning-Centric Models
von: Ding, Longwei, et al.
Veröffentlicht: (2026)