From Generic Correlation to Input-Specific Credit in On-Policy Self Distillation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shen, Guobin, Huang, Lei, Cheng, Xiang, Zhao, Chenxiao, Li, Jindong, Zhao, Dongcheng, Yu, Xing |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
par: Shen, Guobin, et autres
Publié: (2026)
par: Shen, Guobin, et autres
Publié: (2026)
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
par: Shen, Guobin, et autres
Publié: (2026)
par: Shen, Guobin, et autres
Publié: (2026)
Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining
par: Han, Bing, et autres
Publié: (2025)
par: Han, Bing, et autres
Publié: (2025)
Light Alignment Improves LLM Safety via Model Self-Reflection with a Single Neuron
par: Shen, Sicheng, et autres
Publié: (2026)
par: Shen, Sicheng, et autres
Publié: (2026)
Safety Instincts: LLMs Learn to Trust Their Internal Compass for Self-Defense
par: Shen, Guobin, et autres
Publié: (2025)
par: Shen, Guobin, et autres
Publié: (2025)
OISD: On-Policy Internal Self-Distillation of Language Models
par: Liu, Xinyu, et autres
Publié: (2026)
par: Liu, Xinyu, et autres
Publié: (2026)
Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories
par: Zhang, Dongcheng, et autres
Publié: (2026)
par: Zhang, Dongcheng, et autres
Publié: (2026)
PACED: Distillation and On-Policy Self-Distillation at the Frontier of Student Competence
par: Xu, Yuanda, et autres
Publié: (2026)
par: Xu, Yuanda, et autres
Publié: (2026)
Online Policy Distillation with Decision-Attention
par: Yu, Xinqiang, et autres
Publié: (2024)
par: Yu, Xinqiang, et autres
Publié: (2024)
HDPO: Hybrid Distillation Policy Optimization via Privileged Self-Distillation
par: Ding, Ken
Publié: (2026)
par: Ding, Ken
Publié: (2026)
A General Framework for Learning from Weak Supervision
par: Chen, Hao, et autres
Publié: (2024)
par: Chen, Hao, et autres
Publié: (2024)
OPD+: Rethinking the Advantage Design for On-Policy Distillation
par: Zhao, Hanyang, et autres
Publié: (2026)
par: Zhao, Hanyang, et autres
Publié: (2026)
Towards Reliable Evaluation of Adversarial Robustness for Spiking Neural Networks
par: Wang, Jihang, et autres
Publié: (2025)
par: Wang, Jihang, et autres
Publié: (2025)
On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes
par: Agarwal, Rishabh, et autres
Publié: (2023)
par: Agarwal, Rishabh, et autres
Publié: (2023)
Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization
par: Khandoga, Mykola, et autres
Publié: (2026)
par: Khandoga, Mykola, et autres
Publié: (2026)
Implicit Federated In-context Learning For Task-Specific LLM Fine-Tuning
par: Li, Dongcheng, et autres
Publié: (2025)
par: Li, Dongcheng, et autres
Publié: (2025)
Graph Dimension Attention Networks for Enterprise Credit Assessment
par: Wei, Shaopeng, et autres
Publié: (2024)
par: Wei, Shaopeng, et autres
Publié: (2024)
Multimodal Generative Engine Optimization: Rank Manipulation for Vision-Language Model Rankers
par: Du, Yixuan, et autres
Publié: (2026)
par: Du, Yixuan, et autres
Publié: (2026)
Self-Supervised Quantization-Aware Knowledge Distillation
par: Zhao, Kaiqi, et autres
Publié: (2024)
par: Zhao, Kaiqi, et autres
Publié: (2024)
FedSDR: Federated Self-Distillation with Rectification
par: Ren, Ziheng, et autres
Publié: (2026)
par: Ren, Ziheng, et autres
Publié: (2026)
Bootstrapping Exploration with Group-Level Natural Language Feedback in Reinforcement Learning
par: Huang, Lei, et autres
Publié: (2026)
par: Huang, Lei, et autres
Publié: (2026)
Proximal Policy Distillation
par: Spigler, Giacomo
Publié: (2024)
par: Spigler, Giacomo
Publié: (2024)
When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
par: Liu, Xiaogeng, et autres
Publié: (2026)
par: Liu, Xiaogeng, et autres
Publié: (2026)
Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing
par: Li, Gengsheng, et autres
Publié: (2026)
par: Li, Gengsheng, et autres
Publié: (2026)
TRACE: Distilling Where It Matters via Token-Routed Self On-Policy Alignment
par: Wang, Jiaxuan, et autres
Publié: (2026)
par: Wang, Jiaxuan, et autres
Publié: (2026)
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
par: Fu, Yuqian, et autres
Publié: (2026)
par: Fu, Yuqian, et autres
Publié: (2026)
Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level
par: Jia, Nan, et autres
Publié: (2026)
par: Jia, Nan, et autres
Publié: (2026)
PromptBench: A Unified Library for Evaluation of Large Language Models
par: Zhu, Kaijie, et autres
Publié: (2023)
par: Zhu, Kaijie, et autres
Publié: (2023)
Dynamic Evaluation of Large Language Models by Meta Probing Agents
par: Zhu, Kaijie, et autres
Publié: (2024)
par: Zhu, Kaijie, et autres
Publié: (2024)
Prompt Tuning with Diffusion for Few-Shot Pre-trained Policy Generalization
par: Hu, Shengchao, et autres
Publié: (2024)
par: Hu, Shengchao, et autres
Publié: (2024)
DGPO: Distribution Guided Policy Optimization for Fine Grained Credit Assignment
par: Jin, Hongbo, et autres
Publié: (2026)
par: Jin, Hongbo, et autres
Publié: (2026)
Generalized Policy Gradient with History-Aware Decision Transformer for Reliable Routing over Graph Signals
par: Wei, Xing, et autres
Publié: (2025)
par: Wei, Xing, et autres
Publié: (2025)
BPL: Bias-adaptive Preference Distillation Learning for Recommender System
par: Kang, SeongKu, et autres
Publié: (2025)
par: Kang, SeongKu, et autres
Publié: (2025)
OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning
par: Yang, Yuxiao, et autres
Publié: (2026)
par: Yang, Yuxiao, et autres
Publié: (2026)
Provable and Practical In-Context Policy Optimization for Self-Improvement
par: Yu, Tianrun, et autres
Publié: (2026)
par: Yu, Tianrun, et autres
Publié: (2026)
Annealing Self-Distillation Rectification Improves Adversarial Training
par: Wu, Yu-Yu, et autres
Publié: (2023)
par: Wu, Yu-Yu, et autres
Publié: (2023)
Model-Based Proactive Cost Generation for Learning Safe Policies Offline with Limited Violation Data
par: Xue, Ruiqi, et autres
Publié: (2026)
par: Xue, Ruiqi, et autres
Publié: (2026)
Extreme Region Policy Distillation
par: Chen, Changyu, et autres
Publié: (2026)
par: Chen, Changyu, et autres
Publié: (2026)
Towards Better Generalization via Distributional Input Projection Network
par: Hao, Yifan, et autres
Publié: (2025)
par: Hao, Yifan, et autres
Publié: (2025)
Self-Distillation for Multi-Token Prediction
par: Zhao, Guoliang, et autres
Publié: (2026)
par: Zhao, Guoliang, et autres
Publié: (2026)
Documents similaires
-
Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
par: Shen, Guobin, et autres
Publié: (2026) -
VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training
par: Shen, Guobin, et autres
Publié: (2026) -
Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining
par: Han, Bing, et autres
Publié: (2025) -
Light Alignment Improves LLM Safety via Model Self-Reflection with a Single Neuron
par: Shen, Sicheng, et autres
Publié: (2026) -
Safety Instincts: LLMs Learn to Trust Their Internal Compass for Self-Defense
par: Shen, Guobin, et autres
Publié: (2025)