ADWIN: Adaptive Windows for Horizon-Aware On-Policy Distillation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liang, Kun, Tang, Chenming, Bai, Clive, Liu, Weijie, Yang, Saiyong, Wu, Yunfang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ORBIT: On-policy Exploration-Exploitation for Controllable Multi-Budget Reasoning
par: Liang, Kun, et autres
Publié: (2026)
par: Liang, Kun, et autres
Publié: (2026)
Think Outside the Policy: In-Context Steered Policy Optimization
par: Huang, Hsiu-Yuan, et autres
Publié: (2025)
par: Huang, Hsiu-Yuan, et autres
Publié: (2025)
Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error
par: Tang, Chenming, et autres
Publié: (2025)
par: Tang, Chenming, et autres
Publié: (2025)
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
par: Yang, Wenkai, et autres
Publié: (2026)
par: Yang, Wenkai, et autres
Publié: (2026)
Democratizing Tool Learning with Environments Fully Simulated by a Free 8B Language Model
par: Tang, Chenming, et autres
Publié: (2026)
par: Tang, Chenming, et autres
Publié: (2026)
Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex
par: Qu, Yun, et autres
Publié: (2026)
par: Qu, Yun, et autres
Publié: (2026)
Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning
par: Yang, Zhicheng, et autres
Publié: (2026)
par: Yang, Zhicheng, et autres
Publié: (2026)
Small Generalizable Prompt Predictive Models Can Steer Efficient RL Post-Training of Large Reasoning Models
par: Qu, Yun, et autres
Publié: (2026)
par: Qu, Yun, et autres
Publié: (2026)
$\boldsymbol{f}$-OPD: Stabilizing Long-Horizon On-Policy Distillation with Freshness-Aware Control
par: Chen, Xianwei, et autres
Publié: (2026)
par: Chen, Xianwei, et autres
Publié: (2026)
LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
par: Yang, Wenkai, et autres
Publié: (2025)
par: Yang, Wenkai, et autres
Publié: (2025)
EntroPIC: Towards Stable Long-Term Training of LLMs via Entropy Stabilization with Proportional-Integral Control
par: Yang, Kai, et autres
Publié: (2025)
par: Yang, Kai, et autres
Publié: (2025)
An Adaptive Horizon-Aware Model Selection Framework for Demand Forecasting under Horizon-Induced Degradation
par: González, Adolfo, et autres
Publié: (2026)
par: González, Adolfo, et autres
Publié: (2026)
TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents
par: Wang, Jiaqi, et autres
Publié: (2026)
par: Wang, Jiaqi, et autres
Publié: (2026)
Stable On-Policy Distillation through Adaptive Target Reformulation
par: Jang, Ijun, et autres
Publié: (2026)
par: Jang, Ijun, et autres
Publié: (2026)
Collaborative Adaptive Curriculum for Progressive Knowledge Distillation
par: Liu, Jing, et autres
Publié: (2026)
par: Liu, Jing, et autres
Publié: (2026)
How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment
par: Zhu, Rui, et autres
Publié: (2026)
par: Zhu, Rui, et autres
Publié: (2026)
Adaptive Horizon Actor-Critic for Policy Learning in Contact-Rich Differentiable Simulation
par: Georgiev, Ignat, et autres
Publié: (2024)
par: Georgiev, Ignat, et autres
Publié: (2024)
Learning General Parameterized Policies for Infinite Horizon Average Reward Constrained MDPs via Primal-Dual Policy Gradient Algorithm
par: Bai, Qinbo, et autres
Publié: (2024)
par: Bai, Qinbo, et autres
Publié: (2024)
Regret Analysis of Policy Gradient Algorithm for Infinite Horizon Average Reward Markov Decision Processes
par: Bai, Qinbo, et autres
Publié: (2023)
par: Bai, Qinbo, et autres
Publié: (2023)
Class-Imbalanced-Aware Adaptive Dataset Distillation for Scalable Pretrained Model on Credit Scoring
par: Li, Xia, et autres
Publié: (2025)
par: Li, Xia, et autres
Publié: (2025)
ATPO: Adaptive Tree Policy Optimization for Multi-Turn Medical Dialogue
par: Cao, Ruike, et autres
Publié: (2026)
par: Cao, Ruike, et autres
Publié: (2026)
OPD+: Rethinking the Advantage Design for On-Policy Distillation
par: Zhao, Hanyang, et autres
Publié: (2026)
par: Zhao, Hanyang, et autres
Publié: (2026)
Online Policy Distillation with Decision-Attention
par: Yu, Xinqiang, et autres
Publié: (2024)
par: Yu, Xinqiang, et autres
Publié: (2024)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
par: Zhang, Songming, et autres
Publié: (2025)
par: Zhang, Songming, et autres
Publié: (2025)
SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting
par: Zheng, Binbin, et autres
Publié: (2026)
par: Zheng, Binbin, et autres
Publié: (2026)
Proximal Policy Distillation
par: Spigler, Giacomo
Publié: (2024)
par: Spigler, Giacomo
Publié: (2024)
Ada-Diffuser: Latent-Aware Adaptive Diffusion for Decision-Making
par: Feng, Fan, et autres
Publié: (2026)
par: Feng, Fan, et autres
Publié: (2026)
Double Horizon Model-Based Policy Optimization
par: Kubo, Akihiro, et autres
Publié: (2025)
par: Kubo, Akihiro, et autres
Publié: (2025)
FAAR: Format-Aware Adaptive Rounding for NVFP4
par: Li, Hanglin, et autres
Publié: (2026)
par: Li, Hanglin, et autres
Publié: (2026)
Soft Adaptive Policy Optimization
par: Gao, Chang, et autres
Publié: (2025)
par: Gao, Chang, et autres
Publié: (2025)
Extreme Region Policy Distillation
par: Chen, Changyu, et autres
Publié: (2026)
par: Chen, Changyu, et autres
Publié: (2026)
The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation
par: Zhang, Jiaxin, et autres
Publié: (2026)
par: Zhang, Jiaxin, et autres
Publié: (2026)
PACED: Distillation and On-Policy Self-Distillation at the Frontier of Student Competence
par: Xu, Yuanda, et autres
Publié: (2026)
par: Xu, Yuanda, et autres
Publié: (2026)
Adaptive Spatio-Temporal Graphs with Self-Supervised Pretraining for Multi-Horizon Weather Forecasting
par: Liu, Yao
Publié: (2025)
par: Liu, Yao
Publié: (2025)
Importance-Aware Adaptive Dataset Distillation
par: Li, Guang, et autres
Publié: (2024)
par: Li, Guang, et autres
Publié: (2024)
Debiased Model-based Representations for Sample-efficient Continuous Control
par: Lyu, Jiafei, et autres
Publié: (2026)
par: Lyu, Jiafei, et autres
Publié: (2026)
HDPO: Hybrid Distillation Policy Optimization via Privileged Self-Distillation
par: Ding, Ken
Publié: (2026)
par: Ding, Ken
Publié: (2026)
TIP: Token Importance in On-Policy Distillation
par: Xu, Yuanda, et autres
Publié: (2026)
par: Xu, Yuanda, et autres
Publié: (2026)
Learning to Ball: Composing Policies for Long-Horizon Basketball Moves
par: Xu, Pei, et autres
Publié: (2025)
par: Xu, Pei, et autres
Publié: (2025)
Distance-Misaligned Training in Graph Transformers and Adaptive Graph-Aware Control
par: Hou, Qinhan, et autres
Publié: (2026)
par: Hou, Qinhan, et autres
Publié: (2026)
Documents similaires
-
ORBIT: On-policy Exploration-Exploitation for Controllable Multi-Budget Reasoning
par: Liang, Kun, et autres
Publié: (2026) -
Think Outside the Policy: In-Context Steered Policy Optimization
par: Huang, Hsiu-Yuan, et autres
Publié: (2025) -
Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error
par: Tang, Chenming, et autres
Publié: (2025) -
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
par: Yang, Wenkai, et autres
Publié: (2026) -
Democratizing Tool Learning with Environments Fully Simulated by a Free 8B Language Model
par: Tang, Chenming, et autres
Publié: (2026)