Trust Region On-Policy Distillation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xing, Xingrun, Wang, Haoqing, Gao, Boyan, Li, Ziheng, Tang, Yehui |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
When Do LLMs Reason? A Dynamical Systems View via Entropy Phase Transitions
par: Xia, Wei, et autres
Publié: (2026)
par: Xia, Wei, et autres
Publié: (2026)
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
par: Long, Xiang, et autres
Publié: (2026)
par: Long, Xiang, et autres
Publié: (2026)
SpikeLLM: Scaling up Spiking Neural Network to Large Language Models via Saliency-based Spiking
par: Xing, Xingrun, et autres
Publié: (2024)
par: Xing, Xingrun, et autres
Publié: (2024)
TRE: Encouraging Exploration in the Trust Region
par: Huang, Chao, et autres
Publié: (2026)
par: Huang, Chao, et autres
Publié: (2026)
MLKD-BERT: Multi-level Knowledge Distillation for Pre-trained Language Models
par: Zhang, Ying, et autres
Publié: (2024)
par: Zhang, Ying, et autres
Publié: (2024)
PocketLLM: Ultimate Compression of Large Language Models via Meta Networks
par: Tian, Ye, et autres
Publié: (2025)
par: Tian, Ye, et autres
Publié: (2025)
Mixture of Lookup Experts
par: Jie, Shibo, et autres
Publié: (2025)
par: Jie, Shibo, et autres
Publié: (2025)
The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs
par: Li, Xin, et autres
Publié: (2026)
par: Li, Xin, et autres
Publié: (2026)
Internalize the Temperature: On-Policy Self-Distillation as Policy Reheater for Reinforcement Learning
par: Yang, Xuewei, et autres
Publié: (2026)
par: Yang, Xuewei, et autres
Publié: (2026)
Near-Policy: Accelerating On-Policy Distillation via Asynchronous Generation and Selective Packing
par: Rang, Miao, et autres
Publié: (2026)
par: Rang, Miao, et autres
Publié: (2026)
Kangaroo: Lossless Self-Speculative Decoding via Double Early Exiting
par: Liu, Fangcheng, et autres
Publié: (2024)
par: Liu, Fangcheng, et autres
Publié: (2024)
PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization
par: Rahman, Ben
Publié: (2025)
par: Rahman, Ben
Publié: (2025)
Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
par: Zhao, Siyan, et autres
Publié: (2026)
par: Zhao, Siyan, et autres
Publié: (2026)
Sinkhorn Distance Minimization for Knowledge Distillation
par: Cui, Xiao, et autres
Publié: (2024)
par: Cui, Xiao, et autres
Publié: (2024)
TRAM: Bridging Trust Regions and Sharpness Aware Minimization
par: Sherborne, Tom, et autres
Publié: (2023)
par: Sherborne, Tom, et autres
Publié: (2023)
DenseMamba: State Space Models with Dense Hidden Connection for Efficient Large Language Models
par: He, Wei, et autres
Publié: (2024)
par: He, Wei, et autres
Publié: (2024)
SpikeLM: Towards General Spike-Driven Language Modeling via Elastic Bi-Spiking Mechanisms
par: Xing, Xingrun, et autres
Publié: (2024)
par: Xing, Xingrun, et autres
Publié: (2024)
SODA: Semi On-Policy Black-Box Distillation for Large Language Models
par: Chen, Xiwen, et autres
Publié: (2026)
par: Chen, Xiwen, et autres
Publié: (2026)
Mitigating Training Imbalance in LLM Fine-Tuning via Selective Parameter Merging
par: Ju, Yiming, et autres
Publié: (2024)
par: Ju, Yiming, et autres
Publié: (2024)
A Survey of On-Policy Distillation for Large Language Models
par: Song, Mingyang, et autres
Publié: (2026)
par: Song, Mingyang, et autres
Publié: (2026)
Scaling Reasoning Efficiently via Relaxed On-Policy Distillation
par: Ko, Jongwoo, et autres
Publié: (2026)
par: Ko, Jongwoo, et autres
Publié: (2026)
OmniOPD: Logit-Free On-Policy Distillation via Speculative Verification
par: Zhou, Yuhang, et autres
Publié: (2026)
par: Zhou, Yuhang, et autres
Publié: (2026)
Efficient Second-Order Neural Network Optimization via Adaptive Trust Region Methods
par: Vo, James
Publié: (2024)
par: Vo, James
Publié: (2024)
Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
par: Li, Yaxuan, et autres
Publié: (2026)
par: Li, Yaxuan, et autres
Publié: (2026)
SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting
par: Zheng, Binbin, et autres
Publié: (2026)
par: Zheng, Binbin, et autres
Publié: (2026)
Thinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient Reasoners
par: Xu, Xin, et autres
Publié: (2025)
par: Xu, Xin, et autres
Publié: (2025)
ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains
par: Zhao, Ziqi, et autres
Publié: (2026)
par: Zhao, Ziqi, et autres
Publié: (2026)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
par: Zhang, Songming, et autres
Publié: (2025)
par: Zhang, Songming, et autres
Publié: (2025)
ORPO-Distill: Mixed-Policy Preference Optimization for Cross-Architecture LLM Distillation
par: Singh, Aasheesh, et autres
Publié: (2025)
par: Singh, Aasheesh, et autres
Publié: (2025)
BitNet Distillation
par: Wu, Xun, et autres
Publié: (2025)
par: Wu, Xun, et autres
Publié: (2025)
CBQ: Cross-Block Quantization for Large Language Models
par: Ding, Xin, et autres
Publié: (2023)
par: Ding, Xin, et autres
Publié: (2023)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
par: Jie, Shibo, et autres
Publié: (2024)
par: Jie, Shibo, et autres
Publié: (2024)
Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
par: Wang, Jian, et autres
Publié: (2025)
par: Wang, Jian, et autres
Publié: (2025)
MAD-OPD: Breaking the Ceiling in On-Policy Distillation via Multi-Agent Debate
par: Wang, Jianze, et autres
Publié: (2026)
par: Wang, Jianze, et autres
Publié: (2026)
Self-Distilled RLVR
par: Yang, Chenxu, et autres
Publié: (2026)
par: Yang, Chenxu, et autres
Publié: (2026)
A Survey on Transformer Compression
par: Tang, Yehui, et autres
Publié: (2024)
par: Tang, Yehui, et autres
Publié: (2024)
BWArea Model: Learning World Model, Inverse Dynamics, and Policy for Controllable Language Generation
par: Jia, Chengxing, et autres
Publié: (2024)
par: Jia, Chengxing, et autres
Publié: (2024)
Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning
par: Li, Ziheng, et autres
Publié: (2026)
par: Li, Ziheng, et autres
Publié: (2026)
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
par: Fu, Yuqian, et autres
Publié: (2026)
par: Fu, Yuqian, et autres
Publié: (2026)
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
par: Yang, Wenkai, et autres
Publié: (2026)
par: Yang, Wenkai, et autres
Publié: (2026)
Documents similaires
-
When Do LLMs Reason? A Dynamical Systems View via Entropy Phase Transitions
par: Xia, Wei, et autres
Publié: (2026) -
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
par: Long, Xiang, et autres
Publié: (2026) -
SpikeLLM: Scaling up Spiking Neural Network to Large Language Models via Saliency-based Spiking
par: Xing, Xingrun, et autres
Publié: (2024) -
TRE: Encouraging Exploration in the Trust Region
par: Huang, Chao, et autres
Publié: (2026) -
MLKD-BERT: Multi-level Knowledge Distillation for Pre-trained Language Models
par: Zhang, Ying, et autres
Publié: (2024)