Salvato in:
| Autori principali: | Xing, Xingrun, Wang, Haoqing, Gao, Boyan, Li, Ziheng, Tang, Yehui |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2606.01249 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
When Do LLMs Reason? A Dynamical Systems View via Entropy Phase Transitions
di: Xia, Wei, et al.
Pubblicazione: (2026)
di: Xia, Wei, et al.
Pubblicazione: (2026)
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
di: Long, Xiang, et al.
Pubblicazione: (2026)
di: Long, Xiang, et al.
Pubblicazione: (2026)
SpikeLLM: Scaling up Spiking Neural Network to Large Language Models via Saliency-based Spiking
di: Xing, Xingrun, et al.
Pubblicazione: (2024)
di: Xing, Xingrun, et al.
Pubblicazione: (2024)
TRE: Encouraging Exploration in the Trust Region
di: Huang, Chao, et al.
Pubblicazione: (2026)
di: Huang, Chao, et al.
Pubblicazione: (2026)
MLKD-BERT: Multi-level Knowledge Distillation for Pre-trained Language Models
di: Zhang, Ying, et al.
Pubblicazione: (2024)
di: Zhang, Ying, et al.
Pubblicazione: (2024)
PocketLLM: Ultimate Compression of Large Language Models via Meta Networks
di: Tian, Ye, et al.
Pubblicazione: (2025)
di: Tian, Ye, et al.
Pubblicazione: (2025)
Mixture of Lookup Experts
di: Jie, Shibo, et al.
Pubblicazione: (2025)
di: Jie, Shibo, et al.
Pubblicazione: (2025)
Kangaroo: Lossless Self-Speculative Decoding via Double Early Exiting
di: Liu, Fangcheng, et al.
Pubblicazione: (2024)
di: Liu, Fangcheng, et al.
Pubblicazione: (2024)
SpikeLM: Towards General Spike-Driven Language Modeling via Elastic Bi-Spiking Mechanisms
di: Xing, Xingrun, et al.
Pubblicazione: (2024)
di: Xing, Xingrun, et al.
Pubblicazione: (2024)
Mitigating Training Imbalance in LLM Fine-Tuning via Selective Parameter Merging
di: Ju, Yiming, et al.
Pubblicazione: (2024)
di: Ju, Yiming, et al.
Pubblicazione: (2024)
The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs
di: Li, Xin, et al.
Pubblicazione: (2026)
di: Li, Xin, et al.
Pubblicazione: (2026)
PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization
di: Rahman, Ben
Pubblicazione: (2025)
di: Rahman, Ben
Pubblicazione: (2025)
DenseMamba: State Space Models with Dense Hidden Connection for Efficient Large Language Models
di: He, Wei, et al.
Pubblicazione: (2024)
di: He, Wei, et al.
Pubblicazione: (2024)
Internalize the Temperature: On-Policy Self-Distillation as Policy Reheater for Reinforcement Learning
di: Yang, Xuewei, et al.
Pubblicazione: (2026)
di: Yang, Xuewei, et al.
Pubblicazione: (2026)
Near-Policy: Accelerating On-Policy Distillation via Asynchronous Generation and Selective Packing
di: Rang, Miao, et al.
Pubblicazione: (2026)
di: Rang, Miao, et al.
Pubblicazione: (2026)
Sinkhorn Distance Minimization for Knowledge Distillation
di: Cui, Xiao, et al.
Pubblicazione: (2024)
di: Cui, Xiao, et al.
Pubblicazione: (2024)
TRAM: Bridging Trust Regions and Sharpness Aware Minimization
di: Sherborne, Tom, et al.
Pubblicazione: (2023)
di: Sherborne, Tom, et al.
Pubblicazione: (2023)
Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
di: Zhao, Siyan, et al.
Pubblicazione: (2026)
di: Zhao, Siyan, et al.
Pubblicazione: (2026)
SODA: Semi On-Policy Black-Box Distillation for Large Language Models
di: Chen, Xiwen, et al.
Pubblicazione: (2026)
di: Chen, Xiwen, et al.
Pubblicazione: (2026)
A Survey of On-Policy Distillation for Large Language Models
di: Song, Mingyang, et al.
Pubblicazione: (2026)
di: Song, Mingyang, et al.
Pubblicazione: (2026)
Scaling Reasoning Efficiently via Relaxed On-Policy Distillation
di: Ko, Jongwoo, et al.
Pubblicazione: (2026)
di: Ko, Jongwoo, et al.
Pubblicazione: (2026)
OmniOPD: Logit-Free On-Policy Distillation via Speculative Verification
di: Zhou, Yuhang, et al.
Pubblicazione: (2026)
di: Zhou, Yuhang, et al.
Pubblicazione: (2026)
Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
di: Li, Yaxuan, et al.
Pubblicazione: (2026)
di: Li, Yaxuan, et al.
Pubblicazione: (2026)
SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting
di: Zheng, Binbin, et al.
Pubblicazione: (2026)
di: Zheng, Binbin, et al.
Pubblicazione: (2026)
Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning
di: Jie, Shibo, et al.
Pubblicazione: (2024)
di: Jie, Shibo, et al.
Pubblicazione: (2024)
Efficient Second-Order Neural Network Optimization via Adaptive Trust Region Methods
di: Vo, James
Pubblicazione: (2024)
di: Vo, James
Pubblicazione: (2024)
A Survey on Transformer Compression
di: Tang, Yehui, et al.
Pubblicazione: (2024)
di: Tang, Yehui, et al.
Pubblicazione: (2024)
CBQ: Cross-Block Quantization for Large Language Models
di: Ding, Xin, et al.
Pubblicazione: (2023)
di: Ding, Xin, et al.
Pubblicazione: (2023)
Thinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient Reasoners
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
di: Wang, Jian, et al.
Pubblicazione: (2025)
di: Wang, Jian, et al.
Pubblicazione: (2025)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
di: Zhang, Songming, et al.
Pubblicazione: (2025)
di: Zhang, Songming, et al.
Pubblicazione: (2025)
ORPO-Distill: Mixed-Policy Preference Optimization for Cross-Architecture LLM Distillation
di: Singh, Aasheesh, et al.
Pubblicazione: (2025)
di: Singh, Aasheesh, et al.
Pubblicazione: (2025)
ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains
di: Zhao, Ziqi, et al.
Pubblicazione: (2026)
di: Zhao, Ziqi, et al.
Pubblicazione: (2026)
BitNet Distillation
di: Wu, Xun, et al.
Pubblicazione: (2025)
di: Wu, Xun, et al.
Pubblicazione: (2025)
MAD-OPD: Breaking the Ceiling in On-Policy Distillation via Multi-Agent Debate
di: Wang, Jianze, et al.
Pubblicazione: (2026)
di: Wang, Jianze, et al.
Pubblicazione: (2026)
MeKi: Memory-based Expert Knowledge Injection for Efficient LLM Scaling
di: Ding, Ning, et al.
Pubblicazione: (2026)
di: Ding, Ning, et al.
Pubblicazione: (2026)
Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning
di: Li, Ziheng, et al.
Pubblicazione: (2026)
di: Li, Ziheng, et al.
Pubblicazione: (2026)
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
di: Fu, Yuqian, et al.
Pubblicazione: (2026)
di: Fu, Yuqian, et al.
Pubblicazione: (2026)
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
di: Yang, Wenkai, et al.
Pubblicazione: (2026)
di: Yang, Wenkai, et al.
Pubblicazione: (2026)
KL for a KL: On-Policy Distillation with Control Variate Baseline
di: Oh, Minjae, et al.
Pubblicazione: (2026)
di: Oh, Minjae, et al.
Pubblicazione: (2026)
Documenti analoghi
-
When Do LLMs Reason? A Dynamical Systems View via Entropy Phase Transitions
di: Xia, Wei, et al.
Pubblicazione: (2026) -
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
di: Long, Xiang, et al.
Pubblicazione: (2026) -
SpikeLLM: Scaling up Spiking Neural Network to Large Language Models via Saliency-based Spiking
di: Xing, Xingrun, et al.
Pubblicazione: (2024) -
TRE: Encouraging Exploration in the Trust Region
di: Huang, Chao, et al.
Pubblicazione: (2026) -
MLKD-BERT: Multi-level Knowledge Distillation for Pre-trained Language Models
di: Zhang, Ying, et al.
Pubblicazione: (2024)