Counteraction-Aware Multi-Teacher On-Policy Distillation for General Capability Recovery with Domain Preservation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Tianlei, Ou, Jiao, Liu, Ziyuan, Tang, Ruiming, Liang, Jian, Li, Han |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-Distillation as a Performance Recovery Mechanism for LLMs: Counteracting Compression and Catastrophic Forgetting
par: Liu, Chi, et autres
Publié: (2026)
par: Liu, Chi, et autres
Publié: (2026)
ADWIN: Adaptive Windows for Horizon-Aware On-Policy Distillation
par: Liang, Kun, et autres
Publié: (2026)
par: Liang, Kun, et autres
Publié: (2026)
Beyond Answers: Transferring Reasoning Capabilities to Smaller LLMs Using Multi-Teacher Knowledge Distillation
par: Tian, Yijun, et autres
Publié: (2024)
par: Tian, Yijun, et autres
Publié: (2024)
Robust Knowledge Distillation in Federated Learning: Counteracting Backdoor Attacks
par: Alharbi, Ebtisaam, et autres
Publié: (2025)
par: Alharbi, Ebtisaam, et autres
Publié: (2025)
The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation
par: Zhang, Jiaxin, et autres
Publié: (2026)
par: Zhang, Jiaxin, et autres
Publié: (2026)
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
par: Yang, Wenkai, et autres
Publié: (2026)
par: Yang, Wenkai, et autres
Publié: (2026)
Distilling Mathematical Reasoning Capabilities into Small Language Models
par: Zhu, Xunyu, et autres
Publié: (2024)
par: Zhu, Xunyu, et autres
Publié: (2024)
Multi-Agent Reinforcement Learning: Methods, Applications, Visionary Prospects, and Challenges
par: Zhou, Ziyuan, et autres
Publié: (2023)
par: Zhou, Ziyuan, et autres
Publié: (2023)
IKDiffuser: a Diffusion-based Generative Inverse Kinematics Solver for Kinematic Trees
par: Zhang, Zeyu, et autres
Publié: (2025)
par: Zhang, Zeyu, et autres
Publié: (2025)
Teacher-Aware Evolution of Heuristic Programs from Learned Optimization Policies
par: Chen, Minyu, et autres
Publié: (2026)
par: Chen, Minyu, et autres
Publié: (2026)
JL1-CD: A New Benchmark for Remote Sensing Change Detection and a Robust Multi-Teacher Knowledge Distillation Framework
par: Liu, Ziyuan, et autres
Publié: (2025)
par: Liu, Ziyuan, et autres
Publié: (2025)
Following the Teacher's Footsteps: Scheduled Checkpoint Distillation for Domain-Specific LLMs
par: Feng, Cheng, et autres
Publié: (2026)
par: Feng, Cheng, et autres
Publié: (2026)
Large Language Model's Multi-Capability Alignment in Biomedical Domain
par: Wu, Wentao, et autres
Publié: (2025)
par: Wu, Wentao, et autres
Publié: (2025)
OPD+: Rethinking the Advantage Design for On-Policy Distillation
par: Zhao, Hanyang, et autres
Publié: (2026)
par: Zhao, Hanyang, et autres
Publié: (2026)
AlphaAgent: LLM-Driven Alpha Mining with Regularized Exploration to Counteract Alpha Decay
par: Tang, Ziyi, et autres
Publié: (2025)
par: Tang, Ziyi, et autres
Publié: (2025)
Action-Aware Generative Sequence Modeling for Short Video Recommendation
par: Li, Wenhao, et autres
Publié: (2026)
par: Li, Wenhao, et autres
Publié: (2026)
Multi-Teacher Knowledge Distillation via Teacher-Informed Mixture Priors
par: Fang, Luyang, et autres
Publié: (2026)
par: Fang, Luyang, et autres
Publié: (2026)
Understanding the Geospatial Reasoning Capabilities of LLMs: A Trajectory Recovery Perspective
par: Truong, Thinh Hung, et autres
Publié: (2025)
par: Truong, Thinh Hung, et autres
Publié: (2025)
ERABAL: Enhancing Role-Playing Agents through Boundary-Aware Learning
par: Tang, Yihong, et autres
Publié: (2024)
par: Tang, Yihong, et autres
Publié: (2024)
Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation
par: Liu, Yanjiang, et autres
Publié: (2026)
par: Liu, Yanjiang, et autres
Publié: (2026)
When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning
par: Liu, Xiaogeng, et autres
Publié: (2026)
par: Liu, Xiaogeng, et autres
Publié: (2026)
KnowledgeSG: Privacy-Preserving Synthetic Text Generation with Knowledge Distillation from Server
par: Wang, Wenhao, et autres
Publié: (2024)
par: Wang, Wenhao, et autres
Publié: (2024)
Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation
par: Yang, Zhuolin, et autres
Publié: (2026)
par: Yang, Zhuolin, et autres
Publié: (2026)
Adapting Large Language Models for Education: Foundational Capabilities, Potentials, and Challenges
par: Li, Qingyao, et autres
Publié: (2023)
par: Li, Qingyao, et autres
Publié: (2023)
GIST: Cross-Domain Click-Through Rate Prediction via Guided Content-Behavior Distillation
par: Xu, Wei, et autres
Publié: (2025)
par: Xu, Wei, et autres
Publié: (2025)
Drive-KD: Multi-Teacher Distillation for VLMs in Autonomous Driving
par: Lian, Weitong, et autres
Publié: (2026)
par: Lian, Weitong, et autres
Publié: (2026)
Toward a Graph Foundation Model: Pre-Training Transformers With Random Walks
par: Tang, Ziyuan, et autres
Publié: (2025)
par: Tang, Ziyuan, et autres
Publié: (2025)
Improving Mathematical Reasoning Capabilities of Small Language Models via Feedback-Driven Distillation
par: Zhu, Xunyu, et autres
Publié: (2024)
par: Zhu, Xunyu, et autres
Publié: (2024)
SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented Reasoning
par: Ma, Yufei, et autres
Publié: (2026)
par: Ma, Yufei, et autres
Publié: (2026)
Multi-Agent Reinforcement Learning Counteracts Delayed CSI in Multi-Satellite Systems
par: Aristodemou, Marios, et autres
Publié: (2026)
par: Aristodemou, Marios, et autres
Publié: (2026)
One-Step Flow Policy: Self-Distillation for Fast Visuomotor Policies
par: Li, Shaolong, et autres
Publié: (2026)
par: Li, Shaolong, et autres
Publié: (2026)
Model Merging via Multi-Teacher Knowledge Distillation
par: Dalili, Seyed Arshan, et autres
Publié: (2025)
par: Dalili, Seyed Arshan, et autres
Publié: (2025)
Reasoning Compression with Mixed-Policy Distillation
par: Yang, Han, et autres
Publié: (2026)
par: Yang, Han, et autres
Publié: (2026)
Dark Distillation: Backdooring Distilled Datasets without Accessing Raw Data
par: Yang, Ziyuan, et autres
Publié: (2025)
par: Yang, Ziyuan, et autres
Publié: (2025)
On the Learn-to-Optimize Capabilities of Transformers in In-Context Sparse Recovery
par: Liu, Renpu, et autres
Publié: (2024)
par: Liu, Renpu, et autres
Publié: (2024)
"The Whole Is Greater Than the Sum of Its Parts": A Compatibility-Aware Multi-Teacher CoT Distillation Framework
par: Cui, Jin, et autres
Publié: (2026)
par: Cui, Jin, et autres
Publié: (2026)
Enhancing Rare Codes via Probability-Biased Directed Graph Attention for Long-Tail ICD Coding
par: Chen, Tianlei, et autres
Publié: (2025)
par: Chen, Tianlei, et autres
Publié: (2025)
Learning Privacy-Preserving Student Networks via Discriminative-Generative Distillation
par: Ge, Shiming, et autres
Publié: (2024)
par: Ge, Shiming, et autres
Publié: (2024)
A Privacy-Preserving Framework with Multi-Modal Data for Cross-Domain Recommendation
par: Wang, Li, et autres
Publié: (2024)
par: Wang, Li, et autres
Publié: (2024)
Adaptive Federated Distillation for Multi-Domain Non-IID Textual Data
par: Xiao, Jiahao, et autres
Publié: (2025)
par: Xiao, Jiahao, et autres
Publié: (2025)
Documents similaires
-
Self-Distillation as a Performance Recovery Mechanism for LLMs: Counteracting Compression and Catastrophic Forgetting
par: Liu, Chi, et autres
Publié: (2026) -
ADWIN: Adaptive Windows for Horizon-Aware On-Policy Distillation
par: Liang, Kun, et autres
Publié: (2026) -
Beyond Answers: Transferring Reasoning Capabilities to Smaller LLMs Using Multi-Teacher Knowledge Distillation
par: Tian, Yijun, et autres
Publié: (2024) -
Robust Knowledge Distillation in Federated Learning: Counteracting Backdoor Attacks
par: Alharbi, Ebtisaam, et autres
Publié: (2025) -
The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation
par: Zhang, Jiaxin, et autres
Publié: (2026)