MiniDisc: Minimal Distillation Schedule for Language Model Compression
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Chen, Yang, Yang, Wang, Qifan, Liu, Jiahao, Wang, Jingang, Wu, Wei, Song, Dawei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2022
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
LLM-NEO: Parameter Efficient Knowledge Distillation for Large Language Models
von: Yang, Runming, et al.
Veröffentlicht: (2024)
von: Yang, Runming, et al.
Veröffentlicht: (2024)
Towards the Law of Capacity Gap in Distilling Language Models
von: Zhang, Chen, et al.
Veröffentlicht: (2023)
von: Zhang, Chen, et al.
Veröffentlicht: (2023)
Feature Alignment and Representation Transfer in Knowledge Distillation for Large Language Models
von: Yang, Junjie, et al.
Veröffentlicht: (2025)
von: Yang, Junjie, et al.
Veröffentlicht: (2025)
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
von: Liu, Akide, et al.
Veröffentlicht: (2024)
von: Liu, Akide, et al.
Veröffentlicht: (2024)
Knowledge Distillation and Dataset Distillation of Large Language Models: Emerging Trends, Challenges, and Future Directions
von: Fang, Luyang, et al.
Veröffentlicht: (2025)
von: Fang, Luyang, et al.
Veröffentlicht: (2025)
PPC-GPT: Federated Task-Specific Compression of Large Language Models via Pruning and Chain-of-Thought Distillation
von: Fan, Tao, et al.
Veröffentlicht: (2025)
von: Fan, Tao, et al.
Veröffentlicht: (2025)
Structural Rationale Distillation via Reasoning Space Compression
von: Yang, Jialin, et al.
Veröffentlicht: (2026)
von: Yang, Jialin, et al.
Veröffentlicht: (2026)
LongEmbed: Extending Embedding Models for Long Context Retrieval
von: Zhu, Dawei, et al.
Veröffentlicht: (2024)
von: Zhu, Dawei, et al.
Veröffentlicht: (2024)
RSAVQ: Riemannian Sensitivity-Aware Vector Quantization for Large Language Models
von: Xu, Zukang, et al.
Veröffentlicht: (2025)
von: Xu, Zukang, et al.
Veröffentlicht: (2025)
Weight-Inherited Distillation for Task-Agnostic BERT Compression
von: Wu, Taiqiang, et al.
Veröffentlicht: (2023)
von: Wu, Taiqiang, et al.
Veröffentlicht: (2023)
Iterative Layer-wise Distillation for Efficient Compression of Large Language Models
von: Kovalev, Grigory, et al.
Veröffentlicht: (2025)
von: Kovalev, Grigory, et al.
Veröffentlicht: (2025)
Sinkhorn Distance Minimization for Knowledge Distillation
von: Cui, Xiao, et al.
Veröffentlicht: (2024)
von: Cui, Xiao, et al.
Veröffentlicht: (2024)
Structured Agent Distillation for Large Language Model
von: Liu, Jun, et al.
Veröffentlicht: (2025)
von: Liu, Jun, et al.
Veröffentlicht: (2025)
MLKD-BERT: Multi-level Knowledge Distillation for Pre-trained Language Models
von: Zhang, Ying, et al.
Veröffentlicht: (2024)
von: Zhang, Ying, et al.
Veröffentlicht: (2024)
HiGPT: Heterogeneous Graph Language Model
von: Tang, Jiabin, et al.
Veröffentlicht: (2024)
von: Tang, Jiabin, et al.
Veröffentlicht: (2024)
Mini-batch Coresets for Memory-efficient Language Model Training on Data Mixtures
von: Nguyen, Dang, et al.
Veröffentlicht: (2024)
von: Nguyen, Dang, et al.
Veröffentlicht: (2024)
Direct Multi-Turn Preference Optimization for Language Agents
von: Shi, Wentao, et al.
Veröffentlicht: (2024)
von: Shi, Wentao, et al.
Veröffentlicht: (2024)
Thinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient Reasoners
von: Xu, Xin, et al.
Veröffentlicht: (2025)
von: Xu, Xin, et al.
Veröffentlicht: (2025)
A Survey of On-Policy Distillation for Large Language Models
von: Song, Mingyang, et al.
Veröffentlicht: (2026)
von: Song, Mingyang, et al.
Veröffentlicht: (2026)
BitNet Distillation
von: Wu, Xun, et al.
Veröffentlicht: (2025)
von: Wu, Xun, et al.
Veröffentlicht: (2025)
PoSE: Efficient Context Window Extension of LLMs via Positional Skip-wise Training
von: Zhu, Dawei, et al.
Veröffentlicht: (2023)
von: Zhu, Dawei, et al.
Veröffentlicht: (2023)
Adaptive Feature-based Low-Rank Compression of Large Language Models via Bayesian Optimization
von: Ji, Yixin, et al.
Veröffentlicht: (2024)
von: Ji, Yixin, et al.
Veröffentlicht: (2024)
Soft Prompt Tuning for Augmenting Dense Retrieval with Large Language Models
von: Peng, Zhiyuan, et al.
Veröffentlicht: (2023)
von: Peng, Zhiyuan, et al.
Veröffentlicht: (2023)
Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism
von: Liu, Jiahao, et al.
Veröffentlicht: (2024)
von: Liu, Jiahao, et al.
Veröffentlicht: (2024)
Probabilistic Token Alignment for Large Language Model Fusion
von: Zeng, Runjia, et al.
Veröffentlicht: (2025)
von: Zeng, Runjia, et al.
Veröffentlicht: (2025)
Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
von: Zhao, Siyan, et al.
Veröffentlicht: (2026)
von: Zhao, Siyan, et al.
Veröffentlicht: (2026)
LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt Compression
von: Pan, Zhuoshi, et al.
Veröffentlicht: (2024)
von: Pan, Zhuoshi, et al.
Veröffentlicht: (2024)
MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies
von: Hu, Shengding, et al.
Veröffentlicht: (2024)
von: Hu, Shengding, et al.
Veröffentlicht: (2024)
In-context Autoencoder for Context Compression in a Large Language Model
von: Ge, Tao, et al.
Veröffentlicht: (2023)
von: Ge, Tao, et al.
Veröffentlicht: (2023)
MoPD: Mixture-of-Prompts Distillation for Vision-Language Models
von: Chen, Yang, et al.
Veröffentlicht: (2024)
von: Chen, Yang, et al.
Veröffentlicht: (2024)
ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains
von: Zhao, Ziqi, et al.
Veröffentlicht: (2026)
von: Zhao, Ziqi, et al.
Veröffentlicht: (2026)
LoCa: Logit Calibration for Knowledge Distillation
von: Yang, Runming, et al.
Veröffentlicht: (2024)
von: Yang, Runming, et al.
Veröffentlicht: (2024)
SlimMoE: Structured Compression of Large MoE Models via Expert Slimming and Distillation
von: Li, Zichong, et al.
Veröffentlicht: (2025)
von: Li, Zichong, et al.
Veröffentlicht: (2025)
Basis Sharing: Cross-Layer Parameter Sharing for Large Language Model Compression
von: Wang, Jingcun, et al.
Veröffentlicht: (2024)
von: Wang, Jingcun, et al.
Veröffentlicht: (2024)
Proxy Compression for Language Modeling
von: Zheng, Lin, et al.
Veröffentlicht: (2026)
von: Zheng, Lin, et al.
Veröffentlicht: (2026)
SODA: Semi On-Policy Black-Box Distillation for Large Language Models
von: Chen, Xiwen, et al.
Veröffentlicht: (2026)
von: Chen, Xiwen, et al.
Veröffentlicht: (2026)
Learning Virtual Machine Scheduling in Cloud Computing through Language Agents
von: Wu, JieHao, et al.
Veröffentlicht: (2025)
von: Wu, JieHao, et al.
Veröffentlicht: (2025)
A Survey on Symbolic Knowledge Distillation of Large Language Models
von: Acharya, Kamal, et al.
Veröffentlicht: (2024)
von: Acharya, Kamal, et al.
Veröffentlicht: (2024)
ILRe: Intermediate Layer Retrieval for Context Compression in Causal Language Models
von: Liang, Manlai, et al.
Veröffentlicht: (2025)
von: Liang, Manlai, et al.
Veröffentlicht: (2025)
Representation Deficiency in Masked Language Modeling
von: Meng, Yu, et al.
Veröffentlicht: (2023)
von: Meng, Yu, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
LLM-NEO: Parameter Efficient Knowledge Distillation for Large Language Models
von: Yang, Runming, et al.
Veröffentlicht: (2024) -
Towards the Law of Capacity Gap in Distilling Language Models
von: Zhang, Chen, et al.
Veröffentlicht: (2023) -
Feature Alignment and Representation Transfer in Knowledge Distillation for Large Language Models
von: Yang, Junjie, et al.
Veröffentlicht: (2025) -
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
von: Liu, Akide, et al.
Veröffentlicht: (2024) -
Knowledge Distillation and Dataset Distillation of Large Language Models: Emerging Trends, Challenges, and Future Directions
von: Fang, Luyang, et al.
Veröffentlicht: (2025)