Structural Pruning of Pre-trained Language Models via Neural Architecture Search
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Klein, Aaron, Golebiowski, Jacek, Ma, Xingchen, Perrone, Valerio, Archambeau, Cedric |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning
von: Xia, Mengzhou, et al.
Veröffentlicht: (2023)
von: Xia, Mengzhou, et al.
Veröffentlicht: (2023)
Enhancing One-shot Pruned Pre-trained Language Models through Sparse-Dense-Sparse Mechanism
von: Li, Guanchen, et al.
Veröffentlicht: (2024)
von: Li, Guanchen, et al.
Veröffentlicht: (2024)
Design Principle Transfer in Neural Architecture Search via Large Language Models
von: Zhou, Xun, et al.
Veröffentlicht: (2024)
von: Zhou, Xun, et al.
Veröffentlicht: (2024)
Model Merging in Pre-training of Large Language Models
von: Li, Yunshui, et al.
Veröffentlicht: (2025)
von: Li, Yunshui, et al.
Veröffentlicht: (2025)
Hyperparameter Optimization in Machine Learning
von: Franceschi, Luca, et al.
Veröffentlicht: (2024)
von: Franceschi, Luca, et al.
Veröffentlicht: (2024)
Learn or Recall? Revisiting Incremental Learning with Pre-trained Language Models
von: Zheng, Junhao, et al.
Veröffentlicht: (2023)
von: Zheng, Junhao, et al.
Veröffentlicht: (2023)
Integrating Pre-trained Language Model into Neural Machine Translation
von: Hwang, Soon-Jae, et al.
Veröffentlicht: (2023)
von: Hwang, Soon-Jae, et al.
Veröffentlicht: (2023)
DEPT: Decoupled Embeddings for Pre-training Language Models
von: Iacob, Alex, et al.
Veröffentlicht: (2024)
von: Iacob, Alex, et al.
Veröffentlicht: (2024)
Deterministic Differentiable Structured Pruning for Large Language Models
von: Huang, Weiyu, et al.
Veröffentlicht: (2026)
von: Huang, Weiyu, et al.
Veröffentlicht: (2026)
SpikeGPT: Generative Pre-trained Language Model with Spiking Neural Networks
von: Zhu, Rui-Jie, et al.
Veröffentlicht: (2023)
von: Zhu, Rui-Jie, et al.
Veröffentlicht: (2023)
SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training
von: Tang, Shengkun, et al.
Veröffentlicht: (2026)
von: Tang, Shengkun, et al.
Veröffentlicht: (2026)
Sample-aware Adaptive Structured Pruning for Large Language Models
von: Kong, Jun, et al.
Veröffentlicht: (2025)
von: Kong, Jun, et al.
Veröffentlicht: (2025)
Making Pre-trained Language Models Great on Tabular Prediction
von: Yan, Jiahuan, et al.
Veröffentlicht: (2024)
von: Yan, Jiahuan, et al.
Veröffentlicht: (2024)
Exploiting Vocabulary Frequency Imbalance in Language Model Pre-training
von: Chung, Woojin, et al.
Veröffentlicht: (2025)
von: Chung, Woojin, et al.
Veröffentlicht: (2025)
DarwinLM: Evolutionary Structured Pruning of Large Language Models
von: Tang, Shengkun, et al.
Veröffentlicht: (2025)
von: Tang, Shengkun, et al.
Veröffentlicht: (2025)
Jet-Nemotron: Efficient Language Model with Post Neural Architecture Search
von: Gu, Yuxian, et al.
Veröffentlicht: (2025)
von: Gu, Yuxian, et al.
Veröffentlicht: (2025)
Towards Unbiased Calibration using Meta-Regularization
von: Wang, Cheng, et al.
Veröffentlicht: (2023)
von: Wang, Cheng, et al.
Veröffentlicht: (2023)
MediSwift: Efficient Sparse Pre-trained Biomedical Language Models
von: Thangarasa, Vithursan, et al.
Veröffentlicht: (2024)
von: Thangarasa, Vithursan, et al.
Veröffentlicht: (2024)
PaPaformer: Language Model from Pre-trained Parallel Paths
von: Tapaninaho, Joonas, et al.
Veröffentlicht: (2025)
von: Tapaninaho, Joonas, et al.
Veröffentlicht: (2025)
Unmasking Backdoors: An Explainable Defense via Gradient-Attention Anomaly Scoring for Pre-trained Language Models
von: Das, Anindya Sundar, et al.
Veröffentlicht: (2025)
von: Das, Anindya Sundar, et al.
Veröffentlicht: (2025)
Enhancing Vision-Language Model Pre-training with Image-text Pair Pruning Based on Word Frequency
von: Liang, Mingliang, et al.
Veröffentlicht: (2024)
von: Liang, Mingliang, et al.
Veröffentlicht: (2024)
DISP-LLM: Dimension-Independent Structural Pruning for Large Language Models
von: Gao, Shangqian, et al.
Veröffentlicht: (2024)
von: Gao, Shangqian, et al.
Veröffentlicht: (2024)
Olica: Efficient Structured Pruning of Large Language Models without Retraining
von: He, Jiujun, et al.
Veröffentlicht: (2025)
von: He, Jiujun, et al.
Veröffentlicht: (2025)
Bypass Back-propagation: Optimization-based Structural Pruning for Large Language Models via Policy Gradient
von: Gao, Yuan, et al.
Veröffentlicht: (2024)
von: Gao, Yuan, et al.
Veröffentlicht: (2024)
Dissecting Language Models: Machine Unlearning via Selective Pruning
von: Pochinkov, Nicholas, et al.
Veröffentlicht: (2024)
von: Pochinkov, Nicholas, et al.
Veröffentlicht: (2024)
Fine-Tuning Pre-trained Language Models to Detect In-Game Trash Talks
von: Fesalbon, Daniel, et al.
Veröffentlicht: (2024)
von: Fesalbon, Daniel, et al.
Veröffentlicht: (2024)
Pre-trained Large Language Models Use Fourier Features to Compute Addition
von: Zhou, Tianyi, et al.
Veröffentlicht: (2024)
von: Zhou, Tianyi, et al.
Veröffentlicht: (2024)
HLAT: High-quality Large Language Model Pre-trained on AWS Trainium
von: Fan, Haozheng, et al.
Veröffentlicht: (2024)
von: Fan, Haozheng, et al.
Veröffentlicht: (2024)
MLKD-BERT: Multi-level Knowledge Distillation for Pre-trained Language Models
von: Zhang, Ying, et al.
Veröffentlicht: (2024)
von: Zhang, Ying, et al.
Veröffentlicht: (2024)
Lory: Fully Differentiable Mixture-of-Experts for Autoregressive Language Model Pre-training
von: Zhong, Zexuan, et al.
Veröffentlicht: (2024)
von: Zhong, Zexuan, et al.
Veröffentlicht: (2024)
Efficient Knowledge Probing of Large Language Models by Adapting Pre-trained Embeddings
von: Sharma, Kartik, et al.
Veröffentlicht: (2025)
von: Sharma, Kartik, et al.
Veröffentlicht: (2025)
Relative Kinetic Utility for Reasoning-Aware Structural Pruning in Large Language Models
von: Qian, Tianhao
Veröffentlicht: (2026)
von: Qian, Tianhao
Veröffentlicht: (2026)
Investigating Data Contamination for Pre-training Language Models
von: Jiang, Minhao, et al.
Veröffentlicht: (2024)
von: Jiang, Minhao, et al.
Veröffentlicht: (2024)
Aligning Pre-trained Models for Spoken Language Translation
von: Sedláček, Šimon, et al.
Veröffentlicht: (2024)
von: Sedláček, Šimon, et al.
Veröffentlicht: (2024)
Sequence-to-Sequence Spanish Pre-trained Language Models
von: Araujo, Vladimir, et al.
Veröffentlicht: (2023)
von: Araujo, Vladimir, et al.
Veröffentlicht: (2023)
Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training
von: Liu, Hong, et al.
Veröffentlicht: (2023)
von: Liu, Hong, et al.
Veröffentlicht: (2023)
Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models
von: Wang, Ziyan, et al.
Veröffentlicht: (2025)
von: Wang, Ziyan, et al.
Veröffentlicht: (2025)
A Context-Aware Approach for Enhancing Data Imputation with Pre-trained Language Models
von: Hayat, Ahatsham, et al.
Veröffentlicht: (2024)
von: Hayat, Ahatsham, et al.
Veröffentlicht: (2024)
Evaluating the Effectiveness of Pre-trained Language Models in Predicting the Helpfulness of Online Product Reviews
von: Boluki, Ali, et al.
Veröffentlicht: (2023)
von: Boluki, Ali, et al.
Veröffentlicht: (2023)
Adaptive Pre-training Data Detection for Large Language Models via Surprising Tokens
von: Zhang, Anqi, et al.
Veröffentlicht: (2024)
von: Zhang, Anqi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning
von: Xia, Mengzhou, et al.
Veröffentlicht: (2023) -
Enhancing One-shot Pruned Pre-trained Language Models through Sparse-Dense-Sparse Mechanism
von: Li, Guanchen, et al.
Veröffentlicht: (2024) -
Design Principle Transfer in Neural Architecture Search via Large Language Models
von: Zhou, Xun, et al.
Veröffentlicht: (2024) -
Model Merging in Pre-training of Large Language Models
von: Li, Yunshui, et al.
Veröffentlicht: (2025) -
Hyperparameter Optimization in Machine Learning
von: Franceschi, Luca, et al.
Veröffentlicht: (2024)