Lightweight and Post-Training Structured Pruning for On-Device Large Lanaguage Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Zihuai, Xu, Yang, Xu, Hongli, Liao, Yunming, Yao, Zhiwei, Xie, Zuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Efficient Deployment of Large Language Models on Resource-constrained Devices
por: Yao, Zhiwei, et al.
Publicado: (2025)
por: Yao, Zhiwei, et al.
Publicado: (2025)
A Novel Hat-Shaped Device-Cloud Collaborative Inference Framework for Large Language Models
por: Xie, Zuan, et al.
Publicado: (2025)
por: Xie, Zuan, et al.
Publicado: (2025)
Resource-Efficient Federated Fine-Tuning Large Language Models for Heterogeneous Data
por: Liu, Jun, et al.
Publicado: (2025)
por: Liu, Jun, et al.
Publicado: (2025)
Collaborative Inference for Large Models with Task Offloading and Early Exiting
por: Xie, Zuan, et al.
Publicado: (2024)
por: Xie, Zuan, et al.
Publicado: (2024)
LBLLM: Lightweight Binarization of Large Language Models via Three-Stage Distillation
por: Song, Siqing, et al.
Publicado: (2026)
por: Song, Siqing, et al.
Publicado: (2026)
The Structural Scalpel: Automated Contiguous Layer Pruning for Large Language Models
por: Lu, Yao, et al.
Publicado: (2025)
por: Lu, Yao, et al.
Publicado: (2025)
PTQTP: Post-Training Quantization to Trit-Planes for Large Language Models
por: Xiao, He, et al.
Publicado: (2025)
por: Xiao, He, et al.
Publicado: (2025)
Post Training Quantization of Large Language Models with Microscaling Formats
por: Sharify, Sayeh, et al.
Publicado: (2024)
por: Sharify, Sayeh, et al.
Publicado: (2024)
Achieving binary weight and activation for LLMs using Post-Training Quantization
por: Song, Siqing, et al.
Publicado: (2025)
por: Song, Siqing, et al.
Publicado: (2025)
Understanding Post-Training Structural Changes in Large Language Models
por: He, Xinyu, et al.
Publicado: (2025)
por: He, Xinyu, et al.
Publicado: (2025)
Activation Sensitivity as a Unifying Principle for Post-Training Quantization
por: Xu, Bruce Changlong
Publicado: (2026)
por: Xu, Bruce Changlong
Publicado: (2026)
Training Large Language Models to Reason via EM Policy Gradient
por: Xu, Tianbing
Publicado: (2025)
por: Xu, Tianbing
Publicado: (2025)
BWLA: Breaking the Barrier of W1AX Post-Training Quantization for LLMs
por: Zhao, Zhixiong, et al.
Publicado: (2026)
por: Zhao, Zhixiong, et al.
Publicado: (2026)
DapperFL: Domain Adaptive Federated Learning with Model Fusion Pruning for Edge Devices
por: Jia, Yongzhe, et al.
Publicado: (2024)
por: Jia, Yongzhe, et al.
Publicado: (2024)
PT$^2$-LLM: Post-Training Ternarization for Large Language Models
por: Yan, Xianglong, et al.
Publicado: (2025)
por: Yan, Xianglong, et al.
Publicado: (2025)
Exploring Layer-wise Information Effectiveness for Post-Training Quantization in Small Language Models
por: Xiao, He, et al.
Publicado: (2025)
por: Xiao, He, et al.
Publicado: (2025)
MergeSFL: Split Federated Learning with Feature Merging and Batch Size Regulation
por: Liao, Yunming, et al.
Publicado: (2023)
por: Liao, Yunming, et al.
Publicado: (2023)
Lightweight Dataset Pruning without Full Training via Example Difficulty and Prediction Uncertainty
por: Cho, Yeseul, et al.
Publicado: (2025)
por: Cho, Yeseul, et al.
Publicado: (2025)
A Generic Layer Pruning Method for Signal Modulation Recognition Deep Learning Models
por: Lu, Yao, et al.
Publicado: (2024)
por: Lu, Yao, et al.
Publicado: (2024)
RedOne 2.0: Rethinking Domain-specific LLM Post-Training in Social Networking Services
por: Zhao, Fei, et al.
Publicado: (2025)
por: Zhao, Fei, et al.
Publicado: (2025)
SwiftPrune: Hessian-Free Weight Pruning for Large Language Models
por: Kang, Yuhan, et al.
Publicado: (2025)
por: Kang, Yuhan, et al.
Publicado: (2025)
Text Quality-Based Pruning for Efficient Training of Language Models
por: Sharma, Vasu, et al.
Publicado: (2024)
por: Sharma, Vasu, et al.
Publicado: (2024)
Estimating the Effects of Sample Training Orders for Large Language Models without Retraining
por: Yang, Hao, et al.
Publicado: (2025)
por: Yang, Hao, et al.
Publicado: (2025)
Adaptive Parameter-Efficient Federated Fine-Tuning on Heterogeneous Devices
por: Liu, Jun, et al.
Publicado: (2024)
por: Liu, Jun, et al.
Publicado: (2024)
MoBiE: Efficient Inference of Mixture of Binary Experts under Post-Training Quantization
por: Zhao, Zhixiong, et al.
Publicado: (2026)
por: Zhao, Zhixiong, et al.
Publicado: (2026)
Large Language Model Unlearning
por: Yao, Yuanshun, et al.
Publicado: (2023)
por: Yao, Yuanshun, et al.
Publicado: (2023)
Lightweight Edge Learning via Dataset Pruning
por: Ale, Laha, et al.
Publicado: (2026)
por: Ale, Laha, et al.
Publicado: (2026)
BC Protocol: Structured Dual-Expert Dialogue for Eliciting High-Quality Chain-of-Thought Post-Training Data
por: Zou, Bo, et al.
Publicado: (2026)
por: Zou, Bo, et al.
Publicado: (2026)
Compressing Deep Reinforcement Learning Networks with a Dynamic Structured Pruning Method for Autonomous Driving
por: Su, Wensheng, et al.
Publicado: (2024)
por: Su, Wensheng, et al.
Publicado: (2024)
P$^2$ Law: Scaling Law for Post-Training After Model Pruning
por: Chen, Xiaodong, et al.
Publicado: (2024)
por: Chen, Xiaodong, et al.
Publicado: (2024)
GPrune-LLM: Generalization-Aware Structured Pruning for Large Language Models
por: Liu, Xiaoyun, et al.
Publicado: (2026)
por: Liu, Xiaoyun, et al.
Publicado: (2026)
Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning
por: Zhao, Shiwan, et al.
Publicado: (2026)
por: Zhao, Shiwan, et al.
Publicado: (2026)
MoE-Pruner: Pruning Mixture-of-Experts Large Language Model using the Hints from Its Router
por: Xie, Yanyue, et al.
Publicado: (2024)
por: Xie, Yanyue, et al.
Publicado: (2024)
Lightweight Safety Classification Using Pruned Language Models
por: Sawtell, Mason, et al.
Publicado: (2024)
por: Sawtell, Mason, et al.
Publicado: (2024)
GVPO: Group Variance Policy Optimization for Large Language Model Post-Training
por: Zhang, Kaichen, et al.
Publicado: (2025)
por: Zhang, Kaichen, et al.
Publicado: (2025)
FCOS: A Two-Stage Recoverable Model Pruning Framework for Automatic Modulation Recognition
por: Lu, Yao, et al.
Publicado: (2025)
por: Lu, Yao, et al.
Publicado: (2025)
DiRL: An Efficient Post-Training Framework for Diffusion Language Models
por: Zhu, Ying, et al.
Publicado: (2025)
por: Zhu, Ying, et al.
Publicado: (2025)
LOGIN: A Large Language Model Consulted Graph Neural Network Training Framework
por: Qiao, Yiran, et al.
Publicado: (2024)
por: Qiao, Yiran, et al.
Publicado: (2024)
Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training
por: Xu, Yuanda, et al.
Publicado: (2026)
por: Xu, Yuanda, et al.
Publicado: (2026)
Symmetric Pruning of Large Language Models
por: Yi, Kai, et al.
Publicado: (2025)
por: Yi, Kai, et al.
Publicado: (2025)
Ejemplares similares
-
Efficient Deployment of Large Language Models on Resource-constrained Devices
por: Yao, Zhiwei, et al.
Publicado: (2025) -
A Novel Hat-Shaped Device-Cloud Collaborative Inference Framework for Large Language Models
por: Xie, Zuan, et al.
Publicado: (2025) -
Resource-Efficient Federated Fine-Tuning Large Language Models for Heterogeneous Data
por: Liu, Jun, et al.
Publicado: (2025) -
Collaborative Inference for Large Models with Task Offloading and Early Exiting
por: Xie, Zuan, et al.
Publicado: (2024) -
LBLLM: Lightweight Binarization of Large Language Models via Three-Stage Distillation
por: Song, Siqing, et al.
Publicado: (2026)