Pruning Foundation Models for High Accuracy without Retraining
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhao, Pu, Sun, Fei, Shen, Xuan, Yu, Pinrui, Kong, Zhenglun, Wang, Yanzhi, Lin, Xue |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Toward Adaptive Large Language Models Structured Pruning via Hybrid-grained Weight Importance Assessment
von: Liu, Jun, et al.
Veröffentlicht: (2024)
von: Liu, Jun, et al.
Veröffentlicht: (2024)
Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge
von: Shen, Xuan, et al.
Veröffentlicht: (2023)
von: Shen, Xuan, et al.
Veröffentlicht: (2023)
Squat: Quant Small Language Models on the Edge
von: Shen, Xuan, et al.
Veröffentlicht: (2024)
von: Shen, Xuan, et al.
Veröffentlicht: (2024)
Structured Agent Distillation for Large Language Model
von: Liu, Jun, et al.
Veröffentlicht: (2025)
von: Liu, Jun, et al.
Veröffentlicht: (2025)
Exploring Token Pruning in Vision State Space Models
von: Zhan, Zheng, et al.
Veröffentlicht: (2024)
von: Zhan, Zheng, et al.
Veröffentlicht: (2024)
Rethinking Token Reduction for State Space Models
von: Zhan, Zheng, et al.
Veröffentlicht: (2024)
von: Zhan, Zheng, et al.
Veröffentlicht: (2024)
Efficient Reasoning with Hidden Thinking
von: Shen, Xuan, et al.
Veröffentlicht: (2025)
von: Shen, Xuan, et al.
Veröffentlicht: (2025)
MoE-Pruner: Pruning Mixture-of-Experts Large Language Model using the Hints from Its Router
von: Xie, Yanyue, et al.
Veröffentlicht: (2024)
von: Xie, Yanyue, et al.
Veröffentlicht: (2024)
7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement
von: Zhao, Pu, et al.
Veröffentlicht: (2024)
von: Zhao, Pu, et al.
Veröffentlicht: (2024)
RoRA: Efficient Fine-Tuning of LLM with Reliability Optimization for Rank Adaptation
von: Liu, Jun, et al.
Veröffentlicht: (2025)
von: Liu, Jun, et al.
Veröffentlicht: (2025)
Numerical Pruning for Efficient Autoregressive Models
von: Shen, Xuan, et al.
Veröffentlicht: (2024)
von: Shen, Xuan, et al.
Veröffentlicht: (2024)
Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining
von: Han, Bing, et al.
Veröffentlicht: (2025)
von: Han, Bing, et al.
Veröffentlicht: (2025)
Olica: Efficient Structured Pruning of Large Language Models without Retraining
von: He, Jiujun, et al.
Veröffentlicht: (2025)
von: He, Jiujun, et al.
Veröffentlicht: (2025)
When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making
von: Liu, Jun, et al.
Veröffentlicht: (2026)
von: Liu, Jun, et al.
Veröffentlicht: (2026)
Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models
von: Wang, Ziyan, et al.
Veröffentlicht: (2025)
von: Wang, Ziyan, et al.
Veröffentlicht: (2025)
Scaling Reasoning without Attention
von: Zhao, Xueliang, et al.
Veröffentlicht: (2025)
von: Zhao, Xueliang, et al.
Veröffentlicht: (2025)
Sample-aware Adaptive Structured Pruning for Large Language Models
von: Kong, Jun, et al.
Veröffentlicht: (2025)
von: Kong, Jun, et al.
Veröffentlicht: (2025)
Beyond Size: How Gradients Shape Pruning Decisions in Large Language Models
von: Das, Rocktim Jyoti, et al.
Veröffentlicht: (2023)
von: Das, Rocktim Jyoti, et al.
Veröffentlicht: (2023)
Prune-Quantize-Distill: An Ordered Pipeline for Efficient Neural Network Compression
von: Zhou, Longsheng, et al.
Veröffentlicht: (2026)
von: Zhou, Longsheng, et al.
Veröffentlicht: (2026)
PERP: Rethinking the Prune-Retrain Paradigm in the Era of LLMs
von: Zimmer, Max, et al.
Veröffentlicht: (2023)
von: Zimmer, Max, et al.
Veröffentlicht: (2023)
Verbal Werewolf: Engage Users with Verbalized Agentic Werewolf Game Framework
von: Fan, Qihui, et al.
Veröffentlicht: (2025)
von: Fan, Qihui, et al.
Veröffentlicht: (2025)
Less is More: Unlocking Specialization of Time Series Foundation Models via Structured Pruning
von: Zhao, Lifan, et al.
Veröffentlicht: (2025)
von: Zhao, Lifan, et al.
Veröffentlicht: (2025)
Token Reduction Should Go Beyond Efficiency in Generative Models -- From Vision, Language to Multimodality
von: Kong, Zhenglun, et al.
Veröffentlicht: (2025)
von: Kong, Zhenglun, et al.
Veröffentlicht: (2025)
TSLA: A Task-Specific Learning Adaptation for Semantic Segmentation on Autonomous Vehicles Platform
von: Liu, Jun, et al.
Veröffentlicht: (2025)
von: Liu, Jun, et al.
Veröffentlicht: (2025)
Sink-Aware Pruning for Diffusion Language Models
von: Myrzakhan, Aidar, et al.
Veröffentlicht: (2026)
von: Myrzakhan, Aidar, et al.
Veröffentlicht: (2026)
SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models
von: Zhu, Hourun, et al.
Veröffentlicht: (2025)
von: Zhu, Hourun, et al.
Veröffentlicht: (2025)
IDEA Prune: An Integrated Enlarge-and-Prune Pipeline in Generative Language Model Pretraining
von: Li, Yixiao, et al.
Veröffentlicht: (2025)
von: Li, Yixiao, et al.
Veröffentlicht: (2025)
Zeroth-Order Adaptive Neuron Alignment Based Pruning without Re-Training
von: Cunegatti, Elia, et al.
Veröffentlicht: (2024)
von: Cunegatti, Elia, et al.
Veröffentlicht: (2024)
From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models
von: Wang, Ziyan, et al.
Veröffentlicht: (2025)
von: Wang, Ziyan, et al.
Veröffentlicht: (2025)
A Free Lunch in LLM Compression: Revisiting Retraining after Pruning
von: Wagner, Moritz, et al.
Veröffentlicht: (2025)
von: Wagner, Moritz, et al.
Veröffentlicht: (2025)
Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs
von: Sun, Hao, et al.
Veröffentlicht: (2025)
von: Sun, Hao, et al.
Veröffentlicht: (2025)
A Simple and Effective Pruning Approach for Large Language Models
von: Sun, Mingjie, et al.
Veröffentlicht: (2023)
von: Sun, Mingjie, et al.
Veröffentlicht: (2023)
Estimating the Effects of Sample Training Orders for Large Language Models without Retraining
von: Yang, Hao, et al.
Veröffentlicht: (2025)
von: Yang, Hao, et al.
Veröffentlicht: (2025)
Large Language Model Pruning
von: Huang, Hanjuan, et al.
Veröffentlicht: (2024)
von: Huang, Hanjuan, et al.
Veröffentlicht: (2024)
On the Limitations of Language Targeted Pruning: Investigating the Calibration Language Impact in Multilingual LLM Pruning
von: Kurz, Simon, et al.
Veröffentlicht: (2024)
von: Kurz, Simon, et al.
Veröffentlicht: (2024)
Probe Pruning: Accelerating LLMs through Dynamic Pruning via Model-Probing
von: Le, Qi, et al.
Veröffentlicht: (2025)
von: Le, Qi, et al.
Veröffentlicht: (2025)
Theory of Space: Can Foundation Models Construct Spatial Beliefs through Active Exploration?
von: Zhang, Pingyue, et al.
Veröffentlicht: (2026)
von: Zhang, Pingyue, et al.
Veröffentlicht: (2026)
Tool Learning with Foundation Models
von: Qin, Yujia, et al.
Veröffentlicht: (2023)
von: Qin, Yujia, et al.
Veröffentlicht: (2023)
Search for Efficient Large Language Models
von: Shen, Xuan, et al.
Veröffentlicht: (2024)
von: Shen, Xuan, et al.
Veröffentlicht: (2024)
Assessing Per-Sample Membership Inference Vulnerability without Retraining
von: Dorseuil, Valentin, et al.
Veröffentlicht: (2026)
von: Dorseuil, Valentin, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Toward Adaptive Large Language Models Structured Pruning via Hybrid-grained Weight Importance Assessment
von: Liu, Jun, et al.
Veröffentlicht: (2024) -
Agile-Quant: Activation-Guided Quantization for Faster Inference of LLMs on the Edge
von: Shen, Xuan, et al.
Veröffentlicht: (2023) -
Squat: Quant Small Language Models on the Edge
von: Shen, Xuan, et al.
Veröffentlicht: (2024) -
Structured Agent Distillation for Large Language Model
von: Liu, Jun, et al.
Veröffentlicht: (2025) -
Exploring Token Pruning in Vision State Space Models
von: Zhan, Zheng, et al.
Veröffentlicht: (2024)