Probe Pruning: Accelerating LLMs through Dynamic Pruning via Model-Probing
Fuente:
arXiv
Guardado en:
| Autores principales: | Le, Qi, Diao, Enmao, Wang, Ziyan, Wang, Xinran, Ding, Jie, Yang, Li, Anwar, Ali |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models
por: Wang, Ziyan, et al.
Publicado: (2025)
por: Wang, Ziyan, et al.
Publicado: (2025)
From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models
por: Wang, Ziyan, et al.
Publicado: (2025)
por: Wang, Ziyan, et al.
Publicado: (2025)
ColA: Collaborative Adaptation with Gradient Learning
por: Diao, Enmao, et al.
Publicado: (2024)
por: Diao, Enmao, et al.
Publicado: (2024)
DynamicFL: Federated Learning with Dynamic Communication Resource Allocation
por: Le, Qi, et al.
Publicado: (2024)
por: Le, Qi, et al.
Publicado: (2024)
Dynamic Vocabulary Pruning in Early-Exit LLMs
por: Vincenti, Jort, et al.
Publicado: (2024)
por: Vincenti, Jort, et al.
Publicado: (2024)
Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding
por: Xiao, Zhongyu, et al.
Publicado: (2026)
por: Xiao, Zhongyu, et al.
Publicado: (2026)
MAP: Multi-Human-Value Alignment Palette
por: Wang, Xinran, et al.
Publicado: (2024)
por: Wang, Xinran, et al.
Publicado: (2024)
REAM: Merging Improves Pruning of Experts in LLMs
por: Jha, Saurav, et al.
Publicado: (2026)
por: Jha, Saurav, et al.
Publicado: (2026)
IDEA Prune: An Integrated Enlarge-and-Prune Pipeline in Generative Language Model Pretraining
por: Li, Yixiao, et al.
Publicado: (2025)
por: Li, Yixiao, et al.
Publicado: (2025)
Adapt-Pruner: Adaptive Structural Pruning for Efficient Small Language Model Training
por: Pan, Rui, et al.
Publicado: (2025)
por: Pan, Rui, et al.
Publicado: (2025)
OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference
por: Gu, Yuzhe, et al.
Publicado: (2025)
por: Gu, Yuzhe, et al.
Publicado: (2025)
Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning
por: Xia, Mengzhou, et al.
Publicado: (2023)
por: Xia, Mengzhou, et al.
Publicado: (2023)
Efficient Mathematical Reasoning Models via Dynamic Pruning and Knowledge Distillation
por: Yu, Fengming, et al.
Publicado: (2025)
por: Yu, Fengming, et al.
Publicado: (2025)
MaskPrune: Mask-based LLM Pruning for Layer-wise Uniform Structures
por: Qin, Jiayu, et al.
Publicado: (2025)
por: Qin, Jiayu, et al.
Publicado: (2025)
Alignment-Constrained Dynamic Pruning for LLMs: Identifying and Preserving Alignment-Critical Circuits
por: Patel, Dev, et al.
Publicado: (2025)
por: Patel, Dev, et al.
Publicado: (2025)
PAT: Pruning-Aware Tuning for Large Language Models
por: Liu, Yijiang, et al.
Publicado: (2024)
por: Liu, Yijiang, et al.
Publicado: (2024)
Beware of Calibration Data for Pruning Large Language Models
por: Ji, Yixin, et al.
Publicado: (2024)
por: Ji, Yixin, et al.
Publicado: (2024)
Two-Stage Regularization-Based Structured Pruning for LLMs
por: Feng, Mingkuan, et al.
Publicado: (2025)
por: Feng, Mingkuan, et al.
Publicado: (2025)
Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications
por: Wei, Boyi, et al.
Publicado: (2024)
por: Wei, Boyi, et al.
Publicado: (2024)
Probing to Refine: Reinforcement Distillation of LLMs via Explanatory Inversion
por: Tan, Zhen, et al.
Publicado: (2026)
por: Tan, Zhen, et al.
Publicado: (2026)
Large Language Model Pruning
por: Huang, Hanjuan, et al.
Publicado: (2024)
por: Huang, Hanjuan, et al.
Publicado: (2024)
Compact Language Models via Pruning and Knowledge Distillation
por: Muralidharan, Saurav, et al.
Publicado: (2024)
por: Muralidharan, Saurav, et al.
Publicado: (2024)
Wanda++: Pruning Large Language Models via Regional Gradients
por: Yang, Yifan, et al.
Publicado: (2025)
por: Yang, Yifan, et al.
Publicado: (2025)
Pruning Foundation Models for High Accuracy without Retraining
por: Zhao, Pu, et al.
Publicado: (2024)
por: Zhao, Pu, et al.
Publicado: (2024)
Sample-aware Adaptive Structured Pruning for Large Language Models
por: Kong, Jun, et al.
Publicado: (2025)
por: Kong, Jun, et al.
Publicado: (2025)
From Pruning to Grafting: Dynamic Knowledge Redistribution via Learnable Layer Fusion
por: Pei, Zehua, et al.
Publicado: (2024)
por: Pei, Zehua, et al.
Publicado: (2024)
Earley-Driven Dynamic Pruning for Efficient Structured Decoding
por: Sun, Xintong, et al.
Publicado: (2025)
por: Sun, Xintong, et al.
Publicado: (2025)
LLM Pruning and Distillation in Practice: The Minitron Approach
por: Sreenivas, Sharath Turuvekere, et al.
Publicado: (2024)
por: Sreenivas, Sharath Turuvekere, et al.
Publicado: (2024)
2SSP: A Two-Stage Framework for Structured Pruning of LLMs
por: Sandri, Fabrizio, et al.
Publicado: (2025)
por: Sandri, Fabrizio, et al.
Publicado: (2025)
Finding the Cracks: Improving LLMs Reasoning with Paraphrastic Probing and Consistency Verification
por: Shi, Weili, et al.
Publicado: (2026)
por: Shi, Weili, et al.
Publicado: (2026)
Dynamic Evaluation of Large Language Models by Meta Probing Agents
por: Zhu, Kaijie, et al.
Publicado: (2024)
por: Zhu, Kaijie, et al.
Publicado: (2024)
ReplaceMe: Network Simplification via Depth Pruning and Transformer Block Linearization
por: Shopkhoev, Dmitriy, et al.
Publicado: (2025)
por: Shopkhoev, Dmitriy, et al.
Publicado: (2025)
Sink-Aware Pruning for Diffusion Language Models
por: Myrzakhan, Aidar, et al.
Publicado: (2026)
por: Myrzakhan, Aidar, et al.
Publicado: (2026)
On the Limitations of Language Targeted Pruning: Investigating the Calibration Language Impact in Multilingual LLM Pruning
por: Kurz, Simon, et al.
Publicado: (2024)
por: Kurz, Simon, et al.
Publicado: (2024)
Toward Adaptive Large Language Models Structured Pruning via Hybrid-grained Weight Importance Assessment
por: Liu, Jun, et al.
Publicado: (2024)
por: Liu, Jun, et al.
Publicado: (2024)
Pruning for Protection: Increasing Jailbreak Resistance in Aligned LLMs Without Fine-Tuning
por: Hasan, Adib, et al.
Publicado: (2024)
por: Hasan, Adib, et al.
Publicado: (2024)
Accelerating LLM Reasoning via Early Rejection with Partial Reward Modeling
por: Cheshmi, Seyyed Saeid, et al.
Publicado: (2025)
por: Cheshmi, Seyyed Saeid, et al.
Publicado: (2025)
Pruning and Distilling Mixture-of-Experts into Dense Language Models
por: Kim, Junhyuck, et al.
Publicado: (2026)
por: Kim, Junhyuck, et al.
Publicado: (2026)
COPAL: Continual Pruning in Large Language Generative Models
por: Malla, Srikanth, et al.
Publicado: (2024)
por: Malla, Srikanth, et al.
Publicado: (2024)
Lightweight Safety Classification Using Pruned Language Models
por: Sawtell, Mason, et al.
Publicado: (2024)
por: Sawtell, Mason, et al.
Publicado: (2024)
Ejemplares similares
-
Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models
por: Wang, Ziyan, et al.
Publicado: (2025) -
From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models
por: Wang, Ziyan, et al.
Publicado: (2025) -
ColA: Collaborative Adaptation with Gradient Learning
por: Diao, Enmao, et al.
Publicado: (2024) -
DynamicFL: Federated Learning with Dynamic Communication Resource Allocation
por: Le, Qi, et al.
Publicado: (2024) -
Dynamic Vocabulary Pruning in Early-Exit LLMs
por: Vincenti, Jort, et al.
Publicado: (2024)