Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Ziyan, Diao, Enmao, Le, Qi, Wang, Pu, Wang, Guanchu, Lee, Minwoo, Yeh, Shu-ping, Yang, Li |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models
por: Wang, Ziyan, et al.
Publicado: (2025)
por: Wang, Ziyan, et al.
Publicado: (2025)
Probe Pruning: Accelerating LLMs through Dynamic Pruning via Model-Probing
por: Le, Qi, et al.
Publicado: (2025)
por: Le, Qi, et al.
Publicado: (2025)
Think Before You Prune: Selective Self-Generated Calibration for Pruning Large Reasoning Models
por: Xiang, Yang, et al.
Publicado: (2025)
por: Xiang, Yang, et al.
Publicado: (2025)
OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference
por: Gu, Yuzhe, et al.
Publicado: (2025)
por: Gu, Yuzhe, et al.
Publicado: (2025)
Think Twice Before Trusting: Self-Detection for Large Language Models through Comprehensive Answer Reflection
por: Li, Moxin, et al.
Publicado: (2024)
por: Li, Moxin, et al.
Publicado: (2024)
Adapt-Pruner: Adaptive Structural Pruning for Efficient Small Language Model Training
por: Pan, Rui, et al.
Publicado: (2025)
por: Pan, Rui, et al.
Publicado: (2025)
PruneCD: Contrasting Pruned Self Model to Improve Decoding Factuality
por: Yu, Byeongho, et al.
Publicado: (2025)
por: Yu, Byeongho, et al.
Publicado: (2025)
ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning
por: Hou, Bairu, et al.
Publicado: (2025)
por: Hou, Bairu, et al.
Publicado: (2025)
Think Clearly: Improving Reasoning via Redundant Token Pruning
por: Choi, Daewon, et al.
Publicado: (2025)
por: Choi, Daewon, et al.
Publicado: (2025)
Graph-Based Chain-of-Thought Pruning for Reducing Redundant Reflections in Reasoning LLMs
por: Yuan, Hongyuan, et al.
Publicado: (2026)
por: Yuan, Hongyuan, et al.
Publicado: (2026)
IDEA Prune: An Integrated Enlarge-and-Prune Pipeline in Generative Language Model Pretraining
por: Li, Yixiao, et al.
Publicado: (2025)
por: Li, Yixiao, et al.
Publicado: (2025)
IG-Pruning: Input-Guided Block Pruning for Large Language Models
por: Qiao, Kangyu, et al.
Publicado: (2025)
por: Qiao, Kangyu, et al.
Publicado: (2025)
Prejudge-Before-Think: Enhancing Large Language Models at Test-Time by Process Prejudge Reasoning
por: Wang, Jianing, et al.
Publicado: (2025)
por: Wang, Jianing, et al.
Publicado: (2025)
Self-calibration for Language Model Quantization and Pruning
por: Williams, Miles, et al.
Publicado: (2024)
por: Williams, Miles, et al.
Publicado: (2024)
High-Fidelity Pruning for Large Language Models
por: Zhu, Yijun, et al.
Publicado: (2026)
por: Zhu, Yijun, et al.
Publicado: (2026)
KVPruner: Structural Pruning for Faster and Memory-Efficient Large Language Models
por: Lv, Bo, et al.
Publicado: (2024)
por: Lv, Bo, et al.
Publicado: (2024)
Towards Robust Pruning: An Adaptive Knowledge-Retention Pruning Strategy for Language Models
por: Li, Jianwei, et al.
Publicado: (2023)
por: Li, Jianwei, et al.
Publicado: (2023)
Prune as You Generate: Online Rollout Pruning for Faster and Better RLVR
por: Xu, Haobo, et al.
Publicado: (2026)
por: Xu, Haobo, et al.
Publicado: (2026)
Instruction-Following Pruning for Large Language Models
por: Hou, Bairu, et al.
Publicado: (2025)
por: Hou, Bairu, et al.
Publicado: (2025)
Sample-aware Adaptive Structured Pruning for Large Language Models
por: Kong, Jun, et al.
Publicado: (2025)
por: Kong, Jun, et al.
Publicado: (2025)
RCPU: Rotation-Constrained Error Compensation for Structured Pruning of Large Language Models
por: Haruta, Shuichiro, et al.
Publicado: (2025)
por: Haruta, Shuichiro, et al.
Publicado: (2025)
Relative Kinetic Utility for Reasoning-Aware Structural Pruning in Large Language Models
por: Qian, Tianhao
Publicado: (2026)
por: Qian, Tianhao
Publicado: (2026)
Think Before You Lie: How Reasoning Leads to Honesty
por: Yuan, Ann, et al.
Publicado: (2026)
por: Yuan, Ann, et al.
Publicado: (2026)
STUN: Structured-Then-Unstructured Pruning for Scalable MoE Pruning
por: Lee, Jaeseong, et al.
Publicado: (2024)
por: Lee, Jaeseong, et al.
Publicado: (2024)
Task-Agnostic Structured Pruning of Speech Representation Models
por: Wang, Haoyu, et al.
Publicado: (2023)
por: Wang, Haoyu, et al.
Publicado: (2023)
STOP: Structured On-Policy Pruning of Long-Form Reasoning in Low-Data Regimes
por: Xu, Chenjun, et al.
Publicado: (2026)
por: Xu, Chenjun, et al.
Publicado: (2026)
MaskPrune: Mask-based LLM Pruning for Layer-wise Uniform Structures
por: Qin, Jiayu, et al.
Publicado: (2025)
por: Qin, Jiayu, et al.
Publicado: (2025)
Structural Pruning of Large Vision Language Models: A Comprehensive Study on Pruning Dynamics, Recovery, and Data Efficiency
por: Huang, Yiran, et al.
Publicado: (2026)
por: Huang, Yiran, et al.
Publicado: (2026)
Toward Adaptive Large Language Models Structured Pruning via Hybrid-grained Weight Importance Assessment
por: Liu, Jun, et al.
Publicado: (2024)
por: Liu, Jun, et al.
Publicado: (2024)
Saliency-driven Dynamic Token Pruning for Large Language Models
por: Tao, Yao, et al.
Publicado: (2025)
por: Tao, Yao, et al.
Publicado: (2025)
Deterministic Differentiable Structured Pruning for Large Language Models
por: Huang, Weiyu, et al.
Publicado: (2026)
por: Huang, Weiyu, et al.
Publicado: (2026)
NutePrune: Efficient Progressive Pruning with Numerous Teachers for Large Language Models
por: Li, Shengrui, et al.
Publicado: (2024)
por: Li, Shengrui, et al.
Publicado: (2024)
Prune&Comp: Free Lunch for Layer-Pruned LLMs via Iterative Pruning with Magnitude Compensation
por: Chen, Xinrui, et al.
Publicado: (2025)
por: Chen, Xinrui, et al.
Publicado: (2025)
Pruning Foundation Models for High Accuracy without Retraining
por: Zhao, Pu, et al.
Publicado: (2024)
por: Zhao, Pu, et al.
Publicado: (2024)
PAT: Pruning-Aware Tuning for Large Language Models
por: Liu, Yijiang, et al.
Publicado: (2024)
por: Liu, Yijiang, et al.
Publicado: (2024)
Structured Pruning for Diverse Best-of-N Reasoning Optimization
por: Nguyen, Hieu Trung, et al.
Publicado: (2025)
por: Nguyen, Hieu Trung, et al.
Publicado: (2025)
Beware of Calibration Data for Pruning Large Language Models
por: Ji, Yixin, et al.
Publicado: (2024)
por: Ji, Yixin, et al.
Publicado: (2024)
The Better You Learn, The Smarter You Prune: Towards Efficient Vision-language-action Models via Differentiable Token Pruning
por: Jiang, Titong, et al.
Publicado: (2025)
por: Jiang, Titong, et al.
Publicado: (2025)
Entropy-Based Block Pruning for Efficient Large Language Models
por: Yang, Liangwei, et al.
Publicado: (2025)
por: Yang, Liangwei, et al.
Publicado: (2025)
Prompt-based Depth Pruning of Large Language Models
por: Wee, Juyun, et al.
Publicado: (2025)
por: Wee, Juyun, et al.
Publicado: (2025)
Ejemplares similares
-
From Local to Global: Revisiting Structured Pruning Paradigms for Large Language Models
por: Wang, Ziyan, et al.
Publicado: (2025) -
Probe Pruning: Accelerating LLMs through Dynamic Pruning via Model-Probing
por: Le, Qi, et al.
Publicado: (2025) -
Think Before You Prune: Selective Self-Generated Calibration for Pruning Large Reasoning Models
por: Xiang, Yang, et al.
Publicado: (2025) -
OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference
por: Gu, Yuzhe, et al.
Publicado: (2025) -
Think Twice Before Trusting: Self-Detection for Large Language Models through Comprehensive Answer Reflection
por: Li, Moxin, et al.
Publicado: (2024)