A Simple Linear Patch Revives Layer-Pruned Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Xinrui, Bai, Haoli, Yuan, Tao, Liu, Ruikang, Zhao, Kang, Yu, Xianzhi, Hou, Lu, Guan, Tian, He, Yonghong, Yuan, Chun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
E$^3$-Pruner: Towards Efficient, Economical, and Effective Layer Pruning for Large Language Models
par: Yuan, Tao, et autres
Publié: (2025)
par: Yuan, Tao, et autres
Publié: (2025)
Quantization Hurts Reasoning? An Empirical Study on Quantized Reasoning Models
par: Liu, Ruikang, et autres
Publié: (2025)
par: Liu, Ruikang, et autres
Publié: (2025)
IntactKV: Improving Large Language Model Quantization by Keeping Pivot Tokens Intact
par: Liu, Ruikang, et autres
Publié: (2024)
par: Liu, Ruikang, et autres
Publié: (2024)
FlatQuant: Flatness Matters for LLM Quantization
par: Sun, Yuxuan, et autres
Publié: (2024)
par: Sun, Yuxuan, et autres
Publié: (2024)
What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study
par: Lv, Keyu, et autres
Publié: (2026)
par: Lv, Keyu, et autres
Publié: (2026)
Prune&Comp: Free Lunch for Layer-Pruned LLMs via Iterative Pruning with Magnitude Compensation
par: Chen, Xinrui, et autres
Publié: (2025)
par: Chen, Xinrui, et autres
Publié: (2025)
WeightedKV: Attention Scores Weighted Key-Value Cache Merging for Large Language Models
par: Yuan, Jian, et autres
Publié: (2025)
par: Yuan, Jian, et autres
Publié: (2025)
MoPE-CLIP: Structured Pruning for Efficient Vision-Language Models with Module-wise Pruning Error Metric
par: Lin, Haokun, et autres
Publié: (2024)
par: Lin, Haokun, et autres
Publié: (2024)
From Pruning to Grafting: Dynamic Knowledge Redistribution via Learnable Layer Fusion
par: Pei, Zehua, et autres
Publié: (2024)
par: Pei, Zehua, et autres
Publié: (2024)
Benchmarking Post-Training Quantization of Large Language Models under Microscaling Floating Point Formats
par: Zhang, Manyi, et autres
Publié: (2026)
par: Zhang, Manyi, et autres
Publié: (2026)
Faster and Better LLMs via Latency-Aware Test-Time Scaling
par: Wang, Zili, et autres
Publié: (2025)
par: Wang, Zili, et autres
Publié: (2025)
IDEA Prune: An Integrated Enlarge-and-Prune Pipeline in Generative Language Model Pretraining
par: Li, Yixiao, et autres
Publié: (2025)
par: Li, Yixiao, et autres
Publié: (2025)
TreeKV: Smooth Key-Value Cache Compression with Tree Structures
par: He, Ziwei, et autres
Publié: (2025)
par: He, Ziwei, et autres
Publié: (2025)
TriP-LLM: A Tri-Branch Patch-wise Large Language Model Framework for Time-Series Anomaly Detection
par: Yu, Yuan-Cheng, et autres
Publié: (2025)
par: Yu, Yuan-Cheng, et autres
Publié: (2025)
Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models
par: Wang, Huanyu, et autres
Publié: (2025)
par: Wang, Huanyu, et autres
Publié: (2025)
The Structural Scalpel: Automated Contiguous Layer Pruning for Large Language Models
par: Lu, Yao, et autres
Publié: (2025)
par: Lu, Yao, et autres
Publié: (2025)
Roots Beneath the Cut: Uncovering the Risk of Concept Revival in Pruning-Based Unlearning for Diffusion Models
par: Zhang, Ci, et autres
Publié: (2026)
par: Zhang, Ci, et autres
Publié: (2026)
STEAR: Layer-Aware Spatiotemporal Evidence Intervention for Hallucination Mitigation in Video Large Language Models
par: Fan, Linfeng, et autres
Publié: (2026)
par: Fan, Linfeng, et autres
Publié: (2026)
BATQuant: Outlier-resilient MXFP4 Quantization via Learnable Block-wise Optimization
par: Li, Ji-Fu, et autres
Publié: (2026)
par: Li, Ji-Fu, et autres
Publié: (2026)
Cross-Modal Prototype Allocation: Unsupervised Slide Representation Learning via Patch-Text Contrast in Computational Pathology
par: Chen, Yuxuan, et autres
Publié: (2025)
par: Chen, Yuxuan, et autres
Publié: (2025)
LaCo: Large Language Model Pruning via Layer Collapse
par: Yang, Yifei, et autres
Publié: (2024)
par: Yang, Yifei, et autres
Publié: (2024)
A Simple and Effective Pruning Approach for Large Language Models
par: Sun, Mingjie, et autres
Publié: (2023)
par: Sun, Mingjie, et autres
Publié: (2023)
GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching
par: Su, Guinan, et autres
Publié: (2025)
par: Su, Guinan, et autres
Publié: (2025)
Attention Beyond Neighborhoods: Reviving Transformer for Graph Clustering
par: Xie, Xuanting, et autres
Publié: (2025)
par: Xie, Xuanting, et autres
Publié: (2025)
FASP: Fast and Accurate Structured Pruning of Large Language Models
par: Hu, Hanyu, et autres
Publié: (2025)
par: Hu, Hanyu, et autres
Publié: (2025)
SwiftPrune: Hessian-Free Weight Pruning for Large Language Models
par: Kang, Yuhan, et autres
Publié: (2025)
par: Kang, Yuhan, et autres
Publié: (2025)
DTP: A Simple yet Effective Distracting Token Pruning Framework for Vision-Language Action Models
par: Li, Chenyang, et autres
Publié: (2026)
par: Li, Chenyang, et autres
Publié: (2026)
Topology-Aware Revival for Efficient Sparse Training
par: Jin, Meiling, et autres
Publié: (2026)
par: Jin, Meiling, et autres
Publié: (2026)
Memory-Efficient Federated Fine-Tuning of Large Language Models via Layer Pruning
par: Wu, Yebo, et autres
Publié: (2025)
par: Wu, Yebo, et autres
Publié: (2025)
Behavioral Fingerprinting of Large Language Models
par: Pei, Zehua, et autres
Publié: (2025)
par: Pei, Zehua, et autres
Publié: (2025)
HoloTime: Taming Video Diffusion Models for Panoramic 4D Scene Generation
par: Zhou, Haiyang, et autres
Publié: (2025)
par: Zhou, Haiyang, et autres
Publié: (2025)
Instruction-Following Pruning for Large Language Models
par: Hou, Bairu, et autres
Publié: (2025)
par: Hou, Bairu, et autres
Publié: (2025)
Sperm Bioenergetic Plasticity and Metabolic Adaptations During the Journey Toward Fertilization
par: Ruizhi Xue, et autres
Publié: (2026)
par: Ruizhi Xue, et autres
Publié: (2026)
QuantClaw: Precision Where It Matters for OpenClaw
par: Zhang, Manyi, et autres
Publié: (2026)
par: Zhang, Manyi, et autres
Publié: (2026)
FedSpaLLM: Federated Pruning of Large Language Models
par: Bai, Guangji, et autres
Publié: (2024)
par: Bai, Guangji, et autres
Publié: (2024)
AlphaPruning: Using Heavy-Tailed Self Regularization Theory for Improved Layer-wise Pruning of Large Language Models
par: Lu, Haiquan, et autres
Publié: (2024)
par: Lu, Haiquan, et autres
Publié: (2024)
NutePrune: Efficient Progressive Pruning with Numerous Teachers for Large Language Models
par: Li, Shengrui, et autres
Publié: (2024)
par: Li, Shengrui, et autres
Publié: (2024)
Revival of Layered Ferroelectrics in Thin Films
par: Elzbieta Gradauskaite
Publié: (2026)
par: Elzbieta Gradauskaite
Publié: (2026)
Revival of Layered Ferroelectrics in Thin Films
par: Gradauskaite, Elzbieta
Publié: (2025)
par: Gradauskaite, Elzbieta
Publié: (2025)
Topology-Aware Layer Pruning for Large Vision-Language Models
par: Zheng, Pengcheng, et autres
Publié: (2026)
par: Zheng, Pengcheng, et autres
Publié: (2026)
Documents similaires
-
E$^3$-Pruner: Towards Efficient, Economical, and Effective Layer Pruning for Large Language Models
par: Yuan, Tao, et autres
Publié: (2025) -
Quantization Hurts Reasoning? An Empirical Study on Quantized Reasoning Models
par: Liu, Ruikang, et autres
Publié: (2025) -
IntactKV: Improving Large Language Model Quantization by Keeping Pivot Tokens Intact
par: Liu, Ruikang, et autres
Publié: (2024) -
FlatQuant: Flatness Matters for LLM Quantization
par: Sun, Yuxuan, et autres
Publié: (2024) -
What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study
par: Lv, Keyu, et autres
Publié: (2026)