Pruning Large Language Models to Intra-module Low-rank Architecture with Transitional Activations
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Shen, Bowen, Lin, Zheng, Zha, Daren, Liu, Wei, Luan, Jian, Wang, Bin, Wang, Weiping |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization
von: Yao, Dingyu, et al.
Veröffentlicht: (2025)
von: Yao, Dingyu, et al.
Veröffentlicht: (2025)
Light-PEFT: Lightening Parameter-Efficient Fine-Tuning via Early Pruning
von: Gu, Naibin, et al.
Veröffentlicht: (2024)
von: Gu, Naibin, et al.
Veröffentlicht: (2024)
VecInfer: Efficient LLM Inference with Low-Bit KV Cache via Outlier-Suppressed Vector Quantization
von: Yao, Dingyu, et al.
Veröffentlicht: (2025)
von: Yao, Dingyu, et al.
Veröffentlicht: (2025)
Think, But Don't Overthink: Reproducing Recursive Language Models
von: Wang, Daren
Veröffentlicht: (2026)
von: Wang, Daren
Veröffentlicht: (2026)
DIVE into MoE: Diversity-Enhanced Reconstruction of Large Language Models from Dense into Mixture-of-Experts
von: Feng, Yuchen, et al.
Veröffentlicht: (2025)
von: Feng, Yuchen, et al.
Veröffentlicht: (2025)
Multilingual Machine Translation with Open Large Language Models at Practical Scale: An Empirical Study
von: Cui, Menglong, et al.
Veröffentlicht: (2025)
von: Cui, Menglong, et al.
Veröffentlicht: (2025)
MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding
von: Wu, Qinzhuo, et al.
Veröffentlicht: (2024)
von: Wu, Qinzhuo, et al.
Veröffentlicht: (2024)
High-Fidelity Pruning for Large Language Models
von: Zhu, Yijun, et al.
Veröffentlicht: (2026)
von: Zhu, Yijun, et al.
Veröffentlicht: (2026)
DoTA: Weight-Decomposed Tensor Adaptation for Large Language Models
von: Hu, Xiaolin, et al.
Veröffentlicht: (2024)
von: Hu, Xiaolin, et al.
Veröffentlicht: (2024)
FLAT-LLM: Fine-grained Low-rank Activation Space Transformation for Large Language Model Compression
von: Tian, Jiayi, et al.
Veröffentlicht: (2025)
von: Tian, Jiayi, et al.
Veröffentlicht: (2025)
A Comprehensive Evaluation of Quantization Strategies for Large Language Models
von: Jin, Renren, et al.
Veröffentlicht: (2024)
von: Jin, Renren, et al.
Veröffentlicht: (2024)
A Survey on Model Compression for Large Language Models
von: Zhu, Xunyu, et al.
Veröffentlicht: (2023)
von: Zhu, Xunyu, et al.
Veröffentlicht: (2023)
Are Large Language Models Table-based Fact-Checkers?
von: Zhang, Hanwen, et al.
Veröffentlicht: (2024)
von: Zhang, Hanwen, et al.
Veröffentlicht: (2024)
Key-Point-Driven Mathematical Reasoning Distillation of Large Language Model
von: Zhu, Xunyu, et al.
Veröffentlicht: (2024)
von: Zhu, Xunyu, et al.
Veröffentlicht: (2024)
R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning
von: Zhao, Qingfei, et al.
Veröffentlicht: (2025)
von: Zhao, Qingfei, et al.
Veröffentlicht: (2025)
CBP-Tuning: Efficient Local Customization for Black-box Large Language Models
von: Zhao, Jiaxuan, et al.
Veröffentlicht: (2025)
von: Zhao, Jiaxuan, et al.
Veröffentlicht: (2025)
Scaling Model and Data for Multilingual Machine Translation with Open Large Language Models
von: Shang, Yuzhe, et al.
Veröffentlicht: (2026)
von: Shang, Yuzhe, et al.
Veröffentlicht: (2026)
FlexiGPT: Pruning and Extending Large Language Models with Low-Rank Weight Sharing
von: Smith, James Seale, et al.
Veröffentlicht: (2025)
von: Smith, James Seale, et al.
Veröffentlicht: (2025)
NeedleInATable: Exploring Long-Context Capability of Large Language Models towards Long-Structured Tables
von: Wang, Lanrui, et al.
Veröffentlicht: (2025)
von: Wang, Lanrui, et al.
Veröffentlicht: (2025)
DISP-LLM: Dimension-Independent Structural Pruning for Large Language Models
von: Gao, Shangqian, et al.
Veröffentlicht: (2024)
von: Gao, Shangqian, et al.
Veröffentlicht: (2024)
First Activations Matter: Training-Free Methods for Dynamic Activation in Large Language Models
von: Ma, Chi, et al.
Veröffentlicht: (2024)
von: Ma, Chi, et al.
Veröffentlicht: (2024)
Efficient Post-Training Pruning of Large Language Models with Statistical Correction
von: Yu, Peiqi, et al.
Veröffentlicht: (2026)
von: Yu, Peiqi, et al.
Veröffentlicht: (2026)
SEAP: Training-free Sparse Expert Activation Pruning Unlock the Brainpower of Large Language Models
von: Liang, Xun, et al.
Veröffentlicht: (2025)
von: Liang, Xun, et al.
Veröffentlicht: (2025)
Astra: Activation-Space Tail-Eigenvector Low-Rank Adaptation of Large Language Models
von: Liu, Kainan, et al.
Veröffentlicht: (2026)
von: Liu, Kainan, et al.
Veröffentlicht: (2026)
ExDR: Explanation-driven Dynamic Retrieval Enhancement for Multimodal Fake News Detection
von: Ding, Guoxuan, et al.
Veröffentlicht: (2026)
von: Ding, Guoxuan, et al.
Veröffentlicht: (2026)
Instruction-Following Pruning for Large Language Models
von: Hou, Bairu, et al.
Veröffentlicht: (2025)
von: Hou, Bairu, et al.
Veröffentlicht: (2025)
Sibyl: Empowering Empathetic Dialogue Generation in Large Language Models via Sensible and Visionary Commonsense Inference
von: Wang, Lanrui, et al.
Veröffentlicht: (2023)
von: Wang, Lanrui, et al.
Veröffentlicht: (2023)
Resilience of Large Language Models for Noisy Instructions
von: Wang, Bin, et al.
Veröffentlicht: (2024)
von: Wang, Bin, et al.
Veröffentlicht: (2024)
ToolPlanner: A Tool Augmented LLM for Multi Granularity Instructions with Path Planning and Feedback
von: Wu, Qinzhuo, et al.
Veröffentlicht: (2024)
von: Wu, Qinzhuo, et al.
Veröffentlicht: (2024)
ReachAgent: Enhancing Mobile Agent via Page Reaching and Operation
von: Wu, Qinzhuo, et al.
Veröffentlicht: (2025)
von: Wu, Qinzhuo, et al.
Veröffentlicht: (2025)
Detecting Stealthy Backdoor Samples based on Intra-class Distance for Large Language Models
von: Chen, Jinwen, et al.
Veröffentlicht: (2025)
von: Chen, Jinwen, et al.
Veröffentlicht: (2025)
GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching
von: Su, Guinan, et al.
Veröffentlicht: (2025)
von: Su, Guinan, et al.
Veröffentlicht: (2025)
Advantageous Parameter Expansion Training Makes Better Large Language Models
von: Gu, Naibin, et al.
Veröffentlicht: (2025)
von: Gu, Naibin, et al.
Veröffentlicht: (2025)
Weights-Rotated Preference Optimization for Large Language Models
von: Yang, Chenxu, et al.
Veröffentlicht: (2025)
von: Yang, Chenxu, et al.
Veröffentlicht: (2025)
PIP: Perturbation-based Iterative Pruning for Large Language Models
von: Cao, Yi, et al.
Veröffentlicht: (2025)
von: Cao, Yi, et al.
Veröffentlicht: (2025)
MiA-Signature: Approximating Global Activation for Long-Context Understanding
von: Li, Yuqing, et al.
Veröffentlicht: (2026)
von: Li, Yuqing, et al.
Veröffentlicht: (2026)
Understanding Performance Collapse in Layer-Pruned Large Language Models via Decision Representation Transitions
von: Shi, Boyu, et al.
Veröffentlicht: (2026)
von: Shi, Boyu, et al.
Veröffentlicht: (2026)
Distilling Mathematical Reasoning Capabilities into Small Language Models
von: Zhu, Xunyu, et al.
Veröffentlicht: (2024)
von: Zhu, Xunyu, et al.
Veröffentlicht: (2024)
Transport and Merge: Cross-Architecture Merging for Large Language Models
von: Cui, Chenhang, et al.
Veröffentlicht: (2026)
von: Cui, Chenhang, et al.
Veröffentlicht: (2026)
Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models
von: Wang, Yinjie, et al.
Veröffentlicht: (2025)
von: Wang, Yinjie, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization
von: Yao, Dingyu, et al.
Veröffentlicht: (2025) -
Light-PEFT: Lightening Parameter-Efficient Fine-Tuning via Early Pruning
von: Gu, Naibin, et al.
Veröffentlicht: (2024) -
VecInfer: Efficient LLM Inference with Low-Bit KV Cache via Outlier-Suppressed Vector Quantization
von: Yao, Dingyu, et al.
Veröffentlicht: (2025) -
Think, But Don't Overthink: Reproducing Recursive Language Models
von: Wang, Daren
Veröffentlicht: (2026) -
DIVE into MoE: Diversity-Enhanced Reconstruction of Large Language Models from Dense into Mixture-of-Experts
von: Feng, Yuchen, et al.
Veröffentlicht: (2025)