A Systematic Study of Compression Ordering for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Chhawri, Shivansh, Mahadik, Rahul, Rooj, Suparna |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Liquid Reasoning Transformers: A Sudoku-Based Prototype for Chess-Scale Algorithmic Tasks
di: Sahni, Shivansh, et al.
Pubblicazione: (2025)
di: Sahni, Shivansh, et al.
Pubblicazione: (2025)
Large Language Model Compression with Global Rank and Sparsity Optimization
di: Zhou, Changhai, et al.
Pubblicazione: (2025)
di: Zhou, Changhai, et al.
Pubblicazione: (2025)
Activation Sparsity Opportunities for Compressing General Large Language Models
di: Dhar, Nobel, et al.
Pubblicazione: (2024)
di: Dhar, Nobel, et al.
Pubblicazione: (2024)
On the Compressibility of Quantized Large Language Models
di: Mao, Yu, et al.
Pubblicazione: (2024)
di: Mao, Yu, et al.
Pubblicazione: (2024)
GWT: Scalable Optimizer State Compression for Large Language Model Training
di: Wen, Ziqing, et al.
Pubblicazione: (2025)
di: Wen, Ziqing, et al.
Pubblicazione: (2025)
CoSA: Compressed Sensing-Based Adaptation of Large Language Models
di: Wei, Songtao, et al.
Pubblicazione: (2026)
di: Wei, Songtao, et al.
Pubblicazione: (2026)
NoWag: A Unified Framework for Shape Preserving Compression of Large Language Models
di: Liu, Lawrence, et al.
Pubblicazione: (2025)
di: Liu, Lawrence, et al.
Pubblicazione: (2025)
A Practical Tensor-Network Compression Pipeline for Production-Scale Large Language Models
di: Kozyrev, Sergii, et al.
Pubblicazione: (2026)
di: Kozyrev, Sergii, et al.
Pubblicazione: (2026)
PalmBench: A Comprehensive Benchmark of Compressed Large Language Models on Mobile Platforms
di: Li, Yilong, et al.
Pubblicazione: (2024)
di: Li, Yilong, et al.
Pubblicazione: (2024)
Rethinking Key-Value Cache Compression Techniques for Large Language Model Serving
di: Gao, Wei, et al.
Pubblicazione: (2025)
di: Gao, Wei, et al.
Pubblicazione: (2025)
Lillama: Large Language Models Compression via Low-Rank Feature Distillation
di: Sy, Yaya, et al.
Pubblicazione: (2024)
di: Sy, Yaya, et al.
Pubblicazione: (2024)
Large Language Models for Forecasting and Anomaly Detection: A Systematic Literature Review
di: Su, Jing, et al.
Pubblicazione: (2024)
di: Su, Jing, et al.
Pubblicazione: (2024)
Systematic Outliers in Large Language Models
di: An, Yongqi, et al.
Pubblicazione: (2025)
di: An, Yongqi, et al.
Pubblicazione: (2025)
Systematic Optimization of Open Source Large Language Models for Mathematical Reasoning
di: Pawar, Pranav, et al.
Pubblicazione: (2025)
di: Pawar, Pranav, et al.
Pubblicazione: (2025)
CALR: Corrective Adaptive Low-Rank Decomposition for Efficient Large Language Model Layer Compression
di: Kautsar, Muchammad Daniyal, et al.
Pubblicazione: (2025)
di: Kautsar, Muchammad Daniyal, et al.
Pubblicazione: (2025)
When Reasoning Meets Compression: Understanding the Effects of LLMs Compression on Large Reasoning Models
di: Zhang, Nan, et al.
Pubblicazione: (2025)
di: Zhang, Nan, et al.
Pubblicazione: (2025)
DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Diffusion Language Models
di: Bu, Dake, et al.
Pubblicazione: (2026)
di: Bu, Dake, et al.
Pubblicazione: (2026)
Clustering-driven Memory Compression for On-device Large Language Models
di: Bohdal, Ondrej, et al.
Pubblicazione: (2026)
di: Bohdal, Ondrej, et al.
Pubblicazione: (2026)
In-context Autoencoder for Context Compression in a Large Language Model
di: Ge, Tao, et al.
Pubblicazione: (2023)
di: Ge, Tao, et al.
Pubblicazione: (2023)
A Systematic Survey on Large Language Models for Algorithm Design
di: Liu, Fei, et al.
Pubblicazione: (2024)
di: Liu, Fei, et al.
Pubblicazione: (2024)
Generalized Fisher-Weighted SVD: Scalable Kronecker-Factored Fisher Approximation for Compressing Large Language Models
di: Chekalina, Viktoriia, et al.
Pubblicazione: (2025)
di: Chekalina, Viktoriia, et al.
Pubblicazione: (2025)
Model Compression and Efficient Inference for Large Language Models: A Survey
di: Wang, Wenxiao, et al.
Pubblicazione: (2024)
di: Wang, Wenxiao, et al.
Pubblicazione: (2024)
CrossQuant: A Post-Training Quantization Method with Smaller Quantization Kernel for Precise Large Language Model Compression
di: Liu, Wenyuan, et al.
Pubblicazione: (2024)
di: Liu, Wenyuan, et al.
Pubblicazione: (2024)
CURing Large Models: Compression via CUR Decomposition
di: Park, Sanghyeon, et al.
Pubblicazione: (2025)
di: Park, Sanghyeon, et al.
Pubblicazione: (2025)
Novel Epileptic Seizure Detection Techniques and their Empirical Analysis
di: Guharoy, Rabel, et al.
Pubblicazione: (2023)
di: Guharoy, Rabel, et al.
Pubblicazione: (2023)
Prune-Quantize-Distill: An Ordered Pipeline for Efficient Neural Network Compression
di: Zhou, Longsheng, et al.
Pubblicazione: (2026)
di: Zhou, Longsheng, et al.
Pubblicazione: (2026)
Robust Batch-Level Query Routing for Large Language Models under Cost and Capacity Constraints
di: Markovic-Voronov, Jelena, et al.
Pubblicazione: (2026)
di: Markovic-Voronov, Jelena, et al.
Pubblicazione: (2026)
Ranking Large Language Models without Ground Truth
di: Dhurandhar, Amit, et al.
Pubblicazione: (2024)
di: Dhurandhar, Amit, et al.
Pubblicazione: (2024)
Towards Improving Long-Tail Entity Predictions in Temporal Knowledge Graphs through Global Similarity and Weighted Sampling
di: Mirtaheri, Mehrnoosh, et al.
Pubblicazione: (2025)
di: Mirtaheri, Mehrnoosh, et al.
Pubblicazione: (2025)
TuneComp: Joint Fine-tuning and Compression for Large Foundation Models
di: Chen, Xiangyu, et al.
Pubblicazione: (2025)
di: Chen, Xiangyu, et al.
Pubblicazione: (2025)
Enhancing Large Multimodal Models with Adaptive Sparsity and KV Cache Compression
di: Zhang, Te, et al.
Pubblicazione: (2025)
di: Zhang, Te, et al.
Pubblicazione: (2025)
LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit
di: Gong, Ruihao, et al.
Pubblicazione: (2024)
di: Gong, Ruihao, et al.
Pubblicazione: (2024)
Compressing Large Language Models using Low Rank and Low Precision Decomposition
di: Saha, Rajarshi, et al.
Pubblicazione: (2024)
di: Saha, Rajarshi, et al.
Pubblicazione: (2024)
MiniCache: KV Cache Compression in Depth Dimension for Large Language Models
di: Liu, Akide, et al.
Pubblicazione: (2024)
di: Liu, Akide, et al.
Pubblicazione: (2024)
D-QRELO: Training- and Data-Free Delta Compression for Large Language Models via Quantization and Residual Low-Rank Approximation
di: Li, Junlin, et al.
Pubblicazione: (2026)
di: Li, Junlin, et al.
Pubblicazione: (2026)
Learning Structural Causal Models from Ordering: Identifiable Flow Models
di: Le, Minh Khoa, et al.
Pubblicazione: (2024)
di: Le, Minh Khoa, et al.
Pubblicazione: (2024)
The Hidden Bias: A Study on Explicit and Implicit Political Stereotypes in Large Language Models
di: Löhr, Konrad, et al.
Pubblicazione: (2025)
di: Löhr, Konrad, et al.
Pubblicazione: (2025)
Low-Rank Compression of Language Models via Differentiable Rank Selection
di: Sundrani, Sidhant, et al.
Pubblicazione: (2025)
di: Sundrani, Sidhant, et al.
Pubblicazione: (2025)
FineZip : Pushing the Limits of Large Language Models for Practical Lossless Text Compression
di: Mittu, Fazal, et al.
Pubblicazione: (2024)
di: Mittu, Fazal, et al.
Pubblicazione: (2024)
SepLLM: Accelerate Large Language Models by Compressing One Segment into One Separator
di: Chen, Guoxuan, et al.
Pubblicazione: (2024)
di: Chen, Guoxuan, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Liquid Reasoning Transformers: A Sudoku-Based Prototype for Chess-Scale Algorithmic Tasks
di: Sahni, Shivansh, et al.
Pubblicazione: (2025) -
Large Language Model Compression with Global Rank and Sparsity Optimization
di: Zhou, Changhai, et al.
Pubblicazione: (2025) -
Activation Sparsity Opportunities for Compressing General Large Language Models
di: Dhar, Nobel, et al.
Pubblicazione: (2024) -
On the Compressibility of Quantized Large Language Models
di: Mao, Yu, et al.
Pubblicazione: (2024) -
GWT: Scalable Optimizer State Compression for Large Language Model Training
di: Wen, Ziqing, et al.
Pubblicazione: (2025)