Salvato in:
| Autori principali: | von Rad, Jonathan, Cao, Yong, Geiger, Andreas |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2602.09130 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UniComp: Rethinking Video Compression Through Informational Uniqueness
di: Yuan, Chao, et al.
Pubblicazione: (2025)
di: Yuan, Chao, et al.
Pubblicazione: (2025)
Investigating the Effect of Network Pruning on Performance and Interpretability
di: von Rad, Jonathan, et al.
Pubblicazione: (2024)
di: von Rad, Jonathan, et al.
Pubblicazione: (2024)
MDPO: Overcoming the Training-Inference Divide of Masked Diffusion Language Models
di: He, Haoyu, et al.
Pubblicazione: (2025)
di: He, Haoyu, et al.
Pubblicazione: (2025)
UniQL: Unified Quantization and Low-rank Compression for Adaptive Edge LLMs
di: Chiang, Hung-Yueh, et al.
Pubblicazione: (2025)
di: Chiang, Hung-Yueh, et al.
Pubblicazione: (2025)
Prune-Quantize-Distill: An Ordered Pipeline for Efficient Neural Network Compression
di: Zhou, Longsheng, et al.
Pubblicazione: (2026)
di: Zhou, Longsheng, et al.
Pubblicazione: (2026)
UniSD: Towards a Unified Self-Distillation Framework for Large Language Models
di: Jin, Yiqiao, et al.
Pubblicazione: (2026)
di: Jin, Yiqiao, et al.
Pubblicazione: (2026)
UniDetox: Universal Detoxification of Large Language Models via Dataset Distillation
di: Lu, Huimin, et al.
Pubblicazione: (2025)
di: Lu, Huimin, et al.
Pubblicazione: (2025)
PPC-GPT: Federated Task-Specific Compression of Large Language Models via Pruning and Chain-of-Thought Distillation
di: Fan, Tao, et al.
Pubblicazione: (2025)
di: Fan, Tao, et al.
Pubblicazione: (2025)
Extreme Compression of Large Language Models via Additive Quantization
di: Egiazarian, Vage, et al.
Pubblicazione: (2024)
di: Egiazarian, Vage, et al.
Pubblicazione: (2024)
QPruner: Probabilistic Decision Quantization for Structured Pruning in Large Language Models
di: Zhou, Changhai, et al.
Pubblicazione: (2024)
di: Zhou, Changhai, et al.
Pubblicazione: (2024)
On the Compressibility of Quantized Large Language Models
di: Mao, Yu, et al.
Pubblicazione: (2024)
di: Mao, Yu, et al.
Pubblicazione: (2024)
Soft Label Pruning and Quantization for Large-Scale Dataset Distillation
di: Lingao, Xiao, et al.
Pubblicazione: (2026)
di: Lingao, Xiao, et al.
Pubblicazione: (2026)
Compact Language Models via Pruning and Knowledge Distillation
di: Muralidharan, Saurav, et al.
Pubblicazione: (2024)
di: Muralidharan, Saurav, et al.
Pubblicazione: (2024)
TuneComp: Joint Fine-tuning and Compression for Large Foundation Models
di: Chen, Xiangyu, et al.
Pubblicazione: (2025)
di: Chen, Xiangyu, et al.
Pubblicazione: (2025)
Self-Data Distillation for Recovering Quality in Pruned Large Language Models
di: Thangarasa, Vithursan, et al.
Pubblicazione: (2024)
di: Thangarasa, Vithursan, et al.
Pubblicazione: (2024)
Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe
di: Hou, Wenjin, et al.
Pubblicazione: (2026)
di: Hou, Wenjin, et al.
Pubblicazione: (2026)
LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit
di: Gong, Ruihao, et al.
Pubblicazione: (2024)
di: Gong, Ruihao, et al.
Pubblicazione: (2024)
Lillama: Large Language Models Compression via Low-Rank Feature Distillation
di: Sy, Yaya, et al.
Pubblicazione: (2024)
di: Sy, Yaya, et al.
Pubblicazione: (2024)
UniPruning: Unifying Local Metric and Global Feedback for Scalable Sparse LLMs
di: Ding, Yizhuo, et al.
Pubblicazione: (2025)
di: Ding, Yizhuo, et al.
Pubblicazione: (2025)
Unified Stochastic Framework for Neural Network Quantization and Pruning
di: Zhang, Haoyu, et al.
Pubblicazione: (2024)
di: Zhang, Haoyu, et al.
Pubblicazione: (2024)
Spatio-Temporal Pruning for Compressed Spiking Large Language Models
di: Jiang, Yi, et al.
Pubblicazione: (2025)
di: Jiang, Yi, et al.
Pubblicazione: (2025)
EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling
di: Song, Jiafei, et al.
Pubblicazione: (2026)
di: Song, Jiafei, et al.
Pubblicazione: (2026)
SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models
di: Zhu, Hourun, et al.
Pubblicazione: (2025)
di: Zhu, Hourun, et al.
Pubblicazione: (2025)
EPSD: Early Pruning with Self-Distillation for Efficient Model Compression
di: Chen, Dong, et al.
Pubblicazione: (2024)
di: Chen, Dong, et al.
Pubblicazione: (2024)
A Comprehensive Evaluation on Quantization Techniques for Large Language Models
di: Liu, Yutong, et al.
Pubblicazione: (2025)
di: Liu, Yutong, et al.
Pubblicazione: (2025)
UniMove: A Unified Model for Multi-city Human Mobility Prediction
di: Han, Chonghua, et al.
Pubblicazione: (2025)
di: Han, Chonghua, et al.
Pubblicazione: (2025)
StructComp: Substituting Propagation with Structural Compression in Training Graph Contrastive Learning
di: Zhang, Shengzhong, et al.
Pubblicazione: (2023)
di: Zhang, Shengzhong, et al.
Pubblicazione: (2023)
Foundations of Large Language Model Compression -- Part 1: Weight Quantization
di: Young, Sean I.
Pubblicazione: (2024)
di: Young, Sean I.
Pubblicazione: (2024)
Compression Scaling Laws:Unifying Sparsity and Quantization
di: Frantar, Elias, et al.
Pubblicazione: (2025)
di: Frantar, Elias, et al.
Pubblicazione: (2025)
UniCompress: Enhancing Multi-Data Medical Image Compression with Knowledge Distillation
di: Yang, Runzhao, et al.
Pubblicazione: (2024)
di: Yang, Runzhao, et al.
Pubblicazione: (2024)
EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation
di: Zhang, Shu-Hao, et al.
Pubblicazione: (2026)
di: Zhang, Shu-Hao, et al.
Pubblicazione: (2026)
UniFlow: A Foundation Model for Unified Urban Spatio-Temporal Flow Prediction
di: Yuan, Yuan, et al.
Pubblicazione: (2024)
di: Yuan, Yuan, et al.
Pubblicazione: (2024)
Iterative Layer-wise Distillation for Efficient Compression of Large Language Models
di: Kovalev, Grigory, et al.
Pubblicazione: (2025)
di: Kovalev, Grigory, et al.
Pubblicazione: (2025)
CrossQuant: A Post-Training Quantization Method with Smaller Quantization Kernel for Precise Large Language Model Compression
di: Liu, Wenyuan, et al.
Pubblicazione: (2024)
di: Liu, Wenyuan, et al.
Pubblicazione: (2024)
GPU-Accelerated INT8 Quantization for KV Cache Compression in Large Language Models
di: Taneja, Maanas, et al.
Pubblicazione: (2026)
di: Taneja, Maanas, et al.
Pubblicazione: (2026)
Prune, Update and Trim: Robust Structured Pruning for Large Language Models
di: Mecke, Diego Coello de Portugal, et al.
Pubblicazione: (2026)
di: Mecke, Diego Coello de Portugal, et al.
Pubblicazione: (2026)
Pruning and Distilling Mixture-of-Experts into Dense Language Models
di: Kim, Junhyuck, et al.
Pubblicazione: (2026)
di: Kim, Junhyuck, et al.
Pubblicazione: (2026)
UniCO: Towards a Unified Model for Combinatorial Optimization Problems
di: Zong, Zefang, et al.
Pubblicazione: (2025)
di: Zong, Zefang, et al.
Pubblicazione: (2025)
Restoring Pruned Large Language Models via Lost Component Compensation
di: Feng, Zijian, et al.
Pubblicazione: (2025)
di: Feng, Zijian, et al.
Pubblicazione: (2025)
LBLLM: Lightweight Binarization of Large Language Models via Three-Stage Distillation
di: Song, Siqing, et al.
Pubblicazione: (2026)
di: Song, Siqing, et al.
Pubblicazione: (2026)
Documenti analoghi
-
UniComp: Rethinking Video Compression Through Informational Uniqueness
di: Yuan, Chao, et al.
Pubblicazione: (2025) -
Investigating the Effect of Network Pruning on Performance and Interpretability
di: von Rad, Jonathan, et al.
Pubblicazione: (2024) -
MDPO: Overcoming the Training-Inference Divide of Masked Diffusion Language Models
di: He, Haoyu, et al.
Pubblicazione: (2025) -
UniQL: Unified Quantization and Low-rank Compression for Adaptive Edge LLMs
di: Chiang, Hung-Yueh, et al.
Pubblicazione: (2025) -
Prune-Quantize-Distill: An Ordered Pipeline for Efficient Neural Network Compression
di: Zhou, Longsheng, et al.
Pubblicazione: (2026)