Radio: Rate-Distortion Optimization for Large Language Model Compression
Fuente:
arXiv
Guardado en:
| Autor principal: | Young, Sean I. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Foundations of Large Language Model Compression -- Part 1: Weight Quantization
por: Young, Sean I.
Publicado: (2024)
por: Young, Sean I.
Publicado: (2024)
Fundamental Limits of Prompt Compression: A Rate-Distortion Framework for Black-Box Language Models
por: Nagle, Alliot, et al.
Publicado: (2024)
por: Nagle, Alliot, et al.
Publicado: (2024)
Multi-Bit Distortion-Free Watermarking for Large Language Models
por: Boroujeny, Massieh Kordi, et al.
Publicado: (2024)
por: Boroujeny, Massieh Kordi, et al.
Publicado: (2024)
Adaptive Feature-based Low-Rank Compression of Large Language Models via Bayesian Optimization
por: Ji, Yixin, et al.
Publicado: (2024)
por: Ji, Yixin, et al.
Publicado: (2024)
A Rate-Distortion Framework for Summarization
por: Arda, Enes, et al.
Publicado: (2025)
por: Arda, Enes, et al.
Publicado: (2025)
Extreme Compression of Large Language Models via Additive Quantization
por: Egiazarian, Vage, et al.
Publicado: (2024)
por: Egiazarian, Vage, et al.
Publicado: (2024)
On the Compressibility of Quantized Large Language Models
por: Mao, Yu, et al.
Publicado: (2024)
por: Mao, Yu, et al.
Publicado: (2024)
Iterative Layer-wise Distillation for Efficient Compression of Large Language Models
por: Kovalev, Grigory, et al.
Publicado: (2025)
por: Kovalev, Grigory, et al.
Publicado: (2025)
SliceGPT: Compress Large Language Models by Deleting Rows and Columns
por: Ashkboos, Saleh, et al.
Publicado: (2024)
por: Ashkboos, Saleh, et al.
Publicado: (2024)
FoldGPT: Simple and Effective Large Language Model Compression Scheme
por: Liu, Songwei, et al.
Publicado: (2024)
por: Liu, Songwei, et al.
Publicado: (2024)
Local Normalization Distortion and the Thermodynamic Formalism of Decoding Strategies for Large Language Models
por: Kempton, Tom, et al.
Publicado: (2025)
por: Kempton, Tom, et al.
Publicado: (2025)
Towards Linguistically-Aware and Language-Independent Tokenization for Large Language Models (LLMs)
por: Rahman, Abrar, et al.
Publicado: (2024)
por: Rahman, Abrar, et al.
Publicado: (2024)
PocketLLM: Ultimate Compression of Large Language Models via Meta Networks
por: Tian, Ye, et al.
Publicado: (2025)
por: Tian, Ye, et al.
Publicado: (2025)
Basis Sharing: Cross-Layer Parameter Sharing for Large Language Model Compression
por: Wang, Jingcun, et al.
Publicado: (2024)
por: Wang, Jingcun, et al.
Publicado: (2024)
Merging Methods for Multilingual Knowledge Editing for Large Language Models: An Empirical Odyssey
por: Lee, Kunil, et al.
Publicado: (2026)
por: Lee, Kunil, et al.
Publicado: (2026)
Proxy Compression for Language Modeling
por: Zheng, Lin, et al.
Publicado: (2026)
por: Zheng, Lin, et al.
Publicado: (2026)
Supervised Learning and Large Language Model Benchmarks on Mental Health Datasets: Cognitive Distortions and Suicidal Risks in Chinese Social Media
por: Qi, Hongzhi, et al.
Publicado: (2023)
por: Qi, Hongzhi, et al.
Publicado: (2023)
Robust Distortion-free Watermarks for Language Models
por: Kuditipudi, Rohith, et al.
Publicado: (2023)
por: Kuditipudi, Rohith, et al.
Publicado: (2023)
Lossless Compression of Large Language Model-Generated Text via Next-Token Prediction
por: Mao, Yu, et al.
Publicado: (2025)
por: Mao, Yu, et al.
Publicado: (2025)
Saten: Sparse Augmented Tensor Networks for Post-Training Compression of Large Language Models
por: Solgi, Ryan, et al.
Publicado: (2025)
por: Solgi, Ryan, et al.
Publicado: (2025)
SVD-LLM: Truncation-aware Singular Value Decomposition for Large Language Model Compression
por: Wang, Xin, et al.
Publicado: (2024)
por: Wang, Xin, et al.
Publicado: (2024)
Capability-Guided Compression: Toward Interpretability-Aware Budget Allocation for Large Language Models
por: Gupta, Rishaank
Publicado: (2026)
por: Gupta, Rishaank
Publicado: (2026)
Self-Data Distillation for Recovering Quality in Pruned Large Language Models
por: Thangarasa, Vithursan, et al.
Publicado: (2024)
por: Thangarasa, Vithursan, et al.
Publicado: (2024)
SlimMoE: Structured Compression of Large MoE Models via Expert Slimming and Distillation
por: Li, Zichong, et al.
Publicado: (2025)
por: Li, Zichong, et al.
Publicado: (2025)
Optimizing Temperature for Language Models with Multi-Sample Inference
por: Du, Weihua, et al.
Publicado: (2025)
por: Du, Weihua, et al.
Publicado: (2025)
Multi-Reference Preference Optimization for Large Language Models
por: Le, Hung, et al.
Publicado: (2024)
por: Le, Hung, et al.
Publicado: (2024)
Benchmarking Large Language Model Uncertainty for Prompt Optimization
por: Guo, Pei-Fu, et al.
Publicado: (2024)
por: Guo, Pei-Fu, et al.
Publicado: (2024)
Compressed Models are NOT Trust-equivalent to Their Large Counterparts
por: Rai, Rohit Raj, et al.
Publicado: (2025)
por: Rai, Rohit Raj, et al.
Publicado: (2025)
From Token to Token Pair: Efficient Prompt Compression for Large Language Models in Clinical Prediction
por: Zhu, Mingcheng, et al.
Publicado: (2026)
por: Zhu, Mingcheng, et al.
Publicado: (2026)
RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory
por: Zuo, Fei, et al.
Publicado: (2026)
por: Zuo, Fei, et al.
Publicado: (2026)
Clustering-driven Memory Compression for On-device Large Language Models
por: Bohdal, Ondrej, et al.
Publicado: (2026)
por: Bohdal, Ondrej, et al.
Publicado: (2026)
In-context Autoencoder for Context Compression in a Large Language Model
por: Ge, Tao, et al.
Publicado: (2023)
por: Ge, Tao, et al.
Publicado: (2023)
Are Compressed Language Models Less Subgroup Robust?
por: Gee, Leonidas, et al.
Publicado: (2024)
por: Gee, Leonidas, et al.
Publicado: (2024)
Large Language Models as Optimizers
por: Yang, Chengrun, et al.
Publicado: (2023)
por: Yang, Chengrun, et al.
Publicado: (2023)
Energy Considerations of Large Language Model Inference and Efficiency Optimizations
por: Fernandez, Jared, et al.
Publicado: (2025)
por: Fernandez, Jared, et al.
Publicado: (2025)
AE-LLM: Adaptive Efficiency Optimization for Large Language Models
por: Tanaka, Kaito, et al.
Publicado: (2026)
por: Tanaka, Kaito, et al.
Publicado: (2026)
Modifying Large Language Model Post-Training for Diverse Creative Writing
por: Chung, John Joon Young, et al.
Publicado: (2025)
por: Chung, John Joon Young, et al.
Publicado: (2025)
BAPO: Base-Anchored Preference Optimization for Overcoming Forgetting in Large Language Models Personalization
por: Lee, Gihun, et al.
Publicado: (2024)
por: Lee, Gihun, et al.
Publicado: (2024)
Optimizing Large Language Model Training Using FP4 Quantization
por: Wang, Ruizhe, et al.
Publicado: (2025)
por: Wang, Ruizhe, et al.
Publicado: (2025)
Optimizing Multi-Task Learning for Enhanced Performance in Large Language Models
por: Qi, Zhen, et al.
Publicado: (2024)
por: Qi, Zhen, et al.
Publicado: (2024)
Ejemplares similares
-
Foundations of Large Language Model Compression -- Part 1: Weight Quantization
por: Young, Sean I.
Publicado: (2024) -
Fundamental Limits of Prompt Compression: A Rate-Distortion Framework for Black-Box Language Models
por: Nagle, Alliot, et al.
Publicado: (2024) -
Multi-Bit Distortion-Free Watermarking for Large Language Models
por: Boroujeny, Massieh Kordi, et al.
Publicado: (2024) -
Adaptive Feature-based Low-Rank Compression of Large Language Models via Bayesian Optimization
por: Ji, Yixin, et al.
Publicado: (2024) -
A Rate-Distortion Framework for Summarization
por: Arda, Enes, et al.
Publicado: (2025)