Model Compression and Efficient Inference for Large Language Models: A Survey
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Wenxiao, Chen, Wei, Luo, Yicong, Long, Yongliu, Lin, Zhengkai, Zhang, Liye, Lin, Binbin, Cai, Deng, He, Xiaofei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing
von: Zheng, Wenhao, et al.
Veröffentlicht: (2025)
von: Zheng, Wenhao, et al.
Veröffentlicht: (2025)
Enhancing Inference Efficiency of Large Language Models: Investigating Optimization Strategies and Architectural Innovations
von: Tyukin, Georgy
Veröffentlicht: (2024)
von: Tyukin, Georgy
Veröffentlicht: (2024)
SuperCoder: Assembly Program Superoptimization with Large Language Models
von: Wei, Anjiang, et al.
Veröffentlicht: (2025)
von: Wei, Anjiang, et al.
Veröffentlicht: (2025)
Thanos: A Block-wise Pruning Algorithm for Efficient Large Language Model Compression
von: Ilin, Ivan, et al.
Veröffentlicht: (2025)
von: Ilin, Ivan, et al.
Veröffentlicht: (2025)
Beyond Tokens: Semantic-Aware Speculative Decoding for Efficient Inference by Probing Internal States
von: Dong, Ximing, et al.
Veröffentlicht: (2026)
von: Dong, Ximing, et al.
Veröffentlicht: (2026)
DyLLM: Efficient Diffusion LLM Inference via Saliency-based Token Selection and Partial Attention
von: Lee, Younjoo, et al.
Veröffentlicht: (2026)
von: Lee, Younjoo, et al.
Veröffentlicht: (2026)
SimLens for Early Exit in Large Language Models: Eliciting Accurate Latent Predictions with One More Token
von: Ma, Ming, et al.
Veröffentlicht: (2025)
von: Ma, Ming, et al.
Veröffentlicht: (2025)
Delving into the Reversal Curse: How Far Can Large Language Models Generalize?
von: Lin, Zhengkai, et al.
Veröffentlicht: (2024)
von: Lin, Zhengkai, et al.
Veröffentlicht: (2024)
Dynamic Model Routing and Cascading for Efficient LLM Inference: A Survey
von: Moslem, Yasmin, et al.
Veröffentlicht: (2026)
von: Moslem, Yasmin, et al.
Veröffentlicht: (2026)
LOOPRAG: Enhancing Loop Transformation Optimization with Retrieval-Augmented Large Language Models
von: Zhi, Yijie, et al.
Veröffentlicht: (2025)
von: Zhi, Yijie, et al.
Veröffentlicht: (2025)
Hold Onto That Thought: Assessing KV Cache Compression On Reasoning
von: Liu, Minghui, et al.
Veröffentlicht: (2025)
von: Liu, Minghui, et al.
Veröffentlicht: (2025)
Performance Characterization of Expert Router for Scalable LLM Inference
von: Pichlmeier, Josef, et al.
Veröffentlicht: (2024)
von: Pichlmeier, Josef, et al.
Veröffentlicht: (2024)
VL-Cache: Sparsity and Modality-Aware KV Cache Compression for Vision-Language Model Inference Acceleration
von: Tu, Dezhan, et al.
Veröffentlicht: (2024)
von: Tu, Dezhan, et al.
Veröffentlicht: (2024)
Data Efficacy for Language Model Training
von: Dai, Yalun, et al.
Veröffentlicht: (2025)
von: Dai, Yalun, et al.
Veröffentlicht: (2025)
Profiling Large Language Model Inference on Apple Silicon: A Quantization Perspective
von: Benazir, Afsara, et al.
Veröffentlicht: (2025)
von: Benazir, Afsara, et al.
Veröffentlicht: (2025)
Controlling Thinking Speed in Reasoning Models
von: Lin, Zhengkai, et al.
Veröffentlicht: (2025)
von: Lin, Zhengkai, et al.
Veröffentlicht: (2025)
Investigating Execution-Aware Language Models for Code Optimization
von: Di Menna, Federico, et al.
Veröffentlicht: (2025)
von: Di Menna, Federico, et al.
Veröffentlicht: (2025)
SciPIP: An LLM-based Scientific Paper Idea Proposer
von: Wang, Wenxiao, et al.
Veröffentlicht: (2024)
von: Wang, Wenxiao, et al.
Veröffentlicht: (2024)
LFED: A Literary Fiction Evaluation Dataset for Large Language Models
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
von: Yu, Linhao, et al.
Veröffentlicht: (2024)
Optimizing Agentic Language Model Inference via Speculative Tool Calls
von: Nichols, Daniel, et al.
Veröffentlicht: (2025)
von: Nichols, Daniel, et al.
Veröffentlicht: (2025)
QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving
von: Lin, Yujun, et al.
Veröffentlicht: (2024)
von: Lin, Yujun, et al.
Veröffentlicht: (2024)
Iterative Layer Pruning for Efficient Translation Inference
von: Moslem, Yasmin, et al.
Veröffentlicht: (2025)
von: Moslem, Yasmin, et al.
Veröffentlicht: (2025)
DeepSeek-R1 Outperforms Gemini 2.0 Pro, OpenAI o1, and o3-mini in Bilingual Complex Ophthalmology Reasoning
von: Xu, Pusheng, et al.
Veröffentlicht: (2025)
von: Xu, Pusheng, et al.
Veröffentlicht: (2025)
ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching
von: Zhao, Youpeng, et al.
Veröffentlicht: (2024)
von: Zhao, Youpeng, et al.
Veröffentlicht: (2024)
Layer Importance and Hallucination Analysis in Large Language Models via Enhanced Activation Variance-Sparsity
von: Song, Zichen, et al.
Veröffentlicht: (2024)
von: Song, Zichen, et al.
Veröffentlicht: (2024)
Regression Language Models for Code
von: Akhauri, Yash, et al.
Veröffentlicht: (2025)
von: Akhauri, Yash, et al.
Veröffentlicht: (2025)
Green AI: Exploring Carbon Footprints, Mitigation Strategies, and Trade Offs in Large Language Model Training
von: Liu, Vivian, et al.
Veröffentlicht: (2024)
von: Liu, Vivian, et al.
Veröffentlicht: (2024)
Priority Sampling of Large Language Models for Compilers
von: Grubisic, Dejan, et al.
Veröffentlicht: (2024)
von: Grubisic, Dejan, et al.
Veröffentlicht: (2024)
FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models
von: Shao, Zishan, et al.
Veröffentlicht: (2025)
von: Shao, Zishan, et al.
Veröffentlicht: (2025)
R2R: Efficiently Navigating Divergent Reasoning Paths with Small-Large Model Token Routing
von: Fu, Tianyu, et al.
Veröffentlicht: (2025)
von: Fu, Tianyu, et al.
Veröffentlicht: (2025)
Dynamic Compressing Prompts for Efficient Inference of Large Language Models
von: Hu, Jinwu, et al.
Veröffentlicht: (2025)
von: Hu, Jinwu, et al.
Veröffentlicht: (2025)
Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems
von: Miao, Xupeng, et al.
Veröffentlicht: (2023)
von: Miao, Xupeng, et al.
Veröffentlicht: (2023)
Bench360: Benchmarking Local LLM Inference from 360 Degrees
von: Stuhlmann, Linus, et al.
Veröffentlicht: (2025)
von: Stuhlmann, Linus, et al.
Veröffentlicht: (2025)
On the Compression of Language Models for Code: An Empirical Study on CodeBERT
von: d'Aloisio, Giordano, et al.
Veröffentlicht: (2024)
von: d'Aloisio, Giordano, et al.
Veröffentlicht: (2024)
ALISE: Accelerating Large Language Model Serving with Speculative Scheduling
von: Zhao, Youpeng, et al.
Veröffentlicht: (2024)
von: Zhao, Youpeng, et al.
Veröffentlicht: (2024)
TeleEval-OS: Performance evaluations of large language models for operations scheduling
von: Wang, Yanyan, et al.
Veröffentlicht: (2025)
von: Wang, Yanyan, et al.
Veröffentlicht: (2025)
AutoLALA: Automatic Loop Algebraic Locality Analysis for AI and HPC Kernels
von: Zhu, Yifan, et al.
Veröffentlicht: (2026)
von: Zhu, Yifan, et al.
Veröffentlicht: (2026)
MMLU-CF: A Contamination-free Multi-task Language Understanding Benchmark
von: Zhao, Qihao, et al.
Veröffentlicht: (2024)
von: Zhao, Qihao, et al.
Veröffentlicht: (2024)
EPIC: Efficient Position-Independent Caching for Serving Large Language Models
von: Hu, Junhao, et al.
Veröffentlicht: (2024)
von: Hu, Junhao, et al.
Veröffentlicht: (2024)
A Data-driven ML Approach for Maximizing Performance in LLM-Adapter Serving
von: Agullo, Ferran, et al.
Veröffentlicht: (2025)
von: Agullo, Ferran, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing
von: Zheng, Wenhao, et al.
Veröffentlicht: (2025) -
Enhancing Inference Efficiency of Large Language Models: Investigating Optimization Strategies and Architectural Innovations
von: Tyukin, Georgy
Veröffentlicht: (2024) -
SuperCoder: Assembly Program Superoptimization with Large Language Models
von: Wei, Anjiang, et al.
Veröffentlicht: (2025) -
Thanos: A Block-wise Pruning Algorithm for Efficient Large Language Model Compression
von: Ilin, Ivan, et al.
Veröffentlicht: (2025) -
Beyond Tokens: Semantic-Aware Speculative Decoding for Efficient Inference by Probing Internal States
von: Dong, Ximing, et al.
Veröffentlicht: (2026)