Enhancing Inference Efficiency of Large Language Models: Investigating Optimization Strategies and Architectural Innovations
Fuente:
arXiv
Gespeichert in:
| 1. Verfasser: | Tyukin, Georgy |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Model Compression and Efficient Inference for Large Language Models: A Survey
von: Wang, Wenxiao, et al.
Veröffentlicht: (2024)
von: Wang, Wenxiao, et al.
Veröffentlicht: (2024)
CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing
von: Zheng, Wenhao, et al.
Veröffentlicht: (2025)
von: Zheng, Wenhao, et al.
Veröffentlicht: (2025)
Data Efficacy for Language Model Training
von: Dai, Yalun, et al.
Veröffentlicht: (2025)
von: Dai, Yalun, et al.
Veröffentlicht: (2025)
Research on Low-Latency Inference and Training Efficiency Optimization for Graph Neural Network and Large Language Model-Based Recommendation Systems
von: Zhao, Yushang, et al.
Veröffentlicht: (2025)
von: Zhao, Yushang, et al.
Veröffentlicht: (2025)
Bench360: Benchmarking Local LLM Inference from 360 Degrees
von: Stuhlmann, Linus, et al.
Veröffentlicht: (2025)
von: Stuhlmann, Linus, et al.
Veröffentlicht: (2025)
Evaluating the Efficacy of Foundational Models: Advancing Benchmarking Practices to Enhance Fine-Tuning Decision-Making
von: Amujo, Oluyemi Enoch, et al.
Veröffentlicht: (2024)
von: Amujo, Oluyemi Enoch, et al.
Veröffentlicht: (2024)
MMLU-CF: A Contamination-free Multi-task Language Understanding Benchmark
von: Zhao, Qihao, et al.
Veröffentlicht: (2024)
von: Zhao, Qihao, et al.
Veröffentlicht: (2024)
Morpheme Boundary Detection & Grammatical Feature Prediction for Gujarati : Dataset & Model
von: Baxi, Jatayu, et al.
Veröffentlicht: (2021)
von: Baxi, Jatayu, et al.
Veröffentlicht: (2021)
Quamba2: A Robust and Scalable Post-training Quantization Framework for Selective State Space Models
von: Chiang, Hung-Yueh, et al.
Veröffentlicht: (2025)
von: Chiang, Hung-Yueh, et al.
Veröffentlicht: (2025)
Regression Language Models for Code
von: Akhauri, Yash, et al.
Veröffentlicht: (2025)
von: Akhauri, Yash, et al.
Veröffentlicht: (2025)
Energy-Efficient Transformer Inference: Optimization Strategies for Time Series Classification
von: Kermani, Arshia, et al.
Veröffentlicht: (2025)
von: Kermani, Arshia, et al.
Veröffentlicht: (2025)
ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching
von: Zhao, Youpeng, et al.
Veröffentlicht: (2024)
von: Zhao, Youpeng, et al.
Veröffentlicht: (2024)
QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving
von: Lin, Yujun, et al.
Veröffentlicht: (2024)
von: Lin, Yujun, et al.
Veröffentlicht: (2024)
QJL: 1-Bit Quantized JL Transform for KV Cache Quantization with Zero Overhead
von: Zandieh, Amir, et al.
Veröffentlicht: (2024)
von: Zandieh, Amir, et al.
Veröffentlicht: (2024)
Energy-Aware LLMs: A step towards sustainable AI for downstream applications
von: Tran, Nguyen Phuc, et al.
Veröffentlicht: (2025)
von: Tran, Nguyen Phuc, et al.
Veröffentlicht: (2025)
REAM: Merging Improves Pruning of Experts in LLMs
von: Jha, Saurav, et al.
Veröffentlicht: (2026)
von: Jha, Saurav, et al.
Veröffentlicht: (2026)
An energy-based comparative analysis of common approaches to text classification in the Legal domain
von: Gultekin, Sinan, et al.
Veröffentlicht: (2023)
von: Gultekin, Sinan, et al.
Veröffentlicht: (2023)
OptiSeq: Ordering Examples On-The-Fly for In-Context Learning
von: Bhope, Rahul Atul, et al.
Veröffentlicht: (2025)
von: Bhope, Rahul Atul, et al.
Veröffentlicht: (2025)
Accelerating Diffusion LLMs via Adaptive Parallel Decoding
von: Israel, Daniel, et al.
Veröffentlicht: (2025)
von: Israel, Daniel, et al.
Veröffentlicht: (2025)
Investigating Execution-Aware Language Models for Code Optimization
von: Di Menna, Federico, et al.
Veröffentlicht: (2025)
von: Di Menna, Federico, et al.
Veröffentlicht: (2025)
CDS4RAG: Cyclic Dual-Sequential Hyperparameter Optimization for RAG
von: Chen, Pengzhou, et al.
Veröffentlicht: (2026)
von: Chen, Pengzhou, et al.
Veröffentlicht: (2026)
LLMSYS-HPOBench: Hyperparameter Optimization Benchmark Suite for Real-World LLM Systems
von: Wu, Siyu, et al.
Veröffentlicht: (2026)
von: Wu, Siyu, et al.
Veröffentlicht: (2026)
STAlloc: Enhancing Memory Efficiency in Large-Scale Model Training with Spatio-Temporal Planning
von: Huang, Zixiao, et al.
Veröffentlicht: (2025)
von: Huang, Zixiao, et al.
Veröffentlicht: (2025)
Canvas: End-to-End Kernel Architecture Search in Neural Networks
von: Zhao, Chenggang, et al.
Veröffentlicht: (2023)
von: Zhao, Chenggang, et al.
Veröffentlicht: (2023)
ECCO: Evidence-Driven Causal Reasoning for Compiler Optimization
von: Pan, Haolin, et al.
Veröffentlicht: (2026)
von: Pan, Haolin, et al.
Veröffentlicht: (2026)
Throughput Optimization as a Strategic Lever in Large-Scale AI Systems: Evidence from Dataloader and Memory Profiling Innovations
von: Jha, Mayank
Veröffentlicht: (2026)
von: Jha, Mayank
Veröffentlicht: (2026)
R2R: Efficiently Navigating Divergent Reasoning Paths with Small-Large Model Token Routing
von: Fu, Tianyu, et al.
Veröffentlicht: (2025)
von: Fu, Tianyu, et al.
Veröffentlicht: (2025)
Attention Is All You Need But You Don't Need All Of It For Inference of Large Language Models
von: Tyukin, Georgy, et al.
Veröffentlicht: (2024)
von: Tyukin, Georgy, et al.
Veröffentlicht: (2024)
Fairness in Serving Large Language Models
von: Sheng, Ying, et al.
Veröffentlicht: (2023)
von: Sheng, Ying, et al.
Veröffentlicht: (2023)
HashEvict: A Pre-Attention KV Cache Eviction Strategy using Locality-Sensitive Hashing
von: Liu, Minghui, et al.
Veröffentlicht: (2024)
von: Liu, Minghui, et al.
Veröffentlicht: (2024)
Thanos: A Block-wise Pruning Algorithm for Efficient Large Language Model Compression
von: Ilin, Ivan, et al.
Veröffentlicht: (2025)
von: Ilin, Ivan, et al.
Veröffentlicht: (2025)
Priority Sampling of Large Language Models for Compilers
von: Grubisic, Dejan, et al.
Veröffentlicht: (2024)
von: Grubisic, Dejan, et al.
Veröffentlicht: (2024)
Generalizing Scaling Laws for Dense and Sparse Large Language Models
von: Hossain, Md Arafat, et al.
Veröffentlicht: (2025)
von: Hossain, Md Arafat, et al.
Veröffentlicht: (2025)
Deploying Open-Source Large Language Models: A performance Analysis
von: Bendi-Ouis, Yannis, et al.
Veröffentlicht: (2024)
von: Bendi-Ouis, Yannis, et al.
Veröffentlicht: (2024)
Systematic Evaluation of Optimization Techniques for Long-Context Language Models
von: Ahmed, Ammar, et al.
Veröffentlicht: (2025)
von: Ahmed, Ammar, et al.
Veröffentlicht: (2025)
LOOPRAG: Enhancing Loop Transformation Optimization with Retrieval-Augmented Large Language Models
von: Zhi, Yijie, et al.
Veröffentlicht: (2025)
von: Zhi, Yijie, et al.
Veröffentlicht: (2025)
Sometimes Painful but Certainly Promising: Feasibility and Trade-offs of Language Model Inference at the Edge
von: Abstreiter, Maximilian, et al.
Veröffentlicht: (2025)
von: Abstreiter, Maximilian, et al.
Veröffentlicht: (2025)
FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models
von: Shao, Zishan, et al.
Veröffentlicht: (2025)
von: Shao, Zishan, et al.
Veröffentlicht: (2025)
CORM: Cache Optimization with Recent Message for Large Language Model Inference
von: Dai, Jincheng, et al.
Veröffentlicht: (2024)
von: Dai, Jincheng, et al.
Veröffentlicht: (2024)
A Theory of Inference Compute Scaling: Reasoning through Directed Stochastic Skill Search
von: Ellis-Mohr, Austin R., et al.
Veröffentlicht: (2025)
von: Ellis-Mohr, Austin R., et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Model Compression and Efficient Inference for Large Language Models: A Survey
von: Wang, Wenxiao, et al.
Veröffentlicht: (2024) -
CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing
von: Zheng, Wenhao, et al.
Veröffentlicht: (2025) -
Data Efficacy for Language Model Training
von: Dai, Yalun, et al.
Veröffentlicht: (2025) -
Research on Low-Latency Inference and Training Efficiency Optimization for Graph Neural Network and Large Language Model-Based Recommendation Systems
von: Zhao, Yushang, et al.
Veröffentlicht: (2025) -
Bench360: Benchmarking Local LLM Inference from 360 Degrees
von: Stuhlmann, Linus, et al.
Veröffentlicht: (2025)