Deploying Open-Source Large Language Models: A performance Analysis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bendi-Ouis, Yannis, Dutartre, Dan, Hinaut, Xavier |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Echo State Transformer: Attention Over Finite Memories
par: Bendi-Ouis, Yannis, et autres
Publié: (2025)
par: Bendi-Ouis, Yannis, et autres
Publié: (2025)
CogScale: Scalable Benchmark for Sequence Processing
par: Bendi-Ouis, Yannis, et autres
Publié: (2026)
par: Bendi-Ouis, Yannis, et autres
Publié: (2026)
ReservoirChat: Interactive Documentation Enhanced with LLM and Knowledge Graph for ReservoirPy
par: Boraud, Virgile, et autres
Publié: (2025)
par: Boraud, Virgile, et autres
Publié: (2025)
Knowledge Grafting: A Mechanism for Optimizing AI Model Deployment in Resource-Constrained Environments
par: Almurshed, Osama, et autres
Publié: (2025)
par: Almurshed, Osama, et autres
Publié: (2025)
Fairness in Serving Large Language Models
par: Sheng, Ying, et autres
Publié: (2023)
par: Sheng, Ying, et autres
Publié: (2023)
Generalizing Scaling Laws for Dense and Sparse Large Language Models
par: Hossain, Md Arafat, et autres
Publié: (2025)
par: Hossain, Md Arafat, et autres
Publié: (2025)
ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching
par: Zhao, Youpeng, et autres
Publié: (2024)
par: Zhao, Youpeng, et autres
Publié: (2024)
Private LLM Inference on Consumer Blackwell GPUs: A Practical Guide for Cost-Effective Local Deployment in SMEs
par: Knoop, Jonathan, et autres
Publié: (2026)
par: Knoop, Jonathan, et autres
Publié: (2026)
Research on Low-Latency Inference and Training Efficiency Optimization for Graph Neural Network and Large Language Model-Based Recommendation Systems
par: Zhao, Yushang, et autres
Publié: (2025)
par: Zhao, Yushang, et autres
Publié: (2025)
Model Compression and Efficient Inference for Large Language Models: A Survey
par: Wang, Wenxiao, et autres
Publié: (2024)
par: Wang, Wenxiao, et autres
Publié: (2024)
Leveraging Speculative Sampling and KV-Cache Optimizations Together for Generative AI using OpenVINO
par: Barad, Haim, et autres
Publié: (2023)
par: Barad, Haim, et autres
Publié: (2023)
Quantifying the Generalization Gap in Seizure Detection: A Large-Scale Empirical Benchmark via the SzCORE Challenge
par: Dan, Jonathan, et autres
Publié: (2025)
par: Dan, Jonathan, et autres
Publié: (2025)
Enhancing Inference Efficiency of Large Language Models: Investigating Optimization Strategies and Architectural Innovations
par: Tyukin, Georgy
Publié: (2024)
par: Tyukin, Georgy
Publié: (2024)
CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing
par: Zheng, Wenhao, et autres
Publié: (2025)
par: Zheng, Wenhao, et autres
Publié: (2025)
Machine Learning Methods for Evaluating Public Crisis: Meta-Analysis
par: Okpala, Izunna, et autres
Publié: (2023)
par: Okpala, Izunna, et autres
Publié: (2023)
A Performance Evaluation of a Quantized Large Language Model on Various Smartphones
par: Çöplü, Tolga, et autres
Publié: (2023)
par: Çöplü, Tolga, et autres
Publié: (2023)
Applied Federated Model Personalisation in the Industrial Domain: A Comparative Study
par: Siniosoglou, Ilias, et autres
Publié: (2024)
par: Siniosoglou, Ilias, et autres
Publié: (2024)
Performance Modeling of Data Storage Systems using Generative Models
par: Al-Maeeni, Abdalaziz Rashid, et autres
Publié: (2023)
par: Al-Maeeni, Abdalaziz Rashid, et autres
Publié: (2023)
Throughput Optimization as a Strategic Lever in Large-Scale AI Systems: Evidence from Dataloader and Memory Profiling Innovations
par: Jha, Mayank
Publié: (2026)
par: Jha, Mayank
Publié: (2026)
Comment on paper: Position: Rethinking Post-Hoc Search-Based Neural Approaches for Solving Large-Scale Traveling Salesman Problems
par: Min, Yimeng
Publié: (2024)
par: Min, Yimeng
Publié: (2024)
Improving the Serving Performance of Multi-LoRA Large Language Models via Efficient LoRA and KV Cache Management
par: Zhang, Hang, et autres
Publié: (2025)
par: Zhang, Hang, et autres
Publié: (2025)
Quantum Neural Networks for Wind Energy Forecasting: A Comparative Study of Performance and Scalability with Classical Models
par: Hangun, Batuhan, et autres
Publié: (2025)
par: Hangun, Batuhan, et autres
Publié: (2025)
FlashSVD: Memory-Efficient Inference with Streaming for Low-Rank Models
par: Shao, Zishan, et autres
Publié: (2025)
par: Shao, Zishan, et autres
Publié: (2025)
Data Efficacy for Language Model Training
par: Dai, Yalun, et autres
Publié: (2025)
par: Dai, Yalun, et autres
Publié: (2025)
Stochastic Q-learning for Large Discrete Action Spaces
par: Fourati, Fares, et autres
Publié: (2024)
par: Fourati, Fares, et autres
Publié: (2024)
Optimizing the Deployment of Tiny Transformers on Low-Power MCUs
par: Jung, Victor J. B., et autres
Publié: (2024)
par: Jung, Victor J. B., et autres
Publié: (2024)
The Race to Efficiency: A New Perspective on AI Scaling Laws
par: Lu, Chien-Ping
Publié: (2025)
par: Lu, Chien-Ping
Publié: (2025)
FlashOmni: A Unified Sparse Attention Engine for Diffusion Transformers
par: Qiao, Liang, et autres
Publié: (2025)
par: Qiao, Liang, et autres
Publié: (2025)
MoEITS: A Green AI approach for simplifying MoE-LLMs
par: Balderas, Luis, et autres
Publié: (2026)
par: Balderas, Luis, et autres
Publié: (2026)
Ragged Paged Attention: A High-Performance and Flexible LLM Inference Kernel for TPU
par: Jiang, Jevin, et autres
Publié: (2026)
par: Jiang, Jevin, et autres
Publié: (2026)
Towards Generalized Parameter Tuning in Coherent Ising Machines: A Portfolio-Based Approach
par: Hanyu, Tatsuro, et autres
Publié: (2025)
par: Hanyu, Tatsuro, et autres
Publié: (2025)
Rapid Augmentations for Time Series (RATS): A High-Performance Library for Time Series Augmentation
par: Skaf, Wadie, et autres
Publié: (2026)
par: Skaf, Wadie, et autres
Publié: (2026)
Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems
par: Miao, Xupeng, et autres
Publié: (2023)
par: Miao, Xupeng, et autres
Publié: (2023)
SLiM: One-shot Quantization and Sparsity with Low-rank Approximation for LLM Weight Compression
par: Mozaffari, Mohammad, et autres
Publié: (2024)
par: Mozaffari, Mohammad, et autres
Publié: (2024)
EXAQ: Exponent Aware Quantization For LLMs Acceleration
par: Shkolnik, Moran, et autres
Publié: (2024)
par: Shkolnik, Moran, et autres
Publié: (2024)
APOLLO: SGD-like Memory, AdamW-level Performance
par: Zhu, Hanqing, et autres
Publié: (2024)
par: Zhu, Hanqing, et autres
Publié: (2024)
FALCON: Feedback-driven Adaptive Long/short-term memory reinforced Coding Optimization system
par: Li, Zeyuan, et autres
Publié: (2024)
par: Li, Zeyuan, et autres
Publié: (2024)
ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression
par: Liu, Guangda, et autres
Publié: (2024)
par: Liu, Guangda, et autres
Publié: (2024)
The Power of Training: How Different Neural Network Setups Influence the Energy Demand
par: Geißler, Daniel, et autres
Publié: (2024)
par: Geißler, Daniel, et autres
Publié: (2024)
Reducing Latency of LLM Search Agent via Speculation-based Algorithm-System Co-Design
par: Huang, Zixiao, et autres
Publié: (2025)
par: Huang, Zixiao, et autres
Publié: (2025)
Documents similaires
-
Echo State Transformer: Attention Over Finite Memories
par: Bendi-Ouis, Yannis, et autres
Publié: (2025) -
CogScale: Scalable Benchmark for Sequence Processing
par: Bendi-Ouis, Yannis, et autres
Publié: (2026) -
ReservoirChat: Interactive Documentation Enhanced with LLM and Knowledge Graph for ReservoirPy
par: Boraud, Virgile, et autres
Publié: (2025) -
Knowledge Grafting: A Mechanism for Optimizing AI Model Deployment in Resource-Constrained Environments
par: Almurshed, Osama, et autres
Publié: (2025) -
Fairness in Serving Large Language Models
par: Sheng, Ying, et autres
Publié: (2023)