A Cost-Benefit Analysis of On-Premise Large Language Model Deployment: Breaking Even with Commercial LLM Services
Fuente:
arXiv
Saved in:
| Main Authors: | Pan, Guanzhong, Chodnekar, Vishal, Roy, Abinas, Wang, Haibo |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
A Middle Path for On-Premises LLM Deployment: Preserving Privacy Without Sacrificing Model Confidentiality
by: Huang, Hanbo, et al.
Published: (2024)
by: Huang, Hanbo, et al.
Published: (2024)
Multimodal Survival Analysis with Locally Deployable Large Language Models
by: Gögl, Moritz, et al.
Published: (2026)
by: Gögl, Moritz, et al.
Published: (2026)
CATP-LLM: Empowering Large Language Models for Cost-Aware Tool Planning
by: Wu, Duo, et al.
Published: (2024)
by: Wu, Duo, et al.
Published: (2024)
VSPrefill: Vertical-Slash Sparse Attention with Lightweight Indexing for Long-Context Prefilling
by: Guanzhong, Chen
Published: (2026)
by: Guanzhong, Chen
Published: (2026)
AmoebaLLM: Constructing Any-Shape Large Language Models for Efficient and Instant Deployment
by: Fu, Yonggan, et al.
Published: (2024)
by: Fu, Yonggan, et al.
Published: (2024)
Do Large Language Models Reason Causally Like Us? Even Better?
by: Dettki, Hanna M., et al.
Published: (2025)
by: Dettki, Hanna M., et al.
Published: (2025)
Comparing Specialised Small and General Large Language Models on Text Classification: 100 Labelled Samples to Achieve Break-Even Performance
by: Pecher, Branislav, et al.
Published: (2024)
by: Pecher, Branislav, et al.
Published: (2024)
SmallThinker: A Family of Efficient Large Language Models Natively Trained for Local Deployment
by: Song, Yixin, et al.
Published: (2025)
by: Song, Yixin, et al.
Published: (2025)
Deploying Open-Source Large Language Models: A performance Analysis
by: Bendi-Ouis, Yannis, et al.
Published: (2024)
by: Bendi-Ouis, Yannis, et al.
Published: (2024)
Performance Control in Early Exiting to Deploy Large Models at the Same Cost of Smaller Ones
by: Mofakhami, Mehrnaz, et al.
Published: (2024)
by: Mofakhami, Mehrnaz, et al.
Published: (2024)
Provable Benefits of In-Tool Learning for Large Language Models
by: Houliston, Sam, et al.
Published: (2025)
by: Houliston, Sam, et al.
Published: (2025)
Are Large-Language Models Graph Algorithmic Reasoners?
by: Taylor, Alexander K, et al.
Published: (2024)
by: Taylor, Alexander K, et al.
Published: (2024)
Breaking Model Lock-in: Cost-Efficient Zero-Shot LLM Routing via a Universal Latent Space
by: Yan, Cheng, et al.
Published: (2026)
by: Yan, Cheng, et al.
Published: (2026)
Modular Machine Learning: An Indispensable Path towards New-Generation Large Language Models
by: Wang, Xin, et al.
Published: (2025)
by: Wang, Xin, et al.
Published: (2025)
FlattenQuant: Breaking Through the Inference Compute-bound for Large Language Models with Per-tensor Quantization
by: Zhang, Yi, et al.
Published: (2024)
by: Zhang, Yi, et al.
Published: (2024)
Time-LLM: Time Series Forecasting by Reprogramming Large Language Models
by: Jin, Ming, et al.
Published: (2023)
by: Jin, Ming, et al.
Published: (2023)
On-Premise SLMs vs. Commercial LLMs: Prompt Engineering and Incident Classification in SOCs and CSIRTs
by: Almeida, Gefté, et al.
Published: (2025)
by: Almeida, Gefté, et al.
Published: (2025)
Breaking the Factorization Barrier in Diffusion Language Models
by: Li, Ian, et al.
Published: (2026)
by: Li, Ian, et al.
Published: (2026)
ML Compass: Navigating Capability, Cost, and Compliance Trade-offs in AI Model Deployment
by: Digalakis Jr, Vassilis, et al.
Published: (2025)
by: Digalakis Jr, Vassilis, et al.
Published: (2025)
On-Demand Multi-Task Sparsity for Efficient Large-Model Deployment on Edge Devices
by: Huang, Lianming, et al.
Published: (2025)
by: Huang, Lianming, et al.
Published: (2025)
SLMQuant:Benchmarking Small Language Model Quantization for Practical Deployment
by: Wang, Jiacheng, et al.
Published: (2025)
by: Wang, Jiacheng, et al.
Published: (2025)
CASCADE: Case-Based Continual Adaptation for Large Language Models During Deployment
by: Guo, Siyuan, et al.
Published: (2026)
by: Guo, Siyuan, et al.
Published: (2026)
Steering Without Breaking: Mechanistically Informed Interventions for Discrete Diffusion Language Models
by: Zhou, Hanhan, et al.
Published: (2026)
by: Zhou, Hanhan, et al.
Published: (2026)
Advancing Model Refinement: Muon-Optimized Distillation and Quantization for LLM Deployment
by: Sander, Jacob, et al.
Published: (2026)
by: Sander, Jacob, et al.
Published: (2026)
CONSTRUCTA: Automating Commercial Construction Schedules in Fabrication Facilities with Large Language Models
by: Zhang, Yifan, et al.
Published: (2025)
by: Zhang, Yifan, et al.
Published: (2025)
Scaling Down to Scale Up: A Cost-Benefit Analysis of Replacing OpenAI's LLM with Open Source SLMs in Production
by: Irugalbandara, Chandra, et al.
Published: (2023)
by: Irugalbandara, Chandra, et al.
Published: (2023)
Private LLM Inference on Consumer Blackwell GPUs: A Practical Guide for Cost-Effective Local Deployment in SMEs
by: Knoop, Jonathan, et al.
Published: (2026)
by: Knoop, Jonathan, et al.
Published: (2026)
Budget-Constrained Agentic Large Language Models: Intention-Based Planning for Costly Tool Use
by: Liu, Hanbing, et al.
Published: (2026)
by: Liu, Hanbing, et al.
Published: (2026)
Robust Batch-Level Query Routing for Large Language Models under Cost and Capacity Constraints
by: Markovic-Voronov, Jelena, et al.
Published: (2026)
by: Markovic-Voronov, Jelena, et al.
Published: (2026)
Premise Selection for a Lean Hammer
by: Zhu, Thomas, et al.
Published: (2025)
by: Zhu, Thomas, et al.
Published: (2025)
EEGAgent: A Unified Framework for Automated EEG Analysis Using Large Language Models
by: Zhao, Sha, et al.
Published: (2025)
by: Zhao, Sha, et al.
Published: (2025)
Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?
by: Fan, Chenrui, et al.
Published: (2025)
by: Fan, Chenrui, et al.
Published: (2025)
SLOT: Structuring the Output of Large Language Models
by: Wang, Darren Yow-Bang, et al.
Published: (2025)
by: Wang, Darren Yow-Bang, et al.
Published: (2025)
Position: What Can Large Language Models Tell Us about Time Series Analysis
by: Jin, Ming, et al.
Published: (2024)
by: Jin, Ming, et al.
Published: (2024)
Theoretical Benefit and Limitation of Diffusion Language Model
by: Feng, Guhao, et al.
Published: (2025)
by: Feng, Guhao, et al.
Published: (2025)
Collaborative Compression for Large-Scale MoE Deployment on Edge
by: Chen, Yixiao, et al.
Published: (2025)
by: Chen, Yixiao, et al.
Published: (2025)
Renewable Energy Prediction: A Comparative Study of Deep Learning Models for Complex Dataset Analysis
by: Wang, Haibo, et al.
Published: (2025)
by: Wang, Haibo, et al.
Published: (2025)
Sample Transform Cost-Based Training-Free Hallucination Detector for Large Language Models
by: Ding, Zeyang, et al.
Published: (2026)
by: Ding, Zeyang, et al.
Published: (2026)
Large Language Models for Controllable Multi-property Multi-objective Molecule Optimization
by: Dey, Vishal, et al.
Published: (2025)
by: Dey, Vishal, et al.
Published: (2025)
Q-realign: Piggybacking Realignment on Quantization for Safe and Efficient LLM Deployment
by: Tan, Qitao, et al.
Published: (2026)
by: Tan, Qitao, et al.
Published: (2026)
Similar Items
-
A Middle Path for On-Premises LLM Deployment: Preserving Privacy Without Sacrificing Model Confidentiality
by: Huang, Hanbo, et al.
Published: (2024) -
Multimodal Survival Analysis with Locally Deployable Large Language Models
by: Gögl, Moritz, et al.
Published: (2026) -
CATP-LLM: Empowering Large Language Models for Cost-Aware Tool Planning
by: Wu, Duo, et al.
Published: (2024) -
VSPrefill: Vertical-Slash Sparse Attention with Lightweight Indexing for Long-Context Prefilling
by: Guanzhong, Chen
Published: (2026) -
AmoebaLLM: Constructing Any-Shape Large Language Models for Efficient and Instant Deployment
by: Fu, Yonggan, et al.
Published: (2024)