Sometimes Painful but Certainly Promising: Feasibility and Trade-offs of Language Model Inference at the Edge
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Abstreiter, Maximilian, Tarkoma, Sasu, Morabito, Roberto |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
An Uncertainty-Aware Resilience Micro-Agent for Causal Observability in the Computing Continuum
par: De Silva, Suvi, et autres
Publié: (2026)
par: De Silva, Suvi, et autres
Publié: (2026)
Edge-First Language Model Inference: Models, Metrics, and Tradeoffs
par: Jang, SiYoung, et autres
Publié: (2025)
par: Jang, SiYoung, et autres
Publié: (2025)
Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques
par: Behera, Adarsh Prasad, et autres
Publié: (2025)
par: Behera, Adarsh Prasad, et autres
Publié: (2025)
QPART: Adaptive Model Quantization and Dynamic Workload Balancing for Accuracy-aware Edge Inference
par: Li, Xiangchen, et autres
Publié: (2025)
par: Li, Xiangchen, et autres
Publié: (2025)
Multi-Dimensional Autoscaling of Stream Processing Services on Edge Devices
par: Sedlak, Boris, et autres
Publié: (2025)
par: Sedlak, Boris, et autres
Publié: (2025)
Compiler-First State Space Duality and Portable $O(1)$ Autoregressive Caching for Inference
par: Santoni, Cosmo
Publié: (2026)
par: Santoni, Cosmo
Publié: (2026)
Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems
par: Miao, Xupeng, et autres
Publié: (2023)
par: Miao, Xupeng, et autres
Publié: (2023)
Multi-DNN Inference of Sparse Models on Edge SoCs
par: Luo, Jiawei, et autres
Publié: (2026)
par: Luo, Jiawei, et autres
Publié: (2026)
Adaptive Workload Distribution for Accuracy-aware DNN Inference on Collaborative Edge Platforms
par: Taufique, Zain, et autres
Publié: (2023)
par: Taufique, Zain, et autres
Publié: (2023)
Agentic TinyML for Intent-aware Handover in 6G Wireless Networks
par: Saleh, Alaa, et autres
Publié: (2025)
par: Saleh, Alaa, et autres
Publié: (2025)
FastPersist: Accelerating Model Checkpointing in Deep Learning
par: Wang, Guanhua, et autres
Publié: (2024)
par: Wang, Guanhua, et autres
Publié: (2024)
DUAL-BLADE: Dual-Path NVMe-Direct KV-Cache Offloading for Edge LLM Inference
par: Jeong, Bodon, et autres
Publié: (2026)
par: Jeong, Bodon, et autres
Publié: (2026)
CoFormer: Collaborating with Heterogeneous Edge Devices for Scalable Transformer Inference
par: Xu, Guanyu, et autres
Publié: (2025)
par: Xu, Guanyu, et autres
Publié: (2025)
STAlloc: Enhancing Memory Efficiency in Large-Scale Model Training with Spatio-Temporal Planning
par: Huang, Zixiao, et autres
Publié: (2025)
par: Huang, Zixiao, et autres
Publié: (2025)
EdgeProfiler: A Fast Profiling Framework for Lightweight LLMs on Edge Using Analytical Model
par: Pinnock, Alyssa, et autres
Publié: (2025)
par: Pinnock, Alyssa, et autres
Publié: (2025)
Rethinking Inference Placement for Deep Learning across Edge and Cloud Platforms: A Multi-Objective Optimization Perspective and Future Directions
par: Zhang, Zongshun, et autres
Publié: (2025)
par: Zhang, Zongshun, et autres
Publié: (2025)
Prompt-Aware Scheduling for Low-Latency LLM Serving
par: Tao, Yiheng, et autres
Publié: (2025)
par: Tao, Yiheng, et autres
Publié: (2025)
The Illusion of Power Capping in LLM Decode: A Phase-Aware Energy Characterisation Across Attention Architectures
par: Ma, Bole, et autres
Publié: (2026)
par: Ma, Bole, et autres
Publié: (2026)
Record-Remix-Replay: Hierarchical GPU Kernel Optimization using Evolutionary Search
par: Nichols, Daniel, et autres
Publié: (2026)
par: Nichols, Daniel, et autres
Publié: (2026)
ProTrain: Efficient LLM Training via Memory-Aware Techniques
par: Yang, Hanmei, et autres
Publié: (2024)
par: Yang, Hanmei, et autres
Publié: (2024)
Syno: Structured Synthesis for Neural Operators
par: Zhuo, Yongqi, et autres
Publié: (2024)
par: Zhuo, Yongqi, et autres
Publié: (2024)
Low-Rank GEMM: Efficient Matrix Multiplication via Low-Rank Approximation with FP8 Acceleration
par: Metere, Alfredo
Publié: (2025)
par: Metere, Alfredo
Publié: (2025)
Reliable Microservice Tail Latency Prediction via Decoupled Dual-Stream Learning and Gradient Modulation
par: Qian, Wenzhuo, et autres
Publié: (2025)
par: Qian, Wenzhuo, et autres
Publié: (2025)
TrainMover: An Interruption-Resilient Runtime for ML Training
par: Lao, ChonLam, et autres
Publié: (2024)
par: Lao, ChonLam, et autres
Publié: (2024)
Lightweight Software Kernels and Hardware Extensions for Efficient Sparse Deep Neural Networks on Microcontrollers
par: Daghero, Francesco, et autres
Publié: (2025)
par: Daghero, Francesco, et autres
Publié: (2025)
Longer Attention Span: Increasing Transformer Context Length with Sparse Graph Processing Techniques
par: Tomczak, Nathaniel, et autres
Publié: (2025)
par: Tomczak, Nathaniel, et autres
Publié: (2025)
Mixture of Experts with Mixture of Precisions for Tuning Quality of Service
par: Imani, HamidReza, et autres
Publié: (2024)
par: Imani, HamidReza, et autres
Publié: (2024)
Training Time Prediction for Mixed Precision-based Distributed Training
par: Kang, Minchul, et autres
Publié: (2026)
par: Kang, Minchul, et autres
Publié: (2026)
Prism: Unleashing GPU Sharing for Cost-Efficient Multi-LLM Serving
par: Yu, Shan, et autres
Publié: (2025)
par: Yu, Shan, et autres
Publié: (2025)
GPU Kernel Optimization Beyond Full Builds: An LLM Framework with Minimal Executable Programs
par: Chu, Ruifan, et autres
Publié: (2025)
par: Chu, Ruifan, et autres
Publié: (2025)
A Comparative Study of OpenMP Scheduling Algorithm Selection Strategies
par: Korndörfer, Jonas H. Müller, et autres
Publié: (2025)
par: Korndörfer, Jonas H. Müller, et autres
Publié: (2025)
Democratizing AI: A Comparative Study in Deep Learning Efficiency and Future Trends in Computational Processing
par: Amin, Lisan Al, et autres
Publié: (2026)
par: Amin, Lisan Al, et autres
Publié: (2026)
MQ-GNN: A Multi-Queue Pipelined Architecture for Scalable and Efficient GNN Training
par: Ullah, Irfan, et autres
Publié: (2026)
par: Ullah, Irfan, et autres
Publié: (2026)
Cost-Efficient LLM Training with Lifetime-Aware Tensor Offloading via GPUDirect Storage
par: Yuan, Ziqi, et autres
Publié: (2025)
par: Yuan, Ziqi, et autres
Publié: (2025)
A 4D Hybrid Algorithm to Scale Parallel Training to Thousands of GPUs
par: Singh, Siddharth, et autres
Publié: (2023)
par: Singh, Siddharth, et autres
Publié: (2023)
Optimizing the Deployment of Tiny Transformers on Low-Power MCUs
par: Jung, Victor J. B., et autres
Publié: (2024)
par: Jung, Victor J. B., et autres
Publié: (2024)
OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization
par: Zhou, Zhongzhu, et autres
Publié: (2026)
par: Zhou, Zhongzhu, et autres
Publié: (2026)
Equilibrium in the Computing Continuum through Active Inference
par: Sedlak, Boris, et autres
Publié: (2023)
par: Sedlak, Boris, et autres
Publié: (2023)
Understanding Inference Scaling for LLMs: Bottlenecks, Trade-offs, and Performance Principles
par: Arif, Moiz, et autres
Publié: (2026)
par: Arif, Moiz, et autres
Publié: (2026)
CoServe: Efficient Collaboration-of-Experts (CoE) Model Inference with Limited Memory
par: Suo, Jiashun, et autres
Publié: (2025)
par: Suo, Jiashun, et autres
Publié: (2025)
Documents similaires
-
An Uncertainty-Aware Resilience Micro-Agent for Causal Observability in the Computing Continuum
par: De Silva, Suvi, et autres
Publié: (2026) -
Edge-First Language Model Inference: Models, Metrics, and Tradeoffs
par: Jang, SiYoung, et autres
Publié: (2025) -
Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques
par: Behera, Adarsh Prasad, et autres
Publié: (2025) -
QPART: Adaptive Model Quantization and Dynamic Workload Balancing for Accuracy-aware Edge Inference
par: Li, Xiangchen, et autres
Publié: (2025) -
Multi-Dimensional Autoscaling of Stream Processing Services on Edge Devices
par: Sedlak, Boris, et autres
Publié: (2025)