Large Language Model Partitioning for Low-Latency Inference at the Edge
Fuente:
arXiv
Salvato in:
| Autori principali: | Kafetzis, Dimitrios, Khalili, Ramin, Koutsopoulos, Iordanis |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Collaborative Split Federated Learning with Parallel Training and Aggregation
di: Papageorgiou, Yiannis, et al.
Pubblicazione: (2025)
di: Papageorgiou, Yiannis, et al.
Pubblicazione: (2025)
Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning
di: Xu, Lang, et al.
Pubblicazione: (2025)
di: Xu, Lang, et al.
Pubblicazione: (2025)
On the Impact of White-box Deployment Strategies for Edge AI on Latency and Model Performance
di: Singh, Jaskirat, et al.
Pubblicazione: (2024)
di: Singh, Jaskirat, et al.
Pubblicazione: (2024)
Speculative Decoding in Decentralized LLM Inference: Turning Communication Latency into Computation Throughput
di: Song, Jingwei, et al.
Pubblicazione: (2025)
di: Song, Jingwei, et al.
Pubblicazione: (2025)
Understand and Accelerate Memory Processing Pipeline for Large Language Model Inference
di: He, Zifan, et al.
Pubblicazione: (2026)
di: He, Zifan, et al.
Pubblicazione: (2026)
Vec-LUT: Vector Table Lookup for Parallel Ultra-Low-Bit LLM Inference on Edge Devices
di: Li, Xiangyu, et al.
Pubblicazione: (2025)
di: Li, Xiangyu, et al.
Pubblicazione: (2025)
AI Inference as Relocatable Electricity Demand: A Latency-Constrained Energy-Geography Framework
di: Luo, Xubin, et al.
Pubblicazione: (2026)
di: Luo, Xubin, et al.
Pubblicazione: (2026)
SpecEE: Accelerating Large Language Model Inference with Speculative Early Exiting
di: Xu, Jiaming, et al.
Pubblicazione: (2025)
di: Xu, Jiaming, et al.
Pubblicazione: (2025)
AIBrix: Towards Scalable, Cost-Effective Large Language Model Inference Infrastructure
di: The AIBrix Team, et al.
Pubblicazione: (2025)
di: The AIBrix Team, et al.
Pubblicazione: (2025)
TCM-Serve: Modality-aware Scheduling for Multimodal Large Language Model Inference
di: Papaioannou, Konstantinos, et al.
Pubblicazione: (2026)
di: Papaioannou, Konstantinos, et al.
Pubblicazione: (2026)
HiDP: Hierarchical DNN Partitioning for Distributed Inference on Heterogeneous Edge Platforms
di: Taufique, Zain, et al.
Pubblicazione: (2024)
di: Taufique, Zain, et al.
Pubblicazione: (2024)
StreamServe: Adaptive Speculative Flows for Low-Latency Disaggregated LLM Serving
di: Kumar, Satyam, et al.
Pubblicazione: (2026)
di: Kumar, Satyam, et al.
Pubblicazione: (2026)
Failure-Resilient Distributed Inference with Model Compression over Heterogeneous Edge Devices
di: Wang, Li, et al.
Pubblicazione: (2024)
di: Wang, Li, et al.
Pubblicazione: (2024)
Not All Errors Are Equal: A Systematic Study of Error Propagation in Large Language Model Inference
di: Huang, Yafan, et al.
Pubblicazione: (2026)
di: Huang, Yafan, et al.
Pubblicazione: (2026)
Efficient Federated Finetuning of Tiny Transformers with Resource-Constrained Devices
di: Pfeiffer, Kilian, et al.
Pubblicazione: (2024)
di: Pfeiffer, Kilian, et al.
Pubblicazione: (2024)
FlowKV: A Disaggregated Inference Framework with Low-Latency KV Cache Transfer and Load-Aware Scheduling
di: Li, Weiqing, et al.
Pubblicazione: (2025)
di: Li, Weiqing, et al.
Pubblicazione: (2025)
Profiling-Driven Adaptive Distributed Transformer Inference on Embedded Edge Deployment
di: Qazi, Muhammad Azlan, et al.
Pubblicazione: (2026)
di: Qazi, Muhammad Azlan, et al.
Pubblicazione: (2026)
ECCENTRIC: Edge-Cloud Collaboration Framework for Distributed Inference Using Knowledge Adaptation
di: Kamani, Mohammad Mahdi, et al.
Pubblicazione: (2025)
di: Kamani, Mohammad Mahdi, et al.
Pubblicazione: (2025)
SparOA: Sparse and Operator-aware Hybrid Scheduling for Edge DNN Inference
di: Zhang, Ziyang, et al.
Pubblicazione: (2025)
di: Zhang, Ziyang, et al.
Pubblicazione: (2025)
Hardware Utilization and Inference Performance of Edge Object Detection Under Fault Injection
di: Pasandideh, Faezeh, et al.
Pubblicazione: (2026)
di: Pasandideh, Faezeh, et al.
Pubblicazione: (2026)
Hermes: Memory-Efficient Pipeline Inference for Large Models on Edge Devices
di: Han, Xueyuan, et al.
Pubblicazione: (2024)
di: Han, Xueyuan, et al.
Pubblicazione: (2024)
Memory Offloading for Large Language Model Inference with Latency SLO Guarantees
di: Ma, Chenxiang, et al.
Pubblicazione: (2025)
di: Ma, Chenxiang, et al.
Pubblicazione: (2025)
A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems
di: Wu, Qi, et al.
Pubblicazione: (2026)
di: Wu, Qi, et al.
Pubblicazione: (2026)
Distributed Inference on Mobile Edge and Cloud: A Data-Cartography based Clustering Approach
di: Bajpai, Divya Jyoti, et al.
Pubblicazione: (2024)
di: Bajpai, Divya Jyoti, et al.
Pubblicazione: (2024)
ELANA: A Simple Energy and Latency Analyzer for LLMs
di: Chiang, Hung-Yueh, et al.
Pubblicazione: (2025)
di: Chiang, Hung-Yueh, et al.
Pubblicazione: (2025)
Shard the Gradient, Scale the Model: Serverless Federated Aggregation via Gradient Partitioning
di: Barrak, Amine
Pubblicazione: (2026)
di: Barrak, Amine
Pubblicazione: (2026)
T-MAC: CPU Renaissance via Table Lookup for Low-Bit LLM Deployment on Edge
di: Wei, Jianyu, et al.
Pubblicazione: (2024)
di: Wei, Jianyu, et al.
Pubblicazione: (2024)
Compass: A Decentralized Scheduler for Latency-Sensitive ML Workflows
di: Yang, Yuting, et al.
Pubblicazione: (2024)
di: Yang, Yuting, et al.
Pubblicazione: (2024)
ServerlessLLM: Low-Latency Serverless Inference for Large Language Models
di: Fu, Yao, et al.
Pubblicazione: (2024)
di: Fu, Yao, et al.
Pubblicazione: (2024)
Scaling Performance of Large Language Model Pretraining
di: Interrante-Grant, Alexander, et al.
Pubblicazione: (2025)
di: Interrante-Grant, Alexander, et al.
Pubblicazione: (2025)
A Scalable NorthPole System with End-to-End Vertical Integration for Low-Latency and Energy-Efficient LLM Inference
di: DeBole, Michael V., et al.
Pubblicazione: (2025)
di: DeBole, Michael V., et al.
Pubblicazione: (2025)
QPART: Adaptive Model Quantization and Dynamic Workload Balancing for Accuracy-aware Edge Inference
di: Li, Xiangchen, et al.
Pubblicazione: (2025)
di: Li, Xiangchen, et al.
Pubblicazione: (2025)
Remoe: Towards Efficient and Low-Cost MoE Inference in Serverless Computing
di: Liu, Wentao, et al.
Pubblicazione: (2025)
di: Liu, Wentao, et al.
Pubblicazione: (2025)
Hierarchical Autoscaling for Large Language Model Serving with Chiron
di: Patke, Archit, et al.
Pubblicazione: (2025)
di: Patke, Archit, et al.
Pubblicazione: (2025)
Can Large Language Models Write Parallel Code?
di: Nichols, Daniel, et al.
Pubblicazione: (2024)
di: Nichols, Daniel, et al.
Pubblicazione: (2024)
Efficient Multi-Model Orchestration for Self-Hosted Large Language Models
di: Vangala, Bhanu Prakash, et al.
Pubblicazione: (2025)
di: Vangala, Bhanu Prakash, et al.
Pubblicazione: (2025)
HPC-Coder: Modeling Parallel Programs using Large Language Models
di: Nichols, Daniel, et al.
Pubblicazione: (2023)
di: Nichols, Daniel, et al.
Pubblicazione: (2023)
Latency-Aware 2-Opt Monotonic Local Search for Distributed Constraint Optimization
di: Rachmut, Ben, et al.
Pubblicazione: (2025)
di: Rachmut, Ben, et al.
Pubblicazione: (2025)
Equinox: Holistic Fair Scheduling in Serving Large Language Models
di: Wei, Zhixiang, et al.
Pubblicazione: (2025)
di: Wei, Zhixiang, et al.
Pubblicazione: (2025)
Accelerating Edge Inference for Distributed MoE Models with Latency-Optimized Expert Placement
di: Wu, Tian, et al.
Pubblicazione: (2025)
di: Wu, Tian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Collaborative Split Federated Learning with Parallel Training and Aggregation
di: Papageorgiou, Yiannis, et al.
Pubblicazione: (2025) -
Scaling Large Language Model Training on Frontier with Low-Bandwidth Partitioning
di: Xu, Lang, et al.
Pubblicazione: (2025) -
On the Impact of White-box Deployment Strategies for Edge AI on Latency and Model Performance
di: Singh, Jaskirat, et al.
Pubblicazione: (2024) -
Speculative Decoding in Decentralized LLM Inference: Turning Communication Latency into Computation Throughput
di: Song, Jingwei, et al.
Pubblicazione: (2025) -
Understand and Accelerate Memory Processing Pipeline for Large Language Model Inference
di: He, Zifan, et al.
Pubblicazione: (2026)