Efficient Deployment of Large Language Models on Resource-constrained Devices
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yao, Zhiwei, Xu, Yang, Xu, Hongli, Liao, Yunming, Xie, Zuan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Collaborative Inference for Large Models with Task Offloading and Early Exiting
von: Xie, Zuan, et al.
Veröffentlicht: (2024)
von: Xie, Zuan, et al.
Veröffentlicht: (2024)
Adaptive Parameter-Efficient Federated Fine-Tuning on Heterogeneous Devices
von: Liu, Jun, et al.
Veröffentlicht: (2024)
von: Liu, Jun, et al.
Veröffentlicht: (2024)
Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation
von: Zhu, Ying, et al.
Veröffentlicht: (2025)
von: Zhu, Ying, et al.
Veröffentlicht: (2025)
Efficient Federated Fine-Tuning of Large Language Models with Layer Dropout
von: Wang, Shilong, et al.
Veröffentlicht: (2025)
von: Wang, Shilong, et al.
Veröffentlicht: (2025)
ParallelSFL: A Novel Split Federated Learning Framework Tackling Heterogeneity Issues
von: Liao, Yunming, et al.
Veröffentlicht: (2024)
von: Liao, Yunming, et al.
Veröffentlicht: (2024)
Challenges in Deploying Long-Context Transformers: A Theoretical Peak Performance Analysis
von: Fu, Yao
Veröffentlicht: (2024)
von: Fu, Yao
Veröffentlicht: (2024)
Fisher Information-based Efficient Curriculum Federated Learning with Large Language Models
von: Liu, Ji, et al.
Veröffentlicht: (2024)
von: Liu, Ji, et al.
Veröffentlicht: (2024)
Collaborative Speculative Inference for Efficient LLM Inference Serving
von: Gao, Luyao, et al.
Veröffentlicht: (2025)
von: Gao, Luyao, et al.
Veröffentlicht: (2025)
FinGPT-HPC: Efficient Pretraining and Finetuning Large Language Models for Financial Applications with High-Performance Computing
von: Liu, Xiao-Yang, et al.
Veröffentlicht: (2024)
von: Liu, Xiao-Yang, et al.
Veröffentlicht: (2024)
MergeSFL: Split Federated Learning with Feature Merging and Batch Size Regulation
von: Liao, Yunming, et al.
Veröffentlicht: (2023)
von: Liao, Yunming, et al.
Veröffentlicht: (2023)
ReaL: Efficient RLHF Training of Large Language Models with Parameter Reallocation
von: Mei, Zhiyu, et al.
Veröffentlicht: (2024)
von: Mei, Zhiyu, et al.
Veröffentlicht: (2024)
SemiSFL: Split Federated Learning on Unlabeled and Non-IID Data
von: Xu, Yang, et al.
Veröffentlicht: (2023)
von: Xu, Yang, et al.
Veröffentlicht: (2023)
DLoRA: Distributed Parameter-Efficient Fine-Tuning Solution for Large Language Model
von: Gao, Chao, et al.
Veröffentlicht: (2024)
von: Gao, Chao, et al.
Veröffentlicht: (2024)
FedMHO: Heterogeneous One-Shot Federated Learning Towards Resource-Constrained Edge Devices
von: Yao, Dezhong, et al.
Veröffentlicht: (2025)
von: Yao, Dezhong, et al.
Veröffentlicht: (2025)
Federated Fine-Tuning of Sparsely-Activated Large Language Models on Resource-Constrained Devices
von: Chen, Fahao, et al.
Veröffentlicht: (2025)
von: Chen, Fahao, et al.
Veröffentlicht: (2025)
SFPrompt: Communication-Efficient Split Federated Fine-Tuning for Large Pre-Trained Models over Resource-Limited Devices
von: Cao, Linxiao, et al.
Veröffentlicht: (2024)
von: Cao, Linxiao, et al.
Veröffentlicht: (2024)
OpenMoE: An Early Effort on Open Mixture-of-Experts Language Models
von: Xue, Fuzhao, et al.
Veröffentlicht: (2024)
von: Xue, Fuzhao, et al.
Veröffentlicht: (2024)
FedSEA-LLaMA: A Secure, Efficient and Adaptive Federated Splitting Framework for Large Language Models
von: Zhang, Zishuai, et al.
Veröffentlicht: (2025)
von: Zhang, Zishuai, et al.
Veröffentlicht: (2025)
PHOTON: Hierarchical Autoregressive Modeling for Lightspeed and Memory-Efficient Language Generation
von: Ichikawa, Yuma, et al.
Veröffentlicht: (2025)
von: Ichikawa, Yuma, et al.
Veröffentlicht: (2025)
Efficient Federated Finetuning of Tiny Transformers with Resource-Constrained Devices
von: Pfeiffer, Kilian, et al.
Veröffentlicht: (2024)
von: Pfeiffer, Kilian, et al.
Veröffentlicht: (2024)
Hermes: Memory-Efficient Pipeline Inference for Large Models on Edge Devices
von: Han, Xueyuan, et al.
Veröffentlicht: (2024)
von: Han, Xueyuan, et al.
Veröffentlicht: (2024)
FourierMoE: Fourier Mixture-of-Experts Adaptation of Large Language Models
von: Jiang, Juyong, et al.
Veröffentlicht: (2026)
von: Jiang, Juyong, et al.
Veröffentlicht: (2026)
A Sparsity Predicting Approach for Large Language Models via Activation Pattern Clustering
von: Dhar, Nobel, et al.
Veröffentlicht: (2025)
von: Dhar, Nobel, et al.
Veröffentlicht: (2025)
P/D-Device: Disaggregated Large Language Model between Cloud and Devices
von: Jin, Yibo, et al.
Veröffentlicht: (2025)
von: Jin, Yibo, et al.
Veröffentlicht: (2025)
Toward Sustainable GenAI using Generation Directives for Carbon-Friendly Large Language Model Inference
von: Li, Baolin, et al.
Veröffentlicht: (2024)
von: Li, Baolin, et al.
Veröffentlicht: (2024)
Collaboration of Large Language Models and Small Recommendation Models for Device-Cloud Recommendation
von: Lv, Zheqi, et al.
Veröffentlicht: (2025)
von: Lv, Zheqi, et al.
Veröffentlicht: (2025)
Adaptive and Resource-efficient Agentic AI Systems for Mobile and Embedded Devices: A Survey
von: Liu, Sicong, et al.
Veröffentlicht: (2025)
von: Liu, Sicong, et al.
Veröffentlicht: (2025)
Epistemic Observability in Language Models
von: Mason, Tony, et al.
Veröffentlicht: (2026)
von: Mason, Tony, et al.
Veröffentlicht: (2026)
AdaptSFL: Adaptive Split Federated Learning in Resource-constrained Edge Networks
von: Lin, Zheng, et al.
Veröffentlicht: (2024)
von: Lin, Zheng, et al.
Veröffentlicht: (2024)
Systems and Algorithms for Convolutional Multi-Hybrid Language Models at Scale
von: Ku, Jerome, et al.
Veröffentlicht: (2025)
von: Ku, Jerome, et al.
Veröffentlicht: (2025)
Piper: Efficient Large-Scale MoE Training via Resource Modeling and Pipelined Hybrid Parallelism
von: Dash, Sajal, et al.
Veröffentlicht: (2026)
von: Dash, Sajal, et al.
Veröffentlicht: (2026)
Adaptive Fault Tolerance Mechanisms of Large Language Models in Cloud Computing Environments
von: Jin, Yihong, et al.
Veröffentlicht: (2025)
von: Jin, Yihong, et al.
Veröffentlicht: (2025)
DySTop
von: Shi, Yizhou, et al.
Veröffentlicht: (2025)
von: Shi, Yizhou, et al.
Veröffentlicht: (2025)
Minions: Cost-efficient Collaboration Between On-device and Cloud Language Models
von: Narayan, Avanika, et al.
Veröffentlicht: (2025)
von: Narayan, Avanika, et al.
Veröffentlicht: (2025)
Characterizing and Understanding Energy Footprint and Efficiency of Small Language Model on Edges
von: Islam, Md Romyull, et al.
Veröffentlicht: (2025)
von: Islam, Md Romyull, et al.
Veröffentlicht: (2025)
Echo: Efficient Co-Scheduling of Hybrid Online-Offline Tasks for Large Language Model Serving
von: Wang, Zhibin, et al.
Veröffentlicht: (2025)
von: Wang, Zhibin, et al.
Veröffentlicht: (2025)
Taming the Titans: A Survey of Efficient LLM Inference Serving
von: Zhen, Ranran, et al.
Veröffentlicht: (2025)
von: Zhen, Ranran, et al.
Veröffentlicht: (2025)
SPD: Sync-Point Drop for Efficient Tensor Parallelism of Large Language Models
von: Kim, Han-Byul, et al.
Veröffentlicht: (2025)
von: Kim, Han-Byul, et al.
Veröffentlicht: (2025)
Deploying Foundation Model Powered Agent Services: A Survey
von: Xu, Wenchao, et al.
Veröffentlicht: (2024)
von: Xu, Wenchao, et al.
Veröffentlicht: (2024)
RLinf: Flexible and Efficient Large-scale Reinforcement Learning via Macro-to-Micro Flow Transformation
von: Yu, Chao, et al.
Veröffentlicht: (2025)
von: Yu, Chao, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Collaborative Inference for Large Models with Task Offloading and Early Exiting
von: Xie, Zuan, et al.
Veröffentlicht: (2024) -
Adaptive Parameter-Efficient Federated Fine-Tuning on Heterogeneous Devices
von: Liu, Jun, et al.
Veröffentlicht: (2024) -
Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation
von: Zhu, Ying, et al.
Veröffentlicht: (2025) -
Efficient Federated Fine-Tuning of Large Language Models with Layer Dropout
von: Wang, Shilong, et al.
Veröffentlicht: (2025) -
ParallelSFL: A Novel Split Federated Learning Framework Tackling Heterogeneity Issues
von: Liao, Yunming, et al.
Veröffentlicht: (2024)