A Novel Hat-Shaped Device-Cloud Collaborative Inference Framework for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Xie, Zuan, Xu, Yang, Xu, Hongli, Liao, Yunming, Yao, Zhiwei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Efficient Deployment of Large Language Models on Resource-constrained Devices
di: Yao, Zhiwei, et al.
Pubblicazione: (2025)
di: Yao, Zhiwei, et al.
Pubblicazione: (2025)
Lightweight and Post-Training Structured Pruning for On-Device Large Lanaguage Models
di: Xu, Zihuai, et al.
Pubblicazione: (2025)
di: Xu, Zihuai, et al.
Pubblicazione: (2025)
Collaborative Inference for Large Models with Task Offloading and Early Exiting
di: Xie, Zuan, et al.
Pubblicazione: (2024)
di: Xie, Zuan, et al.
Pubblicazione: (2024)
Resource-Efficient Federated Fine-Tuning Large Language Models for Heterogeneous Data
di: Liu, Jun, et al.
Pubblicazione: (2025)
di: Liu, Jun, et al.
Pubblicazione: (2025)
Collaborative Speculative Inference for Efficient LLM Inference Serving
di: Gao, Luyao, et al.
Pubblicazione: (2025)
di: Gao, Luyao, et al.
Pubblicazione: (2025)
MergeSFL: Split Federated Learning with Feature Merging and Batch Size Regulation
di: Liao, Yunming, et al.
Pubblicazione: (2023)
di: Liao, Yunming, et al.
Pubblicazione: (2023)
ParallelSFL: A Novel Split Federated Learning Framework Tackling Heterogeneity Issues
di: Liao, Yunming, et al.
Pubblicazione: (2024)
di: Liao, Yunming, et al.
Pubblicazione: (2024)
SemiSFL: Split Federated Learning on Unlabeled and Non-IID Data
di: Xu, Yang, et al.
Pubblicazione: (2023)
di: Xu, Yang, et al.
Pubblicazione: (2023)
CoFormer: Collaborating with Heterogeneous Edge Devices for Scalable Transformer Inference
di: Xu, Guanyu, et al.
Pubblicazione: (2025)
di: Xu, Guanyu, et al.
Pubblicazione: (2025)
An Efficient Inference Framework for Early-exit Large Language Models
di: Miao, Ruijie, et al.
Pubblicazione: (2024)
di: Miao, Ruijie, et al.
Pubblicazione: (2024)
Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation
di: Zhu, Ying, et al.
Pubblicazione: (2025)
di: Zhu, Ying, et al.
Pubblicazione: (2025)
Lookahead: An Inference Acceleration Framework for Large Language Model with Lossless Generation Accuracy
di: Zhao, Yao, et al.
Pubblicazione: (2023)
di: Zhao, Yao, et al.
Pubblicazione: (2023)
P/D-Device: Disaggregated Large Language Model between Cloud and Devices
di: Jin, Yibo, et al.
Pubblicazione: (2025)
di: Jin, Yibo, et al.
Pubblicazione: (2025)
Personalized Collaborative Fine-Tuning for On-Device Large Language Models
di: Wagner, Nicolas, et al.
Pubblicazione: (2024)
di: Wagner, Nicolas, et al.
Pubblicazione: (2024)
PrivTune: Efficient and Privacy-Preserving Fine-Tuning of Large Language Models via Device-Cloud Collaboration
di: Liu, Yi, et al.
Pubblicazione: (2025)
di: Liu, Yi, et al.
Pubblicazione: (2025)
MNN-LLM: A Generic Inference Engine for Fast Large Language Model Deployment on Mobile Devices
di: Wang, Zhaode, et al.
Pubblicazione: (2025)
di: Wang, Zhaode, et al.
Pubblicazione: (2025)
Large Language Model Unlearning
di: Yao, Yuanshun, et al.
Pubblicazione: (2023)
di: Yao, Yuanshun, et al.
Pubblicazione: (2023)
Collaborative Large Language Model Inference via Resource-Aware Parallel Speculative Decoding
di: Koh, Jungyeon, et al.
Pubblicazione: (2025)
di: Koh, Jungyeon, et al.
Pubblicazione: (2025)
A Robust Federated Learning Framework for Undependable Devices at Scale
di: Wang, Shilong, et al.
Pubblicazione: (2024)
di: Wang, Shilong, et al.
Pubblicazione: (2024)
FedBRB: An Effective Solution to the Small-to-Large Scenario in Device-Heterogeneity Federated Learning
di: Xu, Ziyue, et al.
Pubblicazione: (2024)
di: Xu, Ziyue, et al.
Pubblicazione: (2024)
Accelerating Mixture-of-Expert Inference with Adaptive Expert Split Mechanism
di: Yan, Jiaming, et al.
Pubblicazione: (2025)
di: Yan, Jiaming, et al.
Pubblicazione: (2025)
Collaborative Learning of On-Device Small Model and Cloud-Based Large Model: Advances and Future Directions
di: Niu, Chaoyue, et al.
Pubblicazione: (2025)
di: Niu, Chaoyue, et al.
Pubblicazione: (2025)
Entropy Regularizing Activation: Boosting Continuous Control, Large Language Models, and Image Classification with Activation as Entropy Constraints
di: Kang, Zilin, et al.
Pubblicazione: (2025)
di: Kang, Zilin, et al.
Pubblicazione: (2025)
Understanding Large Language Models in Your Pockets: Performance Study on COTS Mobile Devices
di: Xiao, Jie, et al.
Pubblicazione: (2024)
di: Xiao, Jie, et al.
Pubblicazione: (2024)
HCInfer: An Efficient Inference System via Error Compensation for Resource-Constrained Devices
di: Xu, Shen, et al.
Pubblicazione: (2026)
di: Xu, Shen, et al.
Pubblicazione: (2026)
Data-Free Continual Learning of Server Models in Model-Heterogeneous Cloud-Device Collaboration
di: Zhang, Xiao, et al.
Pubblicazione: (2025)
di: Zhang, Xiao, et al.
Pubblicazione: (2025)
NoWag: A Unified Framework for Shape Preserving Compression of Large Language Models
di: Liu, Lawrence, et al.
Pubblicazione: (2025)
di: Liu, Lawrence, et al.
Pubblicazione: (2025)
Fast Large Language Model Collaborative Decoding via Speculation
di: Fu, Jiale, et al.
Pubblicazione: (2025)
di: Fu, Jiale, et al.
Pubblicazione: (2025)
Toward Inference-optimal Mixture-of-Expert Large Language Models
di: Yun, Longfei, et al.
Pubblicazione: (2024)
di: Yun, Longfei, et al.
Pubblicazione: (2024)
Efficient Federated Fine-Tuning of Large Language Models with Layer Dropout
di: Wang, Shilong, et al.
Pubblicazione: (2025)
di: Wang, Shilong, et al.
Pubblicazione: (2025)
CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing
di: Zheng, Wenhao, et al.
Pubblicazione: (2025)
di: Zheng, Wenhao, et al.
Pubblicazione: (2025)
EntroLLM: Entropy Encoded Weight Compression for Efficient Large Language Model Inference on Edge Devices
di: Sanyal, Arnab, et al.
Pubblicazione: (2025)
di: Sanyal, Arnab, et al.
Pubblicazione: (2025)
MoE$^2$: Optimizing Collaborative Inference for Edge Large Language Models
di: Jin, Lyudong, et al.
Pubblicazione: (2025)
di: Jin, Lyudong, et al.
Pubblicazione: (2025)
Backpropagation-Free Multi-modal On-Device Model Adaptation via Cloud-Device Collaboration
di: Ji, Wei, et al.
Pubblicazione: (2024)
di: Ji, Wei, et al.
Pubblicazione: (2024)
Experts are all you need: A Composable Framework for Large Language Model Inference
di: Sridharan, Shrihari, et al.
Pubblicazione: (2025)
di: Sridharan, Shrihari, et al.
Pubblicazione: (2025)
QuickLLaMA: Query-aware Inference Acceleration for Large Language Models
di: Li, Jingyao, et al.
Pubblicazione: (2024)
di: Li, Jingyao, et al.
Pubblicazione: (2024)
Scaling On-Device GPU Inference for Large Generative Models
di: Tang, Jiuqiang, et al.
Pubblicazione: (2025)
di: Tang, Jiuqiang, et al.
Pubblicazione: (2025)
ABQ-LLM: Arbitrary-Bit Quantized Inference Acceleration for Large Language Models
di: Zeng, Chao, et al.
Pubblicazione: (2024)
di: Zeng, Chao, et al.
Pubblicazione: (2024)
From Supervised to Generative: A Novel Paradigm for Tabular Deep Learning with Large Language Models
di: Wen, Xumeng, et al.
Pubblicazione: (2023)
di: Wen, Xumeng, et al.
Pubblicazione: (2023)
Adaptive Parameter-Efficient Federated Fine-Tuning on Heterogeneous Devices
di: Liu, Jun, et al.
Pubblicazione: (2024)
di: Liu, Jun, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Efficient Deployment of Large Language Models on Resource-constrained Devices
di: Yao, Zhiwei, et al.
Pubblicazione: (2025) -
Lightweight and Post-Training Structured Pruning for On-Device Large Lanaguage Models
di: Xu, Zihuai, et al.
Pubblicazione: (2025) -
Collaborative Inference for Large Models with Task Offloading and Early Exiting
di: Xie, Zuan, et al.
Pubblicazione: (2024) -
Resource-Efficient Federated Fine-Tuning Large Language Models for Heterogeneous Data
di: Liu, Jun, et al.
Pubblicazione: (2025) -
Collaborative Speculative Inference for Efficient LLM Inference Serving
di: Gao, Luyao, et al.
Pubblicazione: (2025)