EDGE-LLM: Enabling Efficient Large Language Model Adaptation on Edge Devices via Layerwise Unified Compression and Adaptive Layer Tuning and Voting
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yu, Zhongzhi, Wang, Zheng, Li, Yuhan, You, Haoran, Gao, Ruijie, Zhou, Xiaoya, Bommu, Sreenidhi Reedy, Zhao, Yang Katie, Lin, Yingyan Celine |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RingAda: Pipelining Large Model Fine-Tuning on Edge Devices with Scheduled Layer Unfreezing
par: Li, Liang, et autres
Publié: (2025)
par: Li, Liang, et autres
Publié: (2025)
Infer-EDGE: Dynamic DNN Inference Optimization in 'Just-in-time' Edge-AI Implementations
par: Mounesan, Motahare, et autres
Publié: (2025)
par: Mounesan, Motahare, et autres
Publié: (2025)
FDLoRA: Personalized Federated Learning of Large Language Model via Dual LoRA Tuning
par: QI, Jiaxing, et autres
Publié: (2024)
par: QI, Jiaxing, et autres
Publié: (2024)
FedHFT: Efficient Federated Finetuning with Heterogeneous Edge Clients
par: Ilhan, Fatih, et autres
Publié: (2025)
par: Ilhan, Fatih, et autres
Publié: (2025)
A DataOps Toolbox Enabling Continuous Semantic Integration of Devices for Edge-Cloud AI Applications
par: Scrocca, Mario, et autres
Publié: (2025)
par: Scrocca, Mario, et autres
Publié: (2025)
GenAI at the Edge: Comprehensive Survey on Empowering Edge Devices
par: Navardi, Mozhgan, et autres
Publié: (2025)
par: Navardi, Mozhgan, et autres
Publié: (2025)
TSFLora: Token-Compressed Split Fine-Tuning for Wireless Edge Networks
par: Qiang, Xianke, et autres
Publié: (2026)
par: Qiang, Xianke, et autres
Publié: (2026)
Failure-Resilient Distributed Inference with Model Compression over Heterogeneous Edge Devices
par: Wang, Li, et autres
Publié: (2024)
par: Wang, Li, et autres
Publié: (2024)
LayerDAG: A Layerwise Autoregressive Diffusion Model for Directed Acyclic Graph Generation
par: Li, Mufei, et autres
Publié: (2024)
par: Li, Mufei, et autres
Publié: (2024)
ADApt: Edge Device Anomaly Detection and Microservice Replica Prediction
par: Mehran, Narges, et autres
Publié: (2025)
par: Mehran, Narges, et autres
Publié: (2025)
Beyond 2-Edge-Connectivity: Algorithms and Impossibility for Content-Oblivious Leader Election
par: Chang, Yi-Jun, et autres
Publié: (2025)
par: Chang, Yi-Jun, et autres
Publié: (2025)
FourierCompress: Layer-Aware Spectral Activation Compression for Efficient and Accurate Collaborative LLM Inference
par: Ma, Jian, et autres
Publié: (2025)
par: Ma, Jian, et autres
Publié: (2025)
MobiZO: Enabling Efficient LLM Fine-Tuning at the Edge via Inference Engines
par: Gao, Lei, et autres
Publié: (2024)
par: Gao, Lei, et autres
Publié: (2024)
Evaluating Multi-Instance DNN Inferencing on Multiple Accelerators of an Edge Device
par: Tayal, Mumuksh, et autres
Publié: (2025)
par: Tayal, Mumuksh, et autres
Publié: (2025)
SLICE: SLO-Driven Scheduling for LLM Inference on Edge Computing Devices
par: Chow, Will
Publié: (2025)
par: Chow, Will
Publié: (2025)
Heterogeneous Federated Fine-Tuning with Parallel One-Rank Adaptation
par: Zhang, Zikai, et autres
Publié: (2026)
par: Zhang, Zikai, et autres
Publié: (2026)
Characterizing the Performance of Accelerated Jetson Edge Devices for Training Deep Learning Models
par: K., Prashanthi S., et autres
Publié: (2025)
par: K., Prashanthi S., et autres
Publié: (2025)
LIME:Accelerating Collaborative Lossless LLM Inference on Memory-Constrained Edge Devices
par: Sun, Mingyu, et autres
Publié: (2025)
par: Sun, Mingyu, et autres
Publié: (2025)
Improved Decision Module Selection for Hierarchical Inference in Resource-Constrained Edge Devices
par: Behera, Adarsh Prasad, et autres
Publié: (2024)
par: Behera, Adarsh Prasad, et autres
Publié: (2024)
Beyond End-to-End: Dynamic Chain Optimization for Private LLM Adaptation on the Edge
par: Wu, Yebo, et autres
Publié: (2026)
par: Wu, Yebo, et autres
Publié: (2026)
FleetOpt: Analytical Fleet Provisioning for LLM Inference with Compress-and-Route as Implementation Mechanism
par: Chen, Huamin, et autres
Publié: (2026)
par: Chen, Huamin, et autres
Publié: (2026)
Content-Oblivious Leader Election in 2-Edge-Connected Networks
par: Chalopin, Jérémie, et autres
Publié: (2025)
par: Chalopin, Jérémie, et autres
Publié: (2025)
LRScheduler: A Layer-aware and Resource-adaptive Container Scheduler in Edge Computing
par: Tang, Zhiqing, et autres
Publié: (2025)
par: Tang, Zhiqing, et autres
Publié: (2025)
Unleashing the Power of Tree-of-Thoughts for Edge-Enabled AIGC Service Provisioning
par: Liu, Zhang, et autres
Publié: (2026)
par: Liu, Zhang, et autres
Publié: (2026)
NCCLZ: Compression-Enabled GPU Collectives with Decoupled Quantization and Entropy Coding
par: Wang, Jiamin, et autres
Publié: (2026)
par: Wang, Jiamin, et autres
Publié: (2026)
High-Efficiency Split Computing for Cooperative Edge Systems: A Novel Compressed Sensing Bottleneck
par: Zhong, Hailin, et autres
Publié: (2025)
par: Zhong, Hailin, et autres
Publié: (2025)
Will LLMs Scaling Hit the Wall? Breaking Barriers via Distributed Resources on Massive Edge Devices
par: Shen, Tao, et autres
Publié: (2025)
par: Shen, Tao, et autres
Publié: (2025)
Adaptive Device-Edge Collaboration on DNN Inference in AIoT: A Digital Twin-Assisted Approach
par: Hu, Shisheng, et autres
Publié: (2024)
par: Hu, Shisheng, et autres
Publié: (2024)
FlexPie: Accelerate Distributed Inference on Edge Devices with Flexible Combinatorial Optimization[Technical Report]
par: Zhang, Runhua, et autres
Publié: (2025)
par: Zhang, Runhua, et autres
Publié: (2025)
Memory-Efficient Split Federated Learning for LLM Fine-Tuning on Heterogeneous Mobile Devices
par: Chen, Xiaopei, et autres
Publié: (2025)
par: Chen, Xiaopei, et autres
Publié: (2025)
LoRA-C: Parameter-Efficient Fine-Tuning of Robust CNN for IoT Devices
par: Ding, Chuntao, et autres
Publié: (2024)
par: Ding, Chuntao, et autres
Publié: (2024)
KnapsackLB: Enabling Performance-Aware Layer-4 Load Balancing
par: Gandhi, Rohan, et autres
Publié: (2024)
par: Gandhi, Rohan, et autres
Publié: (2024)
Memory-Efficient Federated Fine-Tuning of Large Language Models via Layer Pruning
par: Wu, Yebo, et autres
Publié: (2025)
par: Wu, Yebo, et autres
Publié: (2025)
ChunkFlow: Communication-Aware Chunked Prefetching for Layerwise Offloading in Distributed Diffusion Transformer Inference
par: Meng, Han, et autres
Publié: (2026)
par: Meng, Han, et autres
Publié: (2026)
KV Cache Compression for Inference Efficiency in LLMs: A Review
par: Liu, Yanyu, et autres
Publié: (2025)
par: Liu, Yanyu, et autres
Publié: (2025)
LOw-cOst yet High-Performant Sparse Matrix-Matrix Multiplication on Arm SME Architectures
par: Lei, Kelun, et autres
Publié: (2025)
par: Lei, Kelun, et autres
Publié: (2025)
Token Level Routing Inference System for Edge Devices
par: She, Jianshu, et autres
Publié: (2025)
par: She, Jianshu, et autres
Publié: (2025)
Pico-Cloud: Cloud Infrastructure for Tiny Edge Devices
par: Guri, Mordechai
Publié: (2025)
par: Guri, Mordechai
Publié: (2025)
Bridge the Present and Future: A Cross-Layer Matching Game in Dynamic Cloud-Aided Mobile Edge Networks
par: Qi, Houyi, et autres
Publié: (2023)
par: Qi, Houyi, et autres
Publié: (2023)
FedQuad: Adaptive Layer-wise LoRA Deployment and Activation Quantization for Federated Fine-Tuning
par: Li, Rukuo, et autres
Publié: (2025)
par: Li, Rukuo, et autres
Publié: (2025)
Documents similaires
-
RingAda: Pipelining Large Model Fine-Tuning on Edge Devices with Scheduled Layer Unfreezing
par: Li, Liang, et autres
Publié: (2025) -
Infer-EDGE: Dynamic DNN Inference Optimization in 'Just-in-time' Edge-AI Implementations
par: Mounesan, Motahare, et autres
Publié: (2025) -
FDLoRA: Personalized Federated Learning of Large Language Model via Dual LoRA Tuning
par: QI, Jiaxing, et autres
Publié: (2024) -
FedHFT: Efficient Federated Finetuning with Heterogeneous Edge Clients
par: Ilhan, Fatih, et autres
Publié: (2025) -
A DataOps Toolbox Enabling Continuous Semantic Integration of Devices for Edge-Cloud AI Applications
par: Scrocca, Mario, et autres
Publié: (2025)