A Survey of Resource-efficient LLM and Multimodal Foundation Models
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Mengwei, Yin, Wangsong, Cai, Dongqi, Yi, Rongjie, Xu, Daliang, Wang, Qipeng, Wu, Bingyang, Zhao, Yihao, Yang, Chen, Wang, Shihe, Zhang, Qiyang, Lu, Zhenyan, Zhang, Li, Wang, Shangguang, Li, Yuanchun, Liu, Yunxin, Jin, Xin, Liu, Xuanzhe |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MobiEdit: Resource-efficient Knowledge Editing for Personalized On-device LLMs
by: Lu, Zhenyan, et al.
Published: (2025)
by: Lu, Zhenyan, et al.
Published: (2025)
Elastic On-Device LLM Service
by: Yin, Wangsong, et al.
Published: (2024)
by: Yin, Wangsong, et al.
Published: (2024)
LLM as a System Service on Mobile Devices
by: Yin, Wangsong, et al.
Published: (2024)
by: Yin, Wangsong, et al.
Published: (2024)
ShadowNPU: System and Algorithm Co-design for NPU-Centric On-Device LLM Inference
by: Yin, Wangsong, et al.
Published: (2025)
by: Yin, Wangsong, et al.
Published: (2025)
Recall: Empowering Multimodal Embedding for Edge Devices
by: Cai, Dongqi, et al.
Published: (2024)
by: Cai, Dongqi, et al.
Published: (2024)
MobileViews: A Million-scale and Diverse Mobile GUI Dataset
by: Gao, Longxi, et al.
Published: (2024)
by: Gao, Longxi, et al.
Published: (2024)
Small Language Models: Survey, Measurements, and Insights
by: Lu, Zhenyan, et al.
Published: (2024)
by: Lu, Zhenyan, et al.
Published: (2024)
DroidCall: A Dataset for LLM-powered Android Intent Invocation
by: Xie, Weikai, et al.
Published: (2024)
by: Xie, Weikai, et al.
Published: (2024)
Resource-efficient In-orbit Detection of Earth Objects
by: Zhang, Qiyang, et al.
Published: (2024)
by: Zhang, Qiyang, et al.
Published: (2024)
Mobile Foundation Model as Firmware
by: Yuan, Jinliang, et al.
Published: (2023)
by: Yuan, Jinliang, et al.
Published: (2023)
PhoneLM:an Efficient and Capable Small Language Model Family through Principled Pre-training
by: Yi, Rongjie, et al.
Published: (2024)
by: Yi, Rongjie, et al.
Published: (2024)
FwdLLM: Efficient FedLLM using Forward Gradient
by: Xu, Mengwei, et al.
Published: (2023)
by: Xu, Mengwei, et al.
Published: (2023)
Fast On-device LLM Inference with NPUs
by: Xu, Daliang, et al.
Published: (2024)
by: Xu, Daliang, et al.
Published: (2024)
FedMoE: Personalized Federated Learning via Heterogeneous Mixture of Experts
by: Mei, Hanzi, et al.
Published: (2024)
by: Mei, Hanzi, et al.
Published: (2024)
FedRDMA: Communication-Efficient Cross-Silo Federated LLM via Chunked RDMA Transmission
by: Zhang, Zeling, et al.
Published: (2024)
by: Zhang, Zeling, et al.
Published: (2024)
EdgeMoE: Empowering Sparse Large Language Models on Mobile Devices
by: Yi, Rongjie, et al.
Published: (2023)
by: Yi, Rongjie, et al.
Published: (2023)
LlamaTouch: A Faithful and Scalable Testbed for Mobile UI Task Automation
by: Zhang, Li, et al.
Published: (2024)
by: Zhang, Li, et al.
Published: (2024)
Accelerating Mobile Language Model via Speculative Decoding and NPU-Coordinated Execution
by: Chen, Zhiyang, et al.
Published: (2025)
by: Chen, Zhiyang, et al.
Published: (2025)
Accelerating Vertical Federated Learning
by: Cai, Dongqi, et al.
Published: (2022)
by: Cai, Dongqi, et al.
Published: (2022)
Anatomizing Deep Learning Inference in Web Browsers
by: Wang, Qipeng, et al.
Published: (2024)
by: Wang, Qipeng, et al.
Published: (2024)
LoRASuite: Efficient LoRA Adaptation Across Large Language Model Upgrades
by: Li, Yanan, et al.
Published: (2025)
by: Li, Yanan, et al.
Published: (2025)
NanoSpec: Accelerating Speculative Decoding using Minimalist In-Context Vocabularies
by: Chen, Zhiyang, et al.
Published: (2026)
by: Chen, Zhiyang, et al.
Published: (2026)
Deciphering the Enigma of Satellite Computing with COTS Devices: Measurement and Analysis
by: Xing, Ruolin, et al.
Published: (2024)
by: Xing, Ruolin, et al.
Published: (2024)
A First Look At Efficient And Secure On-Device LLM Inference Against KV Leakage
by: Yang, Huan, et al.
Published: (2024)
by: Yang, Huan, et al.
Published: (2024)
SeaLLM: Service-Aware and Latency-Optimized Resource Sharing for Large Language Model Inference
by: Zhao, Yihao, et al.
Published: (2025)
by: Zhao, Yihao, et al.
Published: (2025)
Personal LLM Agents: Insights and Survey about the Capability, Efficiency and Security
by: Li, Yuanchun, et al.
Published: (2024)
by: Li, Yuanchun, et al.
Published: (2024)
Quant.npu: Enabling Efficient Mobile NPU Inference for on-device LLMs via Fully Static Quantization
by: Zhang, Jinghe, et al.
Published: (2026)
by: Zhang, Jinghe, et al.
Published: (2026)
LoRA-Switch: Boosting the Efficiency of Dynamic LLM Adapters via System-Algorithm Co-design
by: Kong, Rui, et al.
Published: (2024)
by: Kong, Rui, et al.
Published: (2024)
SCOPE: Performance Testing for Serverless Computing
by: Wen, Jinfeng, et al.
Published: (2023)
by: Wen, Jinfeng, et al.
Published: (2023)
A Comprehensive Survey on Orbital Edge Computing: Systems, Applications, and Algorithms
by: Wu, Changhao, et al.
Published: (2023)
by: Wu, Changhao, et al.
Published: (2023)
FOOL: Addressing the Downlink Bottleneck in Satellite Computing with Neural Feature Compression
by: Furutanpey, Alireza, et al.
Published: (2024)
by: Furutanpey, Alireza, et al.
Published: (2024)
Research on WebAssembly Runtimes: A Survey
by: Zhang, Yixuan, et al.
Published: (2024)
by: Zhang, Yixuan, et al.
Published: (2024)
Collaborative Inference in DNN-based Satellite Systems with Dynamic Task Streams
by: Guan, Jinglong, et al.
Published: (2023)
by: Guan, Jinglong, et al.
Published: (2023)
KVShare: An LLM Service System with Efficient and Effective Multi-Tenant KV Cache Reuse
by: Yang, Huan, et al.
Published: (2025)
by: Yang, Huan, et al.
Published: (2025)
MCPWorld: A Unified Benchmarking Testbed for API, GUI, and Hybrid Computer Use Agents
by: Yan, Yunhe, et al.
Published: (2025)
by: Yan, Yunhe, et al.
Published: (2025)
LoongServe: Efficiently Serving Long-Context Large Language Models with Elastic Sequence Parallelism
by: Wu, Bingyang, et al.
Published: (2024)
by: Wu, Bingyang, et al.
Published: (2024)
More is Different: Prototyping and Analyzing a New Form of Edge Server with Massive Mobile SoCs
by: Zhang, Li, et al.
Published: (2022)
by: Zhang, Li, et al.
Published: (2022)
Mobile-Bench-v2: A More Realistic and Comprehensive Benchmark for VLM-based Mobile Agents
by: Xu, Weikai, et al.
Published: (2025)
by: Xu, Weikai, et al.
Published: (2025)
ParaThinker: Native Parallel Thinking as a New Paradigm to Scale LLM Test-time Compute
by: Wen, Hao, et al.
Published: (2025)
by: Wen, Hao, et al.
Published: (2025)
Region-based Content Enhancement for Efficient Video Analytics at the Edge
by: Wang, Weijun, et al.
Published: (2024)
by: Wang, Weijun, et al.
Published: (2024)
Similar Items
-
MobiEdit: Resource-efficient Knowledge Editing for Personalized On-device LLMs
by: Lu, Zhenyan, et al.
Published: (2025) -
Elastic On-Device LLM Service
by: Yin, Wangsong, et al.
Published: (2024) -
LLM as a System Service on Mobile Devices
by: Yin, Wangsong, et al.
Published: (2024) -
ShadowNPU: System and Algorithm Co-design for NPU-Centric On-Device LLM Inference
by: Yin, Wangsong, et al.
Published: (2025) -
Recall: Empowering Multimodal Embedding for Edge Devices
by: Cai, Dongqi, et al.
Published: (2024)