HCInfer: An Efficient Inference System via Error Compensation for Resource-Constrained Devices
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Shen, Zhuge, Xiangwen, Xu, Zhe, Hu, Yingkun, Yang, Zheng, Liu, Yunhao |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SpecOffload: Unlocking Latent GPU Capacity for LLM Inference on Resource-Constrained Devices
par: Zhuge, Xiangwen, et autres
Publié: (2025)
par: Zhuge, Xiangwen, et autres
Publié: (2025)
Efficient ANN-SNN Conversion with Error Compensation Learning
par: Liu, Chang, et autres
Publié: (2025)
par: Liu, Chang, et autres
Publié: (2025)
Communication-Efficient Distributed Learning with Local Immediate Error Compensation
par: Cheng, Yifei, et autres
Publié: (2024)
par: Cheng, Yifei, et autres
Publié: (2024)
Rethinking Residual Errors in Compensation-based LLM Quantization
par: Li, Shuaiting, et autres
Publié: (2026)
par: Li, Shuaiting, et autres
Publié: (2026)
Efficient Sensor Fusion for Gesture Recognition on Resource-Constrained Devices
par: Bartoli, Pietro, et autres
Publié: (2026)
par: Bartoli, Pietro, et autres
Publié: (2026)
Memory-Efficient Backpropagation for Fine-Tuning LLMs on Resource-Constrained Mobile Devices
par: Song, Congzheng, et autres
Publié: (2025)
par: Song, Congzheng, et autres
Publié: (2025)
Edge Unlearning is Not "on Edge"! An Adaptive Exact Unlearning System on Resource-Constrained Devices
par: Xia, Xiaoyu, et autres
Publié: (2024)
par: Xia, Xiaoyu, et autres
Publié: (2024)
FL-NAS: Towards Fairness of NAS for Resource Constrained Devices via Large Language Models
par: Qin, Ruiyang, et autres
Publié: (2024)
par: Qin, Ruiyang, et autres
Publié: (2024)
Efficient Zero-Order Federated Finetuning of Language Models for Resource-Constrained Devices
par: Ahmed, Mohamed Aboelenien, et autres
Publié: (2025)
par: Ahmed, Mohamed Aboelenien, et autres
Publié: (2025)
NLI:Non-uniform Linear Interpolation Approximation of Nonlinear Operations for Efficient LLMs Inference
par: Yu, Jiangyong, et autres
Publié: (2026)
par: Yu, Jiangyong, et autres
Publié: (2026)
Dynamic Graph Unlearning: A General and Efficient Post-Processing Method via Gradient Transformation
par: Zhang, He, et autres
Publié: (2024)
par: Zhang, He, et autres
Publié: (2024)
ShadowNPU: System and Algorithm Co-design for NPU-Centric On-Device LLM Inference
par: Yin, Wangsong, et autres
Publié: (2025)
par: Yin, Wangsong, et autres
Publié: (2025)
Efficient Resource-Constrained Training of Transformers via Subspace Optimization
par: Nguyen, Le-Trung, et autres
Publié: (2025)
par: Nguyen, Le-Trung, et autres
Publié: (2025)
Efficient Federated Finetuning of Tiny Transformers with Resource-Constrained Devices
par: Pfeiffer, Kilian, et autres
Publié: (2024)
par: Pfeiffer, Kilian, et autres
Publié: (2024)
Efficient Deployment of Large Language Models on Resource-constrained Devices
par: Yao, Zhiwei, et autres
Publié: (2025)
par: Yao, Zhiwei, et autres
Publié: (2025)
Contextual Bandits for Resource-Constrained Devices using Probabilistic Learning
par: Angioli, Marco, et autres
Publié: (2026)
par: Angioli, Marco, et autres
Publié: (2026)
Hardware-Aware Neural Feature Extraction for Resource-Constrained Devices
par: Tosini, Francesco, et autres
Publié: (2026)
par: Tosini, Francesco, et autres
Publié: (2026)
Resource-Efficient Federated Fine-Tuning Large Language Models for Heterogeneous Data
par: Liu, Jun, et autres
Publié: (2025)
par: Liu, Jun, et autres
Publié: (2025)
FedMHO: Heterogeneous One-Shot Federated Learning Towards Resource-Constrained Edge Devices
par: Yao, Dezhong, et autres
Publié: (2025)
par: Yao, Dezhong, et autres
Publié: (2025)
GCoDE: Efficient Device-Edge Co-Inference for GNNs via Architecture-Mapping Co-Search
par: Zhou, Ao, et autres
Publié: (2025)
par: Zhou, Ao, et autres
Publié: (2025)
Steady-State Error Compensation for Reinforcement Learning with Quadratic Rewards
par: Wang, Liyao, et autres
Publié: (2024)
par: Wang, Liyao, et autres
Publié: (2024)
Bandwidth-Efficient Adaptive Mixture-of-Experts via Low-Rank Compensation
par: Liu, Zhenyu, et autres
Publié: (2025)
par: Liu, Zhenyu, et autres
Publié: (2025)
A Novel Hat-Shaped Device-Cloud Collaborative Inference Framework for Large Language Models
par: Xie, Zuan, et autres
Publié: (2025)
par: Xie, Zuan, et autres
Publié: (2025)
Boosted Trees on a Diet: Compact Models for Resource-Constrained Devices
par: Herrmann, Nina, et autres
Publié: (2025)
par: Herrmann, Nina, et autres
Publié: (2025)
RWKV-edge: Deeply Compressed RWKV for Resource-Constrained Devices
par: Choe, Wonkyo, et autres
Publié: (2024)
par: Choe, Wonkyo, et autres
Publié: (2024)
Efficient LLM Jailbreak via Adaptive Dense-to-sparse Constrained Optimization
par: Hu, Kai, et autres
Publié: (2024)
par: Hu, Kai, et autres
Publié: (2024)
Optimizing Language Models for Inference Time Objectives using Reinforcement Learning
par: Tang, Yunhao, et autres
Publié: (2025)
par: Tang, Yunhao, et autres
Publié: (2025)
AdaptiveFL: Adaptive Heterogeneous Federated Learning for Resource-Constrained AIoT Systems
par: Jia, Chentao, et autres
Publié: (2023)
par: Jia, Chentao, et autres
Publié: (2023)
MiLo: Efficient Quantized MoE Inference with Mixture of Low-Rank Compensators
par: Huang, Beichen, et autres
Publié: (2025)
par: Huang, Beichen, et autres
Publié: (2025)
Memory-Efficient Partitioned DNN Inference on Resource-Constrained Android Crowds
par: Manamperi, Lakshani, et autres
Publié: (2026)
par: Manamperi, Lakshani, et autres
Publié: (2026)
Adapter-Augmented Bandits for Online Multi-Constrained Multi-Modal Inference Scheduling
par: Zhang, Xianzhi, et autres
Publié: (2026)
par: Zhang, Xianzhi, et autres
Publié: (2026)
ESFL: Efficient Split Federated Learning over Resource-Constrained Heterogeneous Wireless Devices
par: Zhu, Guangyu, et autres
Publié: (2024)
par: Zhu, Guangyu, et autres
Publié: (2024)
Continual Error Correction on Low-Resource Devices
par: Paramonov, Kirill, et autres
Publié: (2025)
par: Paramonov, Kirill, et autres
Publié: (2025)
SacFL: Self-Adaptive Federated Continual Learning for Resource-Constrained End Devices
par: Zhong, Zhengyi, et autres
Publié: (2025)
par: Zhong, Zhengyi, et autres
Publié: (2025)
Enabling On-Device Learning via Experience Replay with Efficient Dataset Condensation
par: Xu, Gelei, et autres
Publié: (2024)
par: Xu, Gelei, et autres
Publié: (2024)
Graph Neural Networks Automated Design and Deployment on Device-Edge Co-Inference Systems
par: Zhou, Ao, et autres
Publié: (2024)
par: Zhou, Ao, et autres
Publié: (2024)
Accelerating Local LLMs on Resource-Constrained Edge Devices via Distributed Prompt Caching
par: Matsutani, Hiroki, et autres
Publié: (2026)
par: Matsutani, Hiroki, et autres
Publié: (2026)
Communication-Computation Trade-Off in Resource-Constrained Edge Inference
par: Shao, Jiawei, et autres
Publié: (2020)
par: Shao, Jiawei, et autres
Publié: (2020)
A Systematic Evaluation of On-Device LLMs: Quantization, Performance, and Resources
par: Song, Qingyu, et autres
Publié: (2025)
par: Song, Qingyu, et autres
Publié: (2025)
Prada: Black-Box LLM Adaptation with Private Data on Resource-Constrained Devices
par: Wang, Ziyao, et autres
Publié: (2025)
par: Wang, Ziyao, et autres
Publié: (2025)
Documents similaires
-
SpecOffload: Unlocking Latent GPU Capacity for LLM Inference on Resource-Constrained Devices
par: Zhuge, Xiangwen, et autres
Publié: (2025) -
Efficient ANN-SNN Conversion with Error Compensation Learning
par: Liu, Chang, et autres
Publié: (2025) -
Communication-Efficient Distributed Learning with Local Immediate Error Compensation
par: Cheng, Yifei, et autres
Publié: (2024) -
Rethinking Residual Errors in Compensation-based LLM Quantization
par: Li, Shuaiting, et autres
Publié: (2026) -
Efficient Sensor Fusion for Gesture Recognition on Resource-Constrained Devices
par: Bartoli, Pietro, et autres
Publié: (2026)