A Systematic Evaluation of On-Device LLMs: Quantization, Performance, and Resources
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Song, Qingyu, Liu, Rui, Lin, Wei, Liao, Peiyu, Zhao, Wenqian, Wang, Yiwen, Hu, Shoubo, Jiang, Yining, Long, Mochun, Zhen, Hui-Ling, Jiang, Ning, Yuan, Mingxuan, Xiang, Qiao, Xu, Hong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Innovation Discovery System for Networking Research
par: Zhang, Mengrui, et autres
Publié: (2026)
par: Zhang, Mengrui, et autres
Publié: (2026)
ReThinker: Scientific Reasoning by Rethinking with Guided Reflection and Confidence Control
par: Tang, Zhentao, et autres
Publié: (2026)
par: Tang, Zhentao, et autres
Publié: (2026)
One-Token Rollout: Guiding Supervised Fine-Tuning of LLMs with Policy Gradient
par: Ming, Rui, et autres
Publié: (2025)
par: Ming, Rui, et autres
Publié: (2025)
Inducing Systematicity in Transformers by Attending to Structurally Quantized Embeddings
par: Jiang, Yichen, et autres
Publié: (2024)
par: Jiang, Yichen, et autres
Publié: (2024)
ERVQ: Enhanced Residual Vector Quantization with Intra-and-Inter-Codebook Optimization for Neural Audio Codecs
par: Zheng, Rui-Chen, et autres
Publié: (2024)
par: Zheng, Rui-Chen, et autres
Publié: (2024)
MixPE: Quantization and Hardware Co-design for Efficient LLM Inference
par: Zhang, Yu, et autres
Publié: (2024)
par: Zhang, Yu, et autres
Publié: (2024)
The Regulation of Local Li + Coordination Environment for High‐Performance Quasi‐Solid‐State Polymer Electrolyte
par: Fan Yang, et autres
Publié: (2025)
par: Fan Yang, et autres
Publié: (2025)
A Streamable Neural Audio Codec with Residual Scalar-Vector Quantization for Real-Time Communication
par: Jiang, Xiao-Hang, et autres
Publié: (2025)
par: Jiang, Xiao-Hang, et autres
Publié: (2025)
QFT: Quantized Full-parameter Tuning of LLMs with Affordable Resources
par: Li, Zhikai, et autres
Publié: (2023)
par: Li, Zhikai, et autres
Publié: (2023)
MOSS: Efficient and Accurate FP8 LLM Training with Microscaling and Automatic Scaling
par: Zhang, Yu, et autres
Publié: (2025)
par: Zhang, Yu, et autres
Publié: (2025)
Greening the Grid: Electricity Market Clearing with Consumer-Based Carbon Cost
par: Jiang, Wenqian, et autres
Publié: (2025)
par: Jiang, Wenqian, et autres
Publié: (2025)
Intelligent Icing Detection Model of Wind Turbine Blades Based on SCADA data
par: Jiang, Wenqian, et autres
Publié: (2021)
par: Jiang, Wenqian, et autres
Publié: (2021)
End-to-End On-Device Quantization-Aware Training for LLMs at Inference Cost
par: Tan, Qitao, et autres
Publié: (2025)
par: Tan, Qitao, et autres
Publié: (2025)
SVDq: 1.25-bit and 410x Key Cache Compression for LLM Attention
par: Yankun, Hong, et autres
Publié: (2025)
par: Yankun, Hong, et autres
Publié: (2025)
Resource-Efficient Teleportation of High-Dimensional Quantum Coherence via Initial Phase Engineering
par: Huang, Long, et autres
Publié: (2026)
par: Huang, Long, et autres
Publié: (2026)
Nanoconjugate Improves Cognitive Deficit and Limits the Pathogenic Tau Burden in Okadaic‐Acid‐Induced Alzheimer's Mice
par: Qiuju Liang, et autres
Publié: (2025)
par: Qiuju Liang, et autres
Publié: (2025)
Quantization Meets dLLMs: A Systematic Study of Post-training Quantization for Diffusion LLMs
par: Lin, Haokun, et autres
Publié: (2025)
par: Lin, Haokun, et autres
Publié: (2025)
Empirical Guidelines for Deploying LLMs onto Resource-constrained Edge Devices
par: Qin, Ruiyang, et autres
Publié: (2024)
par: Qin, Ruiyang, et autres
Publié: (2024)
PQD: Post-training Quantization for Efficient Diffusion Models
par: Ye, Jiaojiao, et autres
Publié: (2024)
par: Ye, Jiaojiao, et autres
Publié: (2024)
Embers of Active Galactic Nuclei: Tidal Disruption Events and Quasiperiodic Eruptions
par: Jiang, Ning, et autres
Publié: (2025)
par: Jiang, Ning, et autres
Publié: (2025)
KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference
par: Li, Xing, et autres
Publié: (2025)
par: Li, Xing, et autres
Publié: (2025)
Cell‐Specific Control of Mammalian Gene Expression Using DNA Repair Inducible Ribozyme Switches
par: Jieling Hong, et autres
Publié: (2024)
par: Jieling Hong, et autres
Publié: (2024)
Cell‐Specific Control of Mammalian Gene Expression Using DNA Repair Inducible Ribozyme Switches
par: Jieling Hong, et autres
Publié: (2024)
par: Jieling Hong, et autres
Publié: (2024)
Sharp upper bounds on the $A_α$-spectral radius of graphs
par: Hong, Zhen-Mu, et autres
Publié: (2026)
par: Hong, Zhen-Mu, et autres
Publié: (2026)
On the disjunctive domination numbers of the torus grid graphs
par: Qiao, Zhi, et autres
Publié: (2026)
par: Qiao, Zhi, et autres
Publié: (2026)
BetterV: Controlled Verilog Generation with Discriminative Guidance
par: Pei, Zehua, et autres
Publié: (2024)
par: Pei, Zehua, et autres
Publié: (2024)
Awakening of A Blazar at Redshift 2.7 Temporally Coincident with Arrival of Cospatial Neutrino Event IceCube-201221A
par: Jiang, Xiong, et autres
Publié: (2024)
par: Jiang, Xiong, et autres
Publié: (2024)
HBLLM: Wavelet-Enhanced High-Fidelity 1-Bit Quantization for LLMs
par: Chen, Ningning, et autres
Publié: (2025)
par: Chen, Ningning, et autres
Publié: (2025)
Systematic study of capture thresholds with time dependent Hartree-Fock theory
par: Yao, Hong, et autres
Publié: (2024)
par: Yao, Hong, et autres
Publié: (2024)
Hypercrosslinked porous and coordination polymer materials for electrolyte membranes in lithium‐metal batteries
par: Mochun Zhang, et autres
Publié: (2024)
par: Mochun Zhang, et autres
Publié: (2024)
Certifying Language Model Robustness with Fuzzed Randomized Smoothing: An Efficient Defense Against Backdoor Attacks
par: He, Bowei, et autres
Publié: (2025)
par: He, Bowei, et autres
Publié: (2025)
Uncovering Cross-Objective Interference in Multi-Objective Alignment
par: Lu, Yining, et autres
Publié: (2026)
par: Lu, Yining, et autres
Publié: (2026)
MD-AirComp+: Adaptive Quantization for Blind Massive Digital Over-the-Air Computation
par: Qiao, Li, et autres
Publié: (2026)
par: Qiao, Li, et autres
Publié: (2026)
QKVShare: Quantized KV-Cache Handoff for Multi-Agent On-Device LLMs
par: Honavar, Pratik, et autres
Publié: (2026)
par: Honavar, Pratik, et autres
Publié: (2026)
Beyond Speedup -- Utilizing KV Cache for Sampling and Reasoning
par: Xing, Zeyu, et autres
Publié: (2026)
par: Xing, Zeyu, et autres
Publié: (2026)
Consumer-based Carbon Costs: Integrating Consumer Carbon Preferences in Electricity Markets
par: Jiang, Wenqian, et autres
Publié: (2025)
par: Jiang, Wenqian, et autres
Publié: (2025)
DAQ: Density-Aware Post-Training Weight-Only Quantization For LLMs
par: Luo, Yingsong, et autres
Publié: (2024)
par: Luo, Yingsong, et autres
Publié: (2024)
DemoTuner: Automatic Performance Tuning for Database Management Systems Based on Demonstration Reinforcement Learning
par: Dou, Hui, et autres
Publié: (2025)
par: Dou, Hui, et autres
Publié: (2025)
Quantization-Aware Neuromorphic Architecture for Skin Disease Classification on Resource-Constrained Devices
par: Wang, Haitian, et autres
Publié: (2025)
par: Wang, Haitian, et autres
Publié: (2025)
PSD: Pushing the Pareto Frontier of Diffusion LLMs via Parallel Speculative Decoding
par: Sun, Shengyin, et autres
Publié: (2026)
par: Sun, Shengyin, et autres
Publié: (2026)
Documents similaires
-
Innovation Discovery System for Networking Research
par: Zhang, Mengrui, et autres
Publié: (2026) -
ReThinker: Scientific Reasoning by Rethinking with Guided Reflection and Confidence Control
par: Tang, Zhentao, et autres
Publié: (2026) -
One-Token Rollout: Guiding Supervised Fine-Tuning of LLMs with Policy Gradient
par: Ming, Rui, et autres
Publié: (2025) -
Inducing Systematicity in Transformers by Attending to Structurally Quantized Embeddings
par: Jiang, Yichen, et autres
Publié: (2024) -
ERVQ: Enhanced Residual Vector Quantization with Intra-and-Inter-Codebook Optimization for Neural Audio Codecs
par: Zheng, Rui-Chen, et autres
Publié: (2024)