Scaling Up On-Device LLMs via Active-Weight Swapping Between DRAM and Flash
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jia, Fucheng, Wu, Zewen, Jiang, Shiqi, Jiang, Huiqiang, Zhang, Qianxi, Yang, Yuqing, Liu, Yunxin, Ren, Ju, Zhang, Deyu, Cao, Ting |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Empowering In-Browser Deep Learning Inference on Edge Devices with Just-in-Time Kernel Optimizations
par: Jia, Fucheng, et autres
Publié: (2023)
par: Jia, Fucheng, et autres
Publié: (2023)
Scaling LLM Test-Time Compute with Mobile NPU on Smartphones
par: Hao, Zixu, et autres
Publié: (2025)
par: Hao, Zixu, et autres
Publié: (2025)
AdaNav: Adaptive Reasoning with Uncertainty for Vision-Language Navigation
par: Ding, Xin, et autres
Publié: (2025)
par: Ding, Xin, et autres
Publié: (2025)
Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding
par: Zheng, Yikai, et autres
Publié: (2026)
par: Zheng, Yikai, et autres
Publié: (2026)
Making Every Frame Matter: Continuous Activity Recognition in Streaming Video via Adaptive Video Context Modeling
par: Wu, Hao, et autres
Publié: (2024)
par: Wu, Hao, et autres
Publié: (2024)
KVNAND: Efficient On-Device Large Language Model Inference Using DRAM-Free In-Flash Computing
par: Deng, Lishuo, et autres
Publié: (2025)
par: Deng, Lishuo, et autres
Publié: (2025)
A First Look At Efficient And Secure On-Device LLM Inference Against KV Leakage
par: Yang, Huan, et autres
Publié: (2024)
par: Yang, Huan, et autres
Publié: (2024)
MemCompiler: Compile, Don't Inject -- State-Conditioned Memory for Embodied Agents
par: Ding, Xin, et autres
Publié: (2026)
par: Ding, Xin, et autres
Publié: (2026)
Sculptor: Empowering LLMs with Cognitive Agency via Active Context Management
par: Li, Mo, et autres
Publié: (2025)
par: Li, Mo, et autres
Publié: (2025)
EmbodiSkill: Skill-Aware Reflection for Self-Evolving Embodied Agents
par: Ju, Ruofei, et autres
Publié: (2026)
par: Ju, Ruofei, et autres
Publié: (2026)
Accelerating Prefilling via Decoding-time Contribution Sparsity
par: He, Zhiyuan, et autres
Publié: (2025)
par: He, Zhiyuan, et autres
Publié: (2025)
MTraining: Distributed Dynamic Sparse Attention for Efficient Ultra-Long Context Training
par: Li, Wenxuan, et autres
Publié: (2025)
par: Li, Wenxuan, et autres
Publié: (2025)
MobiFuse: A High-Precision On-device Depth Perception System with Multi-Data Fusion
par: Zhang, Jinrui, et autres
Publié: (2024)
par: Zhang, Jinrui, et autres
Publié: (2024)
SwapNet: Efficient Swapping for DNN Inference on Edge AI Devices Beyond the Memory Budget
par: Wang, Kun, et autres
Publié: (2024)
par: Wang, Kun, et autres
Publié: (2024)
LongLLMLingua: Accelerating and Enhancing LLMs in Long Context Scenarios via Prompt Compression
par: Jiang, Huiqiang, et autres
Publié: (2023)
par: Jiang, Huiqiang, et autres
Publié: (2023)
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling
par: Zhang, Yiqi, et autres
Publié: (2026)
par: Zhang, Yiqi, et autres
Publié: (2026)
FP-Rowhammer: DRAM-Based Device Fingerprinting
par: Venugopalan, Hari, et autres
Publié: (2023)
par: Venugopalan, Hari, et autres
Publié: (2023)
JoyAI-LLM Flash: Advancing Mid-Scale LLMs with Token Efficiency
par: Cai, Aichen, et autres
Publié: (2026)
par: Cai, Aichen, et autres
Publié: (2026)
LeanK: Learnable K Cache Channel Pruning for Efficient Decoding
par: Zhang, Yike, et autres
Publié: (2025)
par: Zhang, Yike, et autres
Publié: (2025)
Revisiting DRAM Read Disturbance: Identifying Inconsistencies Between Experimental Characterization and Device-Level Studies
par: Luo, Haocong, et autres
Publié: (2025)
par: Luo, Haocong, et autres
Publié: (2025)
Settling Weighted Token Swapping up to Algorithmic Barriers
par: Wein, Nicole, et autres
Publié: (2025)
par: Wein, Nicole, et autres
Publié: (2025)
Weisfeiler‐Lehman Kernel Augmented Product Representation for Queries on Large‐Scale BIM Scenes
par: Huiqiang Hu, et autres
Publié: (2025)
par: Huiqiang Hu, et autres
Publié: (2025)
FlashRecovery: Fast and Low-Cost Recovery from Failures for Large-Scale Training of LLMs
par: Zhang, Haijun, et autres
Publié: (2025)
par: Zhang, Haijun, et autres
Publié: (2025)
Distinguishing Translations by Human, NMT, and ChatGPT: A Linguistic and Statistical Approach
par: Jiang, Zhaokun, et autres
Publié: (2023)
par: Jiang, Zhaokun, et autres
Publié: (2023)
Convergences and Divergences between Automatic Assessment and Human Evaluation: Insights from Comparing ChatGPT-Generated Translation and Neural Machine Translation
par: Jiang, Zhaokun, et autres
Publié: (2024)
par: Jiang, Zhaokun, et autres
Publié: (2024)
RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval
par: Liu, Di, et autres
Publié: (2024)
par: Liu, Di, et autres
Publié: (2024)
Uncovering the Role of Initial Saliency in U-Shaped Attention Bias: Scaling Initial Token Weight for Enhanced Long-Text Processing
par: Qiang, Zewen, et autres
Publié: (2025)
par: Qiang, Zewen, et autres
Publié: (2025)
Hardware Co-Design Scaling Laws via Roofline Modelling for On-Device LLMs
par: Sun, Luoyang, et autres
Publié: (2026)
par: Sun, Luoyang, et autres
Publié: (2026)
Position Engineering: Boosting Large Language Models through Positional Information Manipulation
par: He, Zhiyuan, et autres
Publié: (2024)
par: He, Zhiyuan, et autres
Publié: (2024)
An Analytic Model to Determine the Interstitial-Solute Energetics and Underlying Mechanism in Refractory High-Entropy Alloys
par: Zhu, Qianxi, et autres
Publié: (2025)
par: Zhu, Qianxi, et autres
Publié: (2025)
Vec-LUT: Vector Table Lookup for Parallel Ultra-Low-Bit LLM Inference on Edge Devices
par: Li, Xiangyu, et autres
Publié: (2025)
par: Li, Xiangyu, et autres
Publié: (2025)
Zoomer: Adaptive Image Focus Optimization for Black-box MLLM
par: Qian, Jiaxu, et autres
Publié: (2025)
par: Qian, Jiaxu, et autres
Publié: (2025)
ProRe: A Proactive Reward System for GUI Agents via Reasoner-Actor Collaboration
par: Dai, Gaole, et autres
Publié: (2025)
par: Dai, Gaole, et autres
Publié: (2025)
Advancing Mobile GUI Agents: A Verifier-Driven Approach to Practical Deployment
par: Dai, Gaole, et autres
Publié: (2025)
par: Dai, Gaole, et autres
Publié: (2025)
AVA: Towards Agentic Video Analytics with Vision Language Models
par: Yan, Yuxuan, et autres
Publié: (2025)
par: Yan, Yuxuan, et autres
Publié: (2025)
PUDTune: Multi-Level Charging for High-Precision Calibration in Processing-Using-DRAM
par: Kubo, Tatsuya, et autres
Publié: (2025)
par: Kubo, Tatsuya, et autres
Publié: (2025)
SecurityLingua: Efficient Defense of LLM Jailbreak Attacks via Security-Aware Prompt Compression
par: Li, Yucheng, et autres
Publié: (2025)
par: Li, Yucheng, et autres
Publié: (2025)
Mitigate Position Bias in Large Language Models via Scaling a Single Dimension
par: Yu, Yijiong, et autres
Publié: (2024)
par: Yu, Yijiong, et autres
Publié: (2024)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Documents similaires
-
Empowering In-Browser Deep Learning Inference on Edge Devices with Just-in-Time Kernel Optimizations
par: Jia, Fucheng, et autres
Publié: (2023) -
Scaling LLM Test-Time Compute with Mobile NPU on Smartphones
par: Hao, Zixu, et autres
Publié: (2025) -
AdaNav: Adaptive Reasoning with Uncertainty for Vision-Language Navigation
par: Ding, Xin, et autres
Publié: (2025) -
Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding
par: Zheng, Yikai, et autres
Publié: (2026) -
Making Every Frame Matter: Continuous Activity Recognition in Streaming Video via Adaptive Video Context Modeling
par: Wu, Hao, et autres
Publié: (2024)