Transformer-Lite: High-efficiency Deployment of Large Language Models on Mobile Phone GPUs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Luchang, Qian, Sheng, Lu, Jie, Yuan, Lunxi, Wang, Rui, Xie, Qin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can Large Language Models Understand DL-Lite Ontologies? An Empirical Study
par: Wang, Keyu, et autres
Publié: (2024)
par: Wang, Keyu, et autres
Publié: (2024)
LSAQ: Layer-Specific Adaptive Quantization for Large Language Model Deployment
par: Zeng, Binrui, et autres
Publié: (2024)
par: Zeng, Binrui, et autres
Publié: (2024)
FlashDecoding++: Faster Large Language Model Inference on GPUs
par: Hong, Ke, et autres
Publié: (2023)
par: Hong, Ke, et autres
Publié: (2023)
PhoneLM:an Efficient and Capable Small Language Model Family through Principled Pre-training
par: Yi, Rongjie, et autres
Publié: (2024)
par: Yi, Rongjie, et autres
Publié: (2024)
Graph Integrated Language Transformers for Next Action Prediction in Complex Phone Calls
par: Marani, Amin Hosseiny, et autres
Publié: (2024)
par: Marani, Amin Hosseiny, et autres
Publié: (2024)
Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone
par: Abdin, Marah, et autres
Publié: (2024)
par: Abdin, Marah, et autres
Publié: (2024)
Comparison of Large Language Models for Deployment Requirements
par: Yaman, Alper, et autres
Publié: (2025)
par: Yaman, Alper, et autres
Publié: (2025)
LIMP: Large Language Model Enhanced Intent-aware Mobility Prediction
par: Li, Songwei, et autres
Publié: (2024)
par: Li, Songwei, et autres
Publié: (2024)
A Review of Integrating Mobile Phones for Language Learning
par: Darmi, Ramiza, et autres
Publié: (2014)
par: Darmi, Ramiza, et autres
Publié: (2014)
LLMCBench: Benchmarking Large Language Model Compression for Efficient Deployment
par: Yang, Ge, et autres
Publié: (2024)
par: Yang, Ge, et autres
Publié: (2024)
A Foundational Individual Mobility Prediction Model based on Open-Source Large Language Models
par: Qin, Zhenlin, et autres
Publié: (2025)
par: Qin, Zhenlin, et autres
Publié: (2025)
RadLite: Multi-Task LoRA Fine-Tuning of Small Language Models for CPU-Deployable Radiology AI
par: Gupta, Pankaj, et autres
Publié: (2026)
par: Gupta, Pankaj, et autres
Publié: (2026)
Are Large Language Models Economically Viable for Industry Deployment?
par: Mohammad, Abdullah, et autres
Publié: (2026)
par: Mohammad, Abdullah, et autres
Publié: (2026)
PhoneWorld: Scaling Phone-Use Agent Environments
par: Tang, Zhengyang, et autres
Publié: (2026)
par: Tang, Zhengyang, et autres
Publié: (2026)
LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents
par: Peng, Xiaoxuan, et autres
Publié: (2026)
par: Peng, Xiaoxuan, et autres
Publié: (2026)
Efficient Deployment of Large Language Models on Resource-constrained Devices
par: Yao, Zhiwei, et autres
Publié: (2025)
par: Yao, Zhiwei, et autres
Publié: (2025)
Evaluating Accounting Reasoning Capabilities of Large Language Models
par: Zhou, Jie, et autres
Publié: (2026)
par: Zhou, Jie, et autres
Publié: (2026)
Pretraining A Large Language Model using Distributed GPUs: A Memory-Efficient Decentralized Paradigm
par: Zhang, Jinrui, et autres
Publié: (2026)
par: Zhang, Jinrui, et autres
Publié: (2026)
Arena-Lite: Efficient and Reliable Large Language Model Evaluation via Tournament-Based Direct Comparisons
par: Son, Seonil, et autres
Publié: (2024)
par: Son, Seonil, et autres
Publié: (2024)
Controlled Low-Rank Adaptation with Subspace Regularization for Continued Training on Large Language Models
par: Lu, Yuheng, et autres
Publié: (2024)
par: Lu, Yuheng, et autres
Publié: (2024)
Culture-Aware Machine Translation in Large Language Models: Benchmarking and Investigation
par: Yuan, Zekun, et autres
Publié: (2026)
par: Yuan, Zekun, et autres
Publié: (2026)
InsCL: A Data-efficient Continual Learning Paradigm for Fine-tuning Large Language Models with Instructions
par: Wang, Yifan, et autres
Publié: (2024)
par: Wang, Yifan, et autres
Publié: (2024)
Unveiling Super Experts in Mixture-of-Experts Large Language Models
par: Su, Zunhai, et autres
Publié: (2025)
par: Su, Zunhai, et autres
Publié: (2025)
Steering Evaluation-Aware Language Models to Act Like They Are Deployed
par: Hua, Tim Tian, et autres
Publié: (2025)
par: Hua, Tim Tian, et autres
Publié: (2025)
DACP: Domain-Adaptive Continual Pre-Training of Large Language Models for Phone Conversation Summarization
par: Fu, Xue-Yong, et autres
Publié: (2025)
par: Fu, Xue-Yong, et autres
Publié: (2025)
Text Data Augmentation for Large Language Models: A Comprehensive Survey of Methods, Challenges, and Opportunities
par: Chai, Yaping, et autres
Publié: (2025)
par: Chai, Yaping, et autres
Publié: (2025)
ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models
par: Chen, Guiming Hardy, et autres
Publié: (2024)
par: Chen, Guiming Hardy, et autres
Publié: (2024)
Deploying Multi-task Online Server with Large Language Model
par: Qu, Yincen, et autres
Publié: (2024)
par: Qu, Yincen, et autres
Publié: (2024)
PRiSM: Benchmarking Phone Realization in Speech Models
par: Bharadwaj, Shikhar, et autres
Publié: (2026)
par: Bharadwaj, Shikhar, et autres
Publié: (2026)
Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input
par: Li, Chenxu, et autres
Publié: (2025)
par: Li, Chenxu, et autres
Publié: (2025)
Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs
par: Sun, Hao, et autres
Publié: (2025)
par: Sun, Hao, et autres
Publié: (2025)
XTRUST: On the Multilingual Trustworthiness of Large Language Models
par: Li, Yahan, et autres
Publié: (2024)
par: Li, Yahan, et autres
Publié: (2024)
Leveraging Large Language Models for Risk Assessment in Hyperconnected Logistic Hub Network Deployment
par: Quan, Yinzhu, et autres
Publié: (2025)
par: Quan, Yinzhu, et autres
Publié: (2025)
Depression Detection on Social Media with Large Language Models
par: Lan, Xiaochong, et autres
Publié: (2024)
par: Lan, Xiaochong, et autres
Publié: (2024)
SciDaSynth: Interactive Structured Data Extraction from Scientific Literature with Large Language Model
par: Wang, Xingbo, et autres
Publié: (2024)
par: Wang, Xingbo, et autres
Publié: (2024)
RECAP: Resistance Capture in Text-based Mental Health Counseling with Large Language Models
par: Li, Anqi, et autres
Publié: (2026)
par: Li, Anqi, et autres
Publié: (2026)
A Causal Explainable Guardrails for Large Language Models
par: Chu, Zhixuan, et autres
Publié: (2024)
par: Chu, Zhixuan, et autres
Publié: (2024)
Unified Deployment-Aware Evaluation of Open Reasoning Language Models
par: Manik, Md Motaleb Hossen, et autres
Publié: (2026)
par: Manik, Md Motaleb Hossen, et autres
Publié: (2026)
MlingConf: A Comprehensive Study of Multilingual Confidence Estimation on Large Language Models
par: Xue, Boyang, et autres
Publié: (2024)
par: Xue, Boyang, et autres
Publié: (2024)
Helix: Serving Large Language Models over Heterogeneous GPUs and Network via Max-Flow
par: Mei, Yixuan, et autres
Publié: (2024)
par: Mei, Yixuan, et autres
Publié: (2024)
Documents similaires
-
Can Large Language Models Understand DL-Lite Ontologies? An Empirical Study
par: Wang, Keyu, et autres
Publié: (2024) -
LSAQ: Layer-Specific Adaptive Quantization for Large Language Model Deployment
par: Zeng, Binrui, et autres
Publié: (2024) -
FlashDecoding++: Faster Large Language Model Inference on GPUs
par: Hong, Ke, et autres
Publié: (2023) -
PhoneLM:an Efficient and Capable Small Language Model Family through Principled Pre-training
par: Yi, Rongjie, et autres
Publié: (2024) -
Graph Integrated Language Transformers for Next Action Prediction in Complex Phone Calls
par: Marani, Amin Hosseiny, et autres
Publié: (2024)