MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Zechun, Zhao, Changsheng, Iandola, Forrest, Lai, Chen, Tian, Yuandong, Fedorov, Igor, Xiong, Yunyang, Chang, Ernie, Shi, Yangyang, Krishnamoorthi, Raghuraman, Lai, Liangzhen, Chandra, Vikas |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes
por: Zhao, Changsheng, et al.
Publicado: (2025)
por: Zhao, Changsheng, et al.
Publicado: (2025)
MobileLLM-Flash: Latency-Guided On-Device LLM Design for Industry Scale Deployment
por: Huang, Hanxian, et al.
Publicado: (2026)
por: Huang, Hanxian, et al.
Publicado: (2026)
Folding Attention: Memory and Power Optimization for On-Device Transformer-based Streaming Speech Recognition
por: Li, Yang, et al.
Publicado: (2023)
por: Li, Yang, et al.
Publicado: (2023)
MobileLLM-Pro Technical Report
por: Huber, Patrick, et al.
Publicado: (2025)
por: Huber, Patrick, et al.
Publicado: (2025)
SpinQuant: LLM quantization with learned rotations
por: Liu, Zechun, et al.
Publicado: (2024)
por: Liu, Zechun, et al.
Publicado: (2024)
MobileMoE: Scaling On-Device Mixture of Experts
por: Chen, Yanbei, et al.
Publicado: (2026)
por: Chen, Yanbei, et al.
Publicado: (2026)
Agent-as-a-Judge: Evaluate Agents with Agents
por: Zhuge, Mingchen, et al.
Publicado: (2024)
por: Zhuge, Mingchen, et al.
Publicado: (2024)
SqueezeSAM: User friendly mobile interactive segmentation
por: Varadarajan, Balakrishnan, et al.
Publicado: (2023)
por: Varadarajan, Balakrishnan, et al.
Publicado: (2023)
Breaking Down Power Barriers in On-Device Streaming ASR: Insights and Solutions
por: Li, Yang, et al.
Publicado: (2024)
por: Li, Yang, et al.
Publicado: (2024)
Efficient Track Anything
por: Xiong, Yunyang, et al.
Publicado: (2024)
por: Xiong, Yunyang, et al.
Publicado: (2024)
ParetoQ: Improving Scaling Laws in Extremely Low-bit LLM Quantization
por: Liu, Zechun, et al.
Publicado: (2025)
por: Liu, Zechun, et al.
Publicado: (2025)
PathFusion: Path-consistent Lidar-Camera Deep Feature Fusion
por: Wu, Lemeng, et al.
Publicado: (2022)
por: Wu, Lemeng, et al.
Publicado: (2022)
Scaling Parameter-Constrained Language Models with Quality Data
por: Chang, Ernie, et al.
Publicado: (2024)
por: Chang, Ernie, et al.
Publicado: (2024)
EdgeTAM: On-Device Track Anything Model
por: Zhou, Chong, et al.
Publicado: (2025)
por: Zhou, Chong, et al.
Publicado: (2025)
dTRPO: Trajectory Reduction in Policy Optimization of Diffusion Large Language Models
por: Zhang, Wenxuan, et al.
Publicado: (2026)
por: Zhang, Wenxuan, et al.
Publicado: (2026)
Target-Aware Language Modeling via Granular Data Sampling
por: Chang, Ernie, et al.
Publicado: (2024)
por: Chang, Ernie, et al.
Publicado: (2024)
Basis Selection: Low-Rank Decomposition of Pretrained Large Language Models for Target Applications
por: Li, Yang, et al.
Publicado: (2024)
por: Li, Yang, et al.
Publicado: (2024)
Mixture-of-Supernets: Improving Weight-Sharing Supernet Training with Architecture-Routed Mixture-of-Experts
por: Jawahar, Ganesh, et al.
Publicado: (2023)
por: Jawahar, Ganesh, et al.
Publicado: (2023)
LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
por: Shen, Xiaoqian, et al.
Publicado: (2024)
por: Shen, Xiaoqian, et al.
Publicado: (2024)
Efficient Universal Perception Encoder
por: Zhu, Chenchen, et al.
Publicado: (2026)
por: Zhu, Chenchen, et al.
Publicado: (2026)
Self-Vocabularizing Training for Neural Machine Translation
por: Lin, Pin-Jie, et al.
Publicado: (2025)
por: Lin, Pin-Jie, et al.
Publicado: (2025)
Neural Computers
por: Zhuge, Mingchen, et al.
Publicado: (2026)
por: Zhuge, Mingchen, et al.
Publicado: (2026)
Llama Guard 3-1B-INT4: Compact and Efficient Safeguard for Human-AI Conversations
por: Fedorov, Igor, et al.
Publicado: (2024)
por: Fedorov, Igor, et al.
Publicado: (2024)
Small Vision-Language Models are Smart Compressors for Long Video Understanding
por: Fei, Junjie, et al.
Publicado: (2026)
por: Fei, Junjie, et al.
Publicado: (2026)
WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points
por: Li, Dongyue, et al.
Publicado: (2026)
por: Li, Dongyue, et al.
Publicado: (2026)
EgoAVU: Egocentric Audio-Visual Understanding
por: Seth, Ashish, et al.
Publicado: (2026)
por: Seth, Ashish, et al.
Publicado: (2026)
Exploring Audio Hallucination in Egocentric Video Understanding
por: Seth, Ashish, et al.
Publicado: (2026)
por: Seth, Ashish, et al.
Publicado: (2026)
VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice
por: Liu, Shuming, et al.
Publicado: (2026)
por: Liu, Shuming, et al.
Publicado: (2026)
RPRA: Predicting an LLM-Judge for Efficient but Performant Inference
por: Ashley, Dylan R., et al.
Publicado: (2026)
por: Ashley, Dylan R., et al.
Publicado: (2026)
Believe It or Not, Disbelief Remains Mysterious
por: Changsheng Lai
Publicado: (2025)
por: Changsheng Lai
Publicado: (2025)
TensorSLM: Energy-efficient Embedding Compression of Sub-billion Parameter Language Models on Low-end Devices
por: Xu, Mingxue, et al.
Publicado: (2025)
por: Xu, Mingxue, et al.
Publicado: (2025)
DepthShrinker: A New Compression Paradigm Towards Boosting Real-Hardware Efficiency of Compact Neural Networks
por: Fu, Yonggan, et al.
Publicado: (2022)
por: Fu, Yonggan, et al.
Publicado: (2022)
SqueezeMe: Mobile-Ready Distillation of Gaussian Full-Body Avatars
por: Iandola, Forrest, et al.
Publicado: (2024)
por: Iandola, Forrest, et al.
Publicado: (2024)
AutoMixer: Checkpoint Artifacts as Automatic Data Mixers
por: Chang, Ernie, et al.
Publicado: (2025)
por: Chang, Ernie, et al.
Publicado: (2025)
R-Sparse: Rank-Aware Activation Sparsity for Efficient LLM Inference
por: Zhang, Zhenyu, et al.
Publicado: (2025)
por: Zhang, Zhenyu, et al.
Publicado: (2025)
SteinDreamer: Variance Reduction for Text-to-3D Score Distillation via Stein Identity
por: Wang, Peihao, et al.
Publicado: (2023)
por: Wang, Peihao, et al.
Publicado: (2023)
Taming Mode Collapse in Score Distillation for Text-to-3D Generation
por: Wang, Peihao, et al.
Publicado: (2023)
por: Wang, Peihao, et al.
Publicado: (2023)
STEM: Scaling Transformers with Embedding Modules
por: Sadhukhan, Ranajoy, et al.
Publicado: (2026)
por: Sadhukhan, Ranajoy, et al.
Publicado: (2026)
Gaussian Pixel Codec Avatars: A Hybrid Representation for Efficient Rendering
por: Gupta, Divam, et al.
Publicado: (2025)
por: Gupta, Divam, et al.
Publicado: (2025)
Param$Δ$ for Direct Weight Mixing: Post-Train Large Language Model at Zero Cost
por: Cao, Sheng, et al.
Publicado: (2025)
por: Cao, Sheng, et al.
Publicado: (2025)
Ejemplares similares
-
MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes
por: Zhao, Changsheng, et al.
Publicado: (2025) -
MobileLLM-Flash: Latency-Guided On-Device LLM Design for Industry Scale Deployment
por: Huang, Hanxian, et al.
Publicado: (2026) -
Folding Attention: Memory and Power Optimization for On-Device Transformer-based Streaming Speech Recognition
por: Li, Yang, et al.
Publicado: (2023) -
MobileLLM-Pro Technical Report
por: Huber, Patrick, et al.
Publicado: (2025) -
SpinQuant: LLM quantization with learned rotations
por: Liu, Zechun, et al.
Publicado: (2024)