Constrained Edge AI Deployment: Fine-Tuning vs Distillation for LLM Compression
Fuente:
arXiv
Guardado en:
| Autores principales: | Sander, Jacob, Moe, David, Cohen, Achraf, Venable, Brent, Dasari, Venkat, Jalaian, Brian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
On Accelerating Edge AI: Optimizing Resource-Constrained Environments
por: Sander, Jacob, et al.
Publicado: (2025)
por: Sander, Jacob, et al.
Publicado: (2025)
Advancing Model Refinement: Muon-Optimized Distillation and Quantization for LLM Deployment
por: Sander, Jacob, et al.
Publicado: (2026)
por: Sander, Jacob, et al.
Publicado: (2026)
Neurosymbolic AI Transfer Learning Improves Network Intrusion Detection
por: Tran, Huynh T. T., et al.
Publicado: (2025)
por: Tran, Huynh T. T., et al.
Publicado: (2025)
Neurosymbolic Artificial Intelligence for Robust Network Intrusion Detection: From Scratch to Transfer Learning
por: Tran, Huynh T. T., et al.
Publicado: (2025)
por: Tran, Huynh T. T., et al.
Publicado: (2025)
Semantic Edge Computing and Semantic Communications in 6G Networks: A Unifying Survey and Research Challenges
por: Zhang, Milin, et al.
Publicado: (2024)
por: Zhang, Milin, et al.
Publicado: (2024)
Development and Application of a Sentinel-2 Satellite Imagery Dataset for Deep-Learning Driven Forest Wildfire Detection
por: Martin, Valeria, et al.
Publicado: (2024)
por: Martin, Valeria, et al.
Publicado: (2024)
TSFLora: Token-Compressed Split Fine-Tuning for Wireless Edge Networks
por: Qiang, Xianke, et al.
Publicado: (2026)
por: Qiang, Xianke, et al.
Publicado: (2026)
Communication-Aware Knowledge Distillation for Federated LLM Fine-Tuning over Wireless Networks
por: Zhang, Xinlu, et al.
Publicado: (2025)
por: Zhang, Xinlu, et al.
Publicado: (2025)
Collaborative Compression for Large-Scale MoE Deployment on Edge
por: Chen, Yixiao, et al.
Publicado: (2025)
por: Chen, Yixiao, et al.
Publicado: (2025)
Sparse Gradient Compression for Fine-Tuning Large Language Models
por: Yang, David H., et al.
Publicado: (2025)
por: Yang, David H., et al.
Publicado: (2025)
Smooth Model Compression without Fine-Tuning
por: Runkel, Christina, et al.
Publicado: (2025)
por: Runkel, Christina, et al.
Publicado: (2025)
Equivariant-Aware Structured Pruning for Efficient Edge Deployment: A Comprehensive Framework with Adaptive Fine-Tuning
por: Alnemari, Mohammed
Publicado: (2025)
por: Alnemari, Mohammed
Publicado: (2025)
Energy-Efficient Vision Transformer Inference for Edge-AI Deployment
por: Amanzhol, Nursultan, et al.
Publicado: (2025)
por: Amanzhol, Nursultan, et al.
Publicado: (2025)
MCAP: Deployment-Time Layer Profiling for Memory-Constrained LLM Inference
por: Das, Anurita
Publicado: (2026)
por: Das, Anurita
Publicado: (2026)
Collaborative Information Dissemination with Graph-based Multi-Agent Reinforcement Learning
por: Galliera, Raffaele, et al.
Publicado: (2023)
por: Galliera, Raffaele, et al.
Publicado: (2023)
BALF: Budgeted Activation-Aware Low-Rank Factorization for Fine-Tuning-Free Model Compression
por: González-Martínez, David
Publicado: (2025)
por: González-Martínez, David
Publicado: (2025)
Towards Interpretable Adversarial Examples via Sparse Adversarial Attack
por: Lin, Fudong, et al.
Publicado: (2025)
por: Lin, Fudong, et al.
Publicado: (2025)
From LLMs to Edge: Parameter-Efficient Fine-Tuning on Edge Devices
por: Slamanig, Georg, et al.
Publicado: (2025)
por: Slamanig, Georg, et al.
Publicado: (2025)
BitRL: Reinforcement Learning with 1-bit Quantized Language Models for Resource-Constrained Edge Deployment
por: Sajid, Md. Ashiq Ul Islam, et al.
Publicado: (2026)
por: Sajid, Md. Ashiq Ul Islam, et al.
Publicado: (2026)
TuneShift-KD: Knowledge Distillation and Transfer for Fine-tuned Models
por: Guan, Yushi, et al.
Publicado: (2026)
por: Guan, Yushi, et al.
Publicado: (2026)
Study of Training Dynamics for Memory-Constrained Fine-Tuning
por: Quélennec, Aël, et al.
Publicado: (2025)
por: Quélennec, Aël, et al.
Publicado: (2025)
On Statistical Estimation of Edge-Reinforced Random Walks
por: Qinghua, et al.
Publicado: (2025)
por: Qinghua, et al.
Publicado: (2025)
Constrained Flow Optimization via Sequential Fine Tuning for Molecular Design
por: Gutjahr, Sven, et al.
Publicado: (2026)
por: Gutjahr, Sven, et al.
Publicado: (2026)
MobiZO: Enabling Efficient LLM Fine-Tuning at the Edge via Inference Engines
por: Gao, Lei, et al.
Publicado: (2024)
por: Gao, Lei, et al.
Publicado: (2024)
LoRA vs. Full Fine-Tuning: A Theoretical Perspective
por: Zindari, Ali, et al.
Publicado: (2026)
por: Zindari, Ali, et al.
Publicado: (2026)
Edge AI for Automotive Vulnerable Road User Safety: Deployable Detection via Knowledge Distillation
por: Karjol, Akshay, et al.
Publicado: (2026)
por: Karjol, Akshay, et al.
Publicado: (2026)
An Empirical Study of the Influence of Adversarial Fine-Tuning on Compressed Neural Networks
por: Thorsteinsson, Hallgrimur, et al.
Publicado: (2024)
por: Thorsteinsson, Hallgrimur, et al.
Publicado: (2024)
Alignment Dynamics in LLM Fine-Tuning
por: Huang, Yuhan, et al.
Publicado: (2026)
por: Huang, Yuhan, et al.
Publicado: (2026)
Memory-Efficient Backpropagation for Fine-Tuning LLMs on Resource-Constrained Mobile Devices
por: Song, Congzheng, et al.
Publicado: (2025)
por: Song, Congzheng, et al.
Publicado: (2025)
Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL
por: Luo, Qin-Wen, et al.
Publicado: (2024)
por: Luo, Qin-Wen, et al.
Publicado: (2024)
LLM Zeroth-Order Fine-Tuning is an Inference Workload
por: Li, Zelin, et al.
Publicado: (2026)
por: Li, Zelin, et al.
Publicado: (2026)
MobiLLM: Enabling LLM Fine-Tuning on the Mobile Device via Server Assisted Side Tuning
por: Li, Liang, et al.
Publicado: (2025)
por: Li, Liang, et al.
Publicado: (2025)
Resource-Efficient Generative AI Model Deployment in Mobile Edge Networks
por: Liang, Yuxin, et al.
Publicado: (2024)
por: Liang, Yuxin, et al.
Publicado: (2024)
MallowsPO: Fine-Tune Your LLM with Preference Dispersions
por: Chen, Haoxian, et al.
Publicado: (2024)
por: Chen, Haoxian, et al.
Publicado: (2024)
Forget the Data and Fine-Tuning! Just Fold the Network to Compress
por: Wang, Dong, et al.
Publicado: (2025)
por: Wang, Dong, et al.
Publicado: (2025)
NuMuon: Nuclear-Norm-Constrained Muon for Compressible LLM Training
por: Dolatabadi, Hadi Mohaghegh, et al.
Publicado: (2026)
por: Dolatabadi, Hadi Mohaghegh, et al.
Publicado: (2026)
Fine-Tuning Small Language Models for Domain-Specific AI: An Edge AI Perspective
por: Aralimatti, Rakshit, et al.
Publicado: (2025)
por: Aralimatti, Rakshit, et al.
Publicado: (2025)
SplitFrozen: Split Learning with Device-side Model Frozen for Fine-Tuning LLM on Heterogeneous Resource-Constrained Devices
por: Ma, Jian, et al.
Publicado: (2025)
por: Ma, Jian, et al.
Publicado: (2025)
RadLite: Multi-Task LoRA Fine-Tuning of Small Language Models for CPU-Deployable Radiology AI
por: Gupta, Pankaj, et al.
Publicado: (2026)
por: Gupta, Pankaj, et al.
Publicado: (2026)
VeriLeaky: Navigating IP Protection vs Utility in Fine-Tuning for LLM-Driven Verilog Coding
por: Wang, Zeng, et al.
Publicado: (2025)
por: Wang, Zeng, et al.
Publicado: (2025)
Ejemplares similares
-
On Accelerating Edge AI: Optimizing Resource-Constrained Environments
por: Sander, Jacob, et al.
Publicado: (2025) -
Advancing Model Refinement: Muon-Optimized Distillation and Quantization for LLM Deployment
por: Sander, Jacob, et al.
Publicado: (2026) -
Neurosymbolic AI Transfer Learning Improves Network Intrusion Detection
por: Tran, Huynh T. T., et al.
Publicado: (2025) -
Neurosymbolic Artificial Intelligence for Robust Network Intrusion Detection: From Scratch to Transfer Learning
por: Tran, Huynh T. T., et al.
Publicado: (2025) -
Semantic Edge Computing and Semantic Communications in 6G Networks: A Unifying Survey and Research Challenges
por: Zhang, Milin, et al.
Publicado: (2024)