LoHan: Low-Cost High-Performance Framework to Fine-Tune 100B Model on a Consumer GPU
Fuente:
arXiv
Salvato in:
| Autori principali: | Liao, Changyue, Sun, Mo, Yang, Zihan, Xie, Jun, Chen, Kaiqi, Yuan, Binhang, Wu, Fei, Wang, Zeke |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LuWu: An End-to-End In-Network Out-of-Core Optimizer for 100B-Scale Model-in-Network Data-Parallel Training on Distributed GPUs
di: Sun, Mo, et al.
Pubblicazione: (2024)
di: Sun, Mo, et al.
Pubblicazione: (2024)
Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism
di: Mo, Zizhao, et al.
Pubblicazione: (2025)
di: Mo, Zizhao, et al.
Pubblicazione: (2025)
LoRA-C: Parameter-Efficient Fine-Tuning of Robust CNN for IoT Devices
di: Ding, Chuntao, et al.
Pubblicazione: (2024)
di: Ding, Chuntao, et al.
Pubblicazione: (2024)
A Framework for Fine-Grained Synchronization of Dependent GPU Kernels
di: Jangda, Abhinav, et al.
Pubblicazione: (2023)
di: Jangda, Abhinav, et al.
Pubblicazione: (2023)
Low-Latency Federated Fine-Tuning for Large Language Models Over Wireless Networks
di: Pang, Zhiwen, et al.
Pubblicazione: (2026)
di: Pang, Zhiwen, et al.
Pubblicazione: (2026)
EcoLoRA: Communication-Efficient Federated Fine-Tuning of Large Language Models
di: Liu, Han, et al.
Pubblicazione: (2025)
di: Liu, Han, et al.
Pubblicazione: (2025)
BandPilot: Towards Performance- and Contention-Aware GPU Dispatching in AI Clusters
di: Zhang, Kunming, et al.
Pubblicazione: (2025)
di: Zhang, Kunming, et al.
Pubblicazione: (2025)
Cost-Performance Analysis: A Comparative Study of CPU-Based Serverless and GPU-Based Training Architectures
di: Barrak, Amine, et al.
Pubblicazione: (2025)
di: Barrak, Amine, et al.
Pubblicazione: (2025)
FedQuad: Adaptive Layer-wise LoRA Deployment and Activation Quantization for Federated Fine-Tuning
di: Li, Rukuo, et al.
Pubblicazione: (2025)
di: Li, Rukuo, et al.
Pubblicazione: (2025)
Optimal Resource Efficiency with Fairness in Heterogeneous GPU Clusters
di: Mo, Zizhao, et al.
Pubblicazione: (2024)
di: Mo, Zizhao, et al.
Pubblicazione: (2024)
HSplitLoRA: A Heterogeneous Split Parameter-Efficient Fine-Tuning Framework for Large Language Models
di: Lin, Zheng, et al.
Pubblicazione: (2025)
di: Lin, Zheng, et al.
Pubblicazione: (2025)
HexGen-2: Disaggregated Generative Inference of LLMs in Heterogeneous Environment
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
Demystifying Cost-Efficiency in LLM Serving over Heterogeneous GPUs
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
di: Jiang, Youhe, et al.
Pubblicazione: (2025)
CaraServe: CPU-Assisted and Rank-Aware LoRA Serving for Generative LLM Inference
di: Li, Suyi, et al.
Pubblicazione: (2024)
di: Li, Suyi, et al.
Pubblicazione: (2024)
Memory-Efficient Split Federated Learning for LLM Fine-Tuning on Heterogeneous Mobile Devices
di: Chen, Xiaopei, et al.
Pubblicazione: (2025)
di: Chen, Xiaopei, et al.
Pubblicazione: (2025)
An Efficient Heterogeneous Co-Design for Fine-Tuning on a Single GPU
di: Yang, Ruijia, et al.
Pubblicazione: (2026)
di: Yang, Ruijia, et al.
Pubblicazione: (2026)
HAS-GPU: Efficient Hybrid Auto-scaling with Fine-grained GPU Allocation for SLO-aware Serverless Inferences
di: Gu, Jianfeng, et al.
Pubblicazione: (2025)
di: Gu, Jianfeng, et al.
Pubblicazione: (2025)
SplitLoRA: A Split Parameter-Efficient Fine-Tuning Framework for Large Language Models
di: Lin, Zheng, et al.
Pubblicazione: (2024)
di: Lin, Zheng, et al.
Pubblicazione: (2024)
AgentServe: Algorithm-System Co-Design for Efficient Agentic AI Serving on a Consumer-Grade GPU
di: Zhang, Yuning, et al.
Pubblicazione: (2026)
di: Zhang, Yuning, et al.
Pubblicazione: (2026)
The Energy Cost of Execution-Idle in GPU Clusters
di: Lei, Yiran, et al.
Pubblicazione: (2026)
di: Lei, Yiran, et al.
Pubblicazione: (2026)
Serving Hybrid LLM Loads with SLO Guarantees Using CPU-GPU Attention Piggybacking
di: Mo, Zizhao, et al.
Pubblicazione: (2026)
di: Mo, Zizhao, et al.
Pubblicazione: (2026)
Exploring Selective Layer Fine-Tuning in Federated Learning
di: Sun, Yuchang, et al.
Pubblicazione: (2024)
di: Sun, Yuchang, et al.
Pubblicazione: (2024)
Taming GPU Underutilization via Static Partitioning and Fine-grained CPU Offloading
di: Schieffer, Gabin, et al.
Pubblicazione: (2026)
di: Schieffer, Gabin, et al.
Pubblicazione: (2026)
Frenzy: A Memory-Aware Serverless LLM Training System for Heterogeneous GPU Clusters
di: Chang, Zihan, et al.
Pubblicazione: (2024)
di: Chang, Zihan, et al.
Pubblicazione: (2024)
Flock: A Low-Cost Streaming Query Engine on FaaS Platforms
di: Liao, Gang, et al.
Pubblicazione: (2023)
di: Liao, Gang, et al.
Pubblicazione: (2023)
GFS: A Preemption-aware Scheduling Framework for GPU Clusters with Predictive Spot Instance Management
di: Duan, Jiaang, et al.
Pubblicazione: (2025)
di: Duan, Jiaang, et al.
Pubblicazione: (2025)
Torpor: GPU-Enabled Serverless Computing for Low-Latency, Resource-Efficient Inference
di: Yu, Minchen, et al.
Pubblicazione: (2023)
di: Yu, Minchen, et al.
Pubblicazione: (2023)
Evaluation of Programming Models and Performance for Stencil Computation on Current GPU Architectures
di: Shan, Baodi, et al.
Pubblicazione: (2024)
di: Shan, Baodi, et al.
Pubblicazione: (2024)
Host-Side Telemetry for Performance Diagnosis in Cloud and HPC GPU Infrastructure
di: Darzi, Erfan, et al.
Pubblicazione: (2025)
di: Darzi, Erfan, et al.
Pubblicazione: (2025)
Dataflow-Oriented Classification and Performance Analysis of GPU-Accelerated Homomorphic Encryption
di: Nozaki, Ai, et al.
Pubblicazione: (2026)
di: Nozaki, Ai, et al.
Pubblicazione: (2026)
TX-Digital Twin: Visualizing Supercomputer GPU Performance Data Stream
di: Baskakova, Elena, et al.
Pubblicazione: (2026)
di: Baskakova, Elena, et al.
Pubblicazione: (2026)
A Multi-Objective Framework for Optimizing GPU-Enabled VM Placement in Cloud Data Centers with Multi-Instance GPU Technology
di: Siavashi, Ahmad, et al.
Pubblicazione: (2025)
di: Siavashi, Ahmad, et al.
Pubblicazione: (2025)
Fine-Tuning GPT-5 for GPU Kernel Generation
di: Tehrani, Ali, et al.
Pubblicazione: (2026)
di: Tehrani, Ali, et al.
Pubblicazione: (2026)
gZCCL: Compression-Accelerated Collective Communication Framework for GPU Clusters
di: Huang, Jiajun, et al.
Pubblicazione: (2023)
di: Huang, Jiajun, et al.
Pubblicazione: (2023)
PRISM: Dynamic Primitive-Based Forecasting for Large-Scale GPU Cluster Workloads
di: Wu, Xin, et al.
Pubblicazione: (2026)
di: Wu, Xin, et al.
Pubblicazione: (2026)
Stabilizing Decentralized Federated Fine-Tuning via Topology-Aware Alternating LoRA
di: Wang, Xiaoyu, et al.
Pubblicazione: (2026)
di: Wang, Xiaoyu, et al.
Pubblicazione: (2026)
A Spark Optimizer for Adaptive, Fine-Grained Parameter Tuning
di: Lyu, Chenghao, et al.
Pubblicazione: (2024)
di: Lyu, Chenghao, et al.
Pubblicazione: (2024)
Split Fine-Tuning for Large Language Models in Wireless Networks
di: Zhang, Songge, et al.
Pubblicazione: (2025)
di: Zhang, Songge, et al.
Pubblicazione: (2025)
Heterogeneous Federated Fine-Tuning with Parallel One-Rank Adaptation
di: Zhang, Zikai, et al.
Pubblicazione: (2026)
di: Zhang, Zikai, et al.
Pubblicazione: (2026)
LoRAFusion: Efficient LoRA Fine-Tuning for LLMs
di: Zhu, Zhanda, et al.
Pubblicazione: (2025)
di: Zhu, Zhanda, et al.
Pubblicazione: (2025)
Documenti analoghi
-
LuWu: An End-to-End In-Network Out-of-Core Optimizer for 100B-Scale Model-in-Network Data-Parallel Training on Distributed GPUs
di: Sun, Mo, et al.
Pubblicazione: (2024) -
Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism
di: Mo, Zizhao, et al.
Pubblicazione: (2025) -
LoRA-C: Parameter-Efficient Fine-Tuning of Robust CNN for IoT Devices
di: Ding, Chuntao, et al.
Pubblicazione: (2024) -
A Framework for Fine-Grained Synchronization of Dependent GPU Kernels
di: Jangda, Abhinav, et al.
Pubblicazione: (2023) -
Low-Latency Federated Fine-Tuning for Large Language Models Over Wireless Networks
di: Pang, Zhiwen, et al.
Pubblicazione: (2026)