LoHan: Low-Cost High-Performance Framework to Fine-Tune 100B Model on a Consumer GPU
Fuente:
arXiv
Guardado en:
| Autores principales: | Liao, Changyue, Sun, Mo, Yang, Zihan, Xie, Jun, Chen, Kaiqi, Yuan, Binhang, Wu, Fei, Wang, Zeke |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LuWu: An End-to-End In-Network Out-of-Core Optimizer for 100B-Scale Model-in-Network Data-Parallel Training on Distributed GPUs
por: Sun, Mo, et al.
Publicado: (2024)
por: Sun, Mo, et al.
Publicado: (2024)
Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism
por: Mo, Zizhao, et al.
Publicado: (2025)
por: Mo, Zizhao, et al.
Publicado: (2025)
LoRA-C: Parameter-Efficient Fine-Tuning of Robust CNN for IoT Devices
por: Ding, Chuntao, et al.
Publicado: (2024)
por: Ding, Chuntao, et al.
Publicado: (2024)
A Framework for Fine-Grained Synchronization of Dependent GPU Kernels
por: Jangda, Abhinav, et al.
Publicado: (2023)
por: Jangda, Abhinav, et al.
Publicado: (2023)
Low-Latency Federated Fine-Tuning for Large Language Models Over Wireless Networks
por: Pang, Zhiwen, et al.
Publicado: (2026)
por: Pang, Zhiwen, et al.
Publicado: (2026)
EcoLoRA: Communication-Efficient Federated Fine-Tuning of Large Language Models
por: Liu, Han, et al.
Publicado: (2025)
por: Liu, Han, et al.
Publicado: (2025)
BandPilot: Towards Performance- and Contention-Aware GPU Dispatching in AI Clusters
por: Zhang, Kunming, et al.
Publicado: (2025)
por: Zhang, Kunming, et al.
Publicado: (2025)
Cost-Performance Analysis: A Comparative Study of CPU-Based Serverless and GPU-Based Training Architectures
por: Barrak, Amine, et al.
Publicado: (2025)
por: Barrak, Amine, et al.
Publicado: (2025)
FedQuad: Adaptive Layer-wise LoRA Deployment and Activation Quantization for Federated Fine-Tuning
por: Li, Rukuo, et al.
Publicado: (2025)
por: Li, Rukuo, et al.
Publicado: (2025)
Optimal Resource Efficiency with Fairness in Heterogeneous GPU Clusters
por: Mo, Zizhao, et al.
Publicado: (2024)
por: Mo, Zizhao, et al.
Publicado: (2024)
HSplitLoRA: A Heterogeneous Split Parameter-Efficient Fine-Tuning Framework for Large Language Models
por: Lin, Zheng, et al.
Publicado: (2025)
por: Lin, Zheng, et al.
Publicado: (2025)
HexGen-2: Disaggregated Generative Inference of LLMs in Heterogeneous Environment
por: Jiang, Youhe, et al.
Publicado: (2025)
por: Jiang, Youhe, et al.
Publicado: (2025)
Demystifying Cost-Efficiency in LLM Serving over Heterogeneous GPUs
por: Jiang, Youhe, et al.
Publicado: (2025)
por: Jiang, Youhe, et al.
Publicado: (2025)
CaraServe: CPU-Assisted and Rank-Aware LoRA Serving for Generative LLM Inference
por: Li, Suyi, et al.
Publicado: (2024)
por: Li, Suyi, et al.
Publicado: (2024)
Memory-Efficient Split Federated Learning for LLM Fine-Tuning on Heterogeneous Mobile Devices
por: Chen, Xiaopei, et al.
Publicado: (2025)
por: Chen, Xiaopei, et al.
Publicado: (2025)
An Efficient Heterogeneous Co-Design for Fine-Tuning on a Single GPU
por: Yang, Ruijia, et al.
Publicado: (2026)
por: Yang, Ruijia, et al.
Publicado: (2026)
HAS-GPU: Efficient Hybrid Auto-scaling with Fine-grained GPU Allocation for SLO-aware Serverless Inferences
por: Gu, Jianfeng, et al.
Publicado: (2025)
por: Gu, Jianfeng, et al.
Publicado: (2025)
SplitLoRA: A Split Parameter-Efficient Fine-Tuning Framework for Large Language Models
por: Lin, Zheng, et al.
Publicado: (2024)
por: Lin, Zheng, et al.
Publicado: (2024)
AgentServe: Algorithm-System Co-Design for Efficient Agentic AI Serving on a Consumer-Grade GPU
por: Zhang, Yuning, et al.
Publicado: (2026)
por: Zhang, Yuning, et al.
Publicado: (2026)
The Energy Cost of Execution-Idle in GPU Clusters
por: Lei, Yiran, et al.
Publicado: (2026)
por: Lei, Yiran, et al.
Publicado: (2026)
Serving Hybrid LLM Loads with SLO Guarantees Using CPU-GPU Attention Piggybacking
por: Mo, Zizhao, et al.
Publicado: (2026)
por: Mo, Zizhao, et al.
Publicado: (2026)
Exploring Selective Layer Fine-Tuning in Federated Learning
por: Sun, Yuchang, et al.
Publicado: (2024)
por: Sun, Yuchang, et al.
Publicado: (2024)
Taming GPU Underutilization via Static Partitioning and Fine-grained CPU Offloading
por: Schieffer, Gabin, et al.
Publicado: (2026)
por: Schieffer, Gabin, et al.
Publicado: (2026)
Frenzy: A Memory-Aware Serverless LLM Training System for Heterogeneous GPU Clusters
por: Chang, Zihan, et al.
Publicado: (2024)
por: Chang, Zihan, et al.
Publicado: (2024)
Flock: A Low-Cost Streaming Query Engine on FaaS Platforms
por: Liao, Gang, et al.
Publicado: (2023)
por: Liao, Gang, et al.
Publicado: (2023)
GFS: A Preemption-aware Scheduling Framework for GPU Clusters with Predictive Spot Instance Management
por: Duan, Jiaang, et al.
Publicado: (2025)
por: Duan, Jiaang, et al.
Publicado: (2025)
Torpor: GPU-Enabled Serverless Computing for Low-Latency, Resource-Efficient Inference
por: Yu, Minchen, et al.
Publicado: (2023)
por: Yu, Minchen, et al.
Publicado: (2023)
Evaluation of Programming Models and Performance for Stencil Computation on Current GPU Architectures
por: Shan, Baodi, et al.
Publicado: (2024)
por: Shan, Baodi, et al.
Publicado: (2024)
Host-Side Telemetry for Performance Diagnosis in Cloud and HPC GPU Infrastructure
por: Darzi, Erfan, et al.
Publicado: (2025)
por: Darzi, Erfan, et al.
Publicado: (2025)
Dataflow-Oriented Classification and Performance Analysis of GPU-Accelerated Homomorphic Encryption
por: Nozaki, Ai, et al.
Publicado: (2026)
por: Nozaki, Ai, et al.
Publicado: (2026)
TX-Digital Twin: Visualizing Supercomputer GPU Performance Data Stream
por: Baskakova, Elena, et al.
Publicado: (2026)
por: Baskakova, Elena, et al.
Publicado: (2026)
A Multi-Objective Framework for Optimizing GPU-Enabled VM Placement in Cloud Data Centers with Multi-Instance GPU Technology
por: Siavashi, Ahmad, et al.
Publicado: (2025)
por: Siavashi, Ahmad, et al.
Publicado: (2025)
Fine-Tuning GPT-5 for GPU Kernel Generation
por: Tehrani, Ali, et al.
Publicado: (2026)
por: Tehrani, Ali, et al.
Publicado: (2026)
gZCCL: Compression-Accelerated Collective Communication Framework for GPU Clusters
por: Huang, Jiajun, et al.
Publicado: (2023)
por: Huang, Jiajun, et al.
Publicado: (2023)
PRISM: Dynamic Primitive-Based Forecasting for Large-Scale GPU Cluster Workloads
por: Wu, Xin, et al.
Publicado: (2026)
por: Wu, Xin, et al.
Publicado: (2026)
Stabilizing Decentralized Federated Fine-Tuning via Topology-Aware Alternating LoRA
por: Wang, Xiaoyu, et al.
Publicado: (2026)
por: Wang, Xiaoyu, et al.
Publicado: (2026)
A Spark Optimizer for Adaptive, Fine-Grained Parameter Tuning
por: Lyu, Chenghao, et al.
Publicado: (2024)
por: Lyu, Chenghao, et al.
Publicado: (2024)
Split Fine-Tuning for Large Language Models in Wireless Networks
por: Zhang, Songge, et al.
Publicado: (2025)
por: Zhang, Songge, et al.
Publicado: (2025)
Heterogeneous Federated Fine-Tuning with Parallel One-Rank Adaptation
por: Zhang, Zikai, et al.
Publicado: (2026)
por: Zhang, Zikai, et al.
Publicado: (2026)
LoRAFusion: Efficient LoRA Fine-Tuning for LLMs
por: Zhu, Zhanda, et al.
Publicado: (2025)
por: Zhu, Zhanda, et al.
Publicado: (2025)
Ejemplares similares
-
LuWu: An End-to-End In-Network Out-of-Core Optimizer for 100B-Scale Model-in-Network Data-Parallel Training on Distributed GPUs
por: Sun, Mo, et al.
Publicado: (2024) -
Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism
por: Mo, Zizhao, et al.
Publicado: (2025) -
LoRA-C: Parameter-Efficient Fine-Tuning of Robust CNN for IoT Devices
por: Ding, Chuntao, et al.
Publicado: (2024) -
A Framework for Fine-Grained Synchronization of Dependent GPU Kernels
por: Jangda, Abhinav, et al.
Publicado: (2023) -
Low-Latency Federated Fine-Tuning for Large Language Models Over Wireless Networks
por: Pang, Zhiwen, et al.
Publicado: (2026)