GoCkpt: Gradient-Assisted Multi-Step overlapped Checkpointing for Efficient LLM Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Keyao, Chen, Yiquan, Hu, Zhuo, Lin, Wenhai, Xu, Jiexiong, Chen, Wenzhi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Crash-Consistent Checkpointing for AI Training on macOS/APFS
di: Jeon, Juha
Pubblicazione: (2025)
di: Jeon, Juha
Pubblicazione: (2025)
Tutti: Making SSD-Backed KV Cache Practical for Long-Context LLM Serving
di: Qiu, Shi, et al.
Pubblicazione: (2026)
di: Qiu, Shi, et al.
Pubblicazione: (2026)
Flare: Anomaly Diagnostics for Divergent LLM Training in GPU Clusters of Thousand-Plus Scale
di: Cui, Weihao, et al.
Pubblicazione: (2025)
di: Cui, Weihao, et al.
Pubblicazione: (2025)
DeltaBox: Scaling Stateful AI Agents with Millisecond-Level Sandbox Checkpoint/Rollback
di: Dong, Yunpeng, et al.
Pubblicazione: (2026)
di: Dong, Yunpeng, et al.
Pubblicazione: (2026)
UrgenGo: Urgency-Aware Transparent GPU Kernel Launching for Autonomous Driving
di: Zhu, Hanqi, et al.
Pubblicazione: (2025)
di: Zhu, Hanqi, et al.
Pubblicazione: (2025)
RTP-LLM: High-Performance Alibaba LLM Inference Engine
di: Tan, Boyu, et al.
Pubblicazione: (2026)
di: Tan, Boyu, et al.
Pubblicazione: (2026)
Towards High-Goodput LLM Serving with Prefill-decode Multiplexing
di: Chen, Yukang, et al.
Pubblicazione: (2025)
di: Chen, Yukang, et al.
Pubblicazione: (2025)
SSV: Sparse Speculative Verification for Efficient LLM Inference
di: Wang, Zhibin, et al.
Pubblicazione: (2026)
di: Wang, Zhibin, et al.
Pubblicazione: (2026)
Nixie: Efficient, Transparent Temporal Multiplexing for Consumer GPUs
di: Xu, Yechen, et al.
Pubblicazione: (2026)
di: Xu, Yechen, et al.
Pubblicazione: (2026)
PhoenixOS: Concurrent OS-level GPU Checkpoint and Restore with Validated Speculation
di: Wei, Xingda, et al.
Pubblicazione: (2024)
di: Wei, Xingda, et al.
Pubblicazione: (2024)
Efficient Function-as-a-Service for Large Language Models with TIDAL
di: Cui, Weihao, et al.
Pubblicazione: (2025)
di: Cui, Weihao, et al.
Pubblicazione: (2025)
Crab: A Semantics-Aware Checkpoint/Restore Runtime for Agent Sandboxes
di: Wu, Tianyuan, et al.
Pubblicazione: (2026)
di: Wu, Tianyuan, et al.
Pubblicazione: (2026)
Holistic Heterogeneous Scheduling for Autonomous Applications using Fine-grained, Multi-XPU Abstraction
di: Han, Mingcong, et al.
Pubblicazione: (2025)
di: Han, Mingcong, et al.
Pubblicazione: (2025)
MVVM: Deploy Your AI Agents-Securely, Efficiently, Everywhere
di: Yang, Yiwei, et al.
Pubblicazione: (2024)
di: Yang, Yiwei, et al.
Pubblicazione: (2024)
CHRONOS: Compensating Hardware Related Overheads with Native Multi Timer Support for Real-Time Operating Systems
di: Heider, Kay, et al.
Pubblicazione: (2025)
di: Heider, Kay, et al.
Pubblicazione: (2025)
LLM as a System Service on Mobile Devices
di: Yin, Wangsong, et al.
Pubblicazione: (2024)
di: Yin, Wangsong, et al.
Pubblicazione: (2024)
Oneiros: KV Cache Optimization through Parameter Remapping for Multi-tenant LLM Serving
di: Li, Ruihao, et al.
Pubblicazione: (2025)
di: Li, Ruihao, et al.
Pubblicazione: (2025)
Dissecting the Impact of Mobile DVFS Governors on LLM Inference Performance and Energy Efficiency
di: Zhang, Zongpu, et al.
Pubblicazione: (2025)
di: Zhang, Zongpu, et al.
Pubblicazione: (2025)
Nova: Real-Time Agentic Vision-Language Model Serving with Adaptive Cross-Stage Parallelization
di: Xu, Yuhang, et al.
Pubblicazione: (2025)
di: Xu, Yuhang, et al.
Pubblicazione: (2025)
Towards Fully-fledged GPU Multitasking via Proactive Memory Scheduling
di: Shen, Weihang, et al.
Pubblicazione: (2025)
di: Shen, Weihang, et al.
Pubblicazione: (2025)
Principled Performance Tunability in Operating System Kernels
di: Chen, Zhongjie, et al.
Pubblicazione: (2025)
di: Chen, Zhongjie, et al.
Pubblicazione: (2025)
Towards Agentic OS: An LLM Agent Framework for Linux Schedulers
di: Zheng, Yusheng, et al.
Pubblicazione: (2025)
di: Zheng, Yusheng, et al.
Pubblicazione: (2025)
Continuum: Efficient and Robust Multi-Turn LLM Agent Scheduling with KV Cache Time-to-Live
di: Li, Hanchen, et al.
Pubblicazione: (2025)
di: Li, Hanchen, et al.
Pubblicazione: (2025)
Energy-Efficient Computation with DVFS using Deep Reinforcement Learning for Multi-Task Systems in Edge Computing
di: Li, Xinyi, et al.
Pubblicazione: (2024)
di: Li, Xinyi, et al.
Pubblicazione: (2024)
Boosting File Systems Elegantly: A Transparent NVM Write-ahead Log for Disk File Systems
di: Wang, Guoyu, et al.
Pubblicazione: (2024)
di: Wang, Guoyu, et al.
Pubblicazione: (2024)
FRAP: A Flexible Resource Accessing Protocol for Multiprocessor Real-Time Systems
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
di: Zhao, Shuai, et al.
Pubblicazione: (2024)
AugServe: Adaptive Request Scheduling for Augmented Large Language Model Inference Serving
di: Wang, Ying, et al.
Pubblicazione: (2025)
di: Wang, Ying, et al.
Pubblicazione: (2025)
C2CServe: Leveraging NVLink-C2C for Elastic Serverless LLM Serving on MIG
di: Luo, Shutian, et al.
Pubblicazione: (2026)
di: Luo, Shutian, et al.
Pubblicazione: (2026)
AERO: Adaptive and Efficient Runtime-Aware OTA Updates for Energy-Harvesting IoT
di: Wei, Wei, et al.
Pubblicazione: (2026)
di: Wei, Wei, et al.
Pubblicazione: (2026)
Valve: Production Online-Offline Inference Colocation with Jointly-Bounded Preemption Latency and Rate
di: Liu, Fangyue, et al.
Pubblicazione: (2026)
di: Liu, Fangyue, et al.
Pubblicazione: (2026)
Leveraging OS-Level Primitives for Robotic Action Management
di: Zheng, Wenxin, et al.
Pubblicazione: (2025)
di: Zheng, Wenxin, et al.
Pubblicazione: (2025)
Plug. Play. Persist. Inside a Ready-to-Go Havoc C2 Infrastructure
di: Di Santo, Alessio
Pubblicazione: (2025)
di: Di Santo, Alessio
Pubblicazione: (2025)
XBOF: A Cost-Efficient CXL JBOF with Inter-SSD Compute Resource Sharing
di: Yi, Shushu, et al.
Pubblicazione: (2025)
di: Yi, Shushu, et al.
Pubblicazione: (2025)
ThunderAgent: A Simple, Fast and Program-Aware Agentic Inference System
di: Kang, Hao, et al.
Pubblicazione: (2026)
di: Kang, Hao, et al.
Pubblicazione: (2026)
Virtual-Memory Assisted Buffer Management In Tiered Memory
di: Rayhan, Yeasir, et al.
Pubblicazione: (2026)
di: Rayhan, Yeasir, et al.
Pubblicazione: (2026)
EVICPRESS: Joint KV-Cache Compression and Eviction for Efficient LLM Serving
di: Feng, Shaoting, et al.
Pubblicazione: (2025)
di: Feng, Shaoting, et al.
Pubblicazione: (2025)
AgentRM: An OS-Inspired Resource Manager for LLM Agent Systems
di: She, Jianshu
Pubblicazione: (2026)
di: She, Jianshu
Pubblicazione: (2026)
Efficient Memory Tiering in a Virtual Machine
di: Prakash, Chandra, et al.
Pubblicazione: (2025)
di: Prakash, Chandra, et al.
Pubblicazione: (2025)
Asterinas: A Linux ABI-Compatible, Rust-Based Framekernel OS with a Small and Sound TCB
di: Peng, Yuke, et al.
Pubblicazione: (2025)
di: Peng, Yuke, et al.
Pubblicazione: (2025)
Idleness is Relative: Exploiting Tool-Call Idle Windows for Offloading in Agentic Systems with MORI
di: Xia, Tian, et al.
Pubblicazione: (2026)
di: Xia, Tian, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Crash-Consistent Checkpointing for AI Training on macOS/APFS
di: Jeon, Juha
Pubblicazione: (2025) -
Tutti: Making SSD-Backed KV Cache Practical for Long-Context LLM Serving
di: Qiu, Shi, et al.
Pubblicazione: (2026) -
Flare: Anomaly Diagnostics for Divergent LLM Training in GPU Clusters of Thousand-Plus Scale
di: Cui, Weihao, et al.
Pubblicazione: (2025) -
DeltaBox: Scaling Stateful AI Agents with Millisecond-Level Sandbox Checkpoint/Rollback
di: Dong, Yunpeng, et al.
Pubblicazione: (2026) -
UrgenGo: Urgency-Aware Transparent GPU Kernel Launching for Autonomous Driving
di: Zhu, Hanqi, et al.
Pubblicazione: (2025)