ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mai, Haohui, Guo, Xiaoyan, Ding, Xiangyun, Li, Daifeng, Yu, Qiuchu, Guo, Chenzhun, Wang, Cong, Zhao, Jiacheng, Kozyrakis, Christos, Yuan, Binhang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Sparse Checkpointing for Fast and Reliable MoE Training
par: Gandhi, Swapnil, et autres
Publié: (2024)
par: Gandhi, Swapnil, et autres
Publié: (2024)
FSA: An Alternative Efficient Implementation of Native Sparse Attention Kernel
par: Yan, Ran, et autres
Publié: (2025)
par: Yan, Ran, et autres
Publié: (2025)
FailSafe: High-performance Resilient Serving
par: Xu, Ziyi, et autres
Publié: (2025)
par: Xu, Ziyi, et autres
Publié: (2025)
cedar: Optimized and Unified Machine Learning Input Data Pipelines
par: Zhao, Mark, et autres
Publié: (2024)
par: Zhao, Mark, et autres
Publié: (2024)
HexGen-2: Disaggregated Generative Inference of LLMs in Heterogeneous Environment
par: Jiang, Youhe, et autres
Publié: (2025)
par: Jiang, Youhe, et autres
Publié: (2025)
LoHan: Low-Cost High-Performance Framework to Fine-Tune 100B Model on a Consumer GPU
par: Liao, Changyue, et autres
Publié: (2024)
par: Liao, Changyue, et autres
Publié: (2024)
HexAGenT: Efficient Agentic LLM Serving via Workflow- and Heterogeneity-Aware Scheduling
par: Peng, You, et autres
Publié: (2026)
par: Peng, You, et autres
Publié: (2026)
Zorse: Optimizing LLM Training Efficiency on Heterogeneous GPU Clusters
par: Guo, Runsheng Benson, et autres
Publié: (2025)
par: Guo, Runsheng Benson, et autres
Publié: (2025)
ReCycle: Resilient Training of Large DNNs using Pipeline Adaptation
par: Gandhi, Swapnil, et autres
Publié: (2024)
par: Gandhi, Swapnil, et autres
Publié: (2024)
SYMI: Efficient Mixture-of-Experts Training via Model and Optimizer State Decoupling
par: Skiadopoulos, Athinagoras, et autres
Publié: (2025)
par: Skiadopoulos, Athinagoras, et autres
Publié: (2025)
Characterization-Guided GPU Fault Resilience in NVIDIA MPS
par: Liu, Rixin, et autres
Publié: (2026)
par: Liu, Rixin, et autres
Publié: (2026)
FlowWalker: A Memory-efficient and High-performance GPU-based Dynamic Graph Random Walk Framework
par: Mei, Junyi, et autres
Publié: (2024)
par: Mei, Junyi, et autres
Publié: (2024)
AReaL-Hex: Accommodating Asynchronous RL Training over Heterogeneous GPUs
par: Yan, Ran, et autres
Publié: (2025)
par: Yan, Ran, et autres
Publié: (2025)
Strata: Hierarchical Context Caching for Long Context Language Model Serving
par: Xie, Zhiqiang, et autres
Publié: (2025)
par: Xie, Zhiqiang, et autres
Publié: (2025)
AgentServe: Algorithm-System Co-Design for Efficient Agentic AI Serving on a Consumer-Grade GPU
par: Zhang, Yuning, et autres
Publié: (2026)
par: Zhang, Yuning, et autres
Publié: (2026)
GMLake: Efficient and Transparent GPU Memory Defragmentation for Large-scale DNN Training with Virtual Memory Stitching
par: Guo, Cong, et autres
Publié: (2024)
par: Guo, Cong, et autres
Publié: (2024)
Improving GPU Multi-Tenancy Through Dynamic Multi-Instance GPU Reconfiguration
par: Wang, Tianyu, et autres
Publié: (2024)
par: Wang, Tianyu, et autres
Publié: (2024)
VDCores: Resource Decoupled Programming and Execution for Asynchronous GPU
par: He, Zijian, et autres
Publié: (2026)
par: He, Zijian, et autres
Publié: (2026)
DAK: Direct-Access-Enabled GPU Memory Offloading with Optimal Efficiency for LLM Inference
par: Lin, Shouxu, et autres
Publié: (2026)
par: Lin, Shouxu, et autres
Publié: (2026)
Cephalo: Harnessing Heterogeneous GPU Clusters for Training Transformer Models
par: Guo, Runsheng Benson, et autres
Publié: (2024)
par: Guo, Runsheng Benson, et autres
Publié: (2024)
DeepOps & SLURM: Your GPU Cluster Guide
par: Majee, Arindam
Publié: (2024)
par: Majee, Arindam
Publié: (2024)
HexiSeq: Accommodating Long Context Training of LLMs over Heterogeneous Hardware
par: Liang, Yan, et autres
Publié: (2026)
par: Liang, Yan, et autres
Publié: (2026)
HexGen: Generative Inference of Large Language Model over Heterogeneous Environment
par: Jiang, Youhe, et autres
Publié: (2023)
par: Jiang, Youhe, et autres
Publié: (2023)
HexiScale: Facilitating Large Language Model Training over Heterogeneous Hardware
par: Yan, Ran, et autres
Publié: (2024)
par: Yan, Ran, et autres
Publié: (2024)
Optimizing Bloom Filters for Modern GPU Architectures
par: Jünger, Daniel, et autres
Publié: (2025)
par: Jünger, Daniel, et autres
Publié: (2025)
BandPilot: Towards Performance- and Contention-Aware GPU Dispatching in AI Clusters
par: Zhang, Kunming, et autres
Publié: (2025)
par: Zhang, Kunming, et autres
Publié: (2025)
GCAPS: GPU Context-Aware Preemptive Priority-based Scheduling for Real-Time Tasks
par: Wang, Yidi, et autres
Publié: (2024)
par: Wang, Yidi, et autres
Publié: (2024)
KIS-S: A GPU-Aware Kubernetes Inference Simulator with RL-Based Auto-Scaling
par: Zhang, Guilin, et autres
Publié: (2025)
par: Zhang, Guilin, et autres
Publié: (2025)
Heat: Satellite's meat is GPU's poison
par: Yuan, Zhehu, et autres
Publié: (2024)
par: Yuan, Zhehu, et autres
Publié: (2024)
Autopoiesis: A Self-Evolving System Paradigm for LLM Serving Under Runtime Dynamics
par: Jiang, Youhe, et autres
Publié: (2026)
par: Jiang, Youhe, et autres
Publié: (2026)
A Preliminary Study on Accelerating Simulation Optimization with GPU Implementation
par: He, Jinghai, et autres
Publié: (2024)
par: He, Jinghai, et autres
Publié: (2024)
EXaCTz: Guaranteed Extremum Graph and Contour Tree Preservation for Distributed- and GPU-Parallel Lossy Compression
par: Li, Yuxiao, et autres
Publié: (2026)
par: Li, Yuxiao, et autres
Publié: (2026)
Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management
par: Qianli, Liu, et autres
Publié: (2025)
par: Qianli, Liu, et autres
Publié: (2025)
Towards Fast Setup and High Throughput of GPU Serverless Computing
par: Zhao, Han, et autres
Publié: (2024)
par: Zhao, Han, et autres
Publié: (2024)
Regulating Branch Parallelism in LLM Serving
par: Gandhi, Swapnil, et autres
Publié: (2026)
par: Gandhi, Swapnil, et autres
Publié: (2026)
A Multi-Objective Framework for Optimizing GPU-Enabled VM Placement in Cloud Data Centers with Multi-Instance GPU Technology
par: Siavashi, Ahmad, et autres
Publié: (2025)
par: Siavashi, Ahmad, et autres
Publié: (2025)
Breaking the Memory Wall: A Study of I/O Patterns and GPU Memory Utilization for Hybrid CPU-GPU Offloaded Optimizers
par: Maurya, Avinash, et autres
Publié: (2024)
par: Maurya, Avinash, et autres
Publié: (2024)
Cascadia: An Efficient Cascade Serving System for Large Language Models
par: Jiang, Youhe, et autres
Publié: (2025)
par: Jiang, Youhe, et autres
Publié: (2025)
FaaSTube: Optimizing GPU-oriented Data Transfer for Serverless Computing
par: Wu, Hao, et autres
Publié: (2024)
par: Wu, Hao, et autres
Publié: (2024)
ACC Saturator: Automatic Kernel Optimization for Directive-Based GPU Code
par: Matsumura, Kazuaki, et autres
Publié: (2023)
par: Matsumura, Kazuaki, et autres
Publié: (2023)
Documents similaires
-
Sparse Checkpointing for Fast and Reliable MoE Training
par: Gandhi, Swapnil, et autres
Publié: (2024) -
FSA: An Alternative Efficient Implementation of Native Sparse Attention Kernel
par: Yan, Ran, et autres
Publié: (2025) -
FailSafe: High-performance Resilient Serving
par: Xu, Ziyi, et autres
Publié: (2025) -
cedar: Optimized and Unified Machine Learning Input Data Pipelines
par: Zhao, Mark, et autres
Publié: (2024) -
HexGen-2: Disaggregated Generative Inference of LLMs in Heterogeneous Environment
par: Jiang, Youhe, et autres
Publié: (2025)