When GPUs Fail Quietly: Observability-Aware Early Warning Beyond Numeric Telemetry
Fuente:
arXiv
Salvato in:
| Autori principali: | Bidollahkhani, Michael, Nordsiek, Freja, Kunkel, Julian M. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Communication-Avoiding Linear Algebraic Kernel K-Means on GPUs
di: Bellavita, Julian, et al.
Pubblicazione: (2026)
di: Bellavita, Julian, et al.
Pubblicazione: (2026)
HetCCL: Accelerating LLM Training with Heterogeneous GPUs
di: Kim, Heehoon, et al.
Pubblicazione: (2026)
di: Kim, Heehoon, et al.
Pubblicazione: (2026)
GOGH: Correlation-Guided Orchestration of GPUs in Heterogeneous Clusters
di: Raeisi, Ahmad, et al.
Pubblicazione: (2025)
di: Raeisi, Ahmad, et al.
Pubblicazione: (2025)
LLMQ: Efficient Lower-Precision Pretraining for Consumer GPUs
di: Schultheis, Erik, et al.
Pubblicazione: (2025)
di: Schultheis, Erik, et al.
Pubblicazione: (2025)
Tessera: Unlocking Heterogeneous GPUs through Kernel-Granularity Disaggregation
di: Hu, Tiancheng, et al.
Pubblicazione: (2026)
di: Hu, Tiancheng, et al.
Pubblicazione: (2026)
Scaling State-Space Models on Multiple GPUs with Tensor Parallelism
di: Dutt, Anurag, et al.
Pubblicazione: (2026)
di: Dutt, Anurag, et al.
Pubblicazione: (2026)
AcceleratedLiNGAM: Learning Causal DAGs at the speed of GPUs
di: Akinwande, Victor, et al.
Pubblicazione: (2024)
di: Akinwande, Victor, et al.
Pubblicazione: (2024)
Revisiting Early-Learning Regularization When Federated Learning Meets Noisy Labels
di: Kim, Taehyeon, et al.
Pubblicazione: (2024)
di: Kim, Taehyeon, et al.
Pubblicazione: (2024)
HeterMoE: Efficient Training of Mixture-of-Experts Models on Heterogeneous GPUs
di: Wu, Yongji, et al.
Pubblicazione: (2025)
di: Wu, Yongji, et al.
Pubblicazione: (2025)
AReaL-Hex: Accommodating Asynchronous RL Training over Heterogeneous GPUs
di: Yan, Ran, et al.
Pubblicazione: (2025)
di: Yan, Ran, et al.
Pubblicazione: (2025)
FLUX: Fast Software-based Communication Overlap On GPUs Through Kernel Fusion
di: Chang, Li-Wen, et al.
Pubblicazione: (2024)
di: Chang, Li-Wen, et al.
Pubblicazione: (2024)
PipeFill: Using GPUs During Bubbles in Pipeline-parallel LLM Training
di: Arfeen, Daiyaan, et al.
Pubblicazione: (2024)
di: Arfeen, Daiyaan, et al.
Pubblicazione: (2024)
SaberLDA: Sparsity-Aware Learning of Topic Models on GPUs
di: Li, Kaiwei, et al.
Pubblicazione: (2016)
di: Li, Kaiwei, et al.
Pubblicazione: (2016)
FastCHGNet: Training one Universal Interatomic Potential to 1.5 Hours with 32 GPUs
di: Zhou, Yuanchang, et al.
Pubblicazione: (2024)
di: Zhou, Yuanchang, et al.
Pubblicazione: (2024)
MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs
di: Jiang, Ziheng, et al.
Pubblicazione: (2024)
di: Jiang, Ziheng, et al.
Pubblicazione: (2024)
SkipPredict: When to Invest in Predictions for Scheduling
di: Shahout, Rana, et al.
Pubblicazione: (2024)
di: Shahout, Rana, et al.
Pubblicazione: (2024)
DECICE: AI-Driven Scheduling and Digital Twin Integration for the Cloud-HPC-Edge Compute Continuum
di: Sharma, Aasish Kumar, et al.
Pubblicazione: (2026)
di: Sharma, Aasish Kumar, et al.
Pubblicazione: (2026)
A Review of Tools and Techniques for Optimization of Workload Mapping and Scheduling in Heterogeneous HPC System
di: Sharma, Aasish Kumar, et al.
Pubblicazione: (2025)
di: Sharma, Aasish Kumar, et al.
Pubblicazione: (2025)
GrapheonRL: A Graph Neural Network and Reinforcement Learning Framework for Constraint and Data-Aware Workflow Mapping and Scheduling in Heterogeneous HPC Systems
di: Sharma, Aasish Kumar, et al.
Pubblicazione: (2025)
di: Sharma, Aasish Kumar, et al.
Pubblicazione: (2025)
Peer-to-Peer Deep Learning for Beyond-5G IoT
di: Pranav, Srinivasa, et al.
Pubblicazione: (2023)
di: Pranav, Srinivasa, et al.
Pubblicazione: (2023)
SyncFed: Time-Aware Federated Learning through Explicit Timestamping and Synchronization
di: Gül, Baran Can, et al.
Pubblicazione: (2025)
di: Gül, Baran Can, et al.
Pubblicazione: (2025)
Detecting Anomalies in Machine Learning Infrastructure via Hardware Telemetry
di: Chen, Ziji, et al.
Pubblicazione: (2025)
di: Chen, Ziji, et al.
Pubblicazione: (2025)
Efficient Training on Multiple Consumer GPUs with RoundPipe
di: Luo, Yibin, et al.
Pubblicazione: (2026)
di: Luo, Yibin, et al.
Pubblicazione: (2026)
Challenging GPU Dominance: When CPUs Outperform for On-Device LLM Inference
di: Zhang, Haolin, et al.
Pubblicazione: (2025)
di: Zhang, Haolin, et al.
Pubblicazione: (2025)
Beyond Efficiency: Scaling AI Sustainably
di: Wu, Carole-Jean, et al.
Pubblicazione: (2024)
di: Wu, Carole-Jean, et al.
Pubblicazione: (2024)
Exploring the Boundaries of On-Device Inference: When Tiny Falls Short, Go Hierarchical
di: Behera, Adarsh Prasad, et al.
Pubblicazione: (2024)
di: Behera, Adarsh Prasad, et al.
Pubblicazione: (2024)
TP-Aware Dequantization
di: Hoque, Adnan, et al.
Pubblicazione: (2024)
di: Hoque, Adnan, et al.
Pubblicazione: (2024)
Dynamic Rebatching for Efficient Early-Exit Inference with DREX
di: Liu, Xuting, et al.
Pubblicazione: (2025)
di: Liu, Xuting, et al.
Pubblicazione: (2025)
Helix: Serving Large Language Models over Heterogeneous GPUs and Network via Max-Flow
di: Mei, Yixuan, et al.
Pubblicazione: (2024)
di: Mei, Yixuan, et al.
Pubblicazione: (2024)
Uncertainty-Aware Decarbonization for Datacenters
di: Li, Amy, et al.
Pubblicazione: (2024)
di: Li, Amy, et al.
Pubblicazione: (2024)
Hierarchical Resource Partitioning on Modern GPUs: A Reinforcement Learning Approach
di: Saroliya, Urvij, et al.
Pubblicazione: (2024)
di: Saroliya, Urvij, et al.
Pubblicazione: (2024)
Beyond the Federation: Topology-aware Federated Learning for Generalization to Unseen Clients
di: Ma, Mengmeng, et al.
Pubblicazione: (2024)
di: Ma, Mengmeng, et al.
Pubblicazione: (2024)
Apparate: Rethinking Early Exits to Tame Latency-Throughput Tensions in ML Serving
di: Dai, Yinwei, et al.
Pubblicazione: (2023)
di: Dai, Yinwei, et al.
Pubblicazione: (2023)
Dependency Aware Incident Linking in Large Cloud Systems
di: Ghosh, Supriyo, et al.
Pubblicazione: (2024)
di: Ghosh, Supriyo, et al.
Pubblicazione: (2024)
Priority-Aware Model-Distributed Inference at Edge Networks
di: Li, Teng, et al.
Pubblicazione: (2024)
di: Li, Teng, et al.
Pubblicazione: (2024)
Drift-Aware Federated Learning: A Causal Perspective
di: Fang, Yunjie, et al.
Pubblicazione: (2025)
di: Fang, Yunjie, et al.
Pubblicazione: (2025)
Energy-Aware Decentralized Learning with Intermittent Model Training
di: Dhasade, Akash, et al.
Pubblicazione: (2024)
di: Dhasade, Akash, et al.
Pubblicazione: (2024)
Heterogeneity-Aware Client Selection Methodology For Efficient Federated Learning
di: Balivada, Nihal, et al.
Pubblicazione: (2026)
di: Balivada, Nihal, et al.
Pubblicazione: (2026)
Maverick-Aware Shapley Valuation for Client Selection in Federated Learning
di: Yang, Mengwei, et al.
Pubblicazione: (2024)
di: Yang, Mengwei, et al.
Pubblicazione: (2024)
Resource-Aware Aggregation and Sparsification in Heterogeneous Ensemble Federated Learning
di: Ryum, Keumseo, et al.
Pubblicazione: (2025)
di: Ryum, Keumseo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Communication-Avoiding Linear Algebraic Kernel K-Means on GPUs
di: Bellavita, Julian, et al.
Pubblicazione: (2026) -
HetCCL: Accelerating LLM Training with Heterogeneous GPUs
di: Kim, Heehoon, et al.
Pubblicazione: (2026) -
GOGH: Correlation-Guided Orchestration of GPUs in Heterogeneous Clusters
di: Raeisi, Ahmad, et al.
Pubblicazione: (2025) -
LLMQ: Efficient Lower-Precision Pretraining for Consumer GPUs
di: Schultheis, Erik, et al.
Pubblicazione: (2025) -
Tessera: Unlocking Heterogeneous GPUs through Kernel-Granularity Disaggregation
di: Hu, Tiancheng, et al.
Pubblicazione: (2026)