GOGH: Correlation-Guided Orchestration of GPUs in Heterogeneous Clusters
Fuente:
arXiv
Guardado en:
| Autores principales: | Raeisi, Ahmad, Dolati, Mahdi, Darabi, Sina, Talebi, Sadegh, Eugster, Patrick, Khonsari, Ahmad |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HetCCL: Accelerating LLM Training with Heterogeneous GPUs
por: Kim, Heehoon, et al.
Publicado: (2026)
por: Kim, Heehoon, et al.
Publicado: (2026)
Tessera: Unlocking Heterogeneous GPUs through Kernel-Granularity Disaggregation
por: Hu, Tiancheng, et al.
Publicado: (2026)
por: Hu, Tiancheng, et al.
Publicado: (2026)
HeterMoE: Efficient Training of Mixture-of-Experts Models on Heterogeneous GPUs
por: Wu, Yongji, et al.
Publicado: (2025)
por: Wu, Yongji, et al.
Publicado: (2025)
AReaL-Hex: Accommodating Asynchronous RL Training over Heterogeneous GPUs
por: Yan, Ran, et al.
Publicado: (2025)
por: Yan, Ran, et al.
Publicado: (2025)
PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR
por: Zhang, Yiqi, et al.
Publicado: (2026)
por: Zhang, Yiqi, et al.
Publicado: (2026)
LLMQ: Efficient Lower-Precision Pretraining for Consumer GPUs
por: Schultheis, Erik, et al.
Publicado: (2025)
por: Schultheis, Erik, et al.
Publicado: (2025)
Communication-Avoiding Linear Algebraic Kernel K-Means on GPUs
por: Bellavita, Julian, et al.
Publicado: (2026)
por: Bellavita, Julian, et al.
Publicado: (2026)
Scaling State-Space Models on Multiple GPUs with Tensor Parallelism
por: Dutt, Anurag, et al.
Publicado: (2026)
por: Dutt, Anurag, et al.
Publicado: (2026)
AcceleratedLiNGAM: Learning Causal DAGs at the speed of GPUs
por: Akinwande, Victor, et al.
Publicado: (2024)
por: Akinwande, Victor, et al.
Publicado: (2024)
Federated Incomplete Multi-View Clustering with Heterogeneous Graph Neural Networks
por: Yan, Xueming, et al.
Publicado: (2024)
por: Yan, Xueming, et al.
Publicado: (2024)
Helix: Serving Large Language Models over Heterogeneous GPUs and Network via Max-Flow
por: Mei, Yixuan, et al.
Publicado: (2024)
por: Mei, Yixuan, et al.
Publicado: (2024)
FLUX: Fast Software-based Communication Overlap On GPUs Through Kernel Fusion
por: Chang, Li-Wen, et al.
Publicado: (2024)
por: Chang, Li-Wen, et al.
Publicado: (2024)
PipeFill: Using GPUs During Bubbles in Pipeline-parallel LLM Training
por: Arfeen, Daiyaan, et al.
Publicado: (2024)
por: Arfeen, Daiyaan, et al.
Publicado: (2024)
Parallel Split Learning with Global Sampling
por: Kohankhaki, Mohammad, et al.
Publicado: (2024)
por: Kohankhaki, Mohammad, et al.
Publicado: (2024)
Metadata-Guided Adaptable Frequency Scaling across Heterogeneous Applications and Devices
por: Yan, Jinqi, et al.
Publicado: (2025)
por: Yan, Jinqi, et al.
Publicado: (2025)
HARP: Orchestrating Automated Parallel Training on Heterogeneous GPU Clusters
por: Liang, Antian, et al.
Publicado: (2025)
por: Liang, Antian, et al.
Publicado: (2025)
When GPUs Fail Quietly: Observability-Aware Early Warning Beyond Numeric Telemetry
por: Bidollahkhani, Michael, et al.
Publicado: (2026)
por: Bidollahkhani, Michael, et al.
Publicado: (2026)
FedORGP: Guiding Heterogeneous Federated Learning with Orthogonality Regularization on Global Prototypes
por: Guo, Fucheng, et al.
Publicado: (2025)
por: Guo, Fucheng, et al.
Publicado: (2025)
Catastrophic Forgetting Resilient One-Shot Incremental Federated Learning
por: Zaland, Obaidullah, et al.
Publicado: (2026)
por: Zaland, Obaidullah, et al.
Publicado: (2026)
A Semi-Supervised Federated Learning Framework with Hierarchical Clustering Aggregation for Heterogeneous Satellite Networks
por: Liu, Zhuocheng, et al.
Publicado: (2025)
por: Liu, Zhuocheng, et al.
Publicado: (2025)
Clustered Federated Learning with Hierarchical Knowledge Distillation
por: Ahmad, Sabtain, et al.
Publicado: (2025)
por: Ahmad, Sabtain, et al.
Publicado: (2025)
FastCHGNet: Training one Universal Interatomic Potential to 1.5 Hours with 32 GPUs
por: Zhou, Yuanchang, et al.
Publicado: (2024)
por: Zhou, Yuanchang, et al.
Publicado: (2024)
MegaScale: Scaling Large Language Model Training to More Than 10,000 GPUs
por: Jiang, Ziheng, et al.
Publicado: (2024)
por: Jiang, Ziheng, et al.
Publicado: (2024)
Intelligent Orchestration of Distributed Large Foundation Model Inference at the Edge
por: Koch, Fernando, et al.
Publicado: (2025)
por: Koch, Fernando, et al.
Publicado: (2025)
Runtime-Orchestrated Second-Order Optimization for Scalable LLM Training
por: Lu, Yishun, et al.
Publicado: (2026)
por: Lu, Yishun, et al.
Publicado: (2026)
ADAPT: A Self-Calibrating Proactive Autoscaler for Container Orchestration
por: Baghel, Himanshu Singh
Publicado: (2026)
por: Baghel, Himanshu Singh
Publicado: (2026)
Incentivised Orchestrated Training Architecture (IOTA): A Technical Primer for Release
por: Quinque, Felix, et al.
Publicado: (2025)
por: Quinque, Felix, et al.
Publicado: (2025)
FlashEvolve: Accelerating Agent Self-Evolution with Asynchronous Stage Orchestration
por: Hu, Zhengding, et al.
Publicado: (2026)
por: Hu, Zhengding, et al.
Publicado: (2026)
DecHW: Heterogeneous Decentralized Federated Learning Exploiting Second-Order Information
por: Ahmad, Adnan, et al.
Publicado: (2026)
por: Ahmad, Adnan, et al.
Publicado: (2026)
Decentralized Orchestration Architecture for Fluid Computing: A Secure Distributed AI Use Case
por: Cajaraville-Aboy, Diego, et al.
Publicado: (2026)
por: Cajaraville-Aboy, Diego, et al.
Publicado: (2026)
SAFL: Structure-Aware Personalized Federated Learning via Client-Specific Clustering and SCSI-Guided Model Pruning
por: Li, Nan, et al.
Publicado: (2025)
por: Li, Nan, et al.
Publicado: (2025)
ALTO: Adaptive LoRA Tuning and Orchestration for Heterogeneous LoRA Training Workloads
por: Zuo, Jingwei, et al.
Publicado: (2026)
por: Zuo, Jingwei, et al.
Publicado: (2026)
Asynchronous Federated Clustering with Unknown Number of Clusters
por: Zhang, Yunfan, et al.
Publicado: (2024)
por: Zhang, Yunfan, et al.
Publicado: (2024)
Coral: Cost-Efficient Multi-LLM Serving over Heterogeneous Cloud GPUs
por: Mei, Yixuan, et al.
Publicado: (2026)
por: Mei, Yixuan, et al.
Publicado: (2026)
HDEE: Heterogeneous Domain Expert Ensemble
por: Ersoy, Oğuzhan, et al.
Publicado: (2025)
por: Ersoy, Oğuzhan, et al.
Publicado: (2025)
Federated K-means Clustering
por: Garst, Swier, et al.
Publicado: (2023)
por: Garst, Swier, et al.
Publicado: (2023)
Federated Temporal Graph Clustering
por: Zhou, Zihao, et al.
Publicado: (2024)
por: Zhou, Zihao, et al.
Publicado: (2024)
Heterogeneous Federated Learning with Prototype Alignment and Upscaling
por: Lee, Gyuejeong, et al.
Publicado: (2025)
por: Lee, Gyuejeong, et al.
Publicado: (2025)
Hypernetworks for Model-Heterogeneous Personalized Federated Learning
por: Zhang, Chen, et al.
Publicado: (2025)
por: Zhang, Chen, et al.
Publicado: (2025)
STHFL: Spatio-Temporal Heterogeneous Federated Learning
por: Guo, Shunxin, et al.
Publicado: (2025)
por: Guo, Shunxin, et al.
Publicado: (2025)
Ejemplares similares
-
HetCCL: Accelerating LLM Training with Heterogeneous GPUs
por: Kim, Heehoon, et al.
Publicado: (2026) -
Tessera: Unlocking Heterogeneous GPUs through Kernel-Granularity Disaggregation
por: Hu, Tiancheng, et al.
Publicado: (2026) -
HeterMoE: Efficient Training of Mixture-of-Experts Models on Heterogeneous GPUs
por: Wu, Yongji, et al.
Publicado: (2025) -
AReaL-Hex: Accommodating Asynchronous RL Training over Heterogeneous GPUs
por: Yan, Ran, et al.
Publicado: (2025) -
PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR
por: Zhang, Yiqi, et al.
Publicado: (2026)