ClusterFusion++: Expanding Cluster-Level Fusion to Full Transformer-Block Decoding
Fuente:
arXiv
Saved in:
| Main Authors: | Jin, ChiHeng, Yu, Hongche, Chen, Xihui |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ClusterFusion: Expanding Operator Fusion Scope for LLM Inference via Cluster-Level Collective Primitive
by: Luo, Xinhao, et al.
Published: (2025)
by: Luo, Xinhao, et al.
Published: (2025)
KUBEDIRECT: Unleashing the Full Power of the Cluster Manager for Serverless Computing
by: Qi, Sheng, et al.
Published: (2026)
by: Qi, Sheng, et al.
Published: (2026)
FlashFuser: Expanding the Scale of Kernel Fusion for Compute-Intensive Operators via Inter-Core Connection
by: Huang, Ziyu, et al.
Published: (2025)
by: Huang, Ziyu, et al.
Published: (2025)
Cephalo: Harnessing Heterogeneous GPU Clusters for Training Transformer Models
by: Guo, Runsheng Benson, et al.
Published: (2024)
by: Guo, Runsheng Benson, et al.
Published: (2024)
FUSCO: High-Performance Distributed Data Shuffling via Transformation-Communication Fusion
by: Zhu, Zhuoran, et al.
Published: (2025)
by: Zhu, Zhuoran, et al.
Published: (2025)
ClusterLess: Deadline-Aware Serverless Workflow Orchestration on Federated Edge Clusters
by: Farahani, Reza, et al.
Published: (2026)
by: Farahani, Reza, et al.
Published: (2026)
Flexible Clustered Federated Learning for Client-Level Data Distribution Shift
by: Duan, Moming, et al.
Published: (2021)
by: Duan, Moming, et al.
Published: (2021)
FedHC: A Hierarchical Clustered Federated Learning Framework for Satellite Networks
by: Liu, Zhuocheng, et al.
Published: (2025)
by: Liu, Zhuocheng, et al.
Published: (2025)
Konflux: Optimized Function Fusion for Serverless Applications
by: Kowallik, Niklas, et al.
Published: (2026)
by: Kowallik, Niklas, et al.
Published: (2026)
Predictable LLM Serving on GPU Clusters
by: Darzi, Erfan, et al.
Published: (2025)
by: Darzi, Erfan, et al.
Published: (2025)
Composing Distributed Computations Through Task and Kernel Fusion
by: Yadav, Rohan, et al.
Published: (2024)
by: Yadav, Rohan, et al.
Published: (2024)
gZCCL: Compression-Accelerated Collective Communication Framework for GPU Clusters
by: Huang, Jiajun, et al.
Published: (2023)
by: Huang, Jiajun, et al.
Published: (2023)
Fantasy: Efficient Large-scale Vector Search on GPU Clusters with GPUDirect Async
by: Liu, Yi, et al.
Published: (2025)
by: Liu, Yi, et al.
Published: (2025)
Dalek: An Unconventional and Energy-Aware Heterogeneous Cluster
by: Cassagne, Adrien, et al.
Published: (2025)
by: Cassagne, Adrien, et al.
Published: (2025)
Checkpoint and Restart: An Energy Consumption Characterization in Clusters
by: Moran, Marina, et al.
Published: (2024)
by: Moran, Marina, et al.
Published: (2024)
Syndeo: Portable Ray Clusters with Secure Containerization
by: Li, William, et al.
Published: (2024)
by: Li, William, et al.
Published: (2024)
Dynamic Client Clustering, Bandwidth Allocation, and Workload Optimization for Semi-synchronous Federated Learning
by: Yu, Liangkun, et al.
Published: (2024)
by: Yu, Liangkun, et al.
Published: (2024)
A 1024 RV-Cores Shared-L1 Cluster with High Bandwidth Memory Link for Low-Latency 6G-SDR
by: Zhang, Yichao, et al.
Published: (2024)
by: Zhang, Yichao, et al.
Published: (2024)
PAL: A Variability-Aware Policy for Scheduling ML Workloads in GPU Clusters
by: Jain, Rutwik, et al.
Published: (2024)
by: Jain, Rutwik, et al.
Published: (2024)
Optimizing Memory Allocation in Distributed Clusters with Predictive Modeling
by: Bader, Jonathan, et al.
Published: (2026)
by: Bader, Jonathan, et al.
Published: (2026)
Optimal Resource Efficiency with Fairness in Heterogeneous GPU Clusters
by: Mo, Zizhao, et al.
Published: (2024)
by: Mo, Zizhao, et al.
Published: (2024)
DeepOps & SLURM: Your GPU Cluster Guide
by: Majee, Arindam
Published: (2024)
by: Majee, Arindam
Published: (2024)
Megha: Decentralized Global Fair Scheduling for Federated Clusters
by: Thiyyakat, Meghana, et al.
Published: (2021)
by: Thiyyakat, Meghana, et al.
Published: (2021)
Toward Sustainability-Aware LLM Inference on Edge Clusters
by: Rajashekar, Kolichala, et al.
Published: (2025)
by: Rajashekar, Kolichala, et al.
Published: (2025)
Eva: Cost-Efficient Cloud-Based Cluster Scheduling
by: Chang, Tzu-Tao, et al.
Published: (2025)
by: Chang, Tzu-Tao, et al.
Published: (2025)
Solutions for Distributed Memory Access Mechanism on HPC Clusters
by: Meizner, Jan, et al.
Published: (2025)
by: Meizner, Jan, et al.
Published: (2025)
Provuse: Platform-Side Function Fusion for Performance and Efficiency in FaaS Environments
by: Kowallik, Niklas, et al.
Published: (2026)
by: Kowallik, Niklas, et al.
Published: (2026)
Multi-Resolution Model Fusion for Accelerating the Convolutional Neural Network Training
by: Wang, Kewei, et al.
Published: (2025)
by: Wang, Kewei, et al.
Published: (2025)
NanoCP: Request-Level Dynamic Context Parallelism for Data-Expert Parallel Decoding
by: Chen, Jiefei, et al.
Published: (2026)
by: Chen, Jiefei, et al.
Published: (2026)
Asynchronous Federated Clustering with Unknown Number of Clusters
by: Zhang, Yunfan, et al.
Published: (2024)
by: Zhang, Yunfan, et al.
Published: (2024)
An Efficient, Reliable and Observable Collective Communication Library in Large-scale GPU Training Clusters
by: Zhang, Mingjun, et al.
Published: (2025)
by: Zhang, Mingjun, et al.
Published: (2025)
C-Koordinator: Interference-aware Management for Large-scale and Co-located Microservice Clusters
by: Song, Shengye, et al.
Published: (2025)
by: Song, Shengye, et al.
Published: (2025)
Sailor: Automating Distributed Training over Dynamic, Heterogeneous, and Geo-distributed Clusters
by: Strati, Foteini, et al.
Published: (2025)
by: Strati, Foteini, et al.
Published: (2025)
Training DNN Models over Heterogeneous Clusters with Optimal Performance
by: Nie, Chengyi, et al.
Published: (2024)
by: Nie, Chengyi, et al.
Published: (2024)
Balancing Fixed Number of Nodes Among Multiple Fixed Clusters
by: Ranjan, Paritosh, et al.
Published: (2025)
by: Ranjan, Paritosh, et al.
Published: (2025)
Hamava: Fault-tolerant Reconfigurable Geo-Replication on Heterogeneous Clusters
by: Mane, Tejas, et al.
Published: (2024)
by: Mane, Tejas, et al.
Published: (2024)
Faster Parallel Triangular Maximally Filtered Graphs and Hierarchical Clustering
by: Raphael, Steven, et al.
Published: (2024)
by: Raphael, Steven, et al.
Published: (2024)
HARP: Orchestrating Automated Parallel Training on Heterogeneous GPU Clusters
by: Liang, Antian, et al.
Published: (2025)
by: Liang, Antian, et al.
Published: (2025)
Zorse: Optimizing LLM Training Efficiency on Heterogeneous GPU Clusters
by: Guo, Runsheng Benson, et al.
Published: (2025)
by: Guo, Runsheng Benson, et al.
Published: (2025)
Rubick: Exploiting Job Reconfigurability for Deep Learning Cluster Scheduling
by: Zhang, Xinyi, et al.
Published: (2024)
by: Zhang, Xinyi, et al.
Published: (2024)
Similar Items
-
ClusterFusion: Expanding Operator Fusion Scope for LLM Inference via Cluster-Level Collective Primitive
by: Luo, Xinhao, et al.
Published: (2025) -
KUBEDIRECT: Unleashing the Full Power of the Cluster Manager for Serverless Computing
by: Qi, Sheng, et al.
Published: (2026) -
FlashFuser: Expanding the Scale of Kernel Fusion for Compute-Intensive Operators via Inter-Core Connection
by: Huang, Ziyu, et al.
Published: (2025) -
Cephalo: Harnessing Heterogeneous GPU Clusters for Training Transformer Models
by: Guo, Runsheng Benson, et al.
Published: (2024) -
FUSCO: High-Performance Distributed Data Shuffling via Transformation-Communication Fusion
by: Zhu, Zhuoran, et al.
Published: (2025)