Xorbits: Automating Operator Tiling for Distributed Data Science
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lu, Weizheng, He, Kaisheng, Qin, Xuye, Li, Chengjie, Wang, Zhong, Yuan, Tao, Liao, Xia, Zhang, Feng, Chen, Yueguo, Du, Xiaoyong |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
An Efficient and Adaptive Watermark Detection System with Tile-based Error Correction
par: Zhong, Xinrui, et autres
Publié: (2025)
par: Zhong, Xinrui, et autres
Publié: (2025)
IsoSched: Preemptive Tile Cascaded Scheduling of Multi-DNN via Subgraph Isomorphism
par: Zhao, Boran, et autres
Publié: (2025)
par: Zhao, Boran, et autres
Publié: (2025)
Design in Tiles: Automating GEMM Deployment on Tile-Based Many-PE Accelerators
par: Shen, Aofeng, et autres
Publié: (2025)
par: Shen, Aofeng, et autres
Publié: (2025)
Lion: Minimizing Distributed Transactions through Adaptive Replica Provision (Extended Version)
par: Zheng, Qiushi, et autres
Publié: (2024)
par: Zheng, Qiushi, et autres
Publié: (2024)
TileLink: Generating Efficient Compute-Communication Overlapping Kernels using Tile-Centric Primitives
par: Zheng, Size, et autres
Publié: (2025)
par: Zheng, Size, et autres
Publié: (2025)
Hiding Communication Cost in Distributed LLM Training via Micro-batch Co-execution
par: Wang, Haiquan, et autres
Publié: (2024)
par: Wang, Haiquan, et autres
Publié: (2024)
Accelerating Sparse DNNs Based on Tiled GEMM
par: Guo, Cong, et autres
Publié: (2024)
par: Guo, Cong, et autres
Publié: (2024)
Communication-Efficient Distributed Learning via Sparse and Adaptive Stochastic Gradient
par: Deng, Xiaoge, et autres
Publié: (2021)
par: Deng, Xiaoge, et autres
Publié: (2021)
Resilience through Automated Adaptive Configuration for Distribution and Replication
par: Stoller, Scott D., et autres
Publié: (2025)
par: Stoller, Scott D., et autres
Publié: (2025)
PALM: A Efficient Performance Simulator for Tiled Accelerators with Large-scale Model Training
par: Fang, Jiahao, et autres
Publié: (2024)
par: Fang, Jiahao, et autres
Publié: (2024)
On the Performance and Memory Footprint of Distributed Training: An Empirical Study on Transformers
par: Lu, Zhengxian, et autres
Publié: (2024)
par: Lu, Zhengxian, et autres
Publié: (2024)
Leveraging Hardware-Aware Computation in Mixed-Precision Matrix Multiply: A Tile-Centric Approach
par: Zhang, Qiao, et autres
Publié: (2025)
par: Zhang, Qiao, et autres
Publié: (2025)
DAWN: Matrix Operation-Optimized Algorithm for Shortest Paths Problem on Unweighted Graphs
par: Feng, Yelai, et autres
Publié: (2022)
par: Feng, Yelai, et autres
Publié: (2022)
Nezha: Breaking Multi-Rail Network Barriers for Distributed DNN Training
par: Yu, Enda, et autres
Publié: (2024)
par: Yu, Enda, et autres
Publié: (2024)
gLLM: Global Balanced Pipeline Parallelism System for Distributed LLM Serving with Token Throttling
par: Guo, Tianyu, et autres
Publié: (2025)
par: Guo, Tianyu, et autres
Publié: (2025)
TileLoom: Automatic Dataflow Planning for Tile-Based Languages on Spatial Dataflow Accelerators
par: Li, Wei, et autres
Publié: (2025)
par: Li, Wei, et autres
Publié: (2025)
Sailor: Automating Distributed Training over Dynamic, Heterogeneous, and Geo-distributed Clusters
par: Strati, Foteini, et autres
Publié: (2025)
par: Strati, Foteini, et autres
Publié: (2025)
Breaking the Capacity Bottleneck in Model-Heterogeneous Federated Learning via Gradual Model Restoration
par: Ma, Chengjie, et autres
Publié: (2025)
par: Ma, Chengjie, et autres
Publié: (2025)
Federated Learning based on Pruning and Recovery
par: Ma, Chengjie
Publié: (2024)
par: Ma, Chengjie
Publié: (2024)
ColonyOS -- A Meta-Operating System for Distributed Computing Across Heterogeneous Platform
par: Kristiansson, Johan
Publié: (2024)
par: Kristiansson, Johan
Publié: (2024)
Heta: Distributed Training of Heterogeneous Graph Neural Networks
par: Zhong, Yuchen, et autres
Publié: (2024)
par: Zhong, Yuchen, et autres
Publié: (2024)
Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection
par: Zhou, Yuhang, et autres
Publié: (2025)
par: Zhou, Yuhang, et autres
Publié: (2025)
Distributed Retrieval-Augmented Generation
par: Xu, Chenhao, et autres
Publié: (2025)
par: Xu, Chenhao, et autres
Publié: (2025)
You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models
par: Ding, Shiwei, et autres
Publié: (2025)
par: Ding, Shiwei, et autres
Publié: (2025)
Argus: Token Aware Distributed LLM Inference Optimization
par: Wu, Panlong, et autres
Publié: (2025)
par: Wu, Panlong, et autres
Publié: (2025)
Graph for Science: From API based Programming to Graph Engine based Programming for HPC
par: Zhang, Yu, et autres
Publié: (2023)
par: Zhang, Yu, et autres
Publié: (2023)
Distributed Bilevel Optimization with Dual Pruning for Resource-limited Clients
par: Li, Mingyi, et autres
Publié: (2025)
par: Li, Mingyi, et autres
Publié: (2025)
DistFlow: A Fully Distributed RL Framework for Scalable and Efficient LLM Post-Training
par: Wang, Zhixin, et autres
Publié: (2025)
par: Wang, Zhixin, et autres
Publié: (2025)
Jiagu: Optimizing Serverless Computing Resource Utilization with Harmonized Efficiency and Practicability
par: Liu, Qingyuan, et autres
Publié: (2024)
par: Liu, Qingyuan, et autres
Publié: (2024)
Efficient Distributed MLLM Training with Cornstarch
par: Jang, Insu, et autres
Publié: (2025)
par: Jang, Insu, et autres
Publié: (2025)
Dflow, a Python framework for constructing cloud-native AI-for-Science workflows
par: Liu, Xinzijian, et autres
Publié: (2024)
par: Liu, Xinzijian, et autres
Publié: (2024)
HARP: Orchestrating Automated Parallel Training on Heterogeneous GPU Clusters
par: Liang, Antian, et autres
Publié: (2025)
par: Liang, Antian, et autres
Publié: (2025)
Optimal Expert Selection for Distributed Mixture-of-Experts at the Wireless Edge
par: Qin, Shengling, et autres
Publié: (2025)
par: Qin, Shengling, et autres
Publié: (2025)
EXaCTz: Guaranteed Extremum Graph and Contour Tree Preservation for Distributed- and GPU-Parallel Lossy Compression
par: Li, Yuxiao, et autres
Publié: (2026)
par: Li, Yuxiao, et autres
Publié: (2026)
Flint: Compiler Enabled Cluster-Free Design Space Exploration for Distributed ML
par: Yoo, Jinsun, et autres
Publié: (2026)
par: Yoo, Jinsun, et autres
Publié: (2026)
Parallel Collaborative ADMM Privacy Computing and Adaptive GPU Acceleration for Distributed Edge Networks
par: Xia, Mengchun, et autres
Publié: (2026)
par: Xia, Mengchun, et autres
Publié: (2026)
History Rhymes: Accelerating LLM Reinforcement Learning with RhymeRL
par: He, Jingkai, et autres
Publié: (2025)
par: He, Jingkai, et autres
Publié: (2025)
DeepCompile: A Compiler-Driven Approach to Optimizing Distributed Deep Learning Training
par: Tanaka, Masahiro, et autres
Publié: (2025)
par: Tanaka, Masahiro, et autres
Publié: (2025)
Distributed On-Device LLM Inference With Over-the-Air Computation
par: Zhang, Kai, et autres
Publié: (2025)
par: Zhang, Kai, et autres
Publié: (2025)
Automated Calibration of Parallel and Distributed Computing Simulators: A Case Study
par: McDonald, Jesse, et autres
Publié: (2024)
par: McDonald, Jesse, et autres
Publié: (2024)
Documents similaires
-
An Efficient and Adaptive Watermark Detection System with Tile-based Error Correction
par: Zhong, Xinrui, et autres
Publié: (2025) -
IsoSched: Preemptive Tile Cascaded Scheduling of Multi-DNN via Subgraph Isomorphism
par: Zhao, Boran, et autres
Publié: (2025) -
Design in Tiles: Automating GEMM Deployment on Tile-Based Many-PE Accelerators
par: Shen, Aofeng, et autres
Publié: (2025) -
Lion: Minimizing Distributed Transactions through Adaptive Replica Provision (Extended Version)
par: Zheng, Qiushi, et autres
Publié: (2024) -
TileLink: Generating Efficient Compute-Communication Overlapping Kernels using Tile-Centric Primitives
par: Zheng, Size, et autres
Publié: (2025)