PALM: A Efficient Performance Simulator for Tiled Accelerators with Large-scale Model Training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fang, Jiahao, Wang, Huizheng, Yang, Qize, Kong, Dehao, Dai, Xu, Deng, Jinyi, Hu, Yang, Yin, Shouyi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MoEntwine: Unleashing the Potential of Wafer-scale Chips for Large-scale Expert Parallel Inference
par: Tang, Xinru, et autres
Publié: (2025)
par: Tang, Xinru, et autres
Publié: (2025)
TileLink: Generating Efficient Compute-Communication Overlapping Kernels using Tile-Centric Primitives
par: Zheng, Size, et autres
Publié: (2025)
par: Zheng, Size, et autres
Publié: (2025)
Accelerating Sparse DNNs Based on Tiled GEMM
par: Guo, Cong, et autres
Publié: (2024)
par: Guo, Cong, et autres
Publié: (2024)
An Efficient, Reliable and Observable Collective Communication Library in Large-scale GPU Training Clusters
par: Zhang, Mingjun, et autres
Publié: (2025)
par: Zhang, Mingjun, et autres
Publié: (2025)
Lumos: Efficient Performance Modeling and Estimation for Large-scale LLM Training
par: Liang, Mingyu, et autres
Publié: (2025)
par: Liang, Mingyu, et autres
Publié: (2025)
HPCTransCompile: An AI Compiler Generated Dataset for High-Performance CUDA Transpilation and LLM Preliminary Exploration
par: Lv, Jiaqi, et autres
Publié: (2025)
par: Lv, Jiaqi, et autres
Publié: (2025)
Design in Tiles: Automating GEMM Deployment on Tile-Based Many-PE Accelerators
par: Shen, Aofeng, et autres
Publié: (2025)
par: Shen, Aofeng, et autres
Publié: (2025)
An Efficient and Adaptive Watermark Detection System with Tile-based Error Correction
par: Zhong, Xinrui, et autres
Publié: (2025)
par: Zhong, Xinrui, et autres
Publié: (2025)
GPU-Accelerated Distributed QAOA on Large-scale HPC Ecosystems
par: Xu, Zhihao, et autres
Publié: (2025)
par: Xu, Zhihao, et autres
Publié: (2025)
Performance Characterization of Containerized DNN Training and Inference on Edge Accelerators
par: K., Prashanthi S., et autres
Publié: (2023)
par: K., Prashanthi S., et autres
Publié: (2023)
Poplar: Efficient Scaling of Distributed DNN Training on Heterogeneous GPU Clusters
par: Zhang, WenZheng, et autres
Publié: (2024)
par: Zhang, WenZheng, et autres
Publié: (2024)
GMLake: Efficient and Transparent GPU Memory Defragmentation for Large-scale DNN Training with Virtual Memory Stitching
par: Guo, Cong, et autres
Publié: (2024)
par: Guo, Cong, et autres
Publié: (2024)
TileLoom: Automatic Dataflow Planning for Tile-Based Languages on Spatial Dataflow Accelerators
par: Li, Wei, et autres
Publié: (2025)
par: Li, Wei, et autres
Publié: (2025)
PAT: Accelerating LLM Decoding via Prefix-Aware Attention with Resource Efficient Multi-Tile Kernel
par: Yi, Jinjun, et autres
Publié: (2025)
par: Yi, Jinjun, et autres
Publié: (2025)
ACE-Sync: An Adaptive Cloud-Edge Synchronization Framework for Communication-Efficient Large-Scale Distributed Model Training
par: Yang, Yi, et autres
Publié: (2025)
par: Yang, Yi, et autres
Publié: (2025)
SWIFT: Expedited Failure Recovery for Large-scale DNN Training
par: Zhong, Yuchen, et autres
Publié: (2023)
par: Zhong, Yuchen, et autres
Publié: (2023)
Expert-as-a-Service: Towards Efficient, Scalable, and Robust Large-scale MoE Serving
par: Liu, Ziming, et autres
Publié: (2025)
par: Liu, Ziming, et autres
Publié: (2025)
Pro-Prophet: A Systematic Load Balancing Method for Efficient Parallel Training of Large-scale MoE Models
par: Wang, Wei, et autres
Publié: (2024)
par: Wang, Wei, et autres
Publié: (2024)
Characterizing the Performance of Accelerated Jetson Edge Devices for Training Deep Learning Models
par: K., Prashanthi S., et autres
Publié: (2025)
par: K., Prashanthi S., et autres
Publié: (2025)
EROICA: Online Performance Troubleshooting for Large-scale Model Training
par: Guan, Yu, et autres
Publié: (2025)
par: Guan, Yu, et autres
Publié: (2025)
MOSS: A Large-scale Open Microscopic Traffic Simulation System
par: Zhang, Jun, et autres
Publié: (2024)
par: Zhang, Jun, et autres
Publié: (2024)
A Study on the Performance of Distributed Training of Data-driven CFD Simulations
par: Iserte, Sergio, et autres
Publié: (2026)
par: Iserte, Sergio, et autres
Publié: (2026)
CFP: Efficient Optimization of Intra-Operator Parallelism Plans for Large Model Training
par: Hu, Weifang, et autres
Publié: (2025)
par: Hu, Weifang, et autres
Publié: (2025)
Efficient Training of Large Language Models on Distributed Infrastructures: A Survey
par: Duan, Jiangfei, et autres
Publié: (2024)
par: Duan, Jiangfei, et autres
Publié: (2024)
CacheFlow: Efficient LLM Serving with 3D-Parallel KV Cache Restoration
par: Nian, Sean, et autres
Publié: (2026)
par: Nian, Sean, et autres
Publié: (2026)
LoongTrain: Efficient Training of Long-Sequence LLMs with Head-Context Parallelism
par: Gu, Diandian, et autres
Publié: (2024)
par: Gu, Diandian, et autres
Publié: (2024)
Oases: Efficient Large-Scale Model Training on Commodity Servers via Overlapped and Automated Tensor Model Parallelism
par: Li, Shengwei, et autres
Publié: (2023)
par: Li, Shengwei, et autres
Publié: (2023)
IsoSched: Preemptive Tile Cascaded Scheduling of Multi-DNN via Subgraph Isomorphism
par: Zhao, Boran, et autres
Publié: (2025)
par: Zhao, Boran, et autres
Publié: (2025)
SPIN: Accelerating Large Language Model Inference with Heterogeneous Speculative Models
par: Chen, Fahao, et autres
Publié: (2025)
par: Chen, Fahao, et autres
Publié: (2025)
Seq1F1B: Efficient Sequence-Level Pipeline Parallelism for Large Language Model Training
par: Sun, Ao, et autres
Publié: (2024)
par: Sun, Ao, et autres
Publié: (2024)
Humas: A Heterogeneity- and Upgrade-aware Microservice Auto-scaling Framework in Large-scale Data Centers
par: Hua, Qin, et autres
Publié: (2024)
par: Hua, Qin, et autres
Publié: (2024)
On the Performance and Memory Footprint of Distributed Training: An Empirical Study on Transformers
par: Lu, Zhengxian, et autres
Publié: (2024)
par: Lu, Zhengxian, et autres
Publié: (2024)
Xorbits: Automating Operator Tiling for Distributed Data Science
par: Lu, Weizheng, et autres
Publié: (2023)
par: Lu, Weizheng, et autres
Publié: (2023)
Large Scale Multi-GPU Based Parallel Traffic Simulation for Accelerated Traffic Assignment and Propagation
par: Jiang, Xuan, et autres
Publié: (2024)
par: Jiang, Xuan, et autres
Publié: (2024)
DiffusionPipe: Training Large Diffusion Models with Efficient Pipelines
par: Tian, Ye, et autres
Publié: (2024)
par: Tian, Ye, et autres
Publié: (2024)
AMSP: Reducing Communication Overhead of ZeRO for Efficient LLM Training
par: Chen, Qiaoling, et autres
Publié: (2023)
par: Chen, Qiaoling, et autres
Publié: (2023)
Mitigating Interference of Microservices with a Scoring Mechanism in Large-scale Clusters
par: Yang, Dingyu, et autres
Publié: (2024)
par: Yang, Dingyu, et autres
Publié: (2024)
Large-scale Neural Network Quantum States for ab initio Quantum Chemistry Simulations on Fugaku
par: Xu, Hongtao, et autres
Publié: (2025)
par: Xu, Hongtao, et autres
Publié: (2025)
AIReSim: A Discrete Event Simulator for Large-scale AI Cluster Reliability Modeling
par: Pattabiraman, Karthik, et autres
Publié: (2026)
par: Pattabiraman, Karthik, et autres
Publié: (2026)
Zeppelin: Balancing Variable-length Workloads in Data Parallel Large Model Training
par: Chen, Chang, et autres
Publié: (2025)
par: Chen, Chang, et autres
Publié: (2025)
Documents similaires
-
MoEntwine: Unleashing the Potential of Wafer-scale Chips for Large-scale Expert Parallel Inference
par: Tang, Xinru, et autres
Publié: (2025) -
TileLink: Generating Efficient Compute-Communication Overlapping Kernels using Tile-Centric Primitives
par: Zheng, Size, et autres
Publié: (2025) -
Accelerating Sparse DNNs Based on Tiled GEMM
par: Guo, Cong, et autres
Publié: (2024) -
An Efficient, Reliable and Observable Collective Communication Library in Large-scale GPU Training Clusters
par: Zhang, Mingjun, et autres
Publié: (2025) -
Lumos: Efficient Performance Modeling and Estimation for Large-scale LLM Training
par: Liang, Mingyu, et autres
Publié: (2025)