POLAR-PIC: A Holistic Framework for Matrixized PIC with Co-Designed Compute, Layout, and Communication
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rao, Yizhuo, Cui, Xingjian, Pang, Shangzhi, Xie, Jiabin, Feng, Guangnan, Wei, Jinhui, Zhang, Ziyan, Gao, Languang, Wang, Zhenyu, Chen, Zhiguang, Lu, Yutong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Matrix-PIC: Harnessing Matrix Outer-product for High-Performance Particle-in-Cell Simulations
par: Rao, Yizhuo, et autres
Publié: (2026)
par: Rao, Yizhuo, et autres
Publié: (2026)
UNR: Unified Notifiable RMA Library for HPC
par: Feng, Guangnan, et autres
Publié: (2024)
par: Feng, Guangnan, et autres
Publié: (2024)
AlignedServe: Orchestrating Prefix-aware Batching to Build a High-throughput and Computing-efficient LLM Serving System
par: Bai, Fengyao, et autres
Publié: (2026)
par: Bai, Fengyao, et autres
Publié: (2026)
CoCoDiff: Optimizing Collective Communications for Distributed Diffusion Transformer Inference Under Ulysses Sequence Parallelism
par: Ma, Bin, et autres
Publié: (2026)
par: Ma, Bin, et autres
Publié: (2026)
Characterizing the Performance of the Implicit Massively Parallel Particle-in-Cell iPIC3D Code
par: Williams, Jeremy J., et autres
Publié: (2024)
par: Williams, Jeremy J., et autres
Publié: (2024)
Communication Lower Bounds and Optimal Algorithms for Symmetric Matrix Computations
par: Daas, Hussam Al, et autres
Publié: (2024)
par: Daas, Hussam Al, et autres
Publié: (2024)
Layout-Agnostic MPI Abstraction for Distributed Computing in Modern C++
par: Klepl, Jiří, et autres
Publié: (2025)
par: Klepl, Jiří, et autres
Publié: (2025)
TD-Pipe: Temporally-Disaggregated Pipeline Parallelism Architecture for High-Throughput LLM Inference
par: Zhang, Hongbin, et autres
Publié: (2025)
par: Zhang, Hongbin, et autres
Publié: (2025)
gLLM: Global Balanced Pipeline Parallelism System for Distributed LLM Serving with Token Throttling
par: Guo, Tianyu, et autres
Publié: (2025)
par: Guo, Tianyu, et autres
Publié: (2025)
Boosting LLM Serving through Spatial-Temporal GPU Resource Sharing
par: Lin, Zejia, et autres
Publié: (2025)
par: Lin, Zejia, et autres
Publié: (2025)
EcoServe: Enabling Cost-effective LLM Serving with Proactive Intra- and Inter-Instance Orchestration
par: Du, Jiangsu, et autres
Publié: (2025)
par: Du, Jiangsu, et autres
Publié: (2025)
Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism
par: Wei, Jinhui, et autres
Publié: (2025)
par: Wei, Jinhui, et autres
Publié: (2025)
Integrating High Performance In-Memory Data Streaming and In-Situ Visualization in Hybrid MPI+OpenMP PIC MC Simulations Towards Exascale
par: Williams, Jeremy J., et autres
Publié: (2025)
par: Williams, Jeremy J., et autres
Publié: (2025)
PROBE: Co-Balancing Computation and Communication in MoE Inference via Real-Time Predictive Prefetching
par: Zhu, Qianchao, et autres
Publié: (2026)
par: Zhu, Qianchao, et autres
Publié: (2026)
Sparsity-Preserving Encodings for Straggler-Optimal Distributed Matrix Computations at the Edge
par: Das, Anindya Bijoy, et autres
Publié: (2024)
par: Das, Anindya Bijoy, et autres
Publié: (2024)
Application of cloud computing platform in industrial big data processing
par: Yao, Ziyan
Publié: (2024)
par: Yao, Ziyan
Publié: (2024)
Improving SpGEMM Performance Through Matrix Reordering and Cluster-wise Computation
par: Islam, Abdullah Al Raqibul, et autres
Publié: (2025)
par: Islam, Abdullah Al Raqibul, et autres
Publié: (2025)
On Fault Tolerance of Data Storage Systems: A Holistic Perspective
par: Zheng, Mai, et autres
Publié: (2025)
par: Zheng, Mai, et autres
Publié: (2025)
Selection of Supervised Learning-based Sparse Matrix Reordering Algorithms
par: Tang, Tao, et autres
Publié: (2025)
par: Tang, Tao, et autres
Publié: (2025)
ECDQC: Efficient Compilation for Distributed Quantum Computing with Linear Layout
par: Liu, Kecheng, et autres
Publié: (2024)
par: Liu, Kecheng, et autres
Publié: (2024)
Scalable Readability Evaluation for Graph Layouts: 2D Geometric Distributed Algorithms
par: Yun, Sanggeon
Publié: (2024)
par: Yun, Sanggeon
Publié: (2024)
Leveraging Hardware-Aware Computation in Mixed-Precision Matrix Multiply: A Tile-Centric Approach
par: Zhang, Qiao, et autres
Publié: (2025)
par: Zhang, Qiao, et autres
Publié: (2025)
Fast Kronecker Matrix-Matrix Multiplication on GPUs
par: Jangda, Abhinav, et autres
Publié: (2024)
par: Jangda, Abhinav, et autres
Publié: (2024)
DCSim: Computing and Networking Integration based Container Scheduling Simulator for Data Centers
par: Hu, Jinlong, et autres
Publié: (2024)
par: Hu, Jinlong, et autres
Publié: (2024)
UMDAM: A Unified Data Layout and DRAM Address Mapping for Heterogenous NPU-PIM
par: Huang, Hai
Publié: (2025)
par: Huang, Hai
Publié: (2025)
H-EYE: Holistic Resource Modeling and Management for Diversely Scaled Edge-Cloud Systems
par: Dagli, Ismet, et autres
Publié: (2024)
par: Dagli, Ismet, et autres
Publié: (2024)
Stencil Matrixization
par: Zhao, Wenxuan, et autres
Publié: (2023)
par: Zhao, Wenxuan, et autres
Publié: (2023)
Holistic generational offsets: Fostering a primitive online abstraction for human vs. machine cognition
par: D'Souza, Shaun, et autres
Publié: (2018)
par: D'Souza, Shaun, et autres
Publié: (2018)
Sparsity-Aware Roofline Models for Sparse Matrix-Matrix Multiplication
par: Qian, Matthew, et autres
Publié: (2026)
par: Qian, Matthew, et autres
Publié: (2026)
PIM-SHERPA: Software Method for On-device LLM Inference by Resolving PIM Memory Attribute and Layout Inconsistencies
par: Lee, Sunjung, et autres
Publié: (2026)
par: Lee, Sunjung, et autres
Publié: (2026)
Accelerating Sparse Matrix-Matrix Multiplication on GPUs with Processing Near HBMs
par: Li, Shiju, et autres
Publié: (2025)
par: Li, Shiju, et autres
Publié: (2025)
PipeMax: Enhancing Offline LLM Inference on Commodity GPU Servers
par: Zhang, Hongbin, et autres
Publié: (2026)
par: Zhang, Hongbin, et autres
Publié: (2026)
EdgeShard: Efficient LLM Inference via Collaborative Edge Computing
par: Zhang, Mingjin, et autres
Publié: (2024)
par: Zhang, Mingjin, et autres
Publié: (2024)
Integrated Sensing, Communication, and Computing: An Information-oriented Resource Transaction Mechanism
par: Chen, Ning, et autres
Publié: (2024)
par: Chen, Ning, et autres
Publié: (2024)
Lagom: Unleashing the Power of Communication and Computation Overlapping for Distributed LLM Training
par: Xu, Guanbin, et autres
Publié: (2026)
par: Xu, Guanbin, et autres
Publié: (2026)
Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation
par: Zhu, Ying, et autres
Publié: (2025)
par: Zhu, Ying, et autres
Publié: (2025)
Minimizing Communication for Parallel Symmetric Tensor Times Same Vector Computation
par: Daas, Hussam Al, et autres
Publié: (2025)
par: Daas, Hussam Al, et autres
Publié: (2025)
On-the-fly Communication-and-Computing to Enable Representation Learning for Distributed Point Clouds
par: Chen, Xu, et autres
Publié: (2024)
par: Chen, Xu, et autres
Publié: (2024)
AsyncSparse: Accelerating Sparse Matrix-Matrix Multiplication on Asynchronous GPU Architectures
par: Liu, Jie, et autres
Publié: (2026)
par: Liu, Jie, et autres
Publié: (2026)
MAGNUS: Generating Data Locality to Accelerate Sparse Matrix-Matrix Multiplication on CPUs
par: Wolfson-Pou, Jordi, et autres
Publié: (2025)
par: Wolfson-Pou, Jordi, et autres
Publié: (2025)
Documents similaires
-
Matrix-PIC: Harnessing Matrix Outer-product for High-Performance Particle-in-Cell Simulations
par: Rao, Yizhuo, et autres
Publié: (2026) -
UNR: Unified Notifiable RMA Library for HPC
par: Feng, Guangnan, et autres
Publié: (2024) -
AlignedServe: Orchestrating Prefix-aware Batching to Build a High-throughput and Computing-efficient LLM Serving System
par: Bai, Fengyao, et autres
Publié: (2026) -
CoCoDiff: Optimizing Collective Communications for Distributed Diffusion Transformer Inference Under Ulysses Sequence Parallelism
par: Ma, Bin, et autres
Publié: (2026) -
Characterizing the Performance of the Implicit Massively Parallel Particle-in-Cell iPIC3D Code
par: Williams, Jeremy J., et autres
Publié: (2024)