Parallel Track Transformers: Enabling Fast GPU Inference with Reduced Synchronization
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Chong, Du, Nan, Gunter, Tom, Lei, Tao, Seth, Kulin, Tong, Senyu, Wang, Jianyu, Yin, Guoli, Zhou, Xiyou, Zou, Kelvin, Pang, Ruoming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FastTrack: GPU-Accelerated Tracking for Visual SLAM
di: Khabiri, Kimia, et al.
Pubblicazione: (2025)
di: Khabiri, Kimia, et al.
Pubblicazione: (2025)
Torpor: GPU-Enabled Serverless Computing for Low-Latency, Resource-Efficient Inference
di: Yu, Minchen, et al.
Pubblicazione: (2023)
di: Yu, Minchen, et al.
Pubblicazione: (2023)
Parallel GPU-Enabled Algorithms for SpGEMM on Arbitrary Semirings with Hybrid Communication
di: McFarland, Thomas, et al.
Pubblicazione: (2025)
di: McFarland, Thomas, et al.
Pubblicazione: (2025)
FastGraph: Optimized GPU-Enabled Algorithms for Fast Graph Building and Message Passing
di: Agarwal, Aarush, et al.
Pubblicazione: (2025)
di: Agarwal, Aarush, et al.
Pubblicazione: (2025)
FairKV: Balancing Per-Head KV Cache for Fast Multi-GPU Inference
di: Zhao, Bingzhe, et al.
Pubblicazione: (2025)
di: Zhao, Bingzhe, et al.
Pubblicazione: (2025)
APEX: Asynchronous Parallel CPU-GPU Execution for Online LLM Inference on Constrained GPUs
di: Fan, Jiakun, et al.
Pubblicazione: (2025)
di: Fan, Jiakun, et al.
Pubblicazione: (2025)
cuFastTuckerPlus: A Stochastic Parallel Sparse FastTucker Decomposition Using GPU Tensor Cores
di: Li, Zixuan, et al.
Pubblicazione: (2024)
di: Li, Zixuan, et al.
Pubblicazione: (2024)
HARP: Orchestrating Automated Parallel Training on Heterogeneous GPU Clusters
di: Liang, Antian, et al.
Pubblicazione: (2025)
di: Liang, Antian, et al.
Pubblicazione: (2025)
SiPipe: Bridging the CPU-GPU Utilization Gap for Efficient Pipeline-Parallel LLM Inference
di: He, Yongchao, et al.
Pubblicazione: (2025)
di: He, Yongchao, et al.
Pubblicazione: (2025)
λScale: Enabling Fast Scaling for Serverless Large Language Model Inference
di: Yu, Minchen, et al.
Pubblicazione: (2025)
di: Yu, Minchen, et al.
Pubblicazione: (2025)
Arctic Inference with Shift Parallelism: Fast and Efficient Open Source Inference System for Enterprise AI
di: Rajbhandari, Samyam, et al.
Pubblicazione: (2025)
di: Rajbhandari, Samyam, et al.
Pubblicazione: (2025)
Vec-LUT: Vector Table Lookup for Parallel Ultra-Low-Bit LLM Inference on Edge Devices
di: Li, Xiangyu, et al.
Pubblicazione: (2025)
di: Li, Xiangyu, et al.
Pubblicazione: (2025)
DAK: Direct-Access-Enabled GPU Memory Offloading with Optimal Efficiency for LLM Inference
di: Lin, Shouxu, et al.
Pubblicazione: (2026)
di: Lin, Shouxu, et al.
Pubblicazione: (2026)
Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism
di: Wei, Jinhui, et al.
Pubblicazione: (2025)
di: Wei, Jinhui, et al.
Pubblicazione: (2025)
A Framework for Fine-Grained Synchronization of Dependent GPU Kernels
di: Jangda, Abhinav, et al.
Pubblicazione: (2023)
di: Jangda, Abhinav, et al.
Pubblicazione: (2023)
Neutron particle transport 3D method of characteristic Multi GPU platform Parallel Computing
di: Zhou, Faguo, et al.
Pubblicazione: (2025)
di: Zhou, Faguo, et al.
Pubblicazione: (2025)
HAS-GPU: Efficient Hybrid Auto-scaling with Fine-grained GPU Allocation for SLO-aware Serverless Inferences
di: Gu, Jianfeng, et al.
Pubblicazione: (2025)
di: Gu, Jianfeng, et al.
Pubblicazione: (2025)
Massively-Parallel Implementation of Inextensible Elastic Rods Using Inter-block GPU Synchronization
di: Korzeniowski, Przemyslaw, et al.
Pubblicazione: (2025)
di: Korzeniowski, Przemyslaw, et al.
Pubblicazione: (2025)
GigaAPI for GPU Parallelization
di: Suvarna, M., et al.
Pubblicazione: (2025)
di: Suvarna, M., et al.
Pubblicazione: (2025)
NCCLZ: Compression-Enabled GPU Collectives with Decoupled Quantization and Entropy Coding
di: Wang, Jiamin, et al.
Pubblicazione: (2026)
di: Wang, Jiamin, et al.
Pubblicazione: (2026)
Characterization of GPU TEE Overheads in Distributed Data Parallel ML Training
di: Lee, Jonghyun, et al.
Pubblicazione: (2025)
di: Lee, Jonghyun, et al.
Pubblicazione: (2025)
Context Parallelism for Scalable Million-Token Inference
di: Yang, Amy, et al.
Pubblicazione: (2024)
di: Yang, Amy, et al.
Pubblicazione: (2024)
EXaCTz: Guaranteed Extremum Graph and Contour Tree Preservation for Distributed- and GPU-Parallel Lossy Compression
di: Li, Yuxiao, et al.
Pubblicazione: (2026)
di: Li, Yuxiao, et al.
Pubblicazione: (2026)
Parallelizing a modern GPU simulator
di: Huerta, Rodrigo, et al.
Pubblicazione: (2025)
di: Huerta, Rodrigo, et al.
Pubblicazione: (2025)
Seer: Online Context Learning for Fast Synchronous LLM Reinforcement Learning
di: Qin, Ruoyu, et al.
Pubblicazione: (2025)
di: Qin, Ruoyu, et al.
Pubblicazione: (2025)
Accelerating Long-Tail Generation in Synchronous RLHF Training via Adaptive Tensor Parallelism
di: Zhao, Long, et al.
Pubblicazione: (2026)
di: Zhao, Long, et al.
Pubblicazione: (2026)
GPU-Based Parallel Computing Methods for Medical Photoacoustic Image Reconstruction
di: Yi, Xinyao, et al.
Pubblicazione: (2024)
di: Yi, Xinyao, et al.
Pubblicazione: (2024)
Concurrent Scheduling of High-Level Parallel Programs on Multi-GPU Systems
di: Knorr, Fabian, et al.
Pubblicazione: (2025)
di: Knorr, Fabian, et al.
Pubblicazione: (2025)
Fast-HotStuff: A Fast and Resilient HotStuff Protocol
di: Jalalzai, Mohammad M., et al.
Pubblicazione: (2020)
di: Jalalzai, Mohammad M., et al.
Pubblicazione: (2020)
Amoeba: Runtime Tensor Parallel Transformation for LLM Inference Services
di: Chen, Haoyu, et al.
Pubblicazione: (2025)
di: Chen, Haoyu, et al.
Pubblicazione: (2025)
ParvaGPU: Efficient Spatial GPU Sharing for Large-Scale DNN Inference in Cloud Environments
di: Lee, Munkyu, et al.
Pubblicazione: (2024)
di: Lee, Munkyu, et al.
Pubblicazione: (2024)
Enabling Disaggregated Multi-Stage MLLM Inference via GPU-Internal Scheduling and Resource Sharing
di: Zhao, Lingxiao, et al.
Pubblicazione: (2025)
di: Zhao, Lingxiao, et al.
Pubblicazione: (2025)
Staleness-Centric Optimizations for Parallel Diffusion MoE Inference
di: Luo, Jiajun, et al.
Pubblicazione: (2024)
di: Luo, Jiajun, et al.
Pubblicazione: (2024)
FastSet: Parallel Claim Settlement
di: Chen, Xiaohong, et al.
Pubblicazione: (2025)
di: Chen, Xiaohong, et al.
Pubblicazione: (2025)
DreamDDP: Accelerating Data Parallel Distributed LLM Training with Layer-wise Scheduled Partial Synchronization
di: Tang, Zhenheng, et al.
Pubblicazione: (2025)
di: Tang, Zhenheng, et al.
Pubblicazione: (2025)
Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism
di: Mo, Zizhao, et al.
Pubblicazione: (2025)
di: Mo, Zizhao, et al.
Pubblicazione: (2025)
Multi-GPU Acceleration of PALABOS Fluid Solver using C++ Standard Parallelism
di: Latt, Jonas, et al.
Pubblicazione: (2025)
di: Latt, Jonas, et al.
Pubblicazione: (2025)
Heimdall++: Optimizing GPU Utilization and Pipeline Parallelism for Efficient Single-Pulse Detection
di: Xia, Bingzheng, et al.
Pubblicazione: (2025)
di: Xia, Bingzheng, et al.
Pubblicazione: (2025)
Enabling Dynamic Sparsity in Quantized LLM Inference
di: Wang, Rongxiang, et al.
Pubblicazione: (2025)
di: Wang, Rongxiang, et al.
Pubblicazione: (2025)
A Fast Confirmation Rule (aka Fast Synchronous Finality) for the Ethereum Consensus Protocol
di: Asgaonkar, Aditya, et al.
Pubblicazione: (2024)
di: Asgaonkar, Aditya, et al.
Pubblicazione: (2024)
Documenti analoghi
-
FastTrack: GPU-Accelerated Tracking for Visual SLAM
di: Khabiri, Kimia, et al.
Pubblicazione: (2025) -
Torpor: GPU-Enabled Serverless Computing for Low-Latency, Resource-Efficient Inference
di: Yu, Minchen, et al.
Pubblicazione: (2023) -
Parallel GPU-Enabled Algorithms for SpGEMM on Arbitrary Semirings with Hybrid Communication
di: McFarland, Thomas, et al.
Pubblicazione: (2025) -
FastGraph: Optimized GPU-Enabled Algorithms for Fast Graph Building and Message Passing
di: Agarwal, Aarush, et al.
Pubblicazione: (2025) -
FairKV: Balancing Per-Head KV Cache for Fast Multi-GPU Inference
di: Zhao, Bingzhe, et al.
Pubblicazione: (2025)