NCCLZ: Compression-Enabled GPU Collectives with Decoupled Quantization and Entropy Coding
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Jiamin, Ye, Zhijing, Yu, Xiaodong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
gZCCL: Compression-Accelerated Collective Communication Framework for GPU Clusters
por: Huang, Jiajun, et al.
Publicado: (2023)
por: Huang, Jiajun, et al.
Publicado: (2023)
An Efficient Gradient-Aware Error-Bounded Lossy Compressor for Federated Learning
por: Ye, Zhijing, et al.
Publicado: (2025)
por: Ye, Zhijing, et al.
Publicado: (2025)
SPID-Chain: A Smart Contract-Enabled, Polar-Coded Interoperable DAG Chain
por: Taherpour, Amirhossein, et al.
Publicado: (2025)
por: Taherpour, Amirhossein, et al.
Publicado: (2025)
VDCores: Resource Decoupled Programming and Execution for Asynchronous GPU
por: He, Zijian, et al.
Publicado: (2026)
por: He, Zijian, et al.
Publicado: (2026)
Torpor: GPU-Enabled Serverless Computing for Low-Latency, Resource-Efficient Inference
por: Yu, Minchen, et al.
Publicado: (2023)
por: Yu, Minchen, et al.
Publicado: (2023)
An Optimized Error-controlled MPI Collective Framework Integrated with Lossy Compression
por: Huang, Jiajun, et al.
Publicado: (2023)
por: Huang, Jiajun, et al.
Publicado: (2023)
ZCCL: Significantly Improving Collective Communication With Error-Bounded Lossy Compression
por: Huang, Jiajun, et al.
Publicado: (2025)
por: Huang, Jiajun, et al.
Publicado: (2025)
A High-throughput and Secure Coded Blockchain for IoT
por: Taherpour, Amirhossein, et al.
Publicado: (2023)
por: Taherpour, Amirhossein, et al.
Publicado: (2023)
Enabling Dynamic Sparsity in Quantized LLM Inference
por: Wang, Rongxiang, et al.
Publicado: (2025)
por: Wang, Rongxiang, et al.
Publicado: (2025)
EXaCTz: Guaranteed Extremum Graph and Contour Tree Preservation for Distributed- and GPU-Parallel Lossy Compression
por: Li, Yuxiao, et al.
Publicado: (2026)
por: Li, Yuxiao, et al.
Publicado: (2026)
ACC Saturator: Automatic Kernel Optimization for Directive-Based GPU Code
por: Matsumura, Kazuaki, et al.
Publicado: (2023)
por: Matsumura, Kazuaki, et al.
Publicado: (2023)
A Multi-Objective Framework for Optimizing GPU-Enabled VM Placement in Cloud Data Centers with Multi-Instance GPU Technology
por: Siavashi, Ahmad, et al.
Publicado: (2025)
por: Siavashi, Ahmad, et al.
Publicado: (2025)
An Efficient, Reliable and Observable Collective Communication Library in Large-scale GPU Training Clusters
por: Zhang, Mingjun, et al.
Publicado: (2025)
por: Zhang, Mingjun, et al.
Publicado: (2025)
GPU Volume Rendering with Hierarchical Compression Using VDB
por: Zellmann, Stefan, et al.
Publicado: (2025)
por: Zellmann, Stefan, et al.
Publicado: (2025)
Parallel GPU-Enabled Algorithms for SpGEMM on Arbitrary Semirings with Hybrid Communication
por: McFarland, Thomas, et al.
Publicado: (2025)
por: McFarland, Thomas, et al.
Publicado: (2025)
Biased Compression in Gradient Coding for Distributed Learning
por: Li, Chengxi, et al.
Publicado: (2026)
por: Li, Chengxi, et al.
Publicado: (2026)
Optimizing Bloom Filters for Modern GPU Architectures
por: Jünger, Daniel, et al.
Publicado: (2025)
por: Jünger, Daniel, et al.
Publicado: (2025)
Breaking the Memory Wall: A Study of I/O Patterns and GPU Memory Utilization for Hybrid CPU-GPU Offloaded Optimizers
por: Maurya, Avinash, et al.
Publicado: (2024)
por: Maurya, Avinash, et al.
Publicado: (2024)
DAK: Direct-Access-Enabled GPU Memory Offloading with Optimal Efficiency for LLM Inference
por: Lin, Shouxu, et al.
Publicado: (2026)
por: Lin, Shouxu, et al.
Publicado: (2026)
Optimizing the Variant Calling Pipeline Execution on Human Genomes Using GPU-Enabled Machines
por: Kumar, Ajay, et al.
Publicado: (2025)
por: Kumar, Ajay, et al.
Publicado: (2025)
FastGraph: Optimized GPU-Enabled Algorithms for Fast Graph Building and Message Passing
por: Agarwal, Aarush, et al.
Publicado: (2025)
por: Agarwal, Aarush, et al.
Publicado: (2025)
Dilu: Enabling GPU Resourcing-on-Demand for Serverless DL Serving via Introspective Elasticity
por: Lv, Cunchi, et al.
Publicado: (2025)
por: Lv, Cunchi, et al.
Publicado: (2025)
VQ-LLM: High-performance Code Generation for Vector Quantization Augmented LLM Inference
por: Liu, Zihan, et al.
Publicado: (2025)
por: Liu, Zihan, et al.
Publicado: (2025)
Improving GPU Multi-Tenancy Through Dynamic Multi-Instance GPU Reconfiguration
por: Wang, Tianyu, et al.
Publicado: (2024)
por: Wang, Tianyu, et al.
Publicado: (2024)
FaaSTube: Optimizing GPU-oriented Data Transfer for Serverless Computing
por: Wu, Hao, et al.
Publicado: (2024)
por: Wu, Hao, et al.
Publicado: (2024)
SIMT/GPU Data Race Verification using ISCC and Intermediary Code Representations: A Case Study
por: Osterhout, Andrew, et al.
Publicado: (2025)
por: Osterhout, Andrew, et al.
Publicado: (2025)
UCCL-Zip: Lossless Compression Supercharged GPU Communication
por: Ma, Shuang, et al.
Publicado: (2026)
por: Ma, Shuang, et al.
Publicado: (2026)
HAS-GPU: Efficient Hybrid Auto-scaling with Fine-grained GPU Allocation for SLO-aware Serverless Inferences
por: Gu, Jianfeng, et al.
Publicado: (2025)
por: Gu, Jianfeng, et al.
Publicado: (2025)
Decouple and Decompose: Scaling Resource Allocation with DeDe
por: Xu, Zhiying, et al.
Publicado: (2024)
por: Xu, Zhiying, et al.
Publicado: (2024)
FedFQ: Federated Learning with Fine-Grained Quantization
por: Li, Haowei, et al.
Publicado: (2024)
por: Li, Haowei, et al.
Publicado: (2024)
DuaLip-GPU Technical Report
por: Dexter, Gregory, et al.
Publicado: (2026)
por: Dexter, Gregory, et al.
Publicado: (2026)
PICO: Accelerating All k-Core Paradigms on GPU
por: Zhao, Chen, et al.
Publicado: (2024)
por: Zhao, Chen, et al.
Publicado: (2024)
Characterization-Guided GPU Fault Resilience in NVIDIA MPS
por: Liu, Rixin, et al.
Publicado: (2026)
por: Liu, Rixin, et al.
Publicado: (2026)
Understanding the Landscape of Ampere GPU Memory Errors
por: Zhu, Zhu, et al.
Publicado: (2025)
por: Zhu, Zhu, et al.
Publicado: (2025)
Comprehensive Deadlock Prevention for GPU Collective Communication
por: Pan, Lichen, et al.
Publicado: (2023)
por: Pan, Lichen, et al.
Publicado: (2023)
Accelerating Biclique Counting on GPU
por: Qiu, Linshan, et al.
Publicado: (2024)
por: Qiu, Linshan, et al.
Publicado: (2024)
GPU Sharing with Triples Mode
por: Byun, Chansup, et al.
Publicado: (2024)
por: Byun, Chansup, et al.
Publicado: (2024)
Accelerating Intra-Node GPU-to-GPU Communication Through Multi-Path Transfers with CUDA Graphs
por: Sojoodi, Amirhossein, et al.
Publicado: (2026)
por: Sojoodi, Amirhossein, et al.
Publicado: (2026)
ParvaGPU: Efficient Spatial GPU Sharing for Large-Scale DNN Inference in Cloud Environments
por: Lee, Munkyu, et al.
Publicado: (2024)
por: Lee, Munkyu, et al.
Publicado: (2024)
Neutron particle transport 3D method of characteristic Multi GPU platform Parallel Computing
por: Zhou, Faguo, et al.
Publicado: (2025)
por: Zhou, Faguo, et al.
Publicado: (2025)
Ejemplares similares
-
gZCCL: Compression-Accelerated Collective Communication Framework for GPU Clusters
por: Huang, Jiajun, et al.
Publicado: (2023) -
An Efficient Gradient-Aware Error-Bounded Lossy Compressor for Federated Learning
por: Ye, Zhijing, et al.
Publicado: (2025) -
SPID-Chain: A Smart Contract-Enabled, Polar-Coded Interoperable DAG Chain
por: Taherpour, Amirhossein, et al.
Publicado: (2025) -
VDCores: Resource Decoupled Programming and Execution for Asynchronous GPU
por: He, Zijian, et al.
Publicado: (2026) -
Torpor: GPU-Enabled Serverless Computing for Low-Latency, Resource-Efficient Inference
por: Yu, Minchen, et al.
Publicado: (2023)