Fast Entropy Decoding for Sparse MVM on GPUs
Fuente:
arXiv
Salvato in:
| Autori principali: | Schätzle, Emil, Pegolotti, Tommaso, Püschel, Markus |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A high-performance and portable implementation of the SISSO method for CPUs and GPUs
di: Eibl, Sebastian, et al.
Pubblicazione: (2025)
di: Eibl, Sebastian, et al.
Pubblicazione: (2025)
Performance of Confidential Computing GPUs
di: Ibarra, Antonio Martínez, et al.
Pubblicazione: (2025)
di: Ibarra, Antonio Martínez, et al.
Pubblicazione: (2025)
Opening the Black Box: Performance Estimation during Code Generation for GPUs
di: Ernst, Dominik, et al.
Pubblicazione: (2021)
di: Ernst, Dominik, et al.
Pubblicazione: (2021)
SparseInfer: Training-free Prediction of Activation Sparsity for Fast LLM Inference
di: Shin, Jiho, et al.
Pubblicazione: (2024)
di: Shin, Jiho, et al.
Pubblicazione: (2024)
Automated PMC-based Power Modeling Methodology for Modern Mobile GPUs
di: Dash, Pranab, et al.
Pubblicazione: (2024)
di: Dash, Pranab, et al.
Pubblicazione: (2024)
Benchmarking GPUs on SVBRDF Extractor Model
di: Kandel, Narayan, et al.
Pubblicazione: (2023)
di: Kandel, Narayan, et al.
Pubblicazione: (2023)
PM2Lat: Highly Accurate and Generalized Prediction of DNN Execution Latency on GPUs
di: Le, Truong-Thanh, et al.
Pubblicazione: (2026)
di: Le, Truong-Thanh, et al.
Pubblicazione: (2026)
Minuet: Accelerating 3D Sparse Convolutions on GPUs
di: Yang, Jiacheng, et al.
Pubblicazione: (2023)
di: Yang, Jiacheng, et al.
Pubblicazione: (2023)
Mapping Sparse Triangular Solves to GPUs via Fine-grained Domain Decomposition
di: Gondhalekar, Atharva, et al.
Pubblicazione: (2025)
di: Gondhalekar, Atharva, et al.
Pubblicazione: (2025)
How to Rent GPUs on a Budget
di: Li, Zhouzi, et al.
Pubblicazione: (2024)
di: Li, Zhouzi, et al.
Pubblicazione: (2024)
Time is Not Compute: Scaling Laws for Wall-Clock Constrained Training on Consumer GPUs
di: Liu, Yi
Pubblicazione: (2026)
di: Liu, Yi
Pubblicazione: (2026)
DF-GNN: Dynamic Fusion Framework for Attention Graph Neural Networks on GPUs
di: Liu, Jiahui, et al.
Pubblicazione: (2024)
di: Liu, Jiahui, et al.
Pubblicazione: (2024)
FRSZ2 for In-Register Block Compression Inside GMRES on GPUs
di: Grützmacher, Thomas, et al.
Pubblicazione: (2024)
di: Grützmacher, Thomas, et al.
Pubblicazione: (2024)
GVEL: Fast Graph Loading in Edgelist and Compressed Sparse Row (CSR) formats
di: Sahu, Subhajit
Pubblicazione: (2023)
di: Sahu, Subhajit
Pubblicazione: (2023)
Pushing the Envelope of LLM Inference on AI-PC and Intel GPUs
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)
di: Georganas, Evangelos, et al.
Pubblicazione: (2025)
Characterizing and Understanding HGNN Training on GPUs
di: Han, Dengke, et al.
Pubblicazione: (2024)
di: Han, Dengke, et al.
Pubblicazione: (2024)
GROMACS Unplugged: How Power Capping and Frequency Shapes Performance on GPUs
di: Afzal, Ayesha, et al.
Pubblicazione: (2025)
di: Afzal, Ayesha, et al.
Pubblicazione: (2025)
Preliminary report: Initial evaluation of StdPar implementations on AMD GPUs for HPC
di: Lin, Wei-Chen, et al.
Pubblicazione: (2024)
di: Lin, Wei-Chen, et al.
Pubblicazione: (2024)
A Comprehensive Analysis of Process Energy Consumption on Multi-Socket Systems with GPUs
di: León-Vega, Luis G., et al.
Pubblicazione: (2024)
di: León-Vega, Luis G., et al.
Pubblicazione: (2024)
Cyclic Data Streaming on GPUs for Short Range Stencils Applied to Molecular Dynamics
di: Rose, Martin, et al.
Pubblicazione: (2025)
di: Rose, Martin, et al.
Pubblicazione: (2025)
Caspar: CUDA Accelerator for Symbolic Programming with Adaptive Reordering
di: Martens, Emil, et al.
Pubblicazione: (2026)
di: Martens, Emil, et al.
Pubblicazione: (2026)
Architecture Specific Generation of Large Scale Lattice Boltzmann Methods for Sparse Complex Geometries
di: Suffa, Philipp, et al.
Pubblicazione: (2024)
di: Suffa, Philipp, et al.
Pubblicazione: (2024)
How Much Parallelism Is "Free"? A Principle of Near-Free Parallelism for Parallel Decoding
di: He, Minghua, et al.
Pubblicazione: (2026)
di: He, Minghua, et al.
Pubblicazione: (2026)
Explainable Port Mapping Inference with Sparse Performance Counters for AMD's Zen Architectures
di: Ritter, Fabian, et al.
Pubblicazione: (2024)
di: Ritter, Fabian, et al.
Pubblicazione: (2024)
Accelerating AI Performance using Anderson Extrapolation on GPUs
di: Dajani, Saleem Abdul Fattah Ahmed Al, et al.
Pubblicazione: (2024)
di: Dajani, Saleem Abdul Fattah Ahmed Al, et al.
Pubblicazione: (2024)
Fusing Depthwise and Pointwise Convolutions for Efficient Inference on GPUs
di: Qararyah, Fareed, et al.
Pubblicazione: (2024)
di: Qararyah, Fareed, et al.
Pubblicazione: (2024)
Bringing Auto-tuning to HIP: Analysis of Tuning Impact and Difficulty on AMD and Nvidia GPUs
di: Lurati, Milo, et al.
Pubblicazione: (2024)
di: Lurati, Milo, et al.
Pubblicazione: (2024)
SparseX: Efficient Segment-Level KV Cache Sharing for Interleaved LLM Serving
di: Zhang, Quqing, et al.
Pubblicazione: (2026)
di: Zhang, Quqing, et al.
Pubblicazione: (2026)
ZERNIPAX: A Fast and Accurate Zernike Polynomial Calculator in Python
di: Elmacioglu, Yigit Gunsur, et al.
Pubblicazione: (2024)
di: Elmacioglu, Yigit Gunsur, et al.
Pubblicazione: (2024)
cuTeSpMM: Accelerating Sparse-Dense Matrix Multiplication using GPU Tensor Cores
di: Xiang, Lizhi, et al.
Pubblicazione: (2025)
di: Xiang, Lizhi, et al.
Pubblicazione: (2025)
Analysis of Stable Vertex Values: Fast Query Evaluation Over An Evolving Graph
di: Afarin, Mahbod, et al.
Pubblicazione: (2025)
di: Afarin, Mahbod, et al.
Pubblicazione: (2025)
Automotive Middleware Performance: Comparison of FastDDS, Zenoh and vSomeIP
di: Klüner, David Philipp, et al.
Pubblicazione: (2025)
di: Klüner, David Philipp, et al.
Pubblicazione: (2025)
CAPSim: A Fast CPU Performance Simulator Using Attention-based Predictor
di: Xu, Buqing, et al.
Pubblicazione: (2025)
di: Xu, Buqing, et al.
Pubblicazione: (2025)
Tuning Fast Memory Size based on Modeling of Page Migration for Tiered Memory
di: Chen, Shangye, et al.
Pubblicazione: (2024)
di: Chen, Shangye, et al.
Pubblicazione: (2024)
Alya towards Exascale: Optimal OpenACC Performance of the Navier-Stokes Finite Element Assembly on GPUs
di: Owen, Herbert, et al.
Pubblicazione: (2024)
di: Owen, Herbert, et al.
Pubblicazione: (2024)
H2EAL: Hybrid-Bonding Architecture with Hybrid Sparse Attention for Efficient Long-Context LLM Inference
di: Fu, Zizhuo, et al.
Pubblicazione: (2025)
di: Fu, Zizhuo, et al.
Pubblicazione: (2025)
FastDecode: High-Throughput GPU-Efficient LLM Serving using Heterogeneous Pipelines
di: He, Jiaao, et al.
Pubblicazione: (2024)
di: He, Jiaao, et al.
Pubblicazione: (2024)
Accelerating the Tesseract Decoder for Quantum Error Correction
di: Grbic, Dragana, et al.
Pubblicazione: (2026)
di: Grbic, Dragana, et al.
Pubblicazione: (2026)
Steering Pretrained Drafters during Speculative Decoding
di: Berdoz, Frédéric, et al.
Pubblicazione: (2025)
di: Berdoz, Frédéric, et al.
Pubblicazione: (2025)
Confidential Computing on NVIDIA Hopper GPUs: A Performance Benchmark Study
di: Zhu, Jianwei, et al.
Pubblicazione: (2024)
di: Zhu, Jianwei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
A high-performance and portable implementation of the SISSO method for CPUs and GPUs
di: Eibl, Sebastian, et al.
Pubblicazione: (2025) -
Performance of Confidential Computing GPUs
di: Ibarra, Antonio Martínez, et al.
Pubblicazione: (2025) -
Opening the Black Box: Performance Estimation during Code Generation for GPUs
di: Ernst, Dominik, et al.
Pubblicazione: (2021) -
SparseInfer: Training-free Prediction of Activation Sparsity for Fast LLM Inference
di: Shin, Jiho, et al.
Pubblicazione: (2024) -
Automated PMC-based Power Modeling Methodology for Modern Mobile GPUs
di: Dash, Pranab, et al.
Pubblicazione: (2024)