Salvato in:
| Autori principali: | Ni, Xiaobing, Ge, Mengke, Ruan, Jiaheng, Chen, Song, Kang, Yi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2412.11021 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AB-Sparse: Sparse Attention with Adaptive Block Size for Accurate and Efficient Long-Context Inference
di: Liu, Di, et al.
Pubblicazione: (2026)
di: Liu, Di, et al.
Pubblicazione: (2026)
Hecate: Unlocking Efficient Sparse Model Training via Fully Sharded Sparse Data Parallelism
di: Qing, Yuhao, et al.
Pubblicazione: (2025)
di: Qing, Yuhao, et al.
Pubblicazione: (2025)
AsyncSparse: Accelerating Sparse Matrix-Matrix Multiplication on Asynchronous GPU Architectures
di: Liu, Jie, et al.
Pubblicazione: (2026)
di: Liu, Jie, et al.
Pubblicazione: (2026)
Enhancing ASIC Technology Mapping via Parallel Supergate Computing
di: Cai, Ye, et al.
Pubblicazione: (2024)
di: Cai, Ye, et al.
Pubblicazione: (2024)
Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation
di: Chen, Fahao, et al.
Pubblicazione: (2024)
di: Chen, Fahao, et al.
Pubblicazione: (2024)
Distributed-Memory Parallel Algorithms for Sparse Matrix and Sparse Tall-and-Skinny Matrix Multiplication
di: Ranawaka, Isuru, et al.
Pubblicazione: (2024)
di: Ranawaka, Isuru, et al.
Pubblicazione: (2024)
SparseServe: Unlocking Parallelism for Dynamic Sparse Attention in Long-Context LLM Serving
di: Zhou, Qihui, et al.
Pubblicazione: (2025)
di: Zhou, Qihui, et al.
Pubblicazione: (2025)
Mapping Gemma3 onto an Edge Dataflow Architecture
di: Du, Shouyu, et al.
Pubblicazione: (2026)
di: Du, Shouyu, et al.
Pubblicazione: (2026)
RL over Commodity Networks: Overcoming the Bandwidth Barrier with Lossless Sparse Deltas
di: Ruan, Chaoyi, et al.
Pubblicazione: (2026)
di: Ruan, Chaoyi, et al.
Pubblicazione: (2026)
Accelerating Sparse DNNs Based on Tiled GEMM
di: Guo, Cong, et al.
Pubblicazione: (2024)
di: Guo, Cong, et al.
Pubblicazione: (2024)
SpComm3D: A Framework for Enabling Sparse Communication in 3D Sparse Kernels
di: Abubaker, Nabil, et al.
Pubblicazione: (2024)
di: Abubaker, Nabil, et al.
Pubblicazione: (2024)
GPU Accelerated Sparse Cholesky Factorization
di: Karsavuran, M. Ozan, et al.
Pubblicazione: (2024)
di: Karsavuran, M. Ozan, et al.
Pubblicazione: (2024)
Is Sparse Matrix Reordering Effective for Sparse Matrix-Vector Multiplication?
di: Asudeh, Omid, et al.
Pubblicazione: (2025)
di: Asudeh, Omid, et al.
Pubblicazione: (2025)
HieraSparse: Hierarchical Semi-Structured Sparse KV Attention
di: Wang, Haoxuan, et al.
Pubblicazione: (2026)
di: Wang, Haoxuan, et al.
Pubblicazione: (2026)
PICO: Pipeline Inference Framework for Versatile CNNs on Diverse Mobile Devices
di: Yang, Xiang, et al.
Pubblicazione: (2022)
di: Yang, Xiang, et al.
Pubblicazione: (2022)
Wireless MapReduce Arrays for Coded Distributed Computing
di: Peter, Elizabath, et al.
Pubblicazione: (2024)
di: Peter, Elizabath, et al.
Pubblicazione: (2024)
Improving Locality in Sparse and Dense Matrix Multiplications
di: Dezfuli, Mohammad Mahdi Salehi, et al.
Pubblicazione: (2024)
di: Dezfuli, Mohammad Mahdi Salehi, et al.
Pubblicazione: (2024)
Cooperative Inference with Interleaved Operator Partitioning for CNNs
di: Liu, Zhibang, et al.
Pubblicazione: (2024)
di: Liu, Zhibang, et al.
Pubblicazione: (2024)
Sparse Checkpointing for Fast and Reliable MoE Training
di: Gandhi, Swapnil, et al.
Pubblicazione: (2024)
di: Gandhi, Swapnil, et al.
Pubblicazione: (2024)
Accelerating Sparse MTTKRP for Small Tensor Decomposition on GPU
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
RDMA-Based Algorithms for Sparse Matrix Multiplication on GPUs
di: Brock, Benjamin, et al.
Pubblicazione: (2023)
di: Brock, Benjamin, et al.
Pubblicazione: (2023)
A More Scalable Sparse Dynamic Data Exchange
di: Geyko, Andrew, et al.
Pubblicazione: (2023)
di: Geyko, Andrew, et al.
Pubblicazione: (2023)
Transformer-Based Sparse CSI Estimation for Non-Stationary Channels
di: Mohsin, Muhammad Ahmed, et al.
Pubblicazione: (2025)
di: Mohsin, Muhammad Ahmed, et al.
Pubblicazione: (2025)
PRISM: Processing-In-Memory Sparse MTTKRP for Tensor Decomposition Acceleration
di: Pacheco, Daniel, et al.
Pubblicazione: (2026)
di: Pacheco, Daniel, et al.
Pubblicazione: (2026)
Exploring Sparse Matrix Multiplication Kernels on the Cerebras CS-3
di: Shah, Milan, et al.
Pubblicazione: (2026)
di: Shah, Milan, et al.
Pubblicazione: (2026)
Selection of Supervised Learning-based Sparse Matrix Reordering Algorithms
di: Tang, Tao, et al.
Pubblicazione: (2025)
di: Tang, Tao, et al.
Pubblicazione: (2025)
Sparsity-Aware Roofline Models for Sparse Matrix-Matrix Multiplication
di: Qian, Matthew, et al.
Pubblicazione: (2026)
di: Qian, Matthew, et al.
Pubblicazione: (2026)
LOw-cOst yet High-Performant Sparse Matrix-Matrix Multiplication on Arm SME Architectures
di: Lei, Kelun, et al.
Pubblicazione: (2025)
di: Lei, Kelun, et al.
Pubblicazione: (2025)
Opt-GPTQ: An Optimized GPTQ Combining Sparse Attention and Quantization Techniques
di: Kong, Jie, et al.
Pubblicazione: (2025)
di: Kong, Jie, et al.
Pubblicazione: (2025)
Accelerating Sparse Matrix-Matrix Multiplication on GPUs with Processing Near HBMs
di: Li, Shiju, et al.
Pubblicazione: (2025)
di: Li, Shiju, et al.
Pubblicazione: (2025)
Communication-Efficient Distributed Learning via Sparse and Adaptive Stochastic Gradient
di: Deng, Xiaoge, et al.
Pubblicazione: (2021)
di: Deng, Xiaoge, et al.
Pubblicazione: (2021)
Belief Propagation Converges to Gaussian Distributions in Sparsely-Connected Factor Graphs
di: Yates, Tom, et al.
Pubblicazione: (2026)
di: Yates, Tom, et al.
Pubblicazione: (2026)
A Structure-Aware Irregular Blocking Method for Sparse LU Factorization
di: Hu, Zhen, et al.
Pubblicazione: (2025)
di: Hu, Zhen, et al.
Pubblicazione: (2025)
SpArch: Efficient Architecture for Sparse Matrix Multiplication
di: Zhang, Zhekai, et al.
Pubblicazione: (2020)
di: Zhang, Zhekai, et al.
Pubblicazione: (2020)
AGAThA: Fast and Efficient GPU Acceleration of Guided Sequence Alignment for Long Read Mapping
di: Park, Seongyeon, et al.
Pubblicazione: (2024)
di: Park, Seongyeon, et al.
Pubblicazione: (2024)
AMPED: Accelerating MTTKRP for Billion-Scale Sparse Tensor Decomposition on Multiple GPUs
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
FlashSketch: Sketch-Kernel Co-Design for Fast Sparse Sketching on GPUs
di: Dwaraknath, Rajat Vadiraj, et al.
Pubblicazione: (2026)
di: Dwaraknath, Rajat Vadiraj, et al.
Pubblicazione: (2026)
SPIDER: Unleashing Sparse Tensor Cores for Stencil Computation via Strided Swapping
di: GU, Qiqi, et al.
Pubblicazione: (2025)
di: GU, Qiqi, et al.
Pubblicazione: (2025)
Popcorn: Accelerating Kernel K-means on GPUs through Sparse Linear Algebra
di: Bellavita, Julian, et al.
Pubblicazione: (2025)
di: Bellavita, Julian, et al.
Pubblicazione: (2025)
MAGNUS: Generating Data Locality to Accelerate Sparse Matrix-Matrix Multiplication on CPUs
di: Wolfson-Pou, Jordi, et al.
Pubblicazione: (2025)
di: Wolfson-Pou, Jordi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AB-Sparse: Sparse Attention with Adaptive Block Size for Accurate and Efficient Long-Context Inference
di: Liu, Di, et al.
Pubblicazione: (2026) -
Hecate: Unlocking Efficient Sparse Model Training via Fully Sharded Sparse Data Parallelism
di: Qing, Yuhao, et al.
Pubblicazione: (2025) -
AsyncSparse: Accelerating Sparse Matrix-Matrix Multiplication on Asynchronous GPU Architectures
di: Liu, Jie, et al.
Pubblicazione: (2026) -
Enhancing ASIC Technology Mapping via Parallel Supergate Computing
di: Cai, Ye, et al.
Pubblicazione: (2024) -
Communication-Efficient Sparsely-Activated Model Training via Sequence Migration and Token Condensation
di: Chen, Fahao, et al.
Pubblicazione: (2024)