cuFastTuckerPlus: A Stochastic Parallel Sparse FastTucker Decomposition Using GPU Tensor Cores
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Zixuan, Duan, Mingxing, Luo, Huizhang, Yang, Wangdong, Li, Kenli, Li, Keqin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Fused3S: Fast Sparse Attention on Tensor Cores
di: Li, Zitong, et al.
Pubblicazione: (2025)
di: Li, Zitong, et al.
Pubblicazione: (2025)
Accelerating Sparse MTTKRP for Small Tensor Decomposition on GPU
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
Sparse MTTKRP Acceleration for Tensor Decomposition on GPU
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2024)
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2024)
Fast and Scalable Mixed Precision Euclidean Distance Calculations Using GPU Tensor Cores
di: Curless, Brian, et al.
Pubblicazione: (2025)
di: Curless, Brian, et al.
Pubblicazione: (2025)
Ocean: Fast Estimation-Based Sparse General Matrix-Matrix Multiplication on GPU
di: Li, Yifan, et al.
Pubblicazione: (2026)
di: Li, Yifan, et al.
Pubblicazione: (2026)
Towards Fast Setup and High Throughput of GPU Serverless Computing
di: Zhao, Han, et al.
Pubblicazione: (2024)
di: Zhao, Han, et al.
Pubblicazione: (2024)
Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism
di: Wei, Jinhui, et al.
Pubblicazione: (2025)
di: Wei, Jinhui, et al.
Pubblicazione: (2025)
A-IO: Adaptive Inference Orchestration for Memory-Bound NPUs
di: Zhang, Chen, et al.
Pubblicazione: (2026)
di: Zhang, Chen, et al.
Pubblicazione: (2026)
Accelerating Drug Discovery in AutoDock-GPU with Tensor Cores
di: Schieffer, Gabin, et al.
Pubblicazione: (2024)
di: Schieffer, Gabin, et al.
Pubblicazione: (2024)
FastGraph: Optimized GPU-Enabled Algorithms for Fast Graph Building and Message Passing
di: Agarwal, Aarush, et al.
Pubblicazione: (2025)
di: Agarwal, Aarush, et al.
Pubblicazione: (2025)
HC-SpMM: Accelerating Sparse Matrix-Matrix Multiplication for Graphs with Hybrid GPU Cores
di: Li, Zhonggen, et al.
Pubblicazione: (2024)
di: Li, Zhonggen, et al.
Pubblicazione: (2024)
FastSet: Parallel Claim Settlement
di: Chen, Xiaohong, et al.
Pubblicazione: (2025)
di: Chen, Xiaohong, et al.
Pubblicazione: (2025)
Parallel Track Transformers: Enabling Fast GPU Inference with Reduced Synchronization
di: Wang, Chong, et al.
Pubblicazione: (2026)
di: Wang, Chong, et al.
Pubblicazione: (2026)
Synergistic Tensor and Pipeline Parallelism
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
PRISM: Processing-In-Memory Sparse MTTKRP for Tensor Decomposition Acceleration
di: Pacheco, Daniel, et al.
Pubblicazione: (2026)
di: Pacheco, Daniel, et al.
Pubblicazione: (2026)
FPTC: A Fast Parallel Transform-based Codec for Efficient Asymmetric Signal Compression
di: Mechels, Ben, et al.
Pubblicazione: (2026)
di: Mechels, Ben, et al.
Pubblicazione: (2026)
Heimdall++: Optimizing GPU Utilization and Pipeline Parallelism for Efficient Single-Pulse Detection
di: Xia, Bingzheng, et al.
Pubblicazione: (2025)
di: Xia, Bingzheng, et al.
Pubblicazione: (2025)
Acc-SpMM: Accelerating General-purpose Sparse Matrix-Matrix Multiplication with GPU Tensor Cores
di: Zhao, Haisha, et al.
Pubblicazione: (2025)
di: Zhao, Haisha, et al.
Pubblicazione: (2025)
AMPED: Accelerating MTTKRP for Billion-Scale Sparse Tensor Decomposition on Multiple GPUs
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025)
TAPAS: Fast and Automatic Derivation of Tensor Parallel Strategies for Large Neural Networks
di: Shi, Ziji, et al.
Pubblicazione: (2023)
di: Shi, Ziji, et al.
Pubblicazione: (2023)
A Parallel and Distributed Rust Library for Core Decomposition on Large Graphs
di: Rucci, Davide, et al.
Pubblicazione: (2025)
di: Rucci, Davide, et al.
Pubblicazione: (2025)
Sparse Checkpointing for Fast and Reliable MoE Training
di: Gandhi, Swapnil, et al.
Pubblicazione: (2024)
di: Gandhi, Swapnil, et al.
Pubblicazione: (2024)
GRNND: A GPU-Parallel Relative NN-Descent Algorithm for Efficient Approximate Nearest Neighbor Graph Construction
di: Li, Xiang, et al.
Pubblicazione: (2025)
di: Li, Xiang, et al.
Pubblicazione: (2025)
Nitsum: Serving Tiered LLM Requests with Adaptive Tensor Parallelism
di: Srivatsa, Vikranth, et al.
Pubblicazione: (2026)
di: Srivatsa, Vikranth, et al.
Pubblicazione: (2026)
HiRace: Accurate and Fast Source-Level Race Checking of GPU Programs
di: Jacobson, John, et al.
Pubblicazione: (2024)
di: Jacobson, John, et al.
Pubblicazione: (2024)
ZeroPP: Unleashing Exceptional Parallelism Efficiency through Tensor-Parallelism-Free Methodology
di: Tang, Ding, et al.
Pubblicazione: (2024)
di: Tang, Ding, et al.
Pubblicazione: (2024)
HARP: Orchestrating Automated Parallel Training on Heterogeneous GPU Clusters
di: Liang, Antian, et al.
Pubblicazione: (2025)
di: Liang, Antian, et al.
Pubblicazione: (2025)
APEX: Asynchronous Parallel CPU-GPU Execution for Online LLM Inference on Constrained GPUs
di: Fan, Jiakun, et al.
Pubblicazione: (2025)
di: Fan, Jiakun, et al.
Pubblicazione: (2025)
FastTrack: GPU-Accelerated Tracking for Visual SLAM
di: Khabiri, Kimia, et al.
Pubblicazione: (2025)
di: Khabiri, Kimia, et al.
Pubblicazione: (2025)
Amoeba: Runtime Tensor Parallel Transformation for LLM Inference Services
di: Chen, Haoyu, et al.
Pubblicazione: (2025)
di: Chen, Haoyu, et al.
Pubblicazione: (2025)
SPIDER: Unleashing Sparse Tensor Cores for Stencil Computation via Strided Swapping
di: GU, Qiqi, et al.
Pubblicazione: (2025)
di: GU, Qiqi, et al.
Pubblicazione: (2025)
Towards Compute-Aware In-Switch Computing for LLMs Tensor-Parallelism on Multi-GPU Systems
di: Zhang, Chen, et al.
Pubblicazione: (2026)
di: Zhang, Chen, et al.
Pubblicazione: (2026)
TurboFFT: A High-Performance Fast Fourier Transform with Fault Tolerance on GPU
di: Wu, Shixun, et al.
Pubblicazione: (2024)
di: Wu, Shixun, et al.
Pubblicazione: (2024)
AGAThA: Fast and Efficient GPU Acceleration of Guided Sequence Alignment for Long Read Mapping
di: Park, Seongyeon, et al.
Pubblicazione: (2024)
di: Park, Seongyeon, et al.
Pubblicazione: (2024)
GPU Accelerated Sparse Cholesky Factorization
di: Karsavuran, M. Ozan, et al.
Pubblicazione: (2024)
di: Karsavuran, M. Ozan, et al.
Pubblicazione: (2024)
EXaCTz: Guaranteed Extremum Graph and Contour Tree Preservation for Distributed- and GPU-Parallel Lossy Compression
di: Li, Yuxiao, et al.
Pubblicazione: (2026)
di: Li, Yuxiao, et al.
Pubblicazione: (2026)
pdGRASS: A Fast Parallel Density-Aware Algorithm for Graph Spectral Sparsification
di: Zhao, Tiancheng, et al.
Pubblicazione: (2025)
di: Zhao, Tiancheng, et al.
Pubblicazione: (2025)
FlashSparse: Minimizing Computation Redundancy for Fast Sparse Matrix Multiplications on Tensor Cores
di: Shi, Jinliang, et al.
Pubblicazione: (2024)
di: Shi, Jinliang, et al.
Pubblicazione: (2024)
Pipelined Dense Symmetric Eigenvalue Decomposition on Multi-GPU Architectures
di: Wang, Hansheng, et al.
Pubblicazione: (2025)
di: Wang, Hansheng, et al.
Pubblicazione: (2025)
FlashSketch: Sketch-Kernel Co-Design for Fast Sparse Sketching on GPUs
di: Dwaraknath, Rajat Vadiraj, et al.
Pubblicazione: (2026)
di: Dwaraknath, Rajat Vadiraj, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Fused3S: Fast Sparse Attention on Tensor Cores
di: Li, Zitong, et al.
Pubblicazione: (2025) -
Accelerating Sparse MTTKRP for Small Tensor Decomposition on GPU
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2025) -
Sparse MTTKRP Acceleration for Tensor Decomposition on GPU
di: Wijeratne, Sasindu, et al.
Pubblicazione: (2024) -
Fast and Scalable Mixed Precision Euclidean Distance Calculations Using GPU Tensor Cores
di: Curless, Brian, et al.
Pubblicazione: (2025) -
Ocean: Fast Estimation-Based Sparse General Matrix-Matrix Multiplication on GPU
di: Li, Yifan, et al.
Pubblicazione: (2026)