Leveraging Hardware-Aware Computation in Mixed-Precision Matrix Multiply: A Tile-Centric Approach
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Qiao, Alomairy, Rabab, Wang, Dali, Gu, Zhuowei, Cao, Qinglei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Performant Unified GPU Kernels for Portable Singular Value Computation Across Hardware and Precision
par: Ringoot, Evelyne, et autres
Publié: (2025)
par: Ringoot, Evelyne, et autres
Publié: (2025)
Accelerating Bidiagonalization of Banded Matrices through Memory-Aware Bulge-Chasing on GPUs
par: Ringoot, Evelyne, et autres
Publié: (2025)
par: Ringoot, Evelyne, et autres
Publié: (2025)
Hierarchical Recursive Precision for Accelerating Symmetric Linear Solves on MXUs
par: Carrica, Vicki, et autres
Publié: (2026)
par: Carrica, Vicki, et autres
Publié: (2026)
TileLink: Generating Efficient Compute-Communication Overlapping Kernels using Tile-Centric Primitives
par: Zheng, Size, et autres
Publié: (2025)
par: Zheng, Size, et autres
Publié: (2025)
Toward Portable GPU Performance: Julia Recursive Implementation of TRMM and TRSM
par: Carrica, Vicki, et autres
Publié: (2025)
par: Carrica, Vicki, et autres
Publié: (2025)
W4A16 Mixed-Precision Matrix Multiplication on Decoupled Architecture: Kernel Design and Memory Bottleneck Analysis for Ascend NPUs
par: He, Yuanhong, et autres
Publié: (2026)
par: He, Yuanhong, et autres
Publié: (2026)
Shifting the Sweet Spot: High-Performance Matrix-Free Method for High-Order Elasticity
par: Chang, Dali, et autres
Publié: (2026)
par: Chang, Dali, et autres
Publié: (2026)
Leveraging Hardware Performance Counters for Predicting Workload Interference in Vector Supercomputers
par: Shubham, et autres
Publié: (2024)
par: Shubham, et autres
Publié: (2024)
Xorbits: Automating Operator Tiling for Distributed Data Science
par: Lu, Weizheng, et autres
Publié: (2023)
par: Lu, Weizheng, et autres
Publié: (2023)
Sparsity-Aware Roofline Models for Sparse Matrix-Matrix Multiplication
par: Qian, Matthew, et autres
Publié: (2026)
par: Qian, Matthew, et autres
Publié: (2026)
Towards Energy-Efficient Serverless Computing with Hardware Isolation
par: Carl, Natalie, et autres
Publié: (2025)
par: Carl, Natalie, et autres
Publié: (2025)
Accelerating Sparse DNNs Based on Tiled GEMM
par: Guo, Cong, et autres
Publié: (2024)
par: Guo, Cong, et autres
Publié: (2024)
An Efficient and Adaptive Watermark Detection System with Tile-based Error Correction
par: Zhong, Xinrui, et autres
Publié: (2025)
par: Zhong, Xinrui, et autres
Publié: (2025)
Caching Aided Multi-Tenant Serverless Computing
par: Qiao, Chu, et autres
Publié: (2024)
par: Qiao, Chu, et autres
Publié: (2024)
Gaia: Hybrid Hardware Acceleration for Serverless AI in the 3D Compute Continuum
par: Reisecker, Maximilian, et autres
Publié: (2025)
par: Reisecker, Maximilian, et autres
Publié: (2025)
Accelerating Mixed-Precision Out-of-Core Cholesky Factorization with Static Task Scheduling
par: Ren, Jie, et autres
Publié: (2024)
par: Ren, Jie, et autres
Publié: (2024)
Stencil Matrixization
par: Zhao, Wenxuan, et autres
Publié: (2023)
par: Zhao, Wenxuan, et autres
Publié: (2023)
WANSpec: Leveraging Global Compute Capacity for LLM Inference
par: Martin, Noah, et autres
Publié: (2026)
par: Martin, Noah, et autres
Publié: (2026)
IsoSched: Preemptive Tile Cascaded Scheduling of Multi-DNN via Subgraph Isomorphism
par: Zhao, Boran, et autres
Publié: (2025)
par: Zhao, Boran, et autres
Publié: (2025)
Leveraging Teaching on Demand: Approaching HPC to Undergrads
par: Catalán, S., et autres
Publié: (2026)
par: Catalán, S., et autres
Publié: (2026)
Double-Precision Matrix Multiplication Emulation via Ozaki-II Scheme with FP8 Quantization
par: Uchino, Yuki, et autres
Publié: (2026)
par: Uchino, Yuki, et autres
Publié: (2026)
PALM: A Efficient Performance Simulator for Tiled Accelerators with Large-scale Model Training
par: Fang, Jiahao, et autres
Publié: (2024)
par: Fang, Jiahao, et autres
Publié: (2024)
FalconGEMM: Surpassing Hardware Peaks with Lower-Complexity Matrix Multiplication
par: Zhu, Honglin, et autres
Publié: (2026)
par: Zhu, Honglin, et autres
Publié: (2026)
PAT: Accelerating LLM Decoding via Prefix-Aware Attention with Resource Efficient Multi-Tile Kernel
par: Yi, Jinjun, et autres
Publié: (2025)
par: Yi, Jinjun, et autres
Publié: (2025)
Architectural Foundations for Checkpointing and Restoration in Quantum HPC Systems
par: Guan, Qiang, et autres
Publié: (2026)
par: Guan, Qiang, et autres
Publié: (2026)
POLAR-PIC: A Holistic Framework for Matrixized PIC with Co-Designed Compute, Layout, and Communication
par: Rao, Yizhuo, et autres
Publié: (2026)
par: Rao, Yizhuo, et autres
Publié: (2026)
Communication Lower Bounds and Optimal Algorithms for Symmetric Matrix Computations
par: Daas, Hussam Al, et autres
Publié: (2024)
par: Daas, Hussam Al, et autres
Publié: (2024)
FLARE: A Dataflow-Aware and Scalable Hardware Architecture for Neural-Hybrid Scientific Lossy Compression
par: Jia, Wenqi, et autres
Publié: (2025)
par: Jia, Wenqi, et autres
Publié: (2025)
Data-Centric Design: Introducing An Informatics Domain Model And Core Data Ontology For Computational Systems
par: Knowles, Paul, et autres
Publié: (2024)
par: Knowles, Paul, et autres
Publié: (2024)
scaleTRIM: Scalable TRuncation-Based Integer Approximate Multiplier with Linearization and Compensation
par: Farahmand, Ebrahim, et autres
Publié: (2023)
par: Farahmand, Ebrahim, et autres
Publié: (2023)
Scalable Analysis of Urban Scaling Laws: Leveraging Cloud Computing to Analyze 21,280 Global Cities
par: Li, Zhenhui, et autres
Publié: (2024)
par: Li, Zhenhui, et autres
Publié: (2024)
GPU-Based Parallel Computing Methods for Medical Photoacoustic Image Reconstruction
par: Yi, Xinyao, et autres
Publié: (2024)
par: Yi, Xinyao, et autres
Publié: (2024)
Sparsity-Preserving Encodings for Straggler-Optimal Distributed Matrix Computations at the Edge
par: Das, Anindya Bijoy, et autres
Publié: (2024)
par: Das, Anindya Bijoy, et autres
Publié: (2024)
Harnessing Your DRAM and SSD for Sustainable and Accessible LLM Inference with Mixed-Precision and Multi-level Caching
par: Peng, Jie, et autres
Publié: (2024)
par: Peng, Jie, et autres
Publié: (2024)
Syncopate: Efficient Multi-GPU AI Kernels via Automatic Chunk-Centric Compute-Communication Overlap
par: Qiang, Xinwei, et autres
Publié: (2026)
par: Qiang, Xinwei, et autres
Publié: (2026)
LMDeploy Accelerates Mixed-Precision LLM Inference with TurboMind
par: Zhang, Li, et autres
Publié: (2025)
par: Zhang, Li, et autres
Publié: (2025)
SGEMM-cube: Precision-Recovery FP32 GEMM Approximation on Ascend NPUs with FP16 Matrix Engines
par: Xue, Weicheng, et autres
Publié: (2025)
par: Xue, Weicheng, et autres
Publié: (2025)
A Comparative Review of Parallel Exact, Heuristic, Metaheuristic, and Hybrid Optimization Techniques for the Traveling Salesman Problem
par: Alkhalifa, Rabab, et autres
Publié: (2025)
par: Alkhalifa, Rabab, et autres
Publié: (2025)
TileLoom: Automatic Dataflow Planning for Tile-Based Languages on Spatial Dataflow Accelerators
par: Li, Wei, et autres
Publié: (2025)
par: Li, Wei, et autres
Publié: (2025)
Extracting the Potential of Emerging Hardware Accelerators for Symmetric Eigenvalue Decomposition
par: Wang, Hansheng, et autres
Publié: (2024)
par: Wang, Hansheng, et autres
Publié: (2024)
Documents similaires
-
Performant Unified GPU Kernels for Portable Singular Value Computation Across Hardware and Precision
par: Ringoot, Evelyne, et autres
Publié: (2025) -
Accelerating Bidiagonalization of Banded Matrices through Memory-Aware Bulge-Chasing on GPUs
par: Ringoot, Evelyne, et autres
Publié: (2025) -
Hierarchical Recursive Precision for Accelerating Symmetric Linear Solves on MXUs
par: Carrica, Vicki, et autres
Publié: (2026) -
TileLink: Generating Efficient Compute-Communication Overlapping Kernels using Tile-Centric Primitives
par: Zheng, Size, et autres
Publié: (2025) -
Toward Portable GPU Performance: Julia Recursive Implementation of TRMM and TRSM
par: Carrica, Vicki, et autres
Publié: (2025)