Precision-Aware Iterative Algorithms Based on Group-Shared Exponents of Floating-Point Numbers
Fuente:
arXiv
Salvato in:
| Autori principali: | Gao, Jianhua, Shen, Jiayuan, Zhang, Yuxiang, Ji, Weixing, Huang, Hua |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cascaded Prediction and Asynchronous Execution of Iterative Algorithms on Heterogeneous Platforms
di: Gao, Jianhua, et al.
Pubblicazione: (2024)
di: Gao, Jianhua, et al.
Pubblicazione: (2024)
A Systematic Literature Survey of Sparse Matrix-Vector Multiplication
di: Gao, Jianhua, et al.
Pubblicazione: (2024)
di: Gao, Jianhua, et al.
Pubblicazione: (2024)
Dynamic Memory Management on GPUs with SYCL
di: Standish, Russell K.
Pubblicazione: (2025)
di: Standish, Russell K.
Pubblicazione: (2025)
Efficient Parallel Scheduling for Sparse Triangular Solvers
di: Böhnlein, Toni, et al.
Pubblicazione: (2025)
di: Böhnlein, Toni, et al.
Pubblicazione: (2025)
Solving Large Rank-Deficient Linear Least-Squares Problems on Shared-Memory CPU Architectures and GPU Architectures
di: Chillarón, Mónica, et al.
Pubblicazione: (2024)
di: Chillarón, Mónica, et al.
Pubblicazione: (2024)
PackSELL: A Sparse Matrix Format for Precision-Agnostic High-Performance SpMV
di: Suzuki, Kengo, et al.
Pubblicazione: (2026)
di: Suzuki, Kengo, et al.
Pubblicazione: (2026)
Communication-Efficient, 2D Parallel Stochastic Gradient Descent for Distributed-Memory Optimization
di: Devarakonda, Aditya, et al.
Pubblicazione: (2025)
di: Devarakonda, Aditya, et al.
Pubblicazione: (2025)
Guess-Verify-Refine: Data-Aware Top-K for Sparse-Attention Decoding on Blackwell via Temporal Correlation
di: Cheng, Long, et al.
Pubblicazione: (2026)
di: Cheng, Long, et al.
Pubblicazione: (2026)
Design, Configuration, Implementation, and Performance of a Simple 32 Core Raspberry Pi Cluster
di: Cicirello, Vincent A.
Pubblicazione: (2017)
di: Cicirello, Vincent A.
Pubblicazione: (2017)
Accelerating Matrix Multiplication: A Performance Comparison Between Multi-Core CPU and GPU
di: Ansari, Mufakir Qamar, et al.
Pubblicazione: (2025)
di: Ansari, Mufakir Qamar, et al.
Pubblicazione: (2025)
Stochastic well-structured transition systems
di: Aspnes, James
Pubblicazione: (2025)
di: Aspnes, James
Pubblicazione: (2025)
Scalable Domain-decomposed Monte Carlo Neutral Transport for Nuclear Fusion
di: Lappi, Oskar, et al.
Pubblicazione: (2025)
di: Lappi, Oskar, et al.
Pubblicazione: (2025)
Racing to Idle: Energy Efficiency of Matrix Multiplication on Heterogeneous CPU and GPU Architectures
di: Ansari, Mufakir Qamar, et al.
Pubblicazione: (2025)
di: Ansari, Mufakir Qamar, et al.
Pubblicazione: (2025)
FlashSpread: IO-Aware GPU Simulation of Non-Markovian Epidemic Dynamics via Kernel Fusion
di: Shakeri, Heman, et al.
Pubblicazione: (2026)
di: Shakeri, Heman, et al.
Pubblicazione: (2026)
Stream parallel skeleton optimization
di: Aldinucci, Marco, et al.
Pubblicazione: (2024)
di: Aldinucci, Marco, et al.
Pubblicazione: (2024)
StreamFlow: cross-breeding cloud with HPC
di: Colonnelli, Iacopo, et al.
Pubblicazione: (2020)
di: Colonnelli, Iacopo, et al.
Pubblicazione: (2020)
A Study of Performance Portability in Plasma Physics Simulations
di: Ruzicka, Josef, et al.
Pubblicazione: (2024)
di: Ruzicka, Josef, et al.
Pubblicazione: (2024)
Optimizing Fine-Grained Parallelism Through Dynamic Load Balancing on Multi-Socket Many-Core Systems
di: Wang, Wenyi, et al.
Pubblicazione: (2025)
di: Wang, Wenyi, et al.
Pubblicazione: (2025)
Joint Training on AMD and NVIDIA GPUs
di: Hu, Jon, et al.
Pubblicazione: (2026)
di: Hu, Jon, et al.
Pubblicazione: (2026)
AutoTSMM: An Auto-tuning Framework for Building High-Performance Tall-and-Skinny Matrix-Matrix Multiplication on CPUs
di: Li, Chendi, et al.
Pubblicazione: (2022)
di: Li, Chendi, et al.
Pubblicazione: (2022)
Enabling Practical Transparent Checkpointing for MPI: A Topological Sort Approach
di: Xu, Yao, et al.
Pubblicazione: (2024)
di: Xu, Yao, et al.
Pubblicazione: (2024)
Leveraging Multi-Instance GPUs through moldable task scheduling
di: Villarrubia, Jorge, et al.
Pubblicazione: (2025)
di: Villarrubia, Jorge, et al.
Pubblicazione: (2025)
Understanding GEMM Performance and Energy on NVIDIA Ada Lovelace: A Machine Learning-Based Analytical Approach
di: Xiaoteng, et al.
Pubblicazione: (2024)
di: Xiaoteng, et al.
Pubblicazione: (2024)
Data Scheduling Algorithm for Scalable and Efficient IoT Sensing in Cloud Computing
di: Mohammad, Noor Islam S.
Pubblicazione: (2025)
di: Mohammad, Noor Islam S.
Pubblicazione: (2025)
Declarative distributed algorithms as axiomatic theories in three-valued modal logic over semitopologies
di: Gabbay, Murdoch J.
Pubblicazione: (2025)
di: Gabbay, Murdoch J.
Pubblicazione: (2025)
Challenging Portability Paradigms: FPGA Acceleration Using SYCL and OpenCL
di: de Castro, Manuel, et al.
Pubblicazione: (2024)
di: de Castro, Manuel, et al.
Pubblicazione: (2024)
Utilizing Sparsity in the GPU-accelerated Assembly of Schur Complement Matrices in Domain Decomposition Methods
di: Homola, Jakub, et al.
Pubblicazione: (2025)
di: Homola, Jakub, et al.
Pubblicazione: (2025)
A Lock-Free, Fully GPU-Resident Architecture for the Verification of Goldbach's Conjecture
di: Llorente-Saguer, Isaac
Pubblicazione: (2026)
di: Llorente-Saguer, Isaac
Pubblicazione: (2026)
A C++17 Thread Pool for High-Performance Scientific Computing
di: Shoshany, Barak
Pubblicazione: (2021)
di: Shoshany, Barak
Pubblicazione: (2021)
Algorithms for Parallel Shared-Memory Sparse Matrix-Vector Multiplication on Unstructured Matrices
di: Bergmans, Kobe, et al.
Pubblicazione: (2025)
di: Bergmans, Kobe, et al.
Pubblicazione: (2025)
Population Protocols Revisited: Parity and Beyond
di: Gąsieniec, Leszek, et al.
Pubblicazione: (2025)
di: Gąsieniec, Leszek, et al.
Pubblicazione: (2025)
Distortion Resilience for Goal-Oriented Semantic Communication
di: Nguyen, Minh-Duong, et al.
Pubblicazione: (2023)
di: Nguyen, Minh-Duong, et al.
Pubblicazione: (2023)
DNA sequence alignment: An assignment for OpenMP, MPI, and CUDA/OpenCL
di: Gonzalez-Escribano, Arturo, et al.
Pubblicazione: (2024)
di: Gonzalez-Escribano, Arturo, et al.
Pubblicazione: (2024)
Minimum Cost Loop Nests for Contraction of a Sparse Tensor with a Tensor Network
di: Kanakagiri, Raghavendra, et al.
Pubblicazione: (2023)
di: Kanakagiri, Raghavendra, et al.
Pubblicazione: (2023)
Hybrid Quantum-HPC Middleware Systems for Adaptive Resource, Workload and Task Management
di: Mantha, Pradeep, et al.
Pubblicazione: (2026)
di: Mantha, Pradeep, et al.
Pubblicazione: (2026)
pLUTo: Enabling Massively Parallel Computation in DRAM via Lookup Tables
di: Ferreira, João Dinis, et al.
Pubblicazione: (2021)
di: Ferreira, João Dinis, et al.
Pubblicazione: (2021)
Improving inference time in multi-TPU systems with profiled model segmentation
di: Villarrubia, Jorge, et al.
Pubblicazione: (2025)
di: Villarrubia, Jorge, et al.
Pubblicazione: (2025)
Balanced segmentation of CNNs for multi-TPU inference
di: Villarrubia, Jorge, et al.
Pubblicazione: (2025)
di: Villarrubia, Jorge, et al.
Pubblicazione: (2025)
Sharded Elimination and Combining for Highly-Efficient Concurrent Stacks
di: Singh, Ajay, et al.
Pubblicazione: (2026)
di: Singh, Ajay, et al.
Pubblicazione: (2026)
LLM Agents for Interactive Workflow Provenance: Reference Architecture and Evaluation Methodology
di: Souza, Renan, et al.
Pubblicazione: (2025)
di: Souza, Renan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Cascaded Prediction and Asynchronous Execution of Iterative Algorithms on Heterogeneous Platforms
di: Gao, Jianhua, et al.
Pubblicazione: (2024) -
A Systematic Literature Survey of Sparse Matrix-Vector Multiplication
di: Gao, Jianhua, et al.
Pubblicazione: (2024) -
Dynamic Memory Management on GPUs with SYCL
di: Standish, Russell K.
Pubblicazione: (2025) -
Efficient Parallel Scheduling for Sparse Triangular Solvers
di: Böhnlein, Toni, et al.
Pubblicazione: (2025) -
Solving Large Rank-Deficient Linear Least-Squares Problems on Shared-Memory CPU Architectures and GPU Architectures
di: Chillarón, Mónica, et al.
Pubblicazione: (2024)