Mixed-precision finite element kernels and assembly: Rounding error analysis and hardware acceleration
Fuente:
arXiv
Salvato in:
| Autori principali: | Croci, M., Wells, G. N. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MATLAB Simulator of Level-Index Arithmetic
di: Mikaitis, Mantas
Pubblicazione: (2024)
di: Mikaitis, Mantas
Pubblicazione: (2024)
Accurate Models of NVIDIA Tensor Cores
di: Khattak, Faizan A., et al.
Pubblicazione: (2025)
di: Khattak, Faizan A., et al.
Pubblicazione: (2025)
An Open-Source Framework for Efficient Numerically-Tailored Computations
di: Ledoux, Louis, et al.
Pubblicazione: (2024)
di: Ledoux, Louis, et al.
Pubblicazione: (2024)
Inexactness and Correction of Floating-Point Reciprocal, Division and Square Root
di: Dutton, Lucas M., et al.
Pubblicazione: (2024)
di: Dutton, Lucas M., et al.
Pubblicazione: (2024)
SARIS: Accelerating Stencil Computations on Energy-Efficient RISC-V Compute Clusters with Indirect Stream Registers
di: Scheffler, Paul, et al.
Pubblicazione: (2024)
di: Scheffler, Paul, et al.
Pubblicazione: (2024)
Hardware-Accelerated Algorithm for Complex Function Roots Density Graph Plotting
di: Tang, Ruibai, et al.
Pubblicazione: (2025)
di: Tang, Ruibai, et al.
Pubblicazione: (2025)
Generalized Methodology for Determining Numerical Features of Hardware Floating-Point Matrix Multipliers: Part I
di: Khattak, Faizan A, et al.
Pubblicazione: (2025)
di: Khattak, Faizan A, et al.
Pubblicazione: (2025)
HYLU: Hybrid Parallel Sparse LU Factorization
di: Chen, Xiaoming
Pubblicazione: (2025)
di: Chen, Xiaoming
Pubblicazione: (2025)
DGEMM without FP64 Arithmetic - Using FP64 Emulation and FP8 Tensor Cores with Ozaki Scheme
di: Mukunoki, Daichi
Pubblicazione: (2025)
di: Mukunoki, Daichi
Pubblicazione: (2025)
Design and accuracy trade-offs in Computational Statistics
di: Xu, Tiancheng, et al.
Pubblicazione: (2025)
di: Xu, Tiancheng, et al.
Pubblicazione: (2025)
Efficient FRW Transitions via Stochastic Finite Differences for Handling Non-Stratified Dielectrics
di: Huang, Jiechen, et al.
Pubblicazione: (2025)
di: Huang, Jiechen, et al.
Pubblicazione: (2025)
A Hybrid Residue Floating Numerical Architecture for High Precision Arithmetic on FPGAs
di: Darvishi, Mostafa
Pubblicazione: (2025)
di: Darvishi, Mostafa
Pubblicazione: (2025)
Toward Capturing Genetic Epistasis From Multivariate Genome-Wide Association Studies Using Mixed-Precision Kernel Ridge Regression
di: Ltaief, Hatem, et al.
Pubblicazione: (2024)
di: Ltaief, Hatem, et al.
Pubblicazione: (2024)
High-performance finite elements with MFEM
di: Andrej, Julian, et al.
Pubblicazione: (2024)
di: Andrej, Julian, et al.
Pubblicazione: (2024)
Fast and energy-efficient derivatives risk analysis: Streaming option Greeks on Xilinx and Intel FPGAs
di: Klaisoongnoen, Mark, et al.
Pubblicazione: (2022)
di: Klaisoongnoen, Mark, et al.
Pubblicazione: (2022)
Accurate Block Quantization in LLMs with Outliers
di: Trukhanov, Nikita, et al.
Pubblicazione: (2024)
di: Trukhanov, Nikita, et al.
Pubblicazione: (2024)
Bit-Accurate Modeling of GPU Matrix Multiply-Accumulate Units: Demystifying Numerical Discrepancy and Accuracy
di: Xie, Peichen, et al.
Pubblicazione: (2025)
di: Xie, Peichen, et al.
Pubblicazione: (2025)
Hyper-reduction methods for accelerating nonlinear finite element simulations: open source implementation and reproducible benchmarks
di: Larsson, Axel, et al.
Pubblicazione: (2026)
di: Larsson, Axel, et al.
Pubblicazione: (2026)
An abstraction for solving multi-domain problems using finite element methods
di: Sagiyama, Koki, et al.
Pubblicazione: (2025)
di: Sagiyama, Koki, et al.
Pubblicazione: (2025)
Adaptive finite element methods based on flux and stress equilibration using FEniCSx
di: Brodbeck, Maximilian, et al.
Pubblicazione: (2024)
di: Brodbeck, Maximilian, et al.
Pubblicazione: (2024)
Evaluation of POSIT Arithmetic with Accelerators
di: Nakasato, Naohito, et al.
Pubblicazione: (2024)
di: Nakasato, Naohito, et al.
Pubblicazione: (2024)
Faster arbitrary-precision dot product and matrix multiplication
di: Johansson, Fredrik
Pubblicazione: (2019)
di: Johansson, Fredrik
Pubblicazione: (2019)
Acceleration of multi-component multiple-precision arithmetic with branch-free algorithms and SIMD vectorization
di: Kouya, Tomonori
Pubblicazione: (2026)
di: Kouya, Tomonori
Pubblicazione: (2026)
TREA: Low-precision Time-Multiplexed, Resource-Efficient Edge Accelerator for Object Detection and Classification
di: Sharma, Vijay Pratap, et al.
Pubblicazione: (2026)
di: Sharma, Vijay Pratap, et al.
Pubblicazione: (2026)
Fast Mixed-Precision Real Evaluation
di: Yadrov, Artem, et al.
Pubblicazione: (2024)
di: Yadrov, Artem, et al.
Pubblicazione: (2024)
Fast Mixed-Precision Real Evaluation
di: Yadrov, Artem, et al.
Pubblicazione: (2025)
di: Yadrov, Artem, et al.
Pubblicazione: (2025)
A low-rank balanced truncation approach for large-scale RLCk model order reduction based on extended Krylov subspace and a frequency-aware convergence criterion
di: Giamouzis, Christos, et al.
Pubblicazione: (2024)
di: Giamouzis, Christos, et al.
Pubblicazione: (2024)
eXmY: A Data Type and Technique for Arbitrary Bit Precision Quantization
di: Agrawal, Aditya, et al.
Pubblicazione: (2024)
di: Agrawal, Aditya, et al.
Pubblicazione: (2024)
Hawkeye: Reproducing GPU-Level Non-Determinism
di: Badash, Erez, et al.
Pubblicazione: (2026)
di: Badash, Erez, et al.
Pubblicazione: (2026)
MORCIC: Model Order Reduction Techniques for Electromagnetic Models of Integrated Circuits
di: Garyfallou, Dimitrios, et al.
Pubblicazione: (2023)
di: Garyfallou, Dimitrios, et al.
Pubblicazione: (2023)
Mixed Precision Block-Jacobi Preconditioner: Algorithms, Performance Evaluation and Feature Analysis
di: Tian, Ningxi, et al.
Pubblicazione: (2024)
di: Tian, Ningxi, et al.
Pubblicazione: (2024)
Mixed-Order Meshes through rp-adaptivity for Surface Fitting to Implicit Geometries
di: Mittal, Ketan, et al.
Pubblicazione: (2024)
di: Mittal, Ketan, et al.
Pubblicazione: (2024)
Algorithm-hardware co-design for Energy-Efficient A/D conversion in ReRAM-based accelerators
di: Zhang, Chenguang, et al.
Pubblicazione: (2024)
di: Zhang, Chenguang, et al.
Pubblicazione: (2024)
MEIC: Re-thinking RTL Debug Automation using LLMs
di: Xu, Ke, et al.
Pubblicazione: (2024)
di: Xu, Ke, et al.
Pubblicazione: (2024)
C2HLSC: Leveraging Large Language Models to Bridge the Software-to-Hardware Design Gap
di: Collini, Luca, et al.
Pubblicazione: (2024)
di: Collini, Luca, et al.
Pubblicazione: (2024)
A Novel HDL Code Generator for Effectively Testing FPGA Logic Synthesis Compilers
di: Xu, Zhihao, et al.
Pubblicazione: (2024)
di: Xu, Zhihao, et al.
Pubblicazione: (2024)
FLAG: Formal and LLM-assisted SVA Generation for Formal Specifications of On-Chip Communication Protocols
di: Shih, Yu-An, et al.
Pubblicazione: (2025)
di: Shih, Yu-An, et al.
Pubblicazione: (2025)
ITHICA: Intra-Thread Instruction Checking Approach for Defect-Induced Silent Data Corruptions
di: Vavelidou, Ioanna, et al.
Pubblicazione: (2026)
di: Vavelidou, Ioanna, et al.
Pubblicazione: (2026)
Using LLMs to Facilitate Formal Verification of RTL
di: Orenes-Vera, Marcelo, et al.
Pubblicazione: (2023)
di: Orenes-Vera, Marcelo, et al.
Pubblicazione: (2023)
Offloading Data Center Tax
di: Revankar, Akshay, et al.
Pubblicazione: (2025)
di: Revankar, Akshay, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MATLAB Simulator of Level-Index Arithmetic
di: Mikaitis, Mantas
Pubblicazione: (2024) -
Accurate Models of NVIDIA Tensor Cores
di: Khattak, Faizan A., et al.
Pubblicazione: (2025) -
An Open-Source Framework for Efficient Numerically-Tailored Computations
di: Ledoux, Louis, et al.
Pubblicazione: (2024) -
Inexactness and Correction of Floating-Point Reciprocal, Division and Square Root
di: Dutton, Lucas M., et al.
Pubblicazione: (2024) -
SARIS: Accelerating Stencil Computations on Energy-Efficient RISC-V Compute Clusters with Indirect Stream Registers
di: Scheffler, Paul, et al.
Pubblicazione: (2024)