Truncated multiplication and batch software SIMD AVX512 implementation for faster Montgomery multiplications and modular exponentiation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Didier, Laurent-Stéphane, Mrabet, Nadia, Glandus, Léa, Robert, Jean-Marc |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Residue Number System Comparison revisited, a software perspective
par: Didier, Laurent-Stéphane, et autres
Publié: (2026)
par: Didier, Laurent-Stéphane, et autres
Publié: (2026)
RISC-V Word-Size Modular Instructions for Residue Number Systems
par: Didier, Laurent-Stéphane, et autres
Publié: (2024)
par: Didier, Laurent-Stéphane, et autres
Publié: (2024)
A Study of Performance Programming of CPU, GPU accelerated Computers and SIMD Architecture
par: Yi, Xinyao
Publié: (2024)
par: Yi, Xinyao
Publié: (2024)
Leveraging SIMD for Accelerating Large-number Arithmetic
par: Das, Subhrajit, et autres
Publié: (2026)
par: Das, Subhrajit, et autres
Publié: (2026)
A sparsity-aware distributed-memory algorithm for sparse-sparse matrix multiplication
par: Hong, Yuxi, et autres
Publié: (2024)
par: Hong, Yuxi, et autres
Publié: (2024)
Accelerating high-order continuum kinetic plasma simulations using multiple GPUs
par: Ho, Andrew, et autres
Publié: (2024)
par: Ho, Andrew, et autres
Publié: (2024)
Hiding Communication Cost in Distributed LLM Training via Micro-batch Co-execution
par: Wang, Haiquan, et autres
Publié: (2024)
par: Wang, Haiquan, et autres
Publié: (2024)
A task-based data-flow methodology for programming heterogeneous systems with multiple accelerator APIs
par: Boné, Aleix, et autres
Publié: (2026)
par: Boné, Aleix, et autres
Publié: (2026)
Accelerating Optimal Power Flow with GPUs: SIMD Abstraction of Nonlinear Programs and Condensed-Space Interior-Point Methods
par: Shin, Sungho, et autres
Publié: (2023)
par: Shin, Sungho, et autres
Publié: (2023)
Task queue implementation for edge computing platform
par: Maksimovic, Veljko, et autres
Publié: (2024)
par: Maksimovic, Veljko, et autres
Publié: (2024)
Flotilla: A scalable, modular and resilient federated learning framework for heterogeneous resources
par: Banerjee, Roopkatha, et autres
Publié: (2025)
par: Banerjee, Roopkatha, et autres
Publié: (2025)
Breaking through the $Ω(n)$-space barrier: Population Protocols Decide Double-exponential Thresholds
par: Czerner, Philipp
Publié: (2022)
par: Czerner, Philipp
Publié: (2022)
Towards Designing an Energy Aware Data Replication Strategy for Cloud Systems Using Reinforcement Learning
par: Najjar, Amir, et autres
Publié: (2025)
par: Najjar, Amir, et autres
Publié: (2025)
RadixMLP -- Intra-batch Deduplication for Causal Transformers
par: Feil, Michael, et autres
Publié: (2026)
par: Feil, Michael, et autres
Publié: (2026)
Effective implementation of the High Performance Conjugate Gradient benchmark on GraphBLAS
par: Scolari, Alberto, et autres
Publié: (2023)
par: Scolari, Alberto, et autres
Publié: (2023)
Sedna: Sharding transactions in multiple concurrent proposer blockchains
par: Ranchal-Pedrosa, Alejandro, et autres
Publié: (2025)
par: Ranchal-Pedrosa, Alejandro, et autres
Publié: (2025)
Blockchain in a box: A portable blockchain network implementation on Raspberry Pi's
par: Piškorec, Matija, et autres
Publié: (2024)
par: Piškorec, Matija, et autres
Publié: (2024)
Truncated Non-Uniform Quantization for Distributed SGD
par: Yan, Guangfeng, et autres
Publié: (2024)
par: Yan, Guangfeng, et autres
Publié: (2024)
Arbitrageurs' profits, LVR, and sandwich attacks: batch trading as an AMM design response
par: Canidio, Andrea, et autres
Publié: (2023)
par: Canidio, Andrea, et autres
Publié: (2023)
Scalability of 3D-DFT by block tensor-matrix multiplication on the JUWELS Cluster
par: Malapally, Nitin, et autres
Publié: (2023)
par: Malapally, Nitin, et autres
Publié: (2023)
Towards Efficient Verification of Parallel Applications with Mc SimGrid
par: Laurent, Matthieu, et autres
Publié: (2025)
par: Laurent, Matthieu, et autres
Publié: (2025)
Polynomial Time Local Decision Revisited
par: Feuilloley, Laurent, et autres
Publié: (2026)
par: Feuilloley, Laurent, et autres
Publié: (2026)
How local constraints influence network diameter and applications to LCL generalizations
par: Bousquet, Nicolas, et autres
Publié: (2024)
par: Bousquet, Nicolas, et autres
Publié: (2024)
LCI: a Lightweight Communication Interface for Efficient Asynchronous Multithreaded Communication
par: Yan, Jiakun, et autres
Publié: (2025)
par: Yan, Jiakun, et autres
Publié: (2025)
Contemplating a Lightweight Communication Interface for Asynchronous Many-Task Systems
par: Yan, Jiakun, et autres
Publié: (2025)
par: Yan, Jiakun, et autres
Publié: (2025)
Not eXactly Byzantine: Efficient and Resilient TEE-Based State Machine Replication
par: Leinweber, Marc, et autres
Publié: (2025)
par: Leinweber, Marc, et autres
Publié: (2025)
Proving there is a leader without naming it
par: Feuilloley, Laurent, et autres
Publié: (2025)
par: Feuilloley, Laurent, et autres
Publié: (2025)
VMT19937: A SIMD-Friendly Pseudo Random Number Generator based on Mersenne Twister 19937
par: Cannizzo, Fabio
Publié: (2023)
par: Cannizzo, Fabio
Publié: (2023)
Examining MPI and its Extensions for Asynchronous Multithreaded Communication
par: Yan, Jiakun, et autres
Publié: (2025)
par: Yan, Jiakun, et autres
Publié: (2025)
General Convex Agreement with Near-Optimal Communication
par: Dufay, Marc, et autres
Publié: (2026)
par: Dufay, Marc, et autres
Publié: (2026)
Understanding the Communication Needs of Asynchronous Many-Task Systems -- A Case Study of HPX+LCI
par: Yan, Jiakun, et autres
Publié: (2025)
par: Yan, Jiakun, et autres
Publié: (2025)
Multithreaded Fine-Grained Asynchronous BSP for Integer Sorting with LCI and OpenMP
par: Cheng, Minyu, et autres
Publié: (2026)
par: Cheng, Minyu, et autres
Publié: (2026)
Preliminary report: Initial evaluation of StdPar implementations on AMD GPUs for HPC
par: Lin, Wei-Chen, et autres
Publié: (2024)
par: Lin, Wei-Chen, et autres
Publié: (2024)
Evaluation of computational and energy performance in matrix multiplication algorithms on CPU and GPU using MKL, cuBLAS and SYCL
par: Torres, L. A., et autres
Publié: (2024)
par: Torres, L. A., et autres
Publié: (2024)
Decreasing verification radius in local certification
par: Feuilloley, Laurent, et autres
Publié: (2024)
par: Feuilloley, Laurent, et autres
Publié: (2024)
Dissecting the software-based measurement of CPU energy consumption: a comparative analysis
par: Raffin, Guillaume, et autres
Publié: (2024)
par: Raffin, Guillaume, et autres
Publié: (2024)
Round and Resilience-Optimal Approximate Agreement on Trees and Block Graphs
par: Fuchs, Marc, et autres
Publié: (2025)
par: Fuchs, Marc, et autres
Publié: (2025)
Validity in Network-Agnostic Byzantine Agreement
par: Constantinescu, Andrei, et autres
Publié: (2024)
par: Constantinescu, Andrei, et autres
Publié: (2024)
From Few to Many Faults: Optimal Adaptive Byzantine Agreement
par: Constantinescu, Andrei, et autres
Publié: (2025)
par: Constantinescu, Andrei, et autres
Publié: (2025)
Byzantine Stable Matching
par: Constantinescu, Andrei, et autres
Publié: (2025)
par: Constantinescu, Andrei, et autres
Publié: (2025)
Documents similaires
-
Residue Number System Comparison revisited, a software perspective
par: Didier, Laurent-Stéphane, et autres
Publié: (2026) -
RISC-V Word-Size Modular Instructions for Residue Number Systems
par: Didier, Laurent-Stéphane, et autres
Publié: (2024) -
A Study of Performance Programming of CPU, GPU accelerated Computers and SIMD Architecture
par: Yi, Xinyao
Publié: (2024) -
Leveraging SIMD for Accelerating Large-number Arithmetic
par: Das, Subhrajit, et autres
Publié: (2026) -
A sparsity-aware distributed-memory algorithm for sparse-sparse matrix multiplication
par: Hong, Yuxi, et autres
Publié: (2024)